DataBench / dclm-1.0-baseline /trainer_state.json
Harley-ml's picture
Upload 3 files
84dd2c9 verified
Raw
History Blame Contribute Delete
5.98 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 2428,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0411946446961895,
"grad_norm": 0.467864453792572,
"learning_rate": 0.003,
"loss": 6.407201538085937,
"step": 100
},
{
"epoch": 0.082389289392379,
"grad_norm": 0.4472709596157074,
"learning_rate": 0.003,
"loss": 5.041720581054688,
"step": 200
},
{
"epoch": 0.12358393408856849,
"grad_norm": 0.48611021041870117,
"learning_rate": 0.003,
"loss": 4.333825988769531,
"step": 300
},
{
"epoch": 0.164778578784758,
"grad_norm": 0.406901091337204,
"learning_rate": 0.003,
"loss": 4.042262573242187,
"step": 400
},
{
"epoch": 0.2059732234809475,
"grad_norm": 0.33796098828315735,
"learning_rate": 0.003,
"loss": 3.9043743896484373,
"step": 500
},
{
"epoch": 0.2059732234809475,
"eval_loss": 3.865790843963623,
"eval_runtime": 8.0265,
"eval_samples_per_second": 399.925,
"eval_steps_per_second": 50.084,
"step": 500
},
{
"epoch": 0.24716786817713698,
"grad_norm": 0.4365800619125366,
"learning_rate": 0.003,
"loss": 3.8237649536132814,
"step": 600
},
{
"epoch": 0.2883625128733265,
"grad_norm": 0.28054454922676086,
"learning_rate": 0.003,
"loss": 3.764461669921875,
"step": 700
},
{
"epoch": 0.329557157569516,
"grad_norm": 0.29116520285606384,
"learning_rate": 0.003,
"loss": 3.7118209838867187,
"step": 800
},
{
"epoch": 0.3707518022657055,
"grad_norm": 0.3120614290237427,
"learning_rate": 0.003,
"loss": 3.6665850830078126,
"step": 900
},
{
"epoch": 0.411946446961895,
"grad_norm": 0.2823605239391327,
"learning_rate": 0.003,
"loss": 3.6290557861328123,
"step": 1000
},
{
"epoch": 0.411946446961895,
"eval_loss": 3.618884801864624,
"eval_runtime": 7.522,
"eval_samples_per_second": 426.746,
"eval_steps_per_second": 53.443,
"step": 1000
},
{
"epoch": 0.45314109165808447,
"grad_norm": 0.32250627875328064,
"learning_rate": 0.003,
"loss": 3.5978604125976563,
"step": 1100
},
{
"epoch": 0.49433573635427397,
"grad_norm": 0.25370901823043823,
"learning_rate": 0.003,
"loss": 3.5753305053710935,
"step": 1200
},
{
"epoch": 0.5355303810504635,
"grad_norm": 0.27662038803100586,
"learning_rate": 0.003,
"loss": 3.553804626464844,
"step": 1300
},
{
"epoch": 0.576725025746653,
"grad_norm": 0.2849913537502289,
"learning_rate": 0.003,
"loss": 3.5376666259765623,
"step": 1400
},
{
"epoch": 0.6179196704428425,
"grad_norm": 0.2572985291481018,
"learning_rate": 0.003,
"loss": 3.5211285400390624,
"step": 1500
},
{
"epoch": 0.6179196704428425,
"eval_loss": 3.521266460418701,
"eval_runtime": 8.3868,
"eval_samples_per_second": 382.744,
"eval_steps_per_second": 47.932,
"step": 1500
},
{
"epoch": 0.659114315139032,
"grad_norm": 0.21017690002918243,
"learning_rate": 0.003,
"loss": 3.5094705200195313,
"step": 1600
},
{
"epoch": 0.7003089598352215,
"grad_norm": 0.2542063891887665,
"learning_rate": 0.003,
"loss": 3.4962704467773436,
"step": 1700
},
{
"epoch": 0.741503604531411,
"grad_norm": 0.22395335137844086,
"learning_rate": 0.003,
"loss": 3.485750427246094,
"step": 1800
},
{
"epoch": 0.7826982492276005,
"grad_norm": 0.27532121539115906,
"learning_rate": 0.003,
"loss": 3.4784066772460935,
"step": 1900
},
{
"epoch": 0.82389289392379,
"grad_norm": 0.22537492215633392,
"learning_rate": 0.002899325557098001,
"loss": 3.4674105834960938,
"step": 2000
},
{
"epoch": 0.82389289392379,
"eval_loss": 3.4714837074279785,
"eval_runtime": 7.2122,
"eval_samples_per_second": 445.079,
"eval_steps_per_second": 55.739,
"step": 2000
},
{
"epoch": 0.8650875386199794,
"grad_norm": 0.18755502998828888,
"learning_rate": 0.0022915870802995226,
"loss": 3.4546932983398437,
"step": 2100
},
{
"epoch": 0.9062821833161689,
"grad_norm": 0.17484472692012787,
"learning_rate": 0.0013644373889485982,
"loss": 3.42761962890625,
"step": 2200
},
{
"epoch": 0.9474768280123584,
"grad_norm": 0.1623256355524063,
"learning_rate": 0.0004919882091667163,
"loss": 3.4039578247070312,
"step": 2300
},
{
"epoch": 0.9886714727085479,
"grad_norm": 0.1342345029115677,
"learning_rate": 2.6279207952956684e-05,
"loss": 3.3823727416992186,
"step": 2400
},
{
"epoch": 1.0,
"eval_loss": 3.383687973022461,
"eval_runtime": 11.5434,
"eval_samples_per_second": 278.081,
"eval_steps_per_second": 34.825,
"step": 2428
}
],
"logging_steps": 100,
"max_steps": 2428,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 4331665489920000.0,
"train_batch_size": 400,
"trial_name": null,
"trial_params": null
}