DataBench / fineweb /trainer_state.json
Harley-ml's picture
Rename trainer_state.json to fineweb/trainer_state.json
08df20d verified
Raw
History Blame Contribute Delete
5.97 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 2428,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0411946446961895,
"grad_norm": 0.4298292398452759,
"learning_rate": 0.003,
"loss": 6.43610595703125,
"step": 100
},
{
"epoch": 0.082389289392379,
"grad_norm": 0.38683682680130005,
"learning_rate": 0.003,
"loss": 5.0911407470703125,
"step": 200
},
{
"epoch": 0.12358393408856849,
"grad_norm": 0.490421324968338,
"learning_rate": 0.003,
"loss": 4.339219055175781,
"step": 300
},
{
"epoch": 0.164778578784758,
"grad_norm": 0.474597692489624,
"learning_rate": 0.003,
"loss": 4.0295562744140625,
"step": 400
},
{
"epoch": 0.2059732234809475,
"grad_norm": 0.36108437180519104,
"learning_rate": 0.003,
"loss": 3.8877108764648436,
"step": 500
},
{
"epoch": 0.2059732234809475,
"eval_loss": 3.847414255142212,
"eval_runtime": 7.6229,
"eval_samples_per_second": 421.1,
"eval_steps_per_second": 52.736,
"step": 500
},
{
"epoch": 0.24716786817713698,
"grad_norm": 0.26368337869644165,
"learning_rate": 0.003,
"loss": 3.797254638671875,
"step": 600
},
{
"epoch": 0.2883625128733265,
"grad_norm": 0.3213416635990143,
"learning_rate": 0.003,
"loss": 3.721222229003906,
"step": 700
},
{
"epoch": 0.329557157569516,
"grad_norm": 0.3457011878490448,
"learning_rate": 0.003,
"loss": 3.65634033203125,
"step": 800
},
{
"epoch": 0.3707518022657055,
"grad_norm": 0.39577925205230713,
"learning_rate": 0.003,
"loss": 3.6097821044921874,
"step": 900
},
{
"epoch": 0.411946446961895,
"grad_norm": 0.3584425449371338,
"learning_rate": 0.003,
"loss": 3.575661926269531,
"step": 1000
},
{
"epoch": 0.411946446961895,
"eval_loss": 3.5647435188293457,
"eval_runtime": 8.2293,
"eval_samples_per_second": 390.071,
"eval_steps_per_second": 48.85,
"step": 1000
},
{
"epoch": 0.45314109165808447,
"grad_norm": 0.30220553278923035,
"learning_rate": 0.003,
"loss": 3.550927734375,
"step": 1100
},
{
"epoch": 0.49433573635427397,
"grad_norm": 0.3348575234413147,
"learning_rate": 0.003,
"loss": 3.5292623901367186,
"step": 1200
},
{
"epoch": 0.5355303810504635,
"grad_norm": 0.33219438791275024,
"learning_rate": 0.003,
"loss": 3.5094894409179687,
"step": 1300
},
{
"epoch": 0.576725025746653,
"grad_norm": 0.30907726287841797,
"learning_rate": 0.003,
"loss": 3.497273254394531,
"step": 1400
},
{
"epoch": 0.6179196704428425,
"grad_norm": 0.26499462127685547,
"learning_rate": 0.003,
"loss": 3.483502197265625,
"step": 1500
},
{
"epoch": 0.6179196704428425,
"eval_loss": 3.479076385498047,
"eval_runtime": 7.418,
"eval_samples_per_second": 432.73,
"eval_steps_per_second": 54.192,
"step": 1500
},
{
"epoch": 0.659114315139032,
"grad_norm": 0.32156097888946533,
"learning_rate": 0.003,
"loss": 3.469326171875,
"step": 1600
},
{
"epoch": 0.7003089598352215,
"grad_norm": 0.2879614531993866,
"learning_rate": 0.003,
"loss": 3.4609866333007813,
"step": 1700
},
{
"epoch": 0.741503604531411,
"grad_norm": 0.28667426109313965,
"learning_rate": 0.003,
"loss": 3.4503070068359376,
"step": 1800
},
{
"epoch": 0.7826982492276005,
"grad_norm": 0.24957764148712158,
"learning_rate": 0.003,
"loss": 3.439223327636719,
"step": 1900
},
{
"epoch": 0.82389289392379,
"grad_norm": 0.2855299115180969,
"learning_rate": 0.002899325557098001,
"loss": 3.433879699707031,
"step": 2000
},
{
"epoch": 0.82389289392379,
"eval_loss": 3.429241895675659,
"eval_runtime": 7.6711,
"eval_samples_per_second": 418.453,
"eval_steps_per_second": 52.404,
"step": 2000
},
{
"epoch": 0.8650875386199794,
"grad_norm": 0.2643311023712158,
"learning_rate": 0.0022915870802995226,
"loss": 3.418829040527344,
"step": 2100
},
{
"epoch": 0.9062821833161689,
"grad_norm": 0.2072380781173706,
"learning_rate": 0.0013644373889485982,
"loss": 3.397191162109375,
"step": 2200
},
{
"epoch": 0.9474768280123584,
"grad_norm": 0.16420814394950867,
"learning_rate": 0.0004919882091667163,
"loss": 3.369662170410156,
"step": 2300
},
{
"epoch": 0.9886714727085479,
"grad_norm": 0.14552220702171326,
"learning_rate": 2.6279207952956684e-05,
"loss": 3.347156982421875,
"step": 2400
},
{
"epoch": 1.0,
"eval_loss": 3.3448657989501953,
"eval_runtime": 8.6287,
"eval_samples_per_second": 372.013,
"eval_steps_per_second": 46.589,
"step": 2428
}
],
"logging_steps": 100,
"max_steps": 2428,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 4331665489920000.0,
"train_batch_size": 400,
"trial_name": null,
"trial_params": null
}