Width-Vs-Depth / config_a /trainer_state.json
Harley-ml's picture
Rename trainer_state.json to config_a/trainer_state.json
84336d0 verified
Raw
History Blame Contribute Delete
8.9 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 3796,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.026343519494204427,
"grad_norm": 1.127703309059143,
"learning_rate": 0.003,
"loss": 6.6244049072265625,
"step": 100
},
{
"epoch": 0.05268703898840885,
"grad_norm": 0.4761447608470917,
"learning_rate": 0.003,
"loss": 5.238236694335938,
"step": 200
},
{
"epoch": 0.07903055848261328,
"grad_norm": 0.6752868294715881,
"learning_rate": 0.003,
"loss": 4.431298522949219,
"step": 300
},
{
"epoch": 0.1053740779768177,
"grad_norm": 0.3623008131980896,
"learning_rate": 0.003,
"loss": 4.0496432495117185,
"step": 400
},
{
"epoch": 0.13171759747102213,
"grad_norm": 0.43058475852012634,
"learning_rate": 0.003,
"loss": 3.8711343383789063,
"step": 500
},
{
"epoch": 0.13171759747102213,
"eval_loss": 3.812506675720215,
"eval_runtime": 11.5112,
"eval_samples_per_second": 168.967,
"eval_steps_per_second": 21.197,
"step": 500
},
{
"epoch": 0.15806111696522657,
"grad_norm": 0.32820621132850647,
"learning_rate": 0.003,
"loss": 3.7587127685546875,
"step": 600
},
{
"epoch": 0.18440463645943098,
"grad_norm": 0.47970837354660034,
"learning_rate": 0.003,
"loss": 3.6577584838867185,
"step": 700
},
{
"epoch": 0.2107481559536354,
"grad_norm": 0.396938294172287,
"learning_rate": 0.003,
"loss": 3.5827557373046877,
"step": 800
},
{
"epoch": 0.23709167544783982,
"grad_norm": 0.279178649187088,
"learning_rate": 0.003,
"loss": 3.5340786743164063,
"step": 900
},
{
"epoch": 0.26343519494204426,
"grad_norm": 0.33553844690322876,
"learning_rate": 0.003,
"loss": 3.4949127197265626,
"step": 1000
},
{
"epoch": 0.26343519494204426,
"eval_loss": 3.4784910678863525,
"eval_runtime": 11.3326,
"eval_samples_per_second": 171.629,
"eval_steps_per_second": 21.531,
"step": 1000
},
{
"epoch": 0.2897787144362487,
"grad_norm": 0.2446678876876831,
"learning_rate": 0.003,
"loss": 3.4653549194335938,
"step": 1100
},
{
"epoch": 0.31612223393045313,
"grad_norm": 0.2247409224510193,
"learning_rate": 0.003,
"loss": 3.438248596191406,
"step": 1200
},
{
"epoch": 0.3424657534246575,
"grad_norm": 0.2350401133298874,
"learning_rate": 0.003,
"loss": 3.413848876953125,
"step": 1300
},
{
"epoch": 0.36880927291886195,
"grad_norm": 0.20326821506023407,
"learning_rate": 0.003,
"loss": 3.3952545166015624,
"step": 1400
},
{
"epoch": 0.3951527924130664,
"grad_norm": 0.2626149356365204,
"learning_rate": 0.003,
"loss": 3.380882568359375,
"step": 1500
},
{
"epoch": 0.3951527924130664,
"eval_loss": 3.3679862022399902,
"eval_runtime": 11.3426,
"eval_samples_per_second": 171.478,
"eval_steps_per_second": 21.512,
"step": 1500
},
{
"epoch": 0.4214963119072708,
"grad_norm": 0.20528662204742432,
"learning_rate": 0.003,
"loss": 3.3632281494140623,
"step": 1600
},
{
"epoch": 0.44783983140147526,
"grad_norm": 0.19370083510875702,
"learning_rate": 0.003,
"loss": 3.3539483642578123,
"step": 1700
},
{
"epoch": 0.47418335089567965,
"grad_norm": 0.2023897022008896,
"learning_rate": 0.003,
"loss": 3.341988220214844,
"step": 1800
},
{
"epoch": 0.5005268703898841,
"grad_norm": 0.2200741320848465,
"learning_rate": 0.003,
"loss": 3.3259597778320313,
"step": 1900
},
{
"epoch": 0.5268703898840885,
"grad_norm": 0.18966667354106903,
"learning_rate": 0.003,
"loss": 3.3156689453125,
"step": 2000
},
{
"epoch": 0.5268703898840885,
"eval_loss": 3.3106234073638916,
"eval_runtime": 10.6762,
"eval_samples_per_second": 182.182,
"eval_steps_per_second": 22.855,
"step": 2000
},
{
"epoch": 0.553213909378293,
"grad_norm": 0.19186101853847504,
"learning_rate": 0.003,
"loss": 3.30958251953125,
"step": 2100
},
{
"epoch": 0.5795574288724974,
"grad_norm": 0.22750510275363922,
"learning_rate": 0.003,
"loss": 3.3005621337890627,
"step": 2200
},
{
"epoch": 0.6059009483667018,
"grad_norm": 0.18028104305267334,
"learning_rate": 0.003,
"loss": 3.291654052734375,
"step": 2300
},
{
"epoch": 0.6322444678609063,
"grad_norm": 0.2097722589969635,
"learning_rate": 0.003,
"loss": 3.283000793457031,
"step": 2400
},
{
"epoch": 0.6585879873551106,
"grad_norm": 0.16670863330364227,
"learning_rate": 0.003,
"loss": 3.2741189575195313,
"step": 2500
},
{
"epoch": 0.6585879873551106,
"eval_loss": 3.2709083557128906,
"eval_runtime": 11.5428,
"eval_samples_per_second": 168.503,
"eval_steps_per_second": 21.139,
"step": 2500
},
{
"epoch": 0.684931506849315,
"grad_norm": 0.17148427665233612,
"learning_rate": 0.003,
"loss": 3.2707879638671873,
"step": 2600
},
{
"epoch": 0.7112750263435195,
"grad_norm": 0.18402378261089325,
"learning_rate": 0.003,
"loss": 3.266829528808594,
"step": 2700
},
{
"epoch": 0.7376185458377239,
"grad_norm": 0.1653515249490738,
"learning_rate": 0.003,
"loss": 3.257852783203125,
"step": 2800
},
{
"epoch": 0.7639620653319283,
"grad_norm": 0.16761045157909393,
"learning_rate": 0.003,
"loss": 3.2541189575195313,
"step": 2900
},
{
"epoch": 0.7903055848261328,
"grad_norm": 0.14971940219402313,
"learning_rate": 0.003,
"loss": 3.248277282714844,
"step": 3000
},
{
"epoch": 0.7903055848261328,
"eval_loss": 3.2431423664093018,
"eval_runtime": 11.465,
"eval_samples_per_second": 169.647,
"eval_steps_per_second": 21.282,
"step": 3000
},
{
"epoch": 0.8166491043203372,
"grad_norm": 0.17114068567752838,
"learning_rate": 0.0029508779938349373,
"loss": 3.242442321777344,
"step": 3100
},
{
"epoch": 0.8429926238145417,
"grad_norm": 0.152776300907135,
"learning_rate": 0.002675231600866892,
"loss": 3.2337353515625,
"step": 3200
},
{
"epoch": 0.8693361433087461,
"grad_norm": 0.1631833165884018,
"learning_rate": 0.002201098977270783,
"loss": 3.221148681640625,
"step": 3300
},
{
"epoch": 0.8956796628029505,
"grad_norm": 0.13488836586475372,
"learning_rate": 0.0016085569327630683,
"loss": 3.199487609863281,
"step": 3400
},
{
"epoch": 0.9220231822971549,
"grad_norm": 0.12214531749486923,
"learning_rate": 0.0009976805817435207,
"loss": 3.1805181884765625,
"step": 3500
},
{
"epoch": 0.9220231822971549,
"eval_loss": 3.167757987976074,
"eval_runtime": 11.4945,
"eval_samples_per_second": 169.211,
"eval_steps_per_second": 21.228,
"step": 3500
},
{
"epoch": 0.9483667017913593,
"grad_norm": 0.12541885673999786,
"learning_rate": 0.00047164154094220246,
"loss": 3.1607696533203127,
"step": 3600
},
{
"epoch": 0.9747102212855637,
"grad_norm": 0.10409854352474213,
"learning_rate": 0.00011928315518990008,
"loss": 3.1512615966796873,
"step": 3700
},
{
"epoch": 1.0,
"eval_loss": 3.136976957321167,
"eval_runtime": 10.5793,
"eval_samples_per_second": 183.849,
"eval_steps_per_second": 23.064,
"step": 3796
}
],
"logging_steps": 100,
"max_steps": 3796,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.0656885321498624e+16,
"train_batch_size": 256,
"trial_name": null,
"trial_params": null
}