Width-Vs-Depth / config_b /trainer_state.json
Harley-ml's picture
Upload 3 files
f06b647 verified
Raw
History Blame Contribute Delete
8.88 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 3796,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.026343519494204427,
"grad_norm": 0.25060537457466125,
"learning_rate": 0.003,
"loss": 6.455713500976563,
"step": 100
},
{
"epoch": 0.05268703898840885,
"grad_norm": 0.4601215124130249,
"learning_rate": 0.003,
"loss": 5.242710571289063,
"step": 200
},
{
"epoch": 0.07903055848261328,
"grad_norm": 0.8276243805885315,
"learning_rate": 0.003,
"loss": 4.580478210449218,
"step": 300
},
{
"epoch": 0.1053740779768177,
"grad_norm": 0.5789214372634888,
"learning_rate": 0.003,
"loss": 4.156412353515625,
"step": 400
},
{
"epoch": 0.13171759747102213,
"grad_norm": 0.4085150361061096,
"learning_rate": 0.003,
"loss": 3.9434808349609374,
"step": 500
},
{
"epoch": 0.13171759747102213,
"eval_loss": 3.8796331882476807,
"eval_runtime": 5.3536,
"eval_samples_per_second": 363.308,
"eval_steps_per_second": 45.577,
"step": 500
},
{
"epoch": 0.15806111696522657,
"grad_norm": 0.3597581684589386,
"learning_rate": 0.003,
"loss": 3.82419189453125,
"step": 600
},
{
"epoch": 0.18440463645943098,
"grad_norm": 0.34120166301727295,
"learning_rate": 0.003,
"loss": 3.7427273559570313,
"step": 700
},
{
"epoch": 0.2107481559536354,
"grad_norm": 0.28499704599380493,
"learning_rate": 0.003,
"loss": 3.679521484375,
"step": 800
},
{
"epoch": 0.23709167544783982,
"grad_norm": 0.2465476095676422,
"learning_rate": 0.003,
"loss": 3.6226321411132814,
"step": 900
},
{
"epoch": 0.26343519494204426,
"grad_norm": 0.22941064834594727,
"learning_rate": 0.003,
"loss": 3.5675198364257814,
"step": 1000
},
{
"epoch": 0.26343519494204426,
"eval_loss": 3.5459935665130615,
"eval_runtime": 5.0816,
"eval_samples_per_second": 382.75,
"eval_steps_per_second": 48.016,
"step": 1000
},
{
"epoch": 0.2897787144362487,
"grad_norm": 0.25667181611061096,
"learning_rate": 0.003,
"loss": 3.5283328247070314,
"step": 1100
},
{
"epoch": 0.31612223393045313,
"grad_norm": 0.2258286029100418,
"learning_rate": 0.003,
"loss": 3.491883544921875,
"step": 1200
},
{
"epoch": 0.3424657534246575,
"grad_norm": 0.21453158557415009,
"learning_rate": 0.003,
"loss": 3.461572265625,
"step": 1300
},
{
"epoch": 0.36880927291886195,
"grad_norm": 0.1976873278617859,
"learning_rate": 0.003,
"loss": 3.4373324584960936,
"step": 1400
},
{
"epoch": 0.3951527924130664,
"grad_norm": 0.1984185427427292,
"learning_rate": 0.003,
"loss": 3.4184698486328124,
"step": 1500
},
{
"epoch": 0.3951527924130664,
"eval_loss": 3.406769037246704,
"eval_runtime": 5.4292,
"eval_samples_per_second": 358.251,
"eval_steps_per_second": 44.942,
"step": 1500
},
{
"epoch": 0.4214963119072708,
"grad_norm": 0.18770232796669006,
"learning_rate": 0.003,
"loss": 3.3980938720703127,
"step": 1600
},
{
"epoch": 0.44783983140147526,
"grad_norm": 0.1807233989238739,
"learning_rate": 0.003,
"loss": 3.3868283081054686,
"step": 1700
},
{
"epoch": 0.47418335089567965,
"grad_norm": 0.18816792964935303,
"learning_rate": 0.003,
"loss": 3.3717727661132812,
"step": 1800
},
{
"epoch": 0.5005268703898841,
"grad_norm": 0.16948869824409485,
"learning_rate": 0.003,
"loss": 3.35481201171875,
"step": 1900
},
{
"epoch": 0.5268703898840885,
"grad_norm": 0.1610724776983261,
"learning_rate": 0.003,
"loss": 3.3426513671875,
"step": 2000
},
{
"epoch": 0.5268703898840885,
"eval_loss": 3.335824966430664,
"eval_runtime": 5.1676,
"eval_samples_per_second": 376.38,
"eval_steps_per_second": 47.217,
"step": 2000
},
{
"epoch": 0.553213909378293,
"grad_norm": 0.17394305765628815,
"learning_rate": 0.003,
"loss": 3.3357525634765626,
"step": 2100
},
{
"epoch": 0.5795574288724974,
"grad_norm": 0.17073123157024384,
"learning_rate": 0.003,
"loss": 3.3254248046875,
"step": 2200
},
{
"epoch": 0.6059009483667018,
"grad_norm": 0.16089457273483276,
"learning_rate": 0.003,
"loss": 3.315399169921875,
"step": 2300
},
{
"epoch": 0.6322444678609063,
"grad_norm": 0.18953143060207367,
"learning_rate": 0.003,
"loss": 3.305037536621094,
"step": 2400
},
{
"epoch": 0.6585879873551106,
"grad_norm": 0.17774879932403564,
"learning_rate": 0.003,
"loss": 3.2955453491210935,
"step": 2500
},
{
"epoch": 0.6585879873551106,
"eval_loss": 3.291829824447632,
"eval_runtime": 5.1763,
"eval_samples_per_second": 375.751,
"eval_steps_per_second": 47.138,
"step": 2500
},
{
"epoch": 0.684931506849315,
"grad_norm": 0.15615127980709076,
"learning_rate": 0.003,
"loss": 3.291881408691406,
"step": 2600
},
{
"epoch": 0.7112750263435195,
"grad_norm": 0.14877459406852722,
"learning_rate": 0.003,
"loss": 3.28682861328125,
"step": 2700
},
{
"epoch": 0.7376185458377239,
"grad_norm": 0.1652265042066574,
"learning_rate": 0.003,
"loss": 3.2773147583007813,
"step": 2800
},
{
"epoch": 0.7639620653319283,
"grad_norm": 0.15335354208946228,
"learning_rate": 0.003,
"loss": 3.272921142578125,
"step": 2900
},
{
"epoch": 0.7903055848261328,
"grad_norm": 0.15235580503940582,
"learning_rate": 0.003,
"loss": 3.2669085693359374,
"step": 3000
},
{
"epoch": 0.7903055848261328,
"eval_loss": 3.2598516941070557,
"eval_runtime": 5.2882,
"eval_samples_per_second": 367.801,
"eval_steps_per_second": 46.141,
"step": 3000
},
{
"epoch": 0.8166491043203372,
"grad_norm": 0.1472020000219345,
"learning_rate": 0.0029508779938349373,
"loss": 3.2607357788085936,
"step": 3100
},
{
"epoch": 0.8429926238145417,
"grad_norm": 0.14368093013763428,
"learning_rate": 0.002675231600866892,
"loss": 3.2511105346679687,
"step": 3200
},
{
"epoch": 0.8693361433087461,
"grad_norm": 0.13688847422599792,
"learning_rate": 0.002201098977270783,
"loss": 3.2377633666992187,
"step": 3300
},
{
"epoch": 0.8956796628029505,
"grad_norm": 0.12832748889923096,
"learning_rate": 0.0016085569327630683,
"loss": 3.2152593994140624,
"step": 3400
},
{
"epoch": 0.9220231822971549,
"grad_norm": 0.12625813484191895,
"learning_rate": 0.0009976805817435207,
"loss": 3.195493469238281,
"step": 3500
},
{
"epoch": 0.9220231822971549,
"eval_loss": 3.182077646255493,
"eval_runtime": 5.1942,
"eval_samples_per_second": 374.458,
"eval_steps_per_second": 46.976,
"step": 3500
},
{
"epoch": 0.9483667017913593,
"grad_norm": 0.12080375850200653,
"learning_rate": 0.00047164154094220246,
"loss": 3.1744677734375,
"step": 3600
},
{
"epoch": 0.9747102212855637,
"grad_norm": 0.10628718882799149,
"learning_rate": 0.00011928315518990008,
"loss": 3.1650640869140627,
"step": 3700
},
{
"epoch": 1.0,
"eval_loss": 3.149350166320801,
"eval_runtime": 6.4517,
"eval_samples_per_second": 301.472,
"eval_steps_per_second": 37.82,
"step": 3796
}
],
"logging_steps": 100,
"max_steps": 3796,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 9923983243739136.0,
"train_batch_size": 256,
"trial_name": null,
"trial_params": null
}