CodeIsAbstract's picture
Training in progress, step 160, checkpoint
ff0341a verified
Raw
History Blame
8.19 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.8,
"eval_steps": 20,
"global_step": 160,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.025,
"grad_norm": 0.24584950506687164,
"learning_rate": 1.6e-06,
"loss": 22.009127807617187,
"step": 5
},
{
"epoch": 0.05,
"grad_norm": 0.2564426362514496,
"learning_rate": 3.6e-06,
"loss": 22.05052947998047,
"step": 10
},
{
"epoch": 0.075,
"grad_norm": 0.2390100657939911,
"learning_rate": 3.995627254437549e-06,
"loss": 22.014682006835937,
"step": 15
},
{
"epoch": 0.1,
"grad_norm": 0.2513236105442047,
"learning_rate": 3.9778957412029366e-06,
"loss": 22.021099853515626,
"step": 20
},
{
"epoch": 0.1,
"eval_accuracy": 3.1746031746031745e-05,
"eval_loss": 11.020200729370117,
"eval_runtime": 2.4621,
"eval_samples_per_second": 406.152,
"eval_steps_per_second": 67.827,
"step": 20
},
{
"epoch": 0.125,
"grad_norm": 0.25184789299964905,
"learning_rate": 3.9466531944960116e-06,
"loss": 22.0181884765625,
"step": 25
},
{
"epoch": 0.15,
"grad_norm": 0.268789142370224,
"learning_rate": 3.902113032590307e-06,
"loss": 22.01494598388672,
"step": 30
},
{
"epoch": 0.175,
"grad_norm": 0.2609691917896271,
"learning_rate": 3.844579509954769e-06,
"loss": 22.0348876953125,
"step": 35
},
{
"epoch": 0.2,
"grad_norm": 0.2492043823003769,
"learning_rate": 3.7744456388872234e-06,
"loss": 21.99768524169922,
"step": 40
},
{
"epoch": 0.2,
"eval_accuracy": 3.1746031746031745e-05,
"eval_loss": 11.018282890319824,
"eval_runtime": 2.6799,
"eval_samples_per_second": 373.142,
"eval_steps_per_second": 62.315,
"step": 40
},
{
"epoch": 0.225,
"grad_norm": 0.2999836802482605,
"learning_rate": 3.6921905048418706e-06,
"loss": 21.986573791503908,
"step": 45
},
{
"epoch": 0.25,
"grad_norm": 0.2840990126132965,
"learning_rate": 3.598375993789849e-06,
"loss": 22.012301635742187,
"step": 50
},
{
"epoch": 0.275,
"grad_norm": 0.28335806727409363,
"learning_rate": 3.4936429539683075e-06,
"loss": 22.00952606201172,
"step": 55
},
{
"epoch": 0.3,
"grad_norm": 0.2717016935348511,
"learning_rate": 3.3787068182371314e-06,
"loss": 21.99034423828125,
"step": 60
},
{
"epoch": 0.3,
"eval_accuracy": 3.1746031746031745e-05,
"eval_loss": 11.01639175415039,
"eval_runtime": 2.4905,
"eval_samples_per_second": 401.523,
"eval_steps_per_second": 67.054,
"step": 60
},
{
"epoch": 0.325,
"grad_norm": 0.26950836181640625,
"learning_rate": 3.254352716947074e-06,
"loss": 22.037962341308592,
"step": 65
},
{
"epoch": 0.35,
"grad_norm": 0.25924476981163025,
"learning_rate": 3.1214301147033453e-06,
"loss": 22.014053344726562,
"step": 70
},
{
"epoch": 0.375,
"grad_norm": 0.31555065512657166,
"learning_rate": 2.9808470076610163e-06,
"loss": 21.961640930175783,
"step": 75
},
{
"epoch": 0.4,
"grad_norm": 0.2712528705596924,
"learning_rate": 2.833563720990581e-06,
"loss": 21.988558959960937,
"step": 80
},
{
"epoch": 0.4,
"eval_accuracy": 3.1746031746031745e-05,
"eval_loss": 11.01443099975586,
"eval_runtime": 2.612,
"eval_samples_per_second": 382.842,
"eval_steps_per_second": 63.935,
"step": 80
},
{
"epoch": 0.425,
"grad_norm": 0.260957270860672,
"learning_rate": 2.680586348883286e-06,
"loss": 22.034954833984376,
"step": 85
},
{
"epoch": 0.45,
"grad_norm": 0.2659424841403961,
"learning_rate": 2.5229598819076393e-06,
"loss": 22.037962341308592,
"step": 90
},
{
"epoch": 0.475,
"grad_norm": 0.2600838541984558,
"learning_rate": 2.36176106866422e-06,
"loss": 21.996064758300783,
"step": 95
},
{
"epoch": 0.5,
"grad_norm": 0.2419586181640625,
"learning_rate": 2.198091060500926e-06,
"loss": 22.00383605957031,
"step": 100
},
{
"epoch": 0.5,
"eval_accuracy": 3.1746031746031745e-05,
"eval_loss": 11.012611389160156,
"eval_runtime": 2.6096,
"eval_samples_per_second": 383.201,
"eval_steps_per_second": 63.995,
"step": 100
},
{
"epoch": 0.525,
"grad_norm": 0.24510444700717926,
"learning_rate": 2.033067889532717e-06,
"loss": 21.980421447753905,
"step": 105
},
{
"epoch": 0.55,
"grad_norm": 0.24764317274093628,
"learning_rate": 1.8678188313486012e-06,
"loss": 21.973478698730467,
"step": 110
},
{
"epoch": 0.575,
"grad_norm": 0.28122493624687195,
"learning_rate": 1.7034727045763157e-06,
"loss": 21.949703979492188,
"step": 115
},
{
"epoch": 0.6,
"grad_norm": 0.250843346118927,
"learning_rate": 1.541152159906497e-06,
"loss": 21.94451141357422,
"step": 120
},
{
"epoch": 0.6,
"eval_accuracy": 3.1746031746031745e-05,
"eval_loss": 11.010734558105469,
"eval_runtime": 2.7011,
"eval_samples_per_second": 370.215,
"eval_steps_per_second": 61.826,
"step": 120
},
{
"epoch": 0.625,
"grad_norm": 0.24475905299186707,
"learning_rate": 1.3819660112501052e-06,
"loss": 22.0078369140625,
"step": 125
},
{
"epoch": 0.65,
"grad_norm": 0.2379191815853119,
"learning_rate": 1.227001661415096e-06,
"loss": 22.009359741210936,
"step": 130
},
{
"epoch": 0.675,
"grad_norm": 0.26111480593681335,
"learning_rate": 1.0773176740426246e-06,
"loss": 21.976290893554687,
"step": 135
},
{
"epoch": 0.7,
"grad_norm": 0.28270959854125977,
"learning_rate": 9.339365425440129e-07,
"loss": 22.019345092773438,
"step": 140
},
{
"epoch": 0.7,
"eval_accuracy": 3.1746031746031745e-05,
"eval_loss": 11.009251594543457,
"eval_runtime": 2.5123,
"eval_samples_per_second": 398.045,
"eval_steps_per_second": 66.473,
"step": 140
},
{
"epoch": 0.725,
"grad_norm": 0.2701219916343689,
"learning_rate": 7.978377054339498e-07,
"loss": 21.985748291015625,
"step": 145
},
{
"epoch": 0.75,
"grad_norm": 0.24651674926280975,
"learning_rate": 6.699508557723032e-07,
"loss": 22.00152130126953,
"step": 150
},
{
"epoch": 0.775,
"grad_norm": 0.26024770736694336,
"learning_rate": 5.511495904178221e-07,
"loss": 22.02308044433594,
"step": 155
},
{
"epoch": 0.8,
"grad_norm": 0.25778868794441223,
"learning_rate": 4.4224544247577535e-07,
"loss": 21.997288513183594,
"step": 160
},
{
"epoch": 0.8,
"eval_accuracy": 3.1746031746031745e-05,
"eval_loss": 11.007829666137695,
"eval_runtime": 2.7386,
"eval_samples_per_second": 365.156,
"eval_steps_per_second": 60.981,
"step": 160
}
],
"logging_steps": 5,
"max_steps": 200,
"num_input_tokens_seen": 0,
"num_train_epochs": 9223372036854775807,
"save_steps": 20,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 6,
"trial_name": null,
"trial_params": null
}