instruct_glock_28c9f3bb / trainer_state.json
Jordansky's picture
Upload folder using huggingface_hub
9cad513 verified
Raw
History Blame Contribute Delete
11.2 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.9844961240310077,
"eval_steps": 20,
"global_step": 256,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.03875968992248062,
"grad_norm": 6.5625,
"learning_rate": 2.8641664412814824e-05,
"loss": 2.365,
"step": 5
},
{
"epoch": 0.07751937984496124,
"grad_norm": 4.875,
"learning_rate": 6.444374492883336e-05,
"loss": 2.2188,
"step": 10
},
{
"epoch": 0.11627906976744186,
"grad_norm": 4.03125,
"learning_rate": 7.875529867216568e-05,
"loss": 2.1965,
"step": 15
},
{
"epoch": 0.15503875968992248,
"grad_norm": 3.40625,
"learning_rate": 7.869861806238865e-05,
"loss": 2.125,
"step": 20
},
{
"epoch": 0.1937984496124031,
"grad_norm": 3.046875,
"learning_rate": 7.859051033349804e-05,
"loss": 2.0542,
"step": 25
},
{
"epoch": 0.23255813953488372,
"grad_norm": 3.0625,
"learning_rate": 7.843116413585616e-05,
"loss": 2.0675,
"step": 30
},
{
"epoch": 0.2713178294573643,
"grad_norm": 2.75,
"learning_rate": 7.822085753207902e-05,
"loss": 2.0164,
"step": 35
},
{
"epoch": 0.31007751937984496,
"grad_norm": 2.765625,
"learning_rate": 7.795995751181111e-05,
"loss": 1.9894,
"step": 40
},
{
"epoch": 0.3488372093023256,
"grad_norm": 2.578125,
"learning_rate": 7.764891935132029e-05,
"loss": 1.9728,
"step": 45
},
{
"epoch": 0.3875968992248062,
"grad_norm": 2.6875,
"learning_rate": 7.728828581903074e-05,
"loss": 1.9631,
"step": 50
},
{
"epoch": 0.4263565891472868,
"grad_norm": 2.609375,
"learning_rate": 7.687868622838021e-05,
"loss": 1.9469,
"step": 55
},
{
"epoch": 0.46511627906976744,
"grad_norm": 2.421875,
"learning_rate": 7.642083533965407e-05,
"loss": 1.9201,
"step": 60
},
{
"epoch": 0.5038759689922481,
"grad_norm": 2.40625,
"learning_rate": 7.591553211271311e-05,
"loss": 1.9082,
"step": 65
},
{
"epoch": 0.5426356589147286,
"grad_norm": 2.53125,
"learning_rate": 7.536365831279087e-05,
"loss": 1.8827,
"step": 70
},
{
"epoch": 0.5813953488372093,
"grad_norm": 2.390625,
"learning_rate": 7.476617697179401e-05,
"loss": 1.9141,
"step": 75
},
{
"epoch": 0.6201550387596899,
"grad_norm": 2.40625,
"learning_rate": 7.412413070779045e-05,
"loss": 1.8946,
"step": 80
},
{
"epoch": 0.6589147286821705,
"grad_norm": 2.359375,
"learning_rate": 7.343863990561798e-05,
"loss": 1.8896,
"step": 85
},
{
"epoch": 0.6976744186046512,
"grad_norm": 2.21875,
"learning_rate": 7.271090076178798e-05,
"loss": 1.8623,
"step": 90
},
{
"epoch": 0.7364341085271318,
"grad_norm": 2.265625,
"learning_rate": 7.194218319709636e-05,
"loss": 1.8596,
"step": 95
},
{
"epoch": 0.7751937984496124,
"grad_norm": 2.28125,
"learning_rate": 7.113382864058384e-05,
"loss": 1.8199,
"step": 100
},
{
"epoch": 0.7751937984496124,
"eval_loss": 1.8531988859176636,
"eval_runtime": 6.7302,
"eval_samples_per_second": 39.226,
"eval_steps_per_second": 39.226,
"step": 100
},
{
"epoch": 0.813953488372093,
"grad_norm": 2.265625,
"learning_rate": 7.02872476887127e-05,
"loss": 1.8224,
"step": 105
},
{
"epoch": 0.8527131782945736,
"grad_norm": 2.265625,
"learning_rate": 6.940391764384508e-05,
"loss": 1.8168,
"step": 110
},
{
"epoch": 0.8914728682170543,
"grad_norm": 2.1875,
"learning_rate": 6.848537993631783e-05,
"loss": 1.8176,
"step": 115
},
{
"epoch": 0.9302325581395349,
"grad_norm": 2.203125,
"learning_rate": 6.753323743461277e-05,
"loss": 1.7909,
"step": 120
},
{
"epoch": 0.9302325581395349,
"eval_loss": 1.818508505821228,
"eval_runtime": 6.5621,
"eval_samples_per_second": 40.231,
"eval_steps_per_second": 40.231,
"step": 120
},
{
"epoch": 0.9689922480620154,
"grad_norm": 2.203125,
"learning_rate": 6.654915164831587e-05,
"loss": 1.7923,
"step": 125
},
{
"epoch": 0.9922480620155039,
"eval_loss": 1.8079824447631836,
"eval_runtime": 6.6044,
"eval_samples_per_second": 39.973,
"eval_steps_per_second": 39.973,
"step": 128
},
{
"epoch": 1.0077519379844961,
"grad_norm": 2.75,
"learning_rate": 6.553483982874658e-05,
"loss": 1.6814,
"step": 130
},
{
"epoch": 1.0465116279069768,
"grad_norm": 2.6875,
"learning_rate": 6.44920719723166e-05,
"loss": 1.4301,
"step": 135
},
{
"epoch": 1.0852713178294573,
"grad_norm": 2.296875,
"learning_rate": 6.342266773184709e-05,
"loss": 1.3977,
"step": 140
},
{
"epoch": 1.0852713178294573,
"eval_loss": 1.8325544595718384,
"eval_runtime": 6.6999,
"eval_samples_per_second": 39.404,
"eval_steps_per_second": 39.404,
"step": 140
},
{
"epoch": 1.124031007751938,
"grad_norm": 2.328125,
"learning_rate": 6.23284932412347e-05,
"loss": 1.3706,
"step": 145
},
{
"epoch": 1.1627906976744187,
"grad_norm": 2.265625,
"learning_rate": 6.121145785900679e-05,
"loss": 1.3717,
"step": 150
},
{
"epoch": 1.2015503875968991,
"grad_norm": 2.296875,
"learning_rate": 6.007351083644889e-05,
"loss": 1.386,
"step": 155
},
{
"epoch": 1.2403100775193798,
"grad_norm": 2.203125,
"learning_rate": 5.89166379161184e-05,
"loss": 1.3732,
"step": 160
},
{
"epoch": 1.2403100775193798,
"eval_loss": 1.804962396621704,
"eval_runtime": 6.6306,
"eval_samples_per_second": 39.815,
"eval_steps_per_second": 39.815,
"step": 160
},
{
"epoch": 1.2790697674418605,
"grad_norm": 2.171875,
"learning_rate": 5.774285786668016e-05,
"loss": 1.3714,
"step": 165
},
{
"epoch": 1.3178294573643412,
"grad_norm": 2.15625,
"learning_rate": 5.655421896011079e-05,
"loss": 1.3909,
"step": 170
},
{
"epoch": 1.3565891472868217,
"grad_norm": 2.171875,
"learning_rate": 5.535279539741907e-05,
"loss": 1.3855,
"step": 175
},
{
"epoch": 1.3953488372093024,
"grad_norm": 2.15625,
"learning_rate": 5.414068368911964e-05,
"loss": 1.364,
"step": 180
},
{
"epoch": 1.3953488372093024,
"eval_loss": 1.7959312200546265,
"eval_runtime": 10.3349,
"eval_samples_per_second": 25.544,
"eval_steps_per_second": 25.544,
"step": 180
},
{
"epoch": 1.4341085271317828,
"grad_norm": 2.140625,
"learning_rate": 5.291999899677604e-05,
"loss": 1.3704,
"step": 185
},
{
"epoch": 1.4728682170542635,
"grad_norm": 2.078125,
"learning_rate": 5.169287144199738e-05,
"loss": 1.3877,
"step": 190
},
{
"epoch": 1.5116279069767442,
"grad_norm": 2.140625,
"learning_rate": 5.0461442389329213e-05,
"loss": 1.3725,
"step": 195
},
{
"epoch": 1.550387596899225,
"grad_norm": 2.21875,
"learning_rate": 4.9227860709525484e-05,
"loss": 1.3505,
"step": 200
},
{
"epoch": 1.550387596899225,
"eval_loss": 1.7789695262908936,
"eval_runtime": 6.8387,
"eval_samples_per_second": 38.604,
"eval_steps_per_second": 38.604,
"step": 200
},
{
"epoch": 1.5891472868217056,
"grad_norm": 2.21875,
"learning_rate": 4.799427902972175e-05,
"loss": 1.3643,
"step": 205
},
{
"epoch": 1.627906976744186,
"grad_norm": 2.140625,
"learning_rate": 4.676284997705359e-05,
"loss": 1.3627,
"step": 210
},
{
"epoch": 1.6666666666666665,
"grad_norm": 2.09375,
"learning_rate": 4.553572242227492e-05,
"loss": 1.355,
"step": 215
},
{
"epoch": 1.7054263565891472,
"grad_norm": 2.046875,
"learning_rate": 4.431503772993132e-05,
"loss": 1.368,
"step": 220
},
{
"epoch": 1.7054263565891472,
"eval_loss": 1.7671611309051514,
"eval_runtime": 6.5866,
"eval_samples_per_second": 40.082,
"eval_steps_per_second": 40.082,
"step": 220
},
{
"epoch": 1.744186046511628,
"grad_norm": 2.171875,
"learning_rate": 4.310292602163189e-05,
"loss": 1.3474,
"step": 225
},
{
"epoch": 1.7829457364341086,
"grad_norm": 2.03125,
"learning_rate": 4.190150245894017e-05,
"loss": 1.3473,
"step": 230
},
{
"epoch": 1.8217054263565893,
"grad_norm": 2.03125,
"learning_rate": 4.07128635523708e-05,
"loss": 1.3479,
"step": 235
},
{
"epoch": 1.8604651162790697,
"grad_norm": 2.0625,
"learning_rate": 3.953908350293255e-05,
"loss": 1.3268,
"step": 240
},
{
"epoch": 1.8604651162790697,
"eval_loss": 1.7548513412475586,
"eval_runtime": 6.6079,
"eval_samples_per_second": 39.952,
"eval_steps_per_second": 39.952,
"step": 240
},
{
"epoch": 1.8992248062015504,
"grad_norm": 2.09375,
"learning_rate": 3.8382210582602076e-05,
"loss": 1.3408,
"step": 245
},
{
"epoch": 1.937984496124031,
"grad_norm": 2.0625,
"learning_rate": 3.724426356004418e-05,
"loss": 1.3578,
"step": 250
},
{
"epoch": 1.9767441860465116,
"grad_norm": 2.015625,
"learning_rate": 3.612722817781627e-05,
"loss": 1.3552,
"step": 255
},
{
"epoch": 1.9844961240310077,
"eval_loss": 1.7418702840805054,
"eval_runtime": 6.6959,
"eval_samples_per_second": 39.427,
"eval_steps_per_second": 39.427,
"step": 256
}
],
"logging_steps": 5,
"max_steps": 387,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 20,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 6.685242865562419e+16,
"train_batch_size": 100,
"trial_name": null,
"trial_params": null
}