amlk-e4-curated / checkpoint-293 /trainer_state.json
avreymi's picture
Training in progress, step 293, checkpoint
f6ec7e6 verified
Raw
History Blame Contribute Delete
11.6 kB
{
"best_global_step": 293,
"best_metric": 0.7508089542388916,
"best_model_checkpoint": "/data/output/checkpoint-293",
"epoch": 1.0,
"eval_steps": 50,
"global_step": 293,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 0.9166833657771349,
"epoch": 0.034158838599487616,
"grad_norm": 3.222971200942993,
"learning_rate": 0.00012,
"loss": 0.9930056571960449,
"mean_token_accuracy": 0.7560420431196689,
"num_tokens": 527570.0,
"step": 10
},
{
"entropy": 0.8743617489933968,
"epoch": 0.06831767719897523,
"grad_norm": 2.950977325439453,
"learning_rate": 0.00019989785286500295,
"loss": 0.8596245765686035,
"mean_token_accuracy": 0.7780317589640617,
"num_tokens": 911738.0,
"step": 20
},
{
"entropy": 0.8505361303687096,
"epoch": 0.10247651579846286,
"grad_norm": 2.1713857650756836,
"learning_rate": 0.00019875109281794825,
"loss": 0.8519834518432617,
"mean_token_accuracy": 0.7800005592405796,
"num_tokens": 1217407.0,
"step": 30
},
{
"entropy": 0.8255588114261627,
"epoch": 0.13663535439795046,
"grad_norm": 2.044369697570801,
"learning_rate": 0.00019634456691705702,
"loss": 0.8329530715942383,
"mean_token_accuracy": 0.7832169122993946,
"num_tokens": 1459942.0,
"step": 40
},
{
"entropy": 0.7476669192314148,
"epoch": 0.1707941929974381,
"grad_norm": 2.332352638244629,
"learning_rate": 0.00019270897516847403,
"loss": 0.7421693325042724,
"mean_token_accuracy": 0.8033282555639744,
"num_tokens": 1607170.0,
"step": 50
},
{
"epoch": 0.1707941929974381,
"eval_entropy": 0.7600614526867866,
"eval_loss": 0.8239800930023193,
"eval_mean_token_accuracy": 0.783122000694275,
"eval_num_tokens": 1607170.0,
"eval_runtime": 68.4494,
"eval_samples_per_second": 1.461,
"eval_steps_per_second": 1.461,
"step": 50
},
{
"entropy": 0.9212068691849709,
"epoch": 0.2049530315969257,
"grad_norm": 2.5008842945098877,
"learning_rate": 0.0001878906967484966,
"loss": 0.9536626815795899,
"mean_token_accuracy": 0.7510255746543407,
"num_tokens": 2140236.0,
"step": 60
},
{
"entropy": 0.892504171282053,
"epoch": 0.23911187019641333,
"grad_norm": 2.6001062393188477,
"learning_rate": 0.00018195119834528534,
"loss": 0.8938531875610352,
"mean_token_accuracy": 0.7676444724202156,
"num_tokens": 2529105.0,
"step": 70
},
{
"entropy": 0.8622478015720845,
"epoch": 0.27327070879590093,
"grad_norm": 2.4243602752685547,
"learning_rate": 0.000174966250029467,
"loss": 0.8663266181945801,
"mean_token_accuracy": 0.7741704121232033,
"num_tokens": 2827030.0,
"step": 80
},
{
"entropy": 0.8519950624555349,
"epoch": 0.3074295473953886,
"grad_norm": 2.669633150100708,
"learning_rate": 0.0001670249586567531,
"loss": 0.8582368850708008,
"mean_token_accuracy": 0.7774012103676796,
"num_tokens": 3056051.0,
"step": 90
},
{
"entropy": 0.7770494304597377,
"epoch": 0.3415883859948762,
"grad_norm": 2.272737741470337,
"learning_rate": 0.00015822863113343935,
"loss": 0.7583271026611328,
"mean_token_accuracy": 0.7930335685610771,
"num_tokens": 3197462.0,
"step": 100
},
{
"epoch": 0.3415883859948762,
"eval_entropy": 0.7913119502365589,
"eval_loss": 0.8178356885910034,
"eval_mean_token_accuracy": 0.7806616699695588,
"eval_num_tokens": 3197462.0,
"eval_runtime": 68.4545,
"eval_samples_per_second": 1.461,
"eval_steps_per_second": 1.461,
"step": 100
},
{
"entropy": 0.8400638666003942,
"epoch": 0.37574722459436377,
"grad_norm": 2.6273744106292725,
"learning_rate": 0.000148689482046087,
"loss": 0.874265193939209,
"mean_token_accuracy": 0.7818703927099705,
"num_tokens": 3723005.0,
"step": 110
},
{
"entropy": 0.925657919421792,
"epoch": 0.4099060631938514,
"grad_norm": 2.1081862449645996,
"learning_rate": 0.00013852920214212964,
"loss": 0.9439982414245606,
"mean_token_accuracy": 0.7651735462248326,
"num_tokens": 4114734.0,
"step": 120
},
{
"entropy": 0.882326266542077,
"epoch": 0.444064901793339,
"grad_norm": 2.2644991874694824,
"learning_rate": 0.0001278774059232723,
"loss": 0.8633623123168945,
"mean_token_accuracy": 0.7738826431334018,
"num_tokens": 4422977.0,
"step": 130
},
{
"entropy": 0.807782543823123,
"epoch": 0.47822374039282667,
"grad_norm": 3.417691946029663,
"learning_rate": 0.00011686997815570473,
"loss": 0.8137018203735351,
"mean_token_accuracy": 0.7846895553171634,
"num_tokens": 4655796.0,
"step": 140
},
{
"entropy": 0.7050723437219858,
"epoch": 0.5123825789923142,
"grad_norm": 2.4027786254882812,
"learning_rate": 0.00010564734039066699,
"loss": 0.712303638458252,
"mean_token_accuracy": 0.8001660093665123,
"num_tokens": 4792918.0,
"step": 150
},
{
"epoch": 0.5123825789923142,
"eval_entropy": 0.8103001257777214,
"eval_loss": 0.7926951050758362,
"eval_mean_token_accuracy": 0.7870555037260055,
"eval_num_tokens": 4792918.0,
"eval_runtime": 68.4439,
"eval_samples_per_second": 1.461,
"eval_steps_per_second": 1.461,
"step": 150
},
{
"entropy": 0.9130790904164314,
"epoch": 0.5465414175918019,
"grad_norm": 3.106920003890991,
"learning_rate": 9.435265960933302e-05,
"loss": 0.9007230758666992,
"mean_token_accuracy": 0.765869815647602,
"num_tokens": 5341793.0,
"step": 160
},
{
"entropy": 0.8538723237812519,
"epoch": 0.5807002561912895,
"grad_norm": 2.4355342388153076,
"learning_rate": 8.313002184429529e-05,
"loss": 0.8396717071533203,
"mean_token_accuracy": 0.7828280851244926,
"num_tokens": 5741381.0,
"step": 170
},
{
"entropy": 0.8008106090128422,
"epoch": 0.6148590947907772,
"grad_norm": 2.2028732299804688,
"learning_rate": 7.21225940767277e-05,
"loss": 0.8295732498168945,
"mean_token_accuracy": 0.7857915386557579,
"num_tokens": 6044669.0,
"step": 180
},
{
"entropy": 0.7763356593437493,
"epoch": 0.6490179333902647,
"grad_norm": 2.3838558197021484,
"learning_rate": 6.147079785787038e-05,
"loss": 0.7925190925598145,
"mean_token_accuracy": 0.7925213143229485,
"num_tokens": 6265758.0,
"step": 190
},
{
"entropy": 0.7516565401107073,
"epoch": 0.6831767719897524,
"grad_norm": 2.4081294536590576,
"learning_rate": 5.131051795391302e-05,
"loss": 0.7475024223327636,
"mean_token_accuracy": 0.7955034308135509,
"num_tokens": 6393481.0,
"step": 200
},
{
"epoch": 0.6831767719897524,
"eval_entropy": 0.7843938270211219,
"eval_loss": 0.7650399208068848,
"eval_mean_token_accuracy": 0.7912229967117309,
"eval_num_tokens": 6393481.0,
"eval_runtime": 68.4585,
"eval_samples_per_second": 1.461,
"eval_steps_per_second": 1.461,
"step": 200
},
{
"entropy": 0.8729221720248461,
"epoch": 0.71733561058924,
"grad_norm": 2.095632791519165,
"learning_rate": 4.1771368866560665e-05,
"loss": 0.8615994453430176,
"mean_token_accuracy": 0.7780913896858692,
"num_tokens": 6941504.0,
"step": 210
},
{
"entropy": 0.8114416748285294,
"epoch": 0.7514944491887275,
"grad_norm": 2.0843183994293213,
"learning_rate": 3.2975041343246936e-05,
"loss": 0.8434048652648926,
"mean_token_accuracy": 0.7824041344225406,
"num_tokens": 7343592.0,
"step": 220
},
{
"entropy": 0.8621546909213066,
"epoch": 0.7856532877882152,
"grad_norm": 2.093738317489624,
"learning_rate": 2.5033749970533015e-05,
"loss": 0.8560552597045898,
"mean_token_accuracy": 0.7798775337636471,
"num_tokens": 7660705.0,
"step": 230
},
{
"entropy": 0.756019243132323,
"epoch": 0.8198121263877028,
"grad_norm": 2.397739887237549,
"learning_rate": 1.8048801654714688e-05,
"loss": 0.7541797161102295,
"mean_token_accuracy": 0.801513460278511,
"num_tokens": 7899243.0,
"step": 240
},
{
"entropy": 0.6868984286673367,
"epoch": 0.8539709649871904,
"grad_norm": 2.3398942947387695,
"learning_rate": 1.2109303251503434e-05,
"loss": 0.6575294971466065,
"mean_token_accuracy": 0.8151952736079693,
"num_tokens": 8040306.0,
"step": 250
},
{
"epoch": 0.8539709649871904,
"eval_entropy": 0.761812056005001,
"eval_loss": 0.7535683512687683,
"eval_mean_token_accuracy": 0.7959340953826904,
"eval_num_tokens": 8040306.0,
"eval_runtime": 68.4452,
"eval_samples_per_second": 1.461,
"eval_steps_per_second": 1.461,
"step": 250
},
{
"entropy": 0.8774461716413497,
"epoch": 0.888129803586678,
"grad_norm": 3.395538091659546,
"learning_rate": 7.291024831525961e-06,
"loss": 0.8889847755432129,
"mean_token_accuracy": 0.7704262785613537,
"num_tokens": 524637.0,
"step": 260
},
{
"entropy": 0.8536802887916565,
"epoch": 0.9222886421861657,
"grad_norm": 2.4246485233306885,
"learning_rate": 3.655433082942972e-06,
"loss": 0.874198055267334,
"mean_token_accuracy": 0.7646903492510319,
"num_tokens": 896801.0,
"step": 270
},
{
"entropy": 0.8110974848270416,
"epoch": 0.9564474807856533,
"grad_norm": 2.450005531311035,
"learning_rate": 1.2489071820517396e-06,
"loss": 0.8041668891906738,
"mean_token_accuracy": 0.7852038599550724,
"num_tokens": 1182207.0,
"step": 280
},
{
"entropy": 0.7051055304706096,
"epoch": 0.9906063193851409,
"grad_norm": 2.2891805171966553,
"learning_rate": 1.0214713499706597e-07,
"loss": 0.710789155960083,
"mean_token_accuracy": 0.80729488581419,
"num_tokens": 1374112.0,
"step": 290
},
{
"epoch": 1.0,
"eval_entropy": 0.7507871267944575,
"eval_loss": 0.7508089542388916,
"eval_mean_token_accuracy": 0.7960579419136047,
"eval_num_tokens": 1401863.0,
"eval_runtime": 68.5518,
"eval_samples_per_second": 1.459,
"eval_steps_per_second": 1.459,
"step": 293
}
],
"logging_steps": 10,
"max_steps": 293,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 4.0834807145130394e+17,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}