mdlm_cot / checkpoint-500-split1 /trainer_state.json
avgJo3's picture
Add files using upload-large-folder tool
815415a verified
Raw
History Blame Contribute Delete
8.27 kB
{
"best_global_step": 500,
"best_metric": 2.009260514264372,
"best_model_checkpoint": "/content/cot-split1/checkpoint-500",
"epoch": 0.7832080200501254,
"eval_steps": 250,
"global_step": 500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0,
"eval_bpd": 5.449506205976702,
"eval_entropy": 3.8259646681880883,
"eval_loss": 3.7819511890411377,
"eval_mean_token_accuracy": 0.3298281561563004,
"eval_nll": 3.777309862116675,
"eval_num_tokens": 0.0,
"eval_ppl": 43.69832894461198,
"eval_runtime": 318.4397,
"eval_samples_per_second": 570.309,
"eval_steps_per_second": 8.912,
"step": 0
},
{
"entropy": 3.936198543874438,
"epoch": 0.0015664160401002505,
"grad_norm": 3.5,
"learning_rate": 0.0,
"loss": 3.687645435333252,
"mean_token_accuracy": 0.34163331851193124,
"num_tokens": 154043.0,
"step": 1
},
{
"entropy": 4.1582471953791025,
"epoch": 0.039160401002506263,
"grad_norm": 1.8515625,
"learning_rate": 9.375e-05,
"loss": 3.716327985127767,
"mean_token_accuracy": 0.32336124196593746,
"num_tokens": 3937675.0,
"step": 25
},
{
"entropy": 4.004832741749853,
"epoch": 0.07832080200501253,
"grad_norm": 1.578125,
"learning_rate": 0.00019140625,
"loss": 3.245400085449219,
"mean_token_accuracy": 0.3525532396162817,
"num_tokens": 7842040.0,
"step": 50
},
{
"entropy": 3.7060696659038226,
"epoch": 0.1174812030075188,
"grad_norm": 1.1328125,
"learning_rate": 0.0002890625,
"loss": 2.899266357421875,
"mean_token_accuracy": 0.3803508952459354,
"num_tokens": 11723384.0,
"step": 75
},
{
"entropy": 3.483661951565247,
"epoch": 0.15664160401002505,
"grad_norm": 0.796875,
"learning_rate": 0.00038671875,
"loss": 2.5580235290527344,
"mean_token_accuracy": 0.4106306236210145,
"num_tokens": 15613476.0,
"step": 100
},
{
"entropy": 3.279625251379403,
"epoch": 0.19580200501253134,
"grad_norm": 0.71484375,
"learning_rate": 0.000484375,
"loss": 2.3971221923828123,
"mean_token_accuracy": 0.43163137955735414,
"num_tokens": 19537696.0,
"step": 125
},
{
"entropy": 3.1596573478657435,
"epoch": 0.2349624060150376,
"grad_norm": 0.640625,
"learning_rate": 0.0004999075642455791,
"loss": 2.332003479003906,
"mean_token_accuracy": 0.44275144542816425,
"num_tokens": 23462566.0,
"step": 150
},
{
"entropy": 3.104312514398783,
"epoch": 0.2741228070175439,
"grad_norm": 0.609375,
"learning_rate": 0.0004995565798713207,
"loss": 2.2806515502929687,
"mean_token_accuracy": 0.44779701792125276,
"num_tokens": 27367329.0,
"step": 175
},
{
"entropy": 3.062113077731651,
"epoch": 0.3132832080200501,
"grad_norm": 0.796875,
"learning_rate": 0.0004989440608306114,
"loss": 2.2435511779785156,
"mean_token_accuracy": 0.45369474441778246,
"num_tokens": 31290903.0,
"step": 200
},
{
"entropy": 3.007945648412728,
"epoch": 0.3524436090225564,
"grad_norm": 0.71875,
"learning_rate": 0.0004980706490418613,
"loss": 2.214092559814453,
"mean_token_accuracy": 0.46001344086021506,
"num_tokens": 35158603.0,
"step": 225
},
{
"entropy": 2.9779412397442524,
"epoch": 0.3916040100250627,
"grad_norm": 0.65625,
"learning_rate": 0.0004969372598384225,
"loss": 2.191622314453125,
"mean_token_accuracy": 0.46235443734230136,
"num_tokens": 39050018.0,
"step": 250
},
{
"epoch": 0.3916040100250627,
"eval_bpd": 3.058715802573539,
"eval_entropy": 2.8622500597497296,
"eval_loss": 2.117133855819702,
"eval_mean_token_accuracy": 0.4719805146180118,
"eval_nll": 2.120140234687999,
"eval_num_tokens": 39050018.0,
"eval_ppl": 8.332305884076892,
"eval_runtime": 317.9266,
"eval_samples_per_second": 571.229,
"eval_steps_per_second": 8.927,
"step": 250
},
{
"entropy": 2.91319560400022,
"epoch": 0.4307644110275689,
"grad_norm": 0.59375,
"learning_rate": 0.0004955450810093227,
"loss": 2.1354435729980468,
"mean_token_accuracy": 0.46928864274436577,
"num_tokens": 42938915.0,
"step": 275
},
{
"entropy": 2.974404757708524,
"epoch": 0.4699248120300752,
"grad_norm": 0.63671875,
"learning_rate": 0.0004938955715544644,
"loss": 2.180239562988281,
"mean_token_accuracy": 0.4623402148856342,
"num_tokens": 46830642.0,
"step": 300
},
{
"entropy": 2.947778592589299,
"epoch": 0.5090852130325815,
"grad_norm": 0.52734375,
"learning_rate": 0.0004919904601555969,
"loss": 2.137745666503906,
"mean_token_accuracy": 0.4655975033913256,
"num_tokens": 50738889.0,
"step": 325
},
{
"entropy": 2.912182858652311,
"epoch": 0.5482456140350878,
"grad_norm": 0.73046875,
"learning_rate": 0.0004898317433646626,
"loss": 2.134133148193359,
"mean_token_accuracy": 0.47067078409410695,
"num_tokens": 54590447.0,
"step": 350
},
{
"entropy": 2.8808906902937665,
"epoch": 0.5874060150375939,
"grad_norm": 0.71484375,
"learning_rate": 0.00048742168351141525,
"loss": 2.111539001464844,
"mean_token_accuracy": 0.47415726155363475,
"num_tokens": 58477393.0,
"step": 375
},
{
"entropy": 2.8902592806431113,
"epoch": 0.6265664160401002,
"grad_norm": 0.77734375,
"learning_rate": 0.00048476280633250404,
"loss": 2.1172853088378907,
"mean_token_accuracy": 0.47171053962916015,
"num_tokens": 62364053.0,
"step": 400
},
{
"entropy": 2.8472467625827407,
"epoch": 0.6657268170426065,
"grad_norm": 0.5546875,
"learning_rate": 0.00048185789832450813,
"loss": 2.079963836669922,
"mean_token_accuracy": 0.47701584614870657,
"num_tokens": 66254150.0,
"step": 425
},
{
"entropy": 2.849270481153217,
"epoch": 0.7048872180451128,
"grad_norm": 0.76171875,
"learning_rate": 0.00047871000382369524,
"loss": 2.076465911865234,
"mean_token_accuracy": 0.477678835790845,
"num_tokens": 70155017.0,
"step": 450
},
{
"entropy": 2.8533846163704104,
"epoch": 0.7440476190476191,
"grad_norm": 0.75,
"learning_rate": 0.0004753224218155648,
"loss": 2.076942901611328,
"mean_token_accuracy": 0.4763377187304664,
"num_tokens": 74017889.0,
"step": 475
},
{
"entropy": 2.833587274583335,
"epoch": 0.7832080200501254,
"grad_norm": 0.61328125,
"learning_rate": 0.0004716987024775197,
"loss": 2.0738652038574217,
"mean_token_accuracy": 0.48083406578747806,
"num_tokens": 77928779.0,
"step": 500
},
{
"epoch": 0.7832080200501254,
"eval_bpd": 2.898750179783218,
"eval_entropy": 2.6689496127647594,
"eval_loss": 2.006093978881836,
"eval_mean_token_accuracy": 0.4891084327887536,
"eval_nll": 2.009260514264372,
"eval_num_tokens": 77928779.0,
"eval_ppl": 7.457800370714545,
"eval_runtime": 317.8942,
"eval_samples_per_second": 571.288,
"eval_steps_per_second": 8.927,
"step": 500
}
],
"logging_steps": 25,
"max_steps": 2554,
"num_input_tokens_seen": 0,
"num_train_epochs": 4,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.5466593463033856e+17,
"train_batch_size": 64,
"trial_name": null,
"trial_params": null
}