mdlm_cot / checkpoint-500-split3 /trainer_state.json
avgJo3's picture
Add files using upload-large-folder tool
f239f28 verified
Raw
History Blame Contribute Delete
8.3 kB
{
"best_global_step": 500,
"best_metric": 2.0163703955210246,
"best_model_checkpoint": "/content/cot-split3/checkpoint-500",
"epoch": 0.19577900465954032,
"eval_steps": 250,
"global_step": 500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0,
"eval_bpd": 5.410557520272195,
"eval_entropy": 3.805819726348172,
"eval_loss": 3.754805564880371,
"eval_mean_token_accuracy": 0.3303780525619185,
"eval_nll": 3.7503126904340807,
"eval_num_tokens": 0.0,
"eval_ppl": 42.534380014623586,
"eval_runtime": 319.2646,
"eval_samples_per_second": 568.835,
"eval_steps_per_second": 8.889,
"step": 0
},
{
"entropy": 3.939532442367398,
"epoch": 0.00039155800931908063,
"grad_norm": 2.921875,
"learning_rate": 0.0,
"loss": 3.6805007457733154,
"mean_token_accuracy": 0.33797585886722376,
"num_tokens": 159295.0,
"step": 1
},
{
"entropy": 4.131688260781753,
"epoch": 0.009788950232977016,
"grad_norm": 1.828125,
"learning_rate": 9.375e-05,
"loss": 3.7089433670043945,
"mean_token_accuracy": 0.32488122625965454,
"num_tokens": 3875056.0,
"step": 25
},
{
"entropy": 4.03907456745432,
"epoch": 0.01957790046595403,
"grad_norm": 0.87109375,
"learning_rate": 0.00019140625,
"loss": 3.2840447998046876,
"mean_token_accuracy": 0.3501161635947849,
"num_tokens": 7796334.0,
"step": 50
},
{
"entropy": 3.718109237212473,
"epoch": 0.02936685069893105,
"grad_norm": 0.875,
"learning_rate": 0.0002890625,
"loss": 2.907643127441406,
"mean_token_accuracy": 0.37667007823156323,
"num_tokens": 11688138.0,
"step": 75
},
{
"entropy": 3.4646144502832286,
"epoch": 0.03915580093190806,
"grad_norm": 0.71484375,
"learning_rate": 0.00038671875,
"loss": 2.5448974609375,
"mean_token_accuracy": 0.41452789283904995,
"num_tokens": 15554877.0,
"step": 100
},
{
"entropy": 3.2713017840492147,
"epoch": 0.04894475116488508,
"grad_norm": 0.71484375,
"learning_rate": 0.000484375,
"loss": 2.4108335876464846,
"mean_token_accuracy": 0.4332291316341289,
"num_tokens": 19437565.0,
"step": 125
},
{
"entropy": 3.177977246980637,
"epoch": 0.0587337013978621,
"grad_norm": 0.6796875,
"learning_rate": 0.0004999075642455791,
"loss": 2.35259765625,
"mean_token_accuracy": 0.4402555277869966,
"num_tokens": 23324888.0,
"step": 150
},
{
"entropy": 3.1149309732260146,
"epoch": 0.06852265163083911,
"grad_norm": 0.6171875,
"learning_rate": 0.0004995565798713207,
"loss": 2.2896893310546873,
"mean_token_accuracy": 0.44857320203325,
"num_tokens": 27225978.0,
"step": 175
},
{
"entropy": 3.0429316923380134,
"epoch": 0.07831160186381612,
"grad_norm": 0.7109375,
"learning_rate": 0.0004989440608306114,
"loss": 2.2477577209472654,
"mean_token_accuracy": 0.45537929991850945,
"num_tokens": 31124891.0,
"step": 200
},
{
"entropy": 3.000580134712211,
"epoch": 0.08810055209679314,
"grad_norm": 0.73046875,
"learning_rate": 0.0004980706490418613,
"loss": 2.2050234985351564,
"mean_token_accuracy": 0.4608995247476681,
"num_tokens": 35005557.0,
"step": 225
},
{
"entropy": 2.972177586040443,
"epoch": 0.09788950232977016,
"grad_norm": 0.64453125,
"learning_rate": 0.0004969372598384225,
"loss": 2.1969384765625,
"mean_token_accuracy": 0.46284280083339074,
"num_tokens": 38902413.0,
"step": 250
},
{
"epoch": 0.09788950232977016,
"eval_bpd": 3.072745569254064,
"eval_entropy": 2.8243270517127983,
"eval_loss": 2.126833915710449,
"eval_mean_token_accuracy": 0.4728344847516112,
"eval_nll": 2.1298649279065187,
"eval_num_tokens": 38902413.0,
"eval_ppl": 8.41373027452248,
"eval_runtime": 318.4023,
"eval_samples_per_second": 570.376,
"eval_steps_per_second": 8.913,
"step": 250
},
{
"entropy": 2.9943911642269376,
"epoch": 0.10767845256274718,
"grad_norm": 0.6328125,
"learning_rate": 0.0004955450810093227,
"loss": 2.189352722167969,
"mean_token_accuracy": 0.4613144874232056,
"num_tokens": 42787954.0,
"step": 275
},
{
"entropy": 2.9854789787582336,
"epoch": 0.1174674027957242,
"grad_norm": 0.64453125,
"learning_rate": 0.0004938955715544644,
"loss": 2.197265625,
"mean_token_accuracy": 0.4586064115776618,
"num_tokens": 46649640.0,
"step": 300
},
{
"entropy": 2.967871895537734,
"epoch": 0.1272563530287012,
"grad_norm": 0.77734375,
"learning_rate": 0.0004919904601555969,
"loss": 2.1636979675292967,
"mean_token_accuracy": 0.46279846221708726,
"num_tokens": 50562181.0,
"step": 325
},
{
"entropy": 2.9346317600010297,
"epoch": 0.13704530326167821,
"grad_norm": 0.66796875,
"learning_rate": 0.0004898317433646626,
"loss": 2.1643003845214843,
"mean_token_accuracy": 0.4652492077421426,
"num_tokens": 54435712.0,
"step": 350
},
{
"entropy": 2.8769926588271595,
"epoch": 0.14683425349465523,
"grad_norm": 0.81640625,
"learning_rate": 0.00048742168351141525,
"loss": 2.1070077514648435,
"mean_token_accuracy": 0.4735955714097171,
"num_tokens": 58331515.0,
"step": 375
},
{
"entropy": 2.9047266886544443,
"epoch": 0.15662320372763225,
"grad_norm": 0.58984375,
"learning_rate": 0.00048476280633250404,
"loss": 2.1295965576171874,
"mean_token_accuracy": 0.4706730742865917,
"num_tokens": 62245696.0,
"step": 400
},
{
"entropy": 2.8752667624718105,
"epoch": 0.16641215396060927,
"grad_norm": 0.58203125,
"learning_rate": 0.00048185789832450813,
"loss": 2.11253173828125,
"mean_token_accuracy": 0.4743365019853278,
"num_tokens": 66145585.0,
"step": 425
},
{
"entropy": 2.8552429066577076,
"epoch": 0.17620110419358628,
"grad_norm": 0.59375,
"learning_rate": 0.00047871000382369524,
"loss": 2.0846556091308592,
"mean_token_accuracy": 0.47697299871989524,
"num_tokens": 70063214.0,
"step": 450
},
{
"entropy": 2.8341120851783472,
"epoch": 0.1859900544265633,
"grad_norm": 0.58203125,
"learning_rate": 0.0004753224218155648,
"loss": 2.068045349121094,
"mean_token_accuracy": 0.47787787454415265,
"num_tokens": 73984544.0,
"step": 475
},
{
"entropy": 2.8375192761847376,
"epoch": 0.19577900465954032,
"grad_norm": 0.61328125,
"learning_rate": 0.0004716987024775197,
"loss": 2.0847515869140625,
"mean_token_accuracy": 0.47784874690977935,
"num_tokens": 77862885.0,
"step": 500
},
{
"epoch": 0.19577900465954032,
"eval_bpd": 2.9090075702135,
"eval_entropy": 2.6186967416048157,
"eval_loss": 2.013190507888794,
"eval_mean_token_accuracy": 0.48935668935428794,
"eval_nll": 2.0163703955210246,
"eval_num_tokens": 77862885.0,
"eval_ppl": 7.5110133907515495,
"eval_runtime": 318.4358,
"eval_samples_per_second": 570.316,
"eval_steps_per_second": 8.912,
"step": 500
}
],
"logging_steps": 25,
"max_steps": 2554,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.525280992403456e+17,
"train_batch_size": 64,
"trial_name": null,
"trial_params": null
}