mdlm_cot / checkpoint-1000-split3 /trainer_state.json
avgJo3's picture
Add files using upload-large-folder tool
f239f28 verified
Raw
History Blame Contribute Delete
15.1 kB
{
"best_global_step": 1000,
"best_metric": 1.9394328048034677,
"best_model_checkpoint": "/content/cot-split3/checkpoint-1000",
"epoch": 0.39155800931908064,
"eval_steps": 250,
"global_step": 1000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0,
"eval_bpd": 5.410557520272195,
"eval_entropy": 3.805819726348172,
"eval_loss": 3.754805564880371,
"eval_mean_token_accuracy": 0.3303780525619185,
"eval_nll": 3.7503126904340807,
"eval_num_tokens": 0.0,
"eval_ppl": 42.534380014623586,
"eval_runtime": 319.2646,
"eval_samples_per_second": 568.835,
"eval_steps_per_second": 8.889,
"step": 0
},
{
"entropy": 3.939532442367398,
"epoch": 0.00039155800931908063,
"grad_norm": 2.921875,
"learning_rate": 0.0,
"loss": 3.6805007457733154,
"mean_token_accuracy": 0.33797585886722376,
"num_tokens": 159295.0,
"step": 1
},
{
"entropy": 4.131688260781753,
"epoch": 0.009788950232977016,
"grad_norm": 1.828125,
"learning_rate": 9.375e-05,
"loss": 3.7089433670043945,
"mean_token_accuracy": 0.32488122625965454,
"num_tokens": 3875056.0,
"step": 25
},
{
"entropy": 4.03907456745432,
"epoch": 0.01957790046595403,
"grad_norm": 0.87109375,
"learning_rate": 0.00019140625,
"loss": 3.2840447998046876,
"mean_token_accuracy": 0.3501161635947849,
"num_tokens": 7796334.0,
"step": 50
},
{
"entropy": 3.718109237212473,
"epoch": 0.02936685069893105,
"grad_norm": 0.875,
"learning_rate": 0.0002890625,
"loss": 2.907643127441406,
"mean_token_accuracy": 0.37667007823156323,
"num_tokens": 11688138.0,
"step": 75
},
{
"entropy": 3.4646144502832286,
"epoch": 0.03915580093190806,
"grad_norm": 0.71484375,
"learning_rate": 0.00038671875,
"loss": 2.5448974609375,
"mean_token_accuracy": 0.41452789283904995,
"num_tokens": 15554877.0,
"step": 100
},
{
"entropy": 3.2713017840492147,
"epoch": 0.04894475116488508,
"grad_norm": 0.71484375,
"learning_rate": 0.000484375,
"loss": 2.4108335876464846,
"mean_token_accuracy": 0.4332291316341289,
"num_tokens": 19437565.0,
"step": 125
},
{
"entropy": 3.177977246980637,
"epoch": 0.0587337013978621,
"grad_norm": 0.6796875,
"learning_rate": 0.0004999075642455791,
"loss": 2.35259765625,
"mean_token_accuracy": 0.4402555277869966,
"num_tokens": 23324888.0,
"step": 150
},
{
"entropy": 3.1149309732260146,
"epoch": 0.06852265163083911,
"grad_norm": 0.6171875,
"learning_rate": 0.0004995565798713207,
"loss": 2.2896893310546873,
"mean_token_accuracy": 0.44857320203325,
"num_tokens": 27225978.0,
"step": 175
},
{
"entropy": 3.0429316923380134,
"epoch": 0.07831160186381612,
"grad_norm": 0.7109375,
"learning_rate": 0.0004989440608306114,
"loss": 2.2477577209472654,
"mean_token_accuracy": 0.45537929991850945,
"num_tokens": 31124891.0,
"step": 200
},
{
"entropy": 3.000580134712211,
"epoch": 0.08810055209679314,
"grad_norm": 0.73046875,
"learning_rate": 0.0004980706490418613,
"loss": 2.2050234985351564,
"mean_token_accuracy": 0.4608995247476681,
"num_tokens": 35005557.0,
"step": 225
},
{
"entropy": 2.972177586040443,
"epoch": 0.09788950232977016,
"grad_norm": 0.64453125,
"learning_rate": 0.0004969372598384225,
"loss": 2.1969384765625,
"mean_token_accuracy": 0.46284280083339074,
"num_tokens": 38902413.0,
"step": 250
},
{
"epoch": 0.09788950232977016,
"eval_bpd": 3.072745569254064,
"eval_entropy": 2.8243270517127983,
"eval_loss": 2.126833915710449,
"eval_mean_token_accuracy": 0.4728344847516112,
"eval_nll": 2.1298649279065187,
"eval_num_tokens": 38902413.0,
"eval_ppl": 8.41373027452248,
"eval_runtime": 318.4023,
"eval_samples_per_second": 570.376,
"eval_steps_per_second": 8.913,
"step": 250
},
{
"entropy": 2.9943911642269376,
"epoch": 0.10767845256274718,
"grad_norm": 0.6328125,
"learning_rate": 0.0004955450810093227,
"loss": 2.189352722167969,
"mean_token_accuracy": 0.4613144874232056,
"num_tokens": 42787954.0,
"step": 275
},
{
"entropy": 2.9854789787582336,
"epoch": 0.1174674027957242,
"grad_norm": 0.64453125,
"learning_rate": 0.0004938955715544644,
"loss": 2.197265625,
"mean_token_accuracy": 0.4586064115776618,
"num_tokens": 46649640.0,
"step": 300
},
{
"entropy": 2.967871895537734,
"epoch": 0.1272563530287012,
"grad_norm": 0.77734375,
"learning_rate": 0.0004919904601555969,
"loss": 2.1636979675292967,
"mean_token_accuracy": 0.46279846221708726,
"num_tokens": 50562181.0,
"step": 325
},
{
"entropy": 2.9346317600010297,
"epoch": 0.13704530326167821,
"grad_norm": 0.66796875,
"learning_rate": 0.0004898317433646626,
"loss": 2.1643003845214843,
"mean_token_accuracy": 0.4652492077421426,
"num_tokens": 54435712.0,
"step": 350
},
{
"entropy": 2.8769926588271595,
"epoch": 0.14683425349465523,
"grad_norm": 0.81640625,
"learning_rate": 0.00048742168351141525,
"loss": 2.1070077514648435,
"mean_token_accuracy": 0.4735955714097171,
"num_tokens": 58331515.0,
"step": 375
},
{
"entropy": 2.9047266886544443,
"epoch": 0.15662320372763225,
"grad_norm": 0.58984375,
"learning_rate": 0.00048476280633250404,
"loss": 2.1295965576171874,
"mean_token_accuracy": 0.4706730742865917,
"num_tokens": 62245696.0,
"step": 400
},
{
"entropy": 2.8752667624718105,
"epoch": 0.16641215396060927,
"grad_norm": 0.58203125,
"learning_rate": 0.00048185789832450813,
"loss": 2.11253173828125,
"mean_token_accuracy": 0.4743365019853278,
"num_tokens": 66145585.0,
"step": 425
},
{
"entropy": 2.8552429066577076,
"epoch": 0.17620110419358628,
"grad_norm": 0.59375,
"learning_rate": 0.00047871000382369524,
"loss": 2.0846556091308592,
"mean_token_accuracy": 0.47697299871989524,
"num_tokens": 70063214.0,
"step": 450
},
{
"entropy": 2.8341120851783472,
"epoch": 0.1859900544265633,
"grad_norm": 0.58203125,
"learning_rate": 0.0004753224218155648,
"loss": 2.068045349121094,
"mean_token_accuracy": 0.47787787454415265,
"num_tokens": 73984544.0,
"step": 475
},
{
"entropy": 2.8375192761847376,
"epoch": 0.19577900465954032,
"grad_norm": 0.61328125,
"learning_rate": 0.0004716987024775197,
"loss": 2.0847515869140625,
"mean_token_accuracy": 0.47784874690977935,
"num_tokens": 77862885.0,
"step": 500
},
{
"epoch": 0.19577900465954032,
"eval_bpd": 2.9090075702135,
"eval_entropy": 2.6186967416048157,
"eval_loss": 2.013190507888794,
"eval_mean_token_accuracy": 0.48935668935428794,
"eval_nll": 2.0163703955210246,
"eval_num_tokens": 77862885.0,
"eval_ppl": 7.5110133907515495,
"eval_runtime": 318.4358,
"eval_samples_per_second": 570.316,
"eval_steps_per_second": 8.912,
"step": 500
},
{
"entropy": 2.86442423287629,
"epoch": 0.20556795489251733,
"grad_norm": 0.6796875,
"learning_rate": 0.000467842643458289,
"loss": 2.097323455810547,
"mean_token_accuracy": 0.4766681852583933,
"num_tokens": 81738952.0,
"step": 525
},
{
"entropy": 2.8243706708841483,
"epoch": 0.21535690512549435,
"grad_norm": 0.6328125,
"learning_rate": 0.0004637582858980017,
"loss": 2.050118865966797,
"mean_token_accuracy": 0.48122489244307076,
"num_tokens": 85626497.0,
"step": 550
},
{
"entropy": 2.848133797467131,
"epoch": 0.22514585535847137,
"grad_norm": 0.84375,
"learning_rate": 0.0004594499101930825,
"loss": 2.0830853271484373,
"mean_token_accuracy": 0.47580645161290325,
"num_tokens": 89484956.0,
"step": 575
},
{
"entropy": 2.8410350923085876,
"epoch": 0.2349348055914484,
"grad_norm": 0.52734375,
"learning_rate": 0.00045492203151040655,
"loss": 2.0800726318359377,
"mean_token_accuracy": 0.47742178446222894,
"num_tokens": 93413171.0,
"step": 600
},
{
"entropy": 2.7831898042795857,
"epoch": 0.24472375582442538,
"grad_norm": 0.5859375,
"learning_rate": 0.00045017939505541626,
"loss": 2.0370738220214846,
"mean_token_accuracy": 0.4864190419562228,
"num_tokens": 97298042.0,
"step": 625
},
{
"entropy": 2.8064169968349897,
"epoch": 0.2545127060574024,
"grad_norm": 0.5546875,
"learning_rate": 0.00044522697109915813,
"loss": 2.061403503417969,
"mean_token_accuracy": 0.48147006407999693,
"num_tokens": 101194607.0,
"step": 650
},
{
"entropy": 2.7893201624619977,
"epoch": 0.26430165629037944,
"grad_norm": 0.5234375,
"learning_rate": 0.0004400699497694506,
"loss": 2.0294932556152343,
"mean_token_accuracy": 0.48583452555693873,
"num_tokens": 105105248.0,
"step": 675
},
{
"entropy": 2.766137535649265,
"epoch": 0.27409060652335643,
"grad_norm": 0.61328125,
"learning_rate": 0.00043471373561164396,
"loss": 2.0185002136230468,
"mean_token_accuracy": 0.48713530665141636,
"num_tokens": 108992058.0,
"step": 700
},
{
"entropy": 2.7472840214584604,
"epoch": 0.2838795567563335,
"grad_norm": 0.61328125,
"learning_rate": 0.00042916394192466997,
"loss": 2.007948150634766,
"mean_token_accuracy": 0.49140476584755016,
"num_tokens": 112863096.0,
"step": 725
},
{
"entropy": 2.8039981412212533,
"epoch": 0.29366850698931046,
"grad_norm": 0.60546875,
"learning_rate": 0.00042342638487831874,
"loss": 2.0519680786132812,
"mean_token_accuracy": 0.4848400037316914,
"num_tokens": 116741714.0,
"step": 750
},
{
"epoch": 0.29366850698931046,
"eval_bpd": 2.8368191124508524,
"eval_entropy": 2.5129475370871655,
"eval_loss": 1.963122010231018,
"eval_mean_token_accuracy": 0.49759134340714123,
"eval_nll": 1.9663331695538748,
"eval_num_tokens": 116741714.0,
"eval_ppl": 7.144430981798381,
"eval_runtime": 318.4485,
"eval_samples_per_second": 570.293,
"eval_steps_per_second": 8.912,
"step": 750
},
{
"entropy": 2.7818116819998244,
"epoch": 0.3034574572222875,
"grad_norm": 0.60546875,
"learning_rate": 0.0004175070774179078,
"loss": 2.0355569458007814,
"mean_token_accuracy": 0.4845890820401234,
"num_tokens": 120630485.0,
"step": 775
},
{
"entropy": 2.754836296553474,
"epoch": 0.3132464074552645,
"grad_norm": 0.6328125,
"learning_rate": 0.0004114122229627302,
"loss": 2.026649627685547,
"mean_token_accuracy": 0.4883731104937326,
"num_tokens": 124539577.0,
"step": 800
},
{
"entropy": 2.7313264609464514,
"epoch": 0.3230353576882415,
"grad_norm": 0.5546875,
"learning_rate": 0.00040514820890488664,
"loss": 1.9894279479980468,
"mean_token_accuracy": 0.493762371510729,
"num_tokens": 128444796.0,
"step": 825
},
{
"entropy": 2.799315380985199,
"epoch": 0.33282430792121853,
"grad_norm": 0.6171875,
"learning_rate": 0.00039872159991531533,
"loss": 2.04507568359375,
"mean_token_accuracy": 0.48317747648488935,
"num_tokens": 132371500.0,
"step": 850
},
{
"entropy": 2.7418567548344273,
"epoch": 0.3426132581541955,
"grad_norm": 0.64453125,
"learning_rate": 0.0003921391310640325,
"loss": 2.0068865966796876,
"mean_token_accuracy": 0.4890909259070856,
"num_tokens": 136267287.0,
"step": 875
},
{
"entropy": 2.7740001842357076,
"epoch": 0.35240220838717257,
"grad_norm": 0.62109375,
"learning_rate": 0.0003854077007617969,
"loss": 2.022200164794922,
"mean_token_accuracy": 0.4868092625998601,
"num_tokens": 140138103.0,
"step": 900
},
{
"entropy": 2.7364819494297907,
"epoch": 0.36219115862014956,
"grad_norm": 1.65625,
"learning_rate": 0.0003785343635305919,
"loss": 2.0004840087890625,
"mean_token_accuracy": 0.49300860279730147,
"num_tokens": 144053086.0,
"step": 925
},
{
"entropy": 2.739402972362386,
"epoch": 0.3719801088531266,
"grad_norm": 0.51953125,
"learning_rate": 0.00037152632261050483,
"loss": 1.9922245788574218,
"mean_token_accuracy": 0.4915943380171221,
"num_tokens": 147953420.0,
"step": 950
},
{
"entropy": 2.7438382548220077,
"epoch": 0.3817690590861036,
"grad_norm": 0.7265625,
"learning_rate": 0.0003643909224107492,
"loss": 2.0027291870117185,
"mean_token_accuracy": 0.48921148393722236,
"num_tokens": 151836411.0,
"step": 975
},
{
"entropy": 2.7921177392917085,
"epoch": 0.39155800931908064,
"grad_norm": 0.6171875,
"learning_rate": 0.00035713564081274257,
"loss": 2.0273634338378907,
"mean_token_accuracy": 0.48521556448666425,
"num_tokens": 155738536.0,
"step": 1000
},
{
"epoch": 0.39155800931908064,
"eval_bpd": 2.798010089627336,
"eval_entropy": 2.536048009293489,
"eval_loss": 1.9362056255340576,
"eval_mean_token_accuracy": 0.5017364167555982,
"eval_nll": 1.9394328048034677,
"eval_num_tokens": 155738536.0,
"eval_ppl": 6.95480511965251,
"eval_runtime": 318.4763,
"eval_samples_per_second": 570.243,
"eval_steps_per_second": 8.911,
"step": 1000
}
],
"logging_steps": 25,
"max_steps": 2554,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 5.064070482272256e+17,
"train_batch_size": 64,
"trial_name": null,
"trial_params": null
}