TMFT-adv / training_metadata.json
zeronamoni's picture
Upload folder using huggingface_hub
cdf2369 verified
Raw
History Blame Contribute Delete
13.8 kB
{
"method": "tmft_combined",
"model_name": "EleutherAI/pythia-160m",
"train_samples": 4799,
"validation_samples": 599,
"batches_seen": 12375,
"masked_token_ratio": 0.40505473533158165,
"skipped_samples": 6782,
"log_history": [
{
"loss": 2.6159,
"grad_norm": 2.032399892807007,
"learning_rate": 2e-05,
"epoch": 0.06666666666666667,
"step": 10
},
{
"loss": 2.4752,
"grad_norm": 2.080336332321167,
"learning_rate": 4e-05,
"epoch": 0.13333333333333333,
"step": 20
},
{
"loss": 2.5298,
"grad_norm": 1.9358763694763184,
"learning_rate": 6e-05,
"epoch": 0.2,
"step": 30
},
{
"loss": 2.5636,
"grad_norm": 1.8991247415542603,
"learning_rate": 8e-05,
"epoch": 0.26666666666666666,
"step": 40
},
{
"loss": 2.4411,
"grad_norm": 1.736275315284729,
"learning_rate": 0.0001,
"epoch": 0.3333333333333333,
"step": 50
},
{
"loss": 2.3803,
"grad_norm": 1.4791429042816162,
"learning_rate": 0.00012,
"epoch": 0.4,
"step": 60
},
{
"loss": 2.4064,
"grad_norm": 1.5463426113128662,
"learning_rate": 0.00014,
"epoch": 0.4666666666666667,
"step": 70
},
{
"loss": 2.4202,
"grad_norm": 1.5478408336639404,
"learning_rate": 0.00016,
"epoch": 0.5333333333333333,
"step": 80
},
{
"loss": 2.5093,
"grad_norm": 1.23783278465271,
"learning_rate": 0.00018,
"epoch": 0.6,
"step": 90
},
{
"loss": 2.5901,
"grad_norm": 1.0210442543029785,
"learning_rate": 0.0002,
"epoch": 0.6666666666666666,
"step": 100
},
{
"loss": 2.5351,
"grad_norm": 1.0787973403930664,
"learning_rate": 0.00019692307692307696,
"epoch": 0.7333333333333333,
"step": 110
},
{
"loss": 2.485,
"grad_norm": 1.015953779220581,
"learning_rate": 0.00019384615384615385,
"epoch": 0.8,
"step": 120
},
{
"loss": 2.5954,
"grad_norm": 1.0191384553909302,
"learning_rate": 0.0001907692307692308,
"epoch": 0.8666666666666667,
"step": 130
},
{
"loss": 2.4109,
"grad_norm": 1.1665639877319336,
"learning_rate": 0.0001876923076923077,
"epoch": 0.9333333333333333,
"step": 140
},
{
"loss": 2.4105,
"grad_norm": 0.9981837272644043,
"learning_rate": 0.00018461538461538463,
"epoch": 1.0,
"step": 150
},
{
"eval_loss": 2.5646369457244873,
"eval_runtime": 63.0554,
"eval_samples_per_second": 9.5,
"eval_steps_per_second": 1.189,
"epoch": 1.0,
"step": 150
},
{
"loss": 2.4635,
"grad_norm": 0.9652926921844482,
"learning_rate": 0.00018153846153846155,
"epoch": 1.0666666666666667,
"step": 160
},
{
"loss": 2.4143,
"grad_norm": 0.9910626411437988,
"learning_rate": 0.00017846153846153847,
"epoch": 1.1333333333333333,
"step": 170
},
{
"loss": 2.4122,
"grad_norm": 0.9578900933265686,
"learning_rate": 0.0001753846153846154,
"epoch": 1.2,
"step": 180
},
{
"loss": 2.6059,
"grad_norm": 0.8806987404823303,
"learning_rate": 0.00017230769230769234,
"epoch": 1.2666666666666666,
"step": 190
},
{
"loss": 2.4324,
"grad_norm": 0.7595670223236084,
"learning_rate": 0.00016923076923076923,
"epoch": 1.3333333333333333,
"step": 200
},
{
"loss": 2.4291,
"grad_norm": 0.8669508099555969,
"learning_rate": 0.00016615384615384617,
"epoch": 1.4,
"step": 210
},
{
"loss": 2.4332,
"grad_norm": 0.7675260305404663,
"learning_rate": 0.0001630769230769231,
"epoch": 1.4666666666666668,
"step": 220
},
{
"loss": 2.4688,
"grad_norm": 0.8209505677223206,
"learning_rate": 0.00016,
"epoch": 1.5333333333333332,
"step": 230
},
{
"loss": 2.4649,
"grad_norm": 0.6863240599632263,
"learning_rate": 0.00015692307692307693,
"epoch": 1.6,
"step": 240
},
{
"loss": 2.5066,
"grad_norm": 0.8193066120147705,
"learning_rate": 0.00015384615384615385,
"epoch": 1.6666666666666665,
"step": 250
},
{
"loss": 2.4826,
"grad_norm": 0.7208594679832458,
"learning_rate": 0.00015076923076923077,
"epoch": 1.7333333333333334,
"step": 260
},
{
"loss": 2.5793,
"grad_norm": 0.9297627806663513,
"learning_rate": 0.00014769230769230772,
"epoch": 1.8,
"step": 270
},
{
"loss": 2.3968,
"grad_norm": 0.7471694946289062,
"learning_rate": 0.0001446153846153846,
"epoch": 1.8666666666666667,
"step": 280
},
{
"loss": 2.4876,
"grad_norm": 0.6467009782791138,
"learning_rate": 0.00014153846153846156,
"epoch": 1.9333333333333333,
"step": 290
},
{
"loss": 2.4497,
"grad_norm": 0.8748418688774109,
"learning_rate": 0.00013846153846153847,
"epoch": 2.0,
"step": 300
},
{
"eval_loss": 2.540955066680908,
"eval_runtime": 62.6215,
"eval_samples_per_second": 9.565,
"eval_steps_per_second": 1.198,
"epoch": 2.0,
"step": 300
},
{
"loss": 2.4733,
"grad_norm": 0.5512543320655823,
"learning_rate": 0.0001353846153846154,
"epoch": 2.066666666666667,
"step": 310
},
{
"loss": 2.4567,
"grad_norm": 0.6273607015609741,
"learning_rate": 0.0001323076923076923,
"epoch": 2.1333333333333333,
"step": 320
},
{
"loss": 2.3865,
"grad_norm": 0.8209007978439331,
"learning_rate": 0.00012923076923076923,
"epoch": 2.2,
"step": 330
},
{
"loss": 2.5599,
"grad_norm": 0.5290957093238831,
"learning_rate": 0.00012615384615384615,
"epoch": 2.2666666666666666,
"step": 340
},
{
"loss": 2.3978,
"grad_norm": 0.6581332683563232,
"learning_rate": 0.0001230769230769231,
"epoch": 2.3333333333333335,
"step": 350
},
{
"loss": 2.4512,
"grad_norm": 0.7657097578048706,
"learning_rate": 0.00012,
"epoch": 2.4,
"step": 360
},
{
"loss": 2.468,
"grad_norm": 0.7191358208656311,
"learning_rate": 0.00011692307692307694,
"epoch": 2.466666666666667,
"step": 370
},
{
"loss": 2.4746,
"grad_norm": 0.614693820476532,
"learning_rate": 0.00011384615384615384,
"epoch": 2.533333333333333,
"step": 380
},
{
"loss": 2.5409,
"grad_norm": 0.5931090116500854,
"learning_rate": 0.00011076923076923077,
"epoch": 2.6,
"step": 390
},
{
"loss": 2.4011,
"grad_norm": 0.5927258729934692,
"learning_rate": 0.0001076923076923077,
"epoch": 2.6666666666666665,
"step": 400
},
{
"loss": 2.4713,
"grad_norm": 0.611909031867981,
"learning_rate": 0.00010461538461538463,
"epoch": 2.7333333333333334,
"step": 410
},
{
"loss": 2.5035,
"grad_norm": 0.5654336810112,
"learning_rate": 0.00010153846153846153,
"epoch": 2.8,
"step": 420
},
{
"loss": 2.446,
"grad_norm": 0.6055721044540405,
"learning_rate": 9.846153846153848e-05,
"epoch": 2.8666666666666667,
"step": 430
},
{
"loss": 2.4637,
"grad_norm": 0.5348479747772217,
"learning_rate": 9.53846153846154e-05,
"epoch": 2.9333333333333336,
"step": 440
},
{
"loss": 2.5086,
"grad_norm": 0.7424932718276978,
"learning_rate": 9.230769230769232e-05,
"epoch": 3.0,
"step": 450
},
{
"eval_loss": 2.5773184299468994,
"eval_runtime": 62.4972,
"eval_samples_per_second": 9.584,
"eval_steps_per_second": 1.2,
"epoch": 3.0,
"step": 450
},
{
"loss": 2.407,
"grad_norm": 0.5943320393562317,
"learning_rate": 8.923076923076924e-05,
"epoch": 3.066666666666667,
"step": 460
},
{
"loss": 2.4673,
"grad_norm": 0.5045508146286011,
"learning_rate": 8.615384615384617e-05,
"epoch": 3.1333333333333333,
"step": 470
},
{
"loss": 2.4525,
"grad_norm": 0.6461102366447449,
"learning_rate": 8.307692307692309e-05,
"epoch": 3.2,
"step": 480
},
{
"loss": 2.5566,
"grad_norm": 0.6374251842498779,
"learning_rate": 8e-05,
"epoch": 3.2666666666666666,
"step": 490
},
{
"loss": 2.4291,
"grad_norm": 0.590420126914978,
"learning_rate": 7.692307692307693e-05,
"epoch": 3.3333333333333335,
"step": 500
},
{
"loss": 2.489,
"grad_norm": 0.5788375735282898,
"learning_rate": 7.384615384615386e-05,
"epoch": 3.4,
"step": 510
},
{
"loss": 2.5309,
"grad_norm": 0.7464163303375244,
"learning_rate": 7.076923076923078e-05,
"epoch": 3.466666666666667,
"step": 520
},
{
"loss": 2.4961,
"grad_norm": 0.5985592603683472,
"learning_rate": 6.76923076923077e-05,
"epoch": 3.533333333333333,
"step": 530
},
{
"loss": 2.421,
"grad_norm": 0.4846917986869812,
"learning_rate": 6.461538461538462e-05,
"epoch": 3.6,
"step": 540
},
{
"loss": 2.4591,
"grad_norm": 0.5728452205657959,
"learning_rate": 6.153846153846155e-05,
"epoch": 3.6666666666666665,
"step": 550
},
{
"loss": 2.3962,
"grad_norm": 0.5219712853431702,
"learning_rate": 5.846153846153847e-05,
"epoch": 3.7333333333333334,
"step": 560
},
{
"loss": 2.4471,
"grad_norm": 0.6392219066619873,
"learning_rate": 5.538461538461539e-05,
"epoch": 3.8,
"step": 570
},
{
"loss": 2.4287,
"grad_norm": 0.5428284406661987,
"learning_rate": 5.230769230769231e-05,
"epoch": 3.8666666666666667,
"step": 580
},
{
"loss": 2.4054,
"grad_norm": 0.7495147585868835,
"learning_rate": 4.923076923076924e-05,
"epoch": 3.9333333333333336,
"step": 590
},
{
"loss": 2.485,
"grad_norm": 0.5874316096305847,
"learning_rate": 4.615384615384616e-05,
"epoch": 4.0,
"step": 600
},
{
"eval_loss": 2.583185911178589,
"eval_runtime": 62.3323,
"eval_samples_per_second": 9.61,
"eval_steps_per_second": 1.203,
"epoch": 4.0,
"step": 600
},
{
"loss": 2.4716,
"grad_norm": 0.5120574831962585,
"learning_rate": 4.3076923076923084e-05,
"epoch": 4.066666666666666,
"step": 610
},
{
"loss": 2.5469,
"grad_norm": 0.671975314617157,
"learning_rate": 4e-05,
"epoch": 4.133333333333334,
"step": 620
},
{
"loss": 2.3403,
"grad_norm": 0.5151000022888184,
"learning_rate": 3.692307692307693e-05,
"epoch": 4.2,
"step": 630
},
{
"loss": 2.4473,
"grad_norm": 0.5591350197792053,
"learning_rate": 3.384615384615385e-05,
"epoch": 4.266666666666667,
"step": 640
},
{
"loss": 2.4316,
"grad_norm": 0.5070234537124634,
"learning_rate": 3.0769230769230774e-05,
"epoch": 4.333333333333333,
"step": 650
},
{
"loss": 2.4829,
"grad_norm": 0.717612087726593,
"learning_rate": 2.7692307692307694e-05,
"epoch": 4.4,
"step": 660
},
{
"loss": 2.4368,
"grad_norm": 0.6885381937026978,
"learning_rate": 2.461538461538462e-05,
"epoch": 4.466666666666667,
"step": 670
},
{
"loss": 2.4797,
"grad_norm": 0.46743500232696533,
"learning_rate": 2.1538461538461542e-05,
"epoch": 4.533333333333333,
"step": 680
},
{
"loss": 2.3879,
"grad_norm": 0.5259671211242676,
"learning_rate": 1.8461538461538465e-05,
"epoch": 4.6,
"step": 690
},
{
"loss": 2.4394,
"grad_norm": 0.5409215092658997,
"learning_rate": 1.5384615384615387e-05,
"epoch": 4.666666666666667,
"step": 700
},
{
"loss": 2.466,
"grad_norm": 0.4474121332168579,
"learning_rate": 1.230769230769231e-05,
"epoch": 4.733333333333333,
"step": 710
},
{
"loss": 2.5015,
"grad_norm": 0.5628879070281982,
"learning_rate": 9.230769230769232e-06,
"epoch": 4.8,
"step": 720
},
{
"loss": 2.4536,
"grad_norm": 0.5316895246505737,
"learning_rate": 6.153846153846155e-06,
"epoch": 4.866666666666667,
"step": 730
},
{
"loss": 2.5492,
"grad_norm": 0.4985215365886688,
"learning_rate": 3.0769230769230774e-06,
"epoch": 4.933333333333334,
"step": 740
},
{
"loss": 2.4265,
"grad_norm": 0.5098808407783508,
"learning_rate": 0.0,
"epoch": 5.0,
"step": 750
},
{
"eval_loss": 2.5896592140197754,
"eval_runtime": 62.3109,
"eval_samples_per_second": 9.613,
"eval_steps_per_second": 1.204,
"epoch": 5.0,
"step": 750
},
{
"train_runtime": 3411.7173,
"train_samples_per_second": 7.033,
"train_steps_per_second": 0.22,
"total_flos": 6913726822803456.0,
"train_loss": 2.4684160919189453,
"epoch": 5.0,
"step": 750
}
]
}