{ "method": "tmft_combined", "model_name": "EleutherAI/pythia-160m", "train_samples": 4799, "validation_samples": 599, "batches_seen": 12375, "masked_token_ratio": 0.40505473533158165, "skipped_samples": 6782, "log_history": [ { "loss": 2.6159, "grad_norm": 2.032399892807007, "learning_rate": 2e-05, "epoch": 0.06666666666666667, "step": 10 }, { "loss": 2.4752, "grad_norm": 2.080336332321167, "learning_rate": 4e-05, "epoch": 0.13333333333333333, "step": 20 }, { "loss": 2.5298, "grad_norm": 1.9358763694763184, "learning_rate": 6e-05, "epoch": 0.2, "step": 30 }, { "loss": 2.5636, "grad_norm": 1.8991247415542603, "learning_rate": 8e-05, "epoch": 0.26666666666666666, "step": 40 }, { "loss": 2.4411, "grad_norm": 1.736275315284729, "learning_rate": 0.0001, "epoch": 0.3333333333333333, "step": 50 }, { "loss": 2.3803, "grad_norm": 1.4791429042816162, "learning_rate": 0.00012, "epoch": 0.4, "step": 60 }, { "loss": 2.4064, "grad_norm": 1.5463426113128662, "learning_rate": 0.00014, "epoch": 0.4666666666666667, "step": 70 }, { "loss": 2.4202, "grad_norm": 1.5478408336639404, "learning_rate": 0.00016, "epoch": 0.5333333333333333, "step": 80 }, { "loss": 2.5093, "grad_norm": 1.23783278465271, "learning_rate": 0.00018, "epoch": 0.6, "step": 90 }, { "loss": 2.5901, "grad_norm": 1.0210442543029785, "learning_rate": 0.0002, "epoch": 0.6666666666666666, "step": 100 }, { "loss": 2.5351, "grad_norm": 1.0787973403930664, "learning_rate": 0.00019692307692307696, "epoch": 0.7333333333333333, "step": 110 }, { "loss": 2.485, "grad_norm": 1.015953779220581, "learning_rate": 0.00019384615384615385, "epoch": 0.8, "step": 120 }, { "loss": 2.5954, "grad_norm": 1.0191384553909302, "learning_rate": 0.0001907692307692308, "epoch": 0.8666666666666667, "step": 130 }, { "loss": 2.4109, "grad_norm": 1.1665639877319336, "learning_rate": 0.0001876923076923077, "epoch": 0.9333333333333333, "step": 140 }, { "loss": 2.4105, "grad_norm": 0.9981837272644043, "learning_rate": 0.00018461538461538463, "epoch": 1.0, "step": 150 }, { "eval_loss": 2.5646369457244873, "eval_runtime": 63.0554, "eval_samples_per_second": 9.5, "eval_steps_per_second": 1.189, "epoch": 1.0, "step": 150 }, { "loss": 2.4635, "grad_norm": 0.9652926921844482, "learning_rate": 0.00018153846153846155, "epoch": 1.0666666666666667, "step": 160 }, { "loss": 2.4143, "grad_norm": 0.9910626411437988, "learning_rate": 0.00017846153846153847, "epoch": 1.1333333333333333, "step": 170 }, { "loss": 2.4122, "grad_norm": 0.9578900933265686, "learning_rate": 0.0001753846153846154, "epoch": 1.2, "step": 180 }, { "loss": 2.6059, "grad_norm": 0.8806987404823303, "learning_rate": 0.00017230769230769234, "epoch": 1.2666666666666666, "step": 190 }, { "loss": 2.4324, "grad_norm": 0.7595670223236084, "learning_rate": 0.00016923076923076923, "epoch": 1.3333333333333333, "step": 200 }, { "loss": 2.4291, "grad_norm": 0.8669508099555969, "learning_rate": 0.00016615384615384617, "epoch": 1.4, "step": 210 }, { "loss": 2.4332, "grad_norm": 0.7675260305404663, "learning_rate": 0.0001630769230769231, "epoch": 1.4666666666666668, "step": 220 }, { "loss": 2.4688, "grad_norm": 0.8209505677223206, "learning_rate": 0.00016, "epoch": 1.5333333333333332, "step": 230 }, { "loss": 2.4649, "grad_norm": 0.6863240599632263, "learning_rate": 0.00015692307692307693, "epoch": 1.6, "step": 240 }, { "loss": 2.5066, "grad_norm": 0.8193066120147705, "learning_rate": 0.00015384615384615385, "epoch": 1.6666666666666665, "step": 250 }, { "loss": 2.4826, "grad_norm": 0.7208594679832458, "learning_rate": 0.00015076923076923077, "epoch": 1.7333333333333334, "step": 260 }, { "loss": 2.5793, "grad_norm": 0.9297627806663513, "learning_rate": 0.00014769230769230772, "epoch": 1.8, "step": 270 }, { "loss": 2.3968, "grad_norm": 0.7471694946289062, "learning_rate": 0.0001446153846153846, "epoch": 1.8666666666666667, "step": 280 }, { "loss": 2.4876, "grad_norm": 0.6467009782791138, "learning_rate": 0.00014153846153846156, "epoch": 1.9333333333333333, "step": 290 }, { "loss": 2.4497, "grad_norm": 0.8748418688774109, "learning_rate": 0.00013846153846153847, "epoch": 2.0, "step": 300 }, { "eval_loss": 2.540955066680908, "eval_runtime": 62.6215, "eval_samples_per_second": 9.565, "eval_steps_per_second": 1.198, "epoch": 2.0, "step": 300 }, { "loss": 2.4733, "grad_norm": 0.5512543320655823, "learning_rate": 0.0001353846153846154, "epoch": 2.066666666666667, "step": 310 }, { "loss": 2.4567, "grad_norm": 0.6273607015609741, "learning_rate": 0.0001323076923076923, "epoch": 2.1333333333333333, "step": 320 }, { "loss": 2.3865, "grad_norm": 0.8209007978439331, "learning_rate": 0.00012923076923076923, "epoch": 2.2, "step": 330 }, { "loss": 2.5599, "grad_norm": 0.5290957093238831, "learning_rate": 0.00012615384615384615, "epoch": 2.2666666666666666, "step": 340 }, { "loss": 2.3978, "grad_norm": 0.6581332683563232, "learning_rate": 0.0001230769230769231, "epoch": 2.3333333333333335, "step": 350 }, { "loss": 2.4512, "grad_norm": 0.7657097578048706, "learning_rate": 0.00012, "epoch": 2.4, "step": 360 }, { "loss": 2.468, "grad_norm": 0.7191358208656311, "learning_rate": 0.00011692307692307694, "epoch": 2.466666666666667, "step": 370 }, { "loss": 2.4746, "grad_norm": 0.614693820476532, "learning_rate": 0.00011384615384615384, "epoch": 2.533333333333333, "step": 380 }, { "loss": 2.5409, "grad_norm": 0.5931090116500854, "learning_rate": 0.00011076923076923077, "epoch": 2.6, "step": 390 }, { "loss": 2.4011, "grad_norm": 0.5927258729934692, "learning_rate": 0.0001076923076923077, "epoch": 2.6666666666666665, "step": 400 }, { "loss": 2.4713, "grad_norm": 0.611909031867981, "learning_rate": 0.00010461538461538463, "epoch": 2.7333333333333334, "step": 410 }, { "loss": 2.5035, "grad_norm": 0.5654336810112, "learning_rate": 0.00010153846153846153, "epoch": 2.8, "step": 420 }, { "loss": 2.446, "grad_norm": 0.6055721044540405, "learning_rate": 9.846153846153848e-05, "epoch": 2.8666666666666667, "step": 430 }, { "loss": 2.4637, "grad_norm": 0.5348479747772217, "learning_rate": 9.53846153846154e-05, "epoch": 2.9333333333333336, "step": 440 }, { "loss": 2.5086, "grad_norm": 0.7424932718276978, "learning_rate": 9.230769230769232e-05, "epoch": 3.0, "step": 450 }, { "eval_loss": 2.5773184299468994, "eval_runtime": 62.4972, "eval_samples_per_second": 9.584, "eval_steps_per_second": 1.2, "epoch": 3.0, "step": 450 }, { "loss": 2.407, "grad_norm": 0.5943320393562317, "learning_rate": 8.923076923076924e-05, "epoch": 3.066666666666667, "step": 460 }, { "loss": 2.4673, "grad_norm": 0.5045508146286011, "learning_rate": 8.615384615384617e-05, "epoch": 3.1333333333333333, "step": 470 }, { "loss": 2.4525, "grad_norm": 0.6461102366447449, "learning_rate": 8.307692307692309e-05, "epoch": 3.2, "step": 480 }, { "loss": 2.5566, "grad_norm": 0.6374251842498779, "learning_rate": 8e-05, "epoch": 3.2666666666666666, "step": 490 }, { "loss": 2.4291, "grad_norm": 0.590420126914978, "learning_rate": 7.692307692307693e-05, "epoch": 3.3333333333333335, "step": 500 }, { "loss": 2.489, "grad_norm": 0.5788375735282898, "learning_rate": 7.384615384615386e-05, "epoch": 3.4, "step": 510 }, { "loss": 2.5309, "grad_norm": 0.7464163303375244, "learning_rate": 7.076923076923078e-05, "epoch": 3.466666666666667, "step": 520 }, { "loss": 2.4961, "grad_norm": 0.5985592603683472, "learning_rate": 6.76923076923077e-05, "epoch": 3.533333333333333, "step": 530 }, { "loss": 2.421, "grad_norm": 0.4846917986869812, "learning_rate": 6.461538461538462e-05, "epoch": 3.6, "step": 540 }, { "loss": 2.4591, "grad_norm": 0.5728452205657959, "learning_rate": 6.153846153846155e-05, "epoch": 3.6666666666666665, "step": 550 }, { "loss": 2.3962, "grad_norm": 0.5219712853431702, "learning_rate": 5.846153846153847e-05, "epoch": 3.7333333333333334, "step": 560 }, { "loss": 2.4471, "grad_norm": 0.6392219066619873, "learning_rate": 5.538461538461539e-05, "epoch": 3.8, "step": 570 }, { "loss": 2.4287, "grad_norm": 0.5428284406661987, "learning_rate": 5.230769230769231e-05, "epoch": 3.8666666666666667, "step": 580 }, { "loss": 2.4054, "grad_norm": 0.7495147585868835, "learning_rate": 4.923076923076924e-05, "epoch": 3.9333333333333336, "step": 590 }, { "loss": 2.485, "grad_norm": 0.5874316096305847, "learning_rate": 4.615384615384616e-05, "epoch": 4.0, "step": 600 }, { "eval_loss": 2.583185911178589, "eval_runtime": 62.3323, "eval_samples_per_second": 9.61, "eval_steps_per_second": 1.203, "epoch": 4.0, "step": 600 }, { "loss": 2.4716, "grad_norm": 0.5120574831962585, "learning_rate": 4.3076923076923084e-05, "epoch": 4.066666666666666, "step": 610 }, { "loss": 2.5469, "grad_norm": 0.671975314617157, "learning_rate": 4e-05, "epoch": 4.133333333333334, "step": 620 }, { "loss": 2.3403, "grad_norm": 0.5151000022888184, "learning_rate": 3.692307692307693e-05, "epoch": 4.2, "step": 630 }, { "loss": 2.4473, "grad_norm": 0.5591350197792053, "learning_rate": 3.384615384615385e-05, "epoch": 4.266666666666667, "step": 640 }, { "loss": 2.4316, "grad_norm": 0.5070234537124634, "learning_rate": 3.0769230769230774e-05, "epoch": 4.333333333333333, "step": 650 }, { "loss": 2.4829, "grad_norm": 0.717612087726593, "learning_rate": 2.7692307692307694e-05, "epoch": 4.4, "step": 660 }, { "loss": 2.4368, "grad_norm": 0.6885381937026978, "learning_rate": 2.461538461538462e-05, "epoch": 4.466666666666667, "step": 670 }, { "loss": 2.4797, "grad_norm": 0.46743500232696533, "learning_rate": 2.1538461538461542e-05, "epoch": 4.533333333333333, "step": 680 }, { "loss": 2.3879, "grad_norm": 0.5259671211242676, "learning_rate": 1.8461538461538465e-05, "epoch": 4.6, "step": 690 }, { "loss": 2.4394, "grad_norm": 0.5409215092658997, "learning_rate": 1.5384615384615387e-05, "epoch": 4.666666666666667, "step": 700 }, { "loss": 2.466, "grad_norm": 0.4474121332168579, "learning_rate": 1.230769230769231e-05, "epoch": 4.733333333333333, "step": 710 }, { "loss": 2.5015, "grad_norm": 0.5628879070281982, "learning_rate": 9.230769230769232e-06, "epoch": 4.8, "step": 720 }, { "loss": 2.4536, "grad_norm": 0.5316895246505737, "learning_rate": 6.153846153846155e-06, "epoch": 4.866666666666667, "step": 730 }, { "loss": 2.5492, "grad_norm": 0.4985215365886688, "learning_rate": 3.0769230769230774e-06, "epoch": 4.933333333333334, "step": 740 }, { "loss": 2.4265, "grad_norm": 0.5098808407783508, "learning_rate": 0.0, "epoch": 5.0, "step": 750 }, { "eval_loss": 2.5896592140197754, "eval_runtime": 62.3109, "eval_samples_per_second": 9.613, "eval_steps_per_second": 1.204, "epoch": 5.0, "step": 750 }, { "train_runtime": 3411.7173, "train_samples_per_second": 7.033, "train_steps_per_second": 0.22, "total_flos": 6913726822803456.0, "train_loss": 2.4684160919189453, "epoch": 5.0, "step": 750 } ] }