Instructions to use zeronamoni/TMFT-adv with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use zeronamoni/TMFT-adv with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("EleutherAI/pythia-160m") model = PeftModel.from_pretrained(base_model, "zeronamoni/TMFT-adv") - Notebooks
- Google Colab
- Kaggle
| { | |
| "method": "tmft_combined", | |
| "model_name": "EleutherAI/pythia-160m", | |
| "train_samples": 4799, | |
| "validation_samples": 599, | |
| "batches_seen": 12375, | |
| "masked_token_ratio": 0.40505473533158165, | |
| "skipped_samples": 6782, | |
| "log_history": [ | |
| { | |
| "loss": 2.6159, | |
| "grad_norm": 2.032399892807007, | |
| "learning_rate": 2e-05, | |
| "epoch": 0.06666666666666667, | |
| "step": 10 | |
| }, | |
| { | |
| "loss": 2.4752, | |
| "grad_norm": 2.080336332321167, | |
| "learning_rate": 4e-05, | |
| "epoch": 0.13333333333333333, | |
| "step": 20 | |
| }, | |
| { | |
| "loss": 2.5298, | |
| "grad_norm": 1.9358763694763184, | |
| "learning_rate": 6e-05, | |
| "epoch": 0.2, | |
| "step": 30 | |
| }, | |
| { | |
| "loss": 2.5636, | |
| "grad_norm": 1.8991247415542603, | |
| "learning_rate": 8e-05, | |
| "epoch": 0.26666666666666666, | |
| "step": 40 | |
| }, | |
| { | |
| "loss": 2.4411, | |
| "grad_norm": 1.736275315284729, | |
| "learning_rate": 0.0001, | |
| "epoch": 0.3333333333333333, | |
| "step": 50 | |
| }, | |
| { | |
| "loss": 2.3803, | |
| "grad_norm": 1.4791429042816162, | |
| "learning_rate": 0.00012, | |
| "epoch": 0.4, | |
| "step": 60 | |
| }, | |
| { | |
| "loss": 2.4064, | |
| "grad_norm": 1.5463426113128662, | |
| "learning_rate": 0.00014, | |
| "epoch": 0.4666666666666667, | |
| "step": 70 | |
| }, | |
| { | |
| "loss": 2.4202, | |
| "grad_norm": 1.5478408336639404, | |
| "learning_rate": 0.00016, | |
| "epoch": 0.5333333333333333, | |
| "step": 80 | |
| }, | |
| { | |
| "loss": 2.5093, | |
| "grad_norm": 1.23783278465271, | |
| "learning_rate": 0.00018, | |
| "epoch": 0.6, | |
| "step": 90 | |
| }, | |
| { | |
| "loss": 2.5901, | |
| "grad_norm": 1.0210442543029785, | |
| "learning_rate": 0.0002, | |
| "epoch": 0.6666666666666666, | |
| "step": 100 | |
| }, | |
| { | |
| "loss": 2.5351, | |
| "grad_norm": 1.0787973403930664, | |
| "learning_rate": 0.00019692307692307696, | |
| "epoch": 0.7333333333333333, | |
| "step": 110 | |
| }, | |
| { | |
| "loss": 2.485, | |
| "grad_norm": 1.015953779220581, | |
| "learning_rate": 0.00019384615384615385, | |
| "epoch": 0.8, | |
| "step": 120 | |
| }, | |
| { | |
| "loss": 2.5954, | |
| "grad_norm": 1.0191384553909302, | |
| "learning_rate": 0.0001907692307692308, | |
| "epoch": 0.8666666666666667, | |
| "step": 130 | |
| }, | |
| { | |
| "loss": 2.4109, | |
| "grad_norm": 1.1665639877319336, | |
| "learning_rate": 0.0001876923076923077, | |
| "epoch": 0.9333333333333333, | |
| "step": 140 | |
| }, | |
| { | |
| "loss": 2.4105, | |
| "grad_norm": 0.9981837272644043, | |
| "learning_rate": 0.00018461538461538463, | |
| "epoch": 1.0, | |
| "step": 150 | |
| }, | |
| { | |
| "eval_loss": 2.5646369457244873, | |
| "eval_runtime": 63.0554, | |
| "eval_samples_per_second": 9.5, | |
| "eval_steps_per_second": 1.189, | |
| "epoch": 1.0, | |
| "step": 150 | |
| }, | |
| { | |
| "loss": 2.4635, | |
| "grad_norm": 0.9652926921844482, | |
| "learning_rate": 0.00018153846153846155, | |
| "epoch": 1.0666666666666667, | |
| "step": 160 | |
| }, | |
| { | |
| "loss": 2.4143, | |
| "grad_norm": 0.9910626411437988, | |
| "learning_rate": 0.00017846153846153847, | |
| "epoch": 1.1333333333333333, | |
| "step": 170 | |
| }, | |
| { | |
| "loss": 2.4122, | |
| "grad_norm": 0.9578900933265686, | |
| "learning_rate": 0.0001753846153846154, | |
| "epoch": 1.2, | |
| "step": 180 | |
| }, | |
| { | |
| "loss": 2.6059, | |
| "grad_norm": 0.8806987404823303, | |
| "learning_rate": 0.00017230769230769234, | |
| "epoch": 1.2666666666666666, | |
| "step": 190 | |
| }, | |
| { | |
| "loss": 2.4324, | |
| "grad_norm": 0.7595670223236084, | |
| "learning_rate": 0.00016923076923076923, | |
| "epoch": 1.3333333333333333, | |
| "step": 200 | |
| }, | |
| { | |
| "loss": 2.4291, | |
| "grad_norm": 0.8669508099555969, | |
| "learning_rate": 0.00016615384615384617, | |
| "epoch": 1.4, | |
| "step": 210 | |
| }, | |
| { | |
| "loss": 2.4332, | |
| "grad_norm": 0.7675260305404663, | |
| "learning_rate": 0.0001630769230769231, | |
| "epoch": 1.4666666666666668, | |
| "step": 220 | |
| }, | |
| { | |
| "loss": 2.4688, | |
| "grad_norm": 0.8209505677223206, | |
| "learning_rate": 0.00016, | |
| "epoch": 1.5333333333333332, | |
| "step": 230 | |
| }, | |
| { | |
| "loss": 2.4649, | |
| "grad_norm": 0.6863240599632263, | |
| "learning_rate": 0.00015692307692307693, | |
| "epoch": 1.6, | |
| "step": 240 | |
| }, | |
| { | |
| "loss": 2.5066, | |
| "grad_norm": 0.8193066120147705, | |
| "learning_rate": 0.00015384615384615385, | |
| "epoch": 1.6666666666666665, | |
| "step": 250 | |
| }, | |
| { | |
| "loss": 2.4826, | |
| "grad_norm": 0.7208594679832458, | |
| "learning_rate": 0.00015076923076923077, | |
| "epoch": 1.7333333333333334, | |
| "step": 260 | |
| }, | |
| { | |
| "loss": 2.5793, | |
| "grad_norm": 0.9297627806663513, | |
| "learning_rate": 0.00014769230769230772, | |
| "epoch": 1.8, | |
| "step": 270 | |
| }, | |
| { | |
| "loss": 2.3968, | |
| "grad_norm": 0.7471694946289062, | |
| "learning_rate": 0.0001446153846153846, | |
| "epoch": 1.8666666666666667, | |
| "step": 280 | |
| }, | |
| { | |
| "loss": 2.4876, | |
| "grad_norm": 0.6467009782791138, | |
| "learning_rate": 0.00014153846153846156, | |
| "epoch": 1.9333333333333333, | |
| "step": 290 | |
| }, | |
| { | |
| "loss": 2.4497, | |
| "grad_norm": 0.8748418688774109, | |
| "learning_rate": 0.00013846153846153847, | |
| "epoch": 2.0, | |
| "step": 300 | |
| }, | |
| { | |
| "eval_loss": 2.540955066680908, | |
| "eval_runtime": 62.6215, | |
| "eval_samples_per_second": 9.565, | |
| "eval_steps_per_second": 1.198, | |
| "epoch": 2.0, | |
| "step": 300 | |
| }, | |
| { | |
| "loss": 2.4733, | |
| "grad_norm": 0.5512543320655823, | |
| "learning_rate": 0.0001353846153846154, | |
| "epoch": 2.066666666666667, | |
| "step": 310 | |
| }, | |
| { | |
| "loss": 2.4567, | |
| "grad_norm": 0.6273607015609741, | |
| "learning_rate": 0.0001323076923076923, | |
| "epoch": 2.1333333333333333, | |
| "step": 320 | |
| }, | |
| { | |
| "loss": 2.3865, | |
| "grad_norm": 0.8209007978439331, | |
| "learning_rate": 0.00012923076923076923, | |
| "epoch": 2.2, | |
| "step": 330 | |
| }, | |
| { | |
| "loss": 2.5599, | |
| "grad_norm": 0.5290957093238831, | |
| "learning_rate": 0.00012615384615384615, | |
| "epoch": 2.2666666666666666, | |
| "step": 340 | |
| }, | |
| { | |
| "loss": 2.3978, | |
| "grad_norm": 0.6581332683563232, | |
| "learning_rate": 0.0001230769230769231, | |
| "epoch": 2.3333333333333335, | |
| "step": 350 | |
| }, | |
| { | |
| "loss": 2.4512, | |
| "grad_norm": 0.7657097578048706, | |
| "learning_rate": 0.00012, | |
| "epoch": 2.4, | |
| "step": 360 | |
| }, | |
| { | |
| "loss": 2.468, | |
| "grad_norm": 0.7191358208656311, | |
| "learning_rate": 0.00011692307692307694, | |
| "epoch": 2.466666666666667, | |
| "step": 370 | |
| }, | |
| { | |
| "loss": 2.4746, | |
| "grad_norm": 0.614693820476532, | |
| "learning_rate": 0.00011384615384615384, | |
| "epoch": 2.533333333333333, | |
| "step": 380 | |
| }, | |
| { | |
| "loss": 2.5409, | |
| "grad_norm": 0.5931090116500854, | |
| "learning_rate": 0.00011076923076923077, | |
| "epoch": 2.6, | |
| "step": 390 | |
| }, | |
| { | |
| "loss": 2.4011, | |
| "grad_norm": 0.5927258729934692, | |
| "learning_rate": 0.0001076923076923077, | |
| "epoch": 2.6666666666666665, | |
| "step": 400 | |
| }, | |
| { | |
| "loss": 2.4713, | |
| "grad_norm": 0.611909031867981, | |
| "learning_rate": 0.00010461538461538463, | |
| "epoch": 2.7333333333333334, | |
| "step": 410 | |
| }, | |
| { | |
| "loss": 2.5035, | |
| "grad_norm": 0.5654336810112, | |
| "learning_rate": 0.00010153846153846153, | |
| "epoch": 2.8, | |
| "step": 420 | |
| }, | |
| { | |
| "loss": 2.446, | |
| "grad_norm": 0.6055721044540405, | |
| "learning_rate": 9.846153846153848e-05, | |
| "epoch": 2.8666666666666667, | |
| "step": 430 | |
| }, | |
| { | |
| "loss": 2.4637, | |
| "grad_norm": 0.5348479747772217, | |
| "learning_rate": 9.53846153846154e-05, | |
| "epoch": 2.9333333333333336, | |
| "step": 440 | |
| }, | |
| { | |
| "loss": 2.5086, | |
| "grad_norm": 0.7424932718276978, | |
| "learning_rate": 9.230769230769232e-05, | |
| "epoch": 3.0, | |
| "step": 450 | |
| }, | |
| { | |
| "eval_loss": 2.5773184299468994, | |
| "eval_runtime": 62.4972, | |
| "eval_samples_per_second": 9.584, | |
| "eval_steps_per_second": 1.2, | |
| "epoch": 3.0, | |
| "step": 450 | |
| }, | |
| { | |
| "loss": 2.407, | |
| "grad_norm": 0.5943320393562317, | |
| "learning_rate": 8.923076923076924e-05, | |
| "epoch": 3.066666666666667, | |
| "step": 460 | |
| }, | |
| { | |
| "loss": 2.4673, | |
| "grad_norm": 0.5045508146286011, | |
| "learning_rate": 8.615384615384617e-05, | |
| "epoch": 3.1333333333333333, | |
| "step": 470 | |
| }, | |
| { | |
| "loss": 2.4525, | |
| "grad_norm": 0.6461102366447449, | |
| "learning_rate": 8.307692307692309e-05, | |
| "epoch": 3.2, | |
| "step": 480 | |
| }, | |
| { | |
| "loss": 2.5566, | |
| "grad_norm": 0.6374251842498779, | |
| "learning_rate": 8e-05, | |
| "epoch": 3.2666666666666666, | |
| "step": 490 | |
| }, | |
| { | |
| "loss": 2.4291, | |
| "grad_norm": 0.590420126914978, | |
| "learning_rate": 7.692307692307693e-05, | |
| "epoch": 3.3333333333333335, | |
| "step": 500 | |
| }, | |
| { | |
| "loss": 2.489, | |
| "grad_norm": 0.5788375735282898, | |
| "learning_rate": 7.384615384615386e-05, | |
| "epoch": 3.4, | |
| "step": 510 | |
| }, | |
| { | |
| "loss": 2.5309, | |
| "grad_norm": 0.7464163303375244, | |
| "learning_rate": 7.076923076923078e-05, | |
| "epoch": 3.466666666666667, | |
| "step": 520 | |
| }, | |
| { | |
| "loss": 2.4961, | |
| "grad_norm": 0.5985592603683472, | |
| "learning_rate": 6.76923076923077e-05, | |
| "epoch": 3.533333333333333, | |
| "step": 530 | |
| }, | |
| { | |
| "loss": 2.421, | |
| "grad_norm": 0.4846917986869812, | |
| "learning_rate": 6.461538461538462e-05, | |
| "epoch": 3.6, | |
| "step": 540 | |
| }, | |
| { | |
| "loss": 2.4591, | |
| "grad_norm": 0.5728452205657959, | |
| "learning_rate": 6.153846153846155e-05, | |
| "epoch": 3.6666666666666665, | |
| "step": 550 | |
| }, | |
| { | |
| "loss": 2.3962, | |
| "grad_norm": 0.5219712853431702, | |
| "learning_rate": 5.846153846153847e-05, | |
| "epoch": 3.7333333333333334, | |
| "step": 560 | |
| }, | |
| { | |
| "loss": 2.4471, | |
| "grad_norm": 0.6392219066619873, | |
| "learning_rate": 5.538461538461539e-05, | |
| "epoch": 3.8, | |
| "step": 570 | |
| }, | |
| { | |
| "loss": 2.4287, | |
| "grad_norm": 0.5428284406661987, | |
| "learning_rate": 5.230769230769231e-05, | |
| "epoch": 3.8666666666666667, | |
| "step": 580 | |
| }, | |
| { | |
| "loss": 2.4054, | |
| "grad_norm": 0.7495147585868835, | |
| "learning_rate": 4.923076923076924e-05, | |
| "epoch": 3.9333333333333336, | |
| "step": 590 | |
| }, | |
| { | |
| "loss": 2.485, | |
| "grad_norm": 0.5874316096305847, | |
| "learning_rate": 4.615384615384616e-05, | |
| "epoch": 4.0, | |
| "step": 600 | |
| }, | |
| { | |
| "eval_loss": 2.583185911178589, | |
| "eval_runtime": 62.3323, | |
| "eval_samples_per_second": 9.61, | |
| "eval_steps_per_second": 1.203, | |
| "epoch": 4.0, | |
| "step": 600 | |
| }, | |
| { | |
| "loss": 2.4716, | |
| "grad_norm": 0.5120574831962585, | |
| "learning_rate": 4.3076923076923084e-05, | |
| "epoch": 4.066666666666666, | |
| "step": 610 | |
| }, | |
| { | |
| "loss": 2.5469, | |
| "grad_norm": 0.671975314617157, | |
| "learning_rate": 4e-05, | |
| "epoch": 4.133333333333334, | |
| "step": 620 | |
| }, | |
| { | |
| "loss": 2.3403, | |
| "grad_norm": 0.5151000022888184, | |
| "learning_rate": 3.692307692307693e-05, | |
| "epoch": 4.2, | |
| "step": 630 | |
| }, | |
| { | |
| "loss": 2.4473, | |
| "grad_norm": 0.5591350197792053, | |
| "learning_rate": 3.384615384615385e-05, | |
| "epoch": 4.266666666666667, | |
| "step": 640 | |
| }, | |
| { | |
| "loss": 2.4316, | |
| "grad_norm": 0.5070234537124634, | |
| "learning_rate": 3.0769230769230774e-05, | |
| "epoch": 4.333333333333333, | |
| "step": 650 | |
| }, | |
| { | |
| "loss": 2.4829, | |
| "grad_norm": 0.717612087726593, | |
| "learning_rate": 2.7692307692307694e-05, | |
| "epoch": 4.4, | |
| "step": 660 | |
| }, | |
| { | |
| "loss": 2.4368, | |
| "grad_norm": 0.6885381937026978, | |
| "learning_rate": 2.461538461538462e-05, | |
| "epoch": 4.466666666666667, | |
| "step": 670 | |
| }, | |
| { | |
| "loss": 2.4797, | |
| "grad_norm": 0.46743500232696533, | |
| "learning_rate": 2.1538461538461542e-05, | |
| "epoch": 4.533333333333333, | |
| "step": 680 | |
| }, | |
| { | |
| "loss": 2.3879, | |
| "grad_norm": 0.5259671211242676, | |
| "learning_rate": 1.8461538461538465e-05, | |
| "epoch": 4.6, | |
| "step": 690 | |
| }, | |
| { | |
| "loss": 2.4394, | |
| "grad_norm": 0.5409215092658997, | |
| "learning_rate": 1.5384615384615387e-05, | |
| "epoch": 4.666666666666667, | |
| "step": 700 | |
| }, | |
| { | |
| "loss": 2.466, | |
| "grad_norm": 0.4474121332168579, | |
| "learning_rate": 1.230769230769231e-05, | |
| "epoch": 4.733333333333333, | |
| "step": 710 | |
| }, | |
| { | |
| "loss": 2.5015, | |
| "grad_norm": 0.5628879070281982, | |
| "learning_rate": 9.230769230769232e-06, | |
| "epoch": 4.8, | |
| "step": 720 | |
| }, | |
| { | |
| "loss": 2.4536, | |
| "grad_norm": 0.5316895246505737, | |
| "learning_rate": 6.153846153846155e-06, | |
| "epoch": 4.866666666666667, | |
| "step": 730 | |
| }, | |
| { | |
| "loss": 2.5492, | |
| "grad_norm": 0.4985215365886688, | |
| "learning_rate": 3.0769230769230774e-06, | |
| "epoch": 4.933333333333334, | |
| "step": 740 | |
| }, | |
| { | |
| "loss": 2.4265, | |
| "grad_norm": 0.5098808407783508, | |
| "learning_rate": 0.0, | |
| "epoch": 5.0, | |
| "step": 750 | |
| }, | |
| { | |
| "eval_loss": 2.5896592140197754, | |
| "eval_runtime": 62.3109, | |
| "eval_samples_per_second": 9.613, | |
| "eval_steps_per_second": 1.204, | |
| "epoch": 5.0, | |
| "step": 750 | |
| }, | |
| { | |
| "train_runtime": 3411.7173, | |
| "train_samples_per_second": 7.033, | |
| "train_steps_per_second": 0.22, | |
| "total_flos": 6913726822803456.0, | |
| "train_loss": 2.4684160919189453, | |
| "epoch": 5.0, | |
| "step": 750 | |
| } | |
| ] | |
| } |