Text Generation
Transformers
Safetensors
llama
trl
dpo
Generated from Trainer
conversational
text-generation-inference
Instructions to use tsavage68/Transaminitis_L3_1000steps_1e7rate_01beta_CSFTDPO with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use tsavage68/Transaminitis_L3_1000steps_1e7rate_01beta_CSFTDPO with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="tsavage68/Transaminitis_L3_1000steps_1e7rate_01beta_CSFTDPO") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("tsavage68/Transaminitis_L3_1000steps_1e7rate_01beta_CSFTDPO") model = AutoModelForCausalLM.from_pretrained("tsavage68/Transaminitis_L3_1000steps_1e7rate_01beta_CSFTDPO", device_map="auto") messages = [ {"role": "user", "content": "Who are you?"}, ] inputs = tokenizer.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=40) print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use tsavage68/Transaminitis_L3_1000steps_1e7rate_01beta_CSFTDPO with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "tsavage68/Transaminitis_L3_1000steps_1e7rate_01beta_CSFTDPO" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "tsavage68/Transaminitis_L3_1000steps_1e7rate_01beta_CSFTDPO", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/tsavage68/Transaminitis_L3_1000steps_1e7rate_01beta_CSFTDPO
- SGLang
How to use tsavage68/Transaminitis_L3_1000steps_1e7rate_01beta_CSFTDPO with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "tsavage68/Transaminitis_L3_1000steps_1e7rate_01beta_CSFTDPO" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "tsavage68/Transaminitis_L3_1000steps_1e7rate_01beta_CSFTDPO", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "tsavage68/Transaminitis_L3_1000steps_1e7rate_01beta_CSFTDPO" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "tsavage68/Transaminitis_L3_1000steps_1e7rate_01beta_CSFTDPO", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use tsavage68/Transaminitis_L3_1000steps_1e7rate_01beta_CSFTDPO with Docker Model Runner:
docker model run hf.co/tsavage68/Transaminitis_L3_1000steps_1e7rate_01beta_CSFTDPO
Transaminitis_L3_1000steps_1e7rate_01beta_CSFTDPO
This model is a fine-tuned version of tsavage68/Transaminitis_L3_1000rate_1e7_SFT on an unknown dataset. It achieves the following results on the evaluation set:
- Loss: 0.1933
- Rewards/chosen: 0.7492
- Rewards/rejected: -1.2839
- Rewards/accuracies: 0.9300
- Rewards/margins: 2.0331
- Logps/rejected: -31.3938
- Logps/chosen: -11.0420
- Logits/rejected: -1.0508
- Logits/chosen: -1.0376
Model description
More information needed
Intended uses & limitations
More information needed
Training and evaluation data
More information needed
Training procedure
Training hyperparameters
The following hyperparameters were used during training:
- learning_rate: 1e-07
- train_batch_size: 2
- eval_batch_size: 1
- seed: 42
- gradient_accumulation_steps: 2
- total_train_batch_size: 4
- optimizer: Adam with betas=(0.9,0.999) and epsilon=1e-08
- lr_scheduler_type: cosine
- lr_scheduler_warmup_steps: 100
- training_steps: 1000
Training results
| Training Loss | Epoch | Step | Validation Loss | Rewards/chosen | Rewards/rejected | Rewards/accuracies | Rewards/margins | Logps/rejected | Logps/chosen | Logits/rejected | Logits/chosen |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 0.6925 | 0.2 | 25 | 0.6925 | -0.0045 | -0.0060 | 0.5500 | 0.0014 | -18.6144 | -18.5795 | -1.0662 | -1.0649 |
| 0.6933 | 0.4 | 50 | 0.6925 | -0.0166 | -0.0181 | 0.5100 | 0.0014 | -18.7354 | -18.7005 | -1.0667 | -1.0654 |
| 0.6915 | 0.6 | 75 | 0.6945 | -0.0053 | -0.0039 | 0.4600 | -0.0015 | -18.5932 | -18.5873 | -1.0676 | -1.0664 |
| 0.6761 | 0.8 | 100 | 0.7028 | -0.0339 | -0.0261 | 0.4600 | -0.0078 | -18.8159 | -18.8731 | -1.0697 | -1.0686 |
| 0.6921 | 1.0 | 125 | 0.6820 | -0.1696 | -0.1980 | 0.5400 | 0.0284 | -20.5345 | -20.2299 | -1.0740 | -1.0726 |
| 0.6815 | 1.2 | 150 | 0.6861 | -0.0069 | -0.0260 | 0.4600 | 0.0191 | -18.8146 | -18.6028 | -1.0702 | -1.0689 |
| 0.6671 | 1.4 | 175 | 0.6780 | -0.0128 | -0.0468 | 0.5 | 0.0339 | -19.0222 | -18.6624 | -1.0734 | -1.0720 |
| 0.6638 | 1.6 | 200 | 0.6604 | 0.0019 | -0.0673 | 0.7400 | 0.0692 | -19.2276 | -18.5154 | -1.0758 | -1.0743 |
| 0.6595 | 1.8 | 225 | 0.6509 | 0.1265 | 0.0377 | 0.8000 | 0.0888 | -18.1775 | -17.2692 | -1.0741 | -1.0725 |
| 0.6367 | 2.0 | 250 | 0.6334 | 0.1771 | 0.0509 | 0.8900 | 0.1262 | -18.0452 | -16.7631 | -1.0738 | -1.0720 |
| 0.6195 | 2.2 | 275 | 0.6085 | 0.2361 | 0.0531 | 0.8700 | 0.1830 | -18.0241 | -16.1733 | -1.0733 | -1.0711 |
| 0.5823 | 2.4 | 300 | 0.5785 | 0.3043 | 0.0504 | 0.8900 | 0.2539 | -18.0504 | -15.4909 | -1.0732 | -1.0705 |
| 0.566 | 2.6 | 325 | 0.5388 | 0.4536 | 0.0969 | 0.8800 | 0.3566 | -17.5852 | -13.9987 | -1.0723 | -1.0690 |
| 0.4489 | 2.8 | 350 | 0.4631 | 0.4810 | -0.0948 | 0.9200 | 0.5759 | -19.5031 | -13.7237 | -1.0716 | -1.0669 |
| 0.4492 | 3.0 | 375 | 0.4239 | 0.5170 | -0.1855 | 0.8800 | 0.7025 | -20.4092 | -13.3640 | -1.0688 | -1.0634 |
| 0.3953 | 3.2 | 400 | 0.3679 | 0.5401 | -0.3677 | 0.9100 | 0.9078 | -22.2317 | -13.1329 | -1.0687 | -1.0618 |
| 0.3352 | 3.4 | 425 | 0.3283 | 0.6091 | -0.4726 | 0.9200 | 1.0817 | -23.2806 | -12.4430 | -1.0668 | -1.0589 |
| 0.3345 | 3.6 | 450 | 0.3031 | 0.5660 | -0.6308 | 0.9100 | 1.1968 | -24.8626 | -12.8744 | -1.0634 | -1.0550 |
| 0.2808 | 3.8 | 475 | 0.2814 | 0.5999 | -0.7205 | 0.9200 | 1.3204 | -25.7593 | -12.5348 | -1.0619 | -1.0530 |
| 0.295 | 4.0 | 500 | 0.2710 | 0.6397 | -0.7787 | 0.9100 | 1.4184 | -26.3414 | -12.1370 | -1.0598 | -1.0503 |
| 0.1522 | 4.2 | 525 | 0.2397 | 0.6658 | -0.9115 | 0.9200 | 1.5773 | -27.6701 | -11.8764 | -1.0584 | -1.0478 |
| 0.2229 | 4.4 | 550 | 0.2333 | 0.6781 | -0.9833 | 0.9400 | 1.6614 | -28.3878 | -11.7537 | -1.0576 | -1.0467 |
| 0.1649 | 4.6 | 575 | 0.2182 | 0.7121 | -1.0636 | 0.9300 | 1.7757 | -29.1910 | -11.4132 | -1.0554 | -1.0439 |
| 0.2244 | 4.8 | 600 | 0.2161 | 0.7092 | -1.1127 | 0.9400 | 1.8219 | -29.6819 | -11.4421 | -1.0538 | -1.0421 |
| 0.1693 | 5.0 | 625 | 0.2022 | 0.7249 | -1.1646 | 0.9300 | 1.8895 | -30.2002 | -11.2852 | -1.0535 | -1.0411 |
| 0.1678 | 5.2 | 650 | 0.1995 | 0.7305 | -1.2049 | 0.9300 | 1.9354 | -30.6042 | -11.2294 | -1.0522 | -1.0397 |
| 0.201 | 5.4 | 675 | 0.2023 | 0.7376 | -1.2194 | 0.9400 | 1.9570 | -30.7488 | -11.1583 | -1.0513 | -1.0387 |
| 0.1349 | 5.6 | 700 | 0.2020 | 0.7378 | -1.2410 | 0.9400 | 1.9788 | -30.9646 | -11.1562 | -1.0514 | -1.0387 |
| 0.1701 | 5.8 | 725 | 0.1906 | 0.7477 | -1.2728 | 0.9400 | 2.0205 | -31.2831 | -11.0576 | -1.0516 | -1.0386 |
| 0.2496 | 6.0 | 750 | 0.1936 | 0.7436 | -1.2811 | 0.9400 | 2.0246 | -31.3653 | -11.0984 | -1.0504 | -1.0375 |
| 0.1687 | 6.2 | 775 | 0.1954 | 0.7415 | -1.2850 | 0.9300 | 2.0265 | -31.4046 | -11.1193 | -1.0510 | -1.0379 |
| 0.2297 | 6.4 | 800 | 0.1902 | 0.7475 | -1.2899 | 0.9400 | 2.0375 | -31.4538 | -11.0588 | -1.0511 | -1.0379 |
| 0.1449 | 6.6 | 825 | 0.1913 | 0.7469 | -1.2876 | 0.9400 | 2.0345 | -31.4306 | -11.0649 | -1.0506 | -1.0375 |
| 0.1558 | 6.8 | 850 | 0.1915 | 0.7522 | -1.2831 | 0.9400 | 2.0353 | -31.3859 | -11.0121 | -1.0509 | -1.0376 |
| 0.1445 | 7.0 | 875 | 0.1907 | 0.7502 | -1.2855 | 0.9300 | 2.0358 | -31.4099 | -11.0318 | -1.0508 | -1.0377 |
| 0.1568 | 7.2 | 900 | 0.1925 | 0.7477 | -1.2878 | 0.9300 | 2.0355 | -31.4327 | -11.0573 | -1.0507 | -1.0376 |
| 0.2344 | 7.4 | 925 | 0.1933 | 0.7486 | -1.2845 | 0.9300 | 2.0331 | -31.3995 | -11.0484 | -1.0508 | -1.0377 |
| 0.2176 | 7.6 | 950 | 0.1933 | 0.7492 | -1.2839 | 0.9300 | 2.0331 | -31.3938 | -11.0420 | -1.0508 | -1.0376 |
| 0.14 | 7.8 | 975 | 0.1933 | 0.7492 | -1.2839 | 0.9300 | 2.0331 | -31.3938 | -11.0420 | -1.0508 | -1.0376 |
| 0.1992 | 8.0 | 1000 | 0.1933 | 0.7492 | -1.2839 | 0.9300 | 2.0331 | -31.3938 | -11.0420 | -1.0508 | -1.0376 |
Framework versions
- Transformers 4.40.2
- Pytorch 2.0.0+cu117
- Datasets 2.19.1
- Tokenizers 0.19.1
- Downloads last month
- 6
Model tree for tsavage68/Transaminitis_L3_1000steps_1e7rate_01beta_CSFTDPO
Base model
meta-llama/Meta-Llama-3-8B-Instruct