Text Generation
Transformers
Safetensors
llama
trl
dpo
Generated from Trainer
conversational
text-generation-inference
Instructions to use tsavage68/Transaminitis_L3_1000steps_1e7rate_03beta_CSFTDPO with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use tsavage68/Transaminitis_L3_1000steps_1e7rate_03beta_CSFTDPO with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="tsavage68/Transaminitis_L3_1000steps_1e7rate_03beta_CSFTDPO") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("tsavage68/Transaminitis_L3_1000steps_1e7rate_03beta_CSFTDPO") model = AutoModelForCausalLM.from_pretrained("tsavage68/Transaminitis_L3_1000steps_1e7rate_03beta_CSFTDPO", device_map="auto") messages = [ {"role": "user", "content": "Who are you?"}, ] inputs = tokenizer.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=40) print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use tsavage68/Transaminitis_L3_1000steps_1e7rate_03beta_CSFTDPO with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "tsavage68/Transaminitis_L3_1000steps_1e7rate_03beta_CSFTDPO" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "tsavage68/Transaminitis_L3_1000steps_1e7rate_03beta_CSFTDPO", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/tsavage68/Transaminitis_L3_1000steps_1e7rate_03beta_CSFTDPO
- SGLang
How to use tsavage68/Transaminitis_L3_1000steps_1e7rate_03beta_CSFTDPO with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "tsavage68/Transaminitis_L3_1000steps_1e7rate_03beta_CSFTDPO" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "tsavage68/Transaminitis_L3_1000steps_1e7rate_03beta_CSFTDPO", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "tsavage68/Transaminitis_L3_1000steps_1e7rate_03beta_CSFTDPO" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "tsavage68/Transaminitis_L3_1000steps_1e7rate_03beta_CSFTDPO", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use tsavage68/Transaminitis_L3_1000steps_1e7rate_03beta_CSFTDPO with Docker Model Runner:
docker model run hf.co/tsavage68/Transaminitis_L3_1000steps_1e7rate_03beta_CSFTDPO
Transaminitis_L3_1000steps_1e7rate_03beta_CSFTDPO
This model is a fine-tuned version of tsavage68/Transaminitis_L3_1000rate_1e7_SFT on an unknown dataset. It achieves the following results on the evaluation set:
- Loss: 0.1392
- Rewards/chosen: 1.7582
- Rewards/rejected: -2.4140
- Rewards/accuracies: 0.9300
- Rewards/margins: 4.1722
- Logps/rejected: -26.6014
- Logps/chosen: -12.6736
- Logits/rejected: -1.0630
- Logits/chosen: -1.0536
Model description
More information needed
Intended uses & limitations
More information needed
Training and evaluation data
More information needed
Training procedure
Training hyperparameters
The following hyperparameters were used during training:
- learning_rate: 1e-07
- train_batch_size: 2
- eval_batch_size: 1
- seed: 42
- gradient_accumulation_steps: 2
- total_train_batch_size: 4
- optimizer: Adam with betas=(0.9,0.999) and epsilon=1e-08
- lr_scheduler_type: cosine
- lr_scheduler_warmup_steps: 100
- training_steps: 1000
Training results
| Training Loss | Epoch | Step | Validation Loss | Rewards/chosen | Rewards/rejected | Rewards/accuracies | Rewards/margins | Logps/rejected | Logps/chosen | Logits/rejected | Logits/chosen |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 0.6949 | 0.2 | 25 | 0.6922 | -0.0089 | -0.0113 | 0.5600 | 0.0023 | -18.5922 | -18.5640 | -1.0661 | -1.0649 |
| 0.689 | 0.4 | 50 | 0.6902 | -0.0743 | -0.0808 | 0.5700 | 0.0065 | -18.8241 | -18.7820 | -1.0662 | -1.0650 |
| 0.6966 | 0.6 | 75 | 0.6990 | -0.0262 | -0.0204 | 0.4500 | -0.0058 | -18.6227 | -18.6216 | -1.0666 | -1.0653 |
| 0.6628 | 0.8 | 100 | 0.7163 | -0.1175 | -0.1132 | 0.4600 | -0.0042 | -18.9322 | -18.9257 | -1.0693 | -1.0680 |
| 0.7015 | 1.0 | 125 | 0.6776 | -0.4612 | -0.5510 | 0.5400 | 0.0898 | -20.3914 | -20.0715 | -1.0730 | -1.0717 |
| 0.6668 | 1.2 | 150 | 0.6800 | 0.0635 | 0.0084 | 0.4600 | 0.0551 | -18.5267 | -18.3224 | -1.0700 | -1.0688 |
| 0.6409 | 1.4 | 175 | 0.6361 | -0.0704 | -0.1936 | 0.7700 | 0.1232 | -19.2001 | -18.7690 | -1.0737 | -1.0723 |
| 0.6123 | 1.6 | 200 | 0.6074 | 0.0180 | -0.1849 | 0.7300 | 0.2030 | -19.1711 | -18.4741 | -1.0741 | -1.0726 |
| 0.6043 | 1.8 | 225 | 0.5988 | 0.3189 | 0.0943 | 0.75 | 0.2245 | -18.2403 | -17.4714 | -1.0739 | -1.0724 |
| 0.5608 | 2.0 | 250 | 0.5625 | 0.4639 | 0.1602 | 0.8300 | 0.3037 | -18.0205 | -16.9878 | -1.0739 | -1.0723 |
| 0.5206 | 2.2 | 275 | 0.5084 | 0.5476 | 0.0971 | 0.8700 | 0.4504 | -18.2310 | -16.7090 | -1.0751 | -1.0732 |
| 0.4709 | 2.4 | 300 | 0.4614 | 0.7169 | 0.1230 | 0.8800 | 0.5939 | -18.1448 | -16.1447 | -1.0753 | -1.0732 |
| 0.433 | 2.6 | 325 | 0.4388 | 1.1217 | 0.3690 | 0.8500 | 0.7527 | -17.3245 | -14.7951 | -1.0729 | -1.0703 |
| 0.2802 | 2.8 | 350 | 0.3165 | 1.1549 | -0.0896 | 0.9200 | 1.2445 | -18.8533 | -14.6845 | -1.0737 | -1.0701 |
| 0.3044 | 3.0 | 375 | 0.2744 | 1.3071 | -0.1921 | 0.9000 | 1.4992 | -19.1949 | -14.1771 | -1.0729 | -1.0688 |
| 0.284 | 3.2 | 400 | 0.2314 | 1.5290 | -0.3317 | 0.9100 | 1.8607 | -19.6603 | -13.4374 | -1.0713 | -1.0663 |
| 0.1771 | 3.4 | 425 | 0.1947 | 1.6285 | -0.6031 | 0.9300 | 2.2317 | -20.5652 | -13.1057 | -1.0703 | -1.0645 |
| 0.2167 | 3.6 | 450 | 0.1840 | 1.5135 | -0.9678 | 0.9200 | 2.4813 | -21.7808 | -13.4893 | -1.0704 | -1.0643 |
| 0.1395 | 3.8 | 475 | 0.1771 | 1.5622 | -1.1304 | 0.9200 | 2.6926 | -22.3226 | -13.3267 | -1.0702 | -1.0636 |
| 0.2148 | 4.0 | 500 | 0.1874 | 1.6351 | -1.2063 | 0.9300 | 2.8414 | -22.5757 | -13.0837 | -1.0669 | -1.0600 |
| 0.0286 | 4.2 | 525 | 0.1577 | 1.6211 | -1.6079 | 0.9200 | 3.2289 | -23.9142 | -13.1307 | -1.0665 | -1.0588 |
| 0.1347 | 4.4 | 550 | 0.1587 | 1.6299 | -1.7763 | 0.9200 | 3.4062 | -24.4757 | -13.1011 | -1.0654 | -1.0575 |
| 0.0575 | 4.6 | 575 | 0.1473 | 1.6935 | -1.9790 | 0.9200 | 3.6725 | -25.1514 | -12.8892 | -1.0648 | -1.0564 |
| 0.158 | 4.8 | 600 | 0.1509 | 1.6992 | -2.0296 | 0.9300 | 3.7288 | -25.3200 | -12.8703 | -1.0651 | -1.0566 |
| 0.0607 | 5.0 | 625 | 0.1475 | 1.6735 | -2.1752 | 0.9400 | 3.8488 | -25.8055 | -12.9557 | -1.0647 | -1.0558 |
| 0.1122 | 5.2 | 650 | 0.1404 | 1.7217 | -2.2066 | 0.9400 | 3.9283 | -25.9101 | -12.7953 | -1.0637 | -1.0549 |
| 0.1517 | 5.4 | 675 | 0.1448 | 1.7525 | -2.2515 | 0.9400 | 4.0040 | -26.0596 | -12.6925 | -1.0628 | -1.0538 |
| 0.0413 | 5.6 | 700 | 0.1418 | 1.7609 | -2.3002 | 0.9400 | 4.0611 | -26.2220 | -12.6647 | -1.0635 | -1.0545 |
| 0.0528 | 5.8 | 725 | 0.1358 | 1.7517 | -2.3539 | 0.9200 | 4.1056 | -26.4012 | -12.6954 | -1.0634 | -1.0542 |
| 0.243 | 6.0 | 750 | 0.1356 | 1.7676 | -2.3804 | 0.9300 | 4.1480 | -26.4894 | -12.6424 | -1.0623 | -1.0531 |
| 0.1309 | 6.2 | 775 | 0.1522 | 1.7393 | -2.3923 | 0.9300 | 4.1315 | -26.5290 | -12.7367 | -1.0632 | -1.0540 |
| 0.1943 | 6.4 | 800 | 0.1425 | 1.7703 | -2.3997 | 0.9300 | 4.1699 | -26.5535 | -12.6333 | -1.0628 | -1.0534 |
| 0.0754 | 6.6 | 825 | 0.1308 | 1.7709 | -2.4143 | 0.9400 | 4.1852 | -26.6025 | -12.6314 | -1.0623 | -1.0529 |
| 0.0603 | 6.8 | 850 | 0.1401 | 1.7587 | -2.4040 | 0.9300 | 4.1627 | -26.5682 | -12.6720 | -1.0630 | -1.0537 |
| 0.0603 | 7.0 | 875 | 0.1402 | 1.7651 | -2.3976 | 0.9300 | 4.1627 | -26.5466 | -12.6505 | -1.0636 | -1.0543 |
| 0.046 | 7.2 | 900 | 0.1397 | 1.7519 | -2.4254 | 0.9300 | 4.1773 | -26.6393 | -12.6945 | -1.0631 | -1.0538 |
| 0.2102 | 7.4 | 925 | 0.1390 | 1.7602 | -2.4168 | 0.9300 | 4.1770 | -26.6105 | -12.6669 | -1.0631 | -1.0537 |
| 0.2116 | 7.6 | 950 | 0.1392 | 1.7582 | -2.4140 | 0.9300 | 4.1722 | -26.6014 | -12.6736 | -1.0630 | -1.0536 |
| 0.094 | 7.8 | 975 | 0.1392 | 1.7582 | -2.4140 | 0.9300 | 4.1722 | -26.6014 | -12.6736 | -1.0630 | -1.0536 |
| 0.1121 | 8.0 | 1000 | 0.1392 | 1.7582 | -2.4140 | 0.9300 | 4.1722 | -26.6014 | -12.6736 | -1.0630 | -1.0536 |
Framework versions
- Transformers 4.40.2
- Pytorch 2.0.0+cu117
- Datasets 2.19.1
- Tokenizers 0.19.1
- Downloads last month
- 8
Model tree for tsavage68/Transaminitis_L3_1000steps_1e7rate_03beta_CSFTDPO
Base model
meta-llama/Meta-Llama-3-8B-Instruct