Text Generation
Transformers
Safetensors
llama
trl
dpo
Generated from Trainer
conversational
text-generation-inference
Instructions to use tsavage68/Transaminitis_L3_1000steps_1e6rate_03beta_CSFTDPO with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use tsavage68/Transaminitis_L3_1000steps_1e6rate_03beta_CSFTDPO with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="tsavage68/Transaminitis_L3_1000steps_1e6rate_03beta_CSFTDPO") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("tsavage68/Transaminitis_L3_1000steps_1e6rate_03beta_CSFTDPO") model = AutoModelForCausalLM.from_pretrained("tsavage68/Transaminitis_L3_1000steps_1e6rate_03beta_CSFTDPO", device_map="auto") messages = [ {"role": "user", "content": "Who are you?"}, ] inputs = tokenizer.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=40) print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use tsavage68/Transaminitis_L3_1000steps_1e6rate_03beta_CSFTDPO with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "tsavage68/Transaminitis_L3_1000steps_1e6rate_03beta_CSFTDPO" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "tsavage68/Transaminitis_L3_1000steps_1e6rate_03beta_CSFTDPO", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/tsavage68/Transaminitis_L3_1000steps_1e6rate_03beta_CSFTDPO
- SGLang
How to use tsavage68/Transaminitis_L3_1000steps_1e6rate_03beta_CSFTDPO with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "tsavage68/Transaminitis_L3_1000steps_1e6rate_03beta_CSFTDPO" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "tsavage68/Transaminitis_L3_1000steps_1e6rate_03beta_CSFTDPO", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "tsavage68/Transaminitis_L3_1000steps_1e6rate_03beta_CSFTDPO" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "tsavage68/Transaminitis_L3_1000steps_1e6rate_03beta_CSFTDPO", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use tsavage68/Transaminitis_L3_1000steps_1e6rate_03beta_CSFTDPO with Docker Model Runner:
docker model run hf.co/tsavage68/Transaminitis_L3_1000steps_1e6rate_03beta_CSFTDPO
Transaminitis_L3_1000steps_1e6rate_03beta_CSFTDPO
This model is a fine-tuned version of tsavage68/Transaminitis_L3_1000rate_1e7_SFT on an unknown dataset. It achieves the following results on the evaluation set:
- Loss: 0.0000
- Rewards/chosen: 4.3354
- Rewards/rejected: -9.1238
- Rewards/accuracies: 1.0
- Rewards/margins: 13.4592
- Logps/rejected: -48.9674
- Logps/chosen: -4.0829
- Logits/rejected: -1.0304
- Logits/chosen: -1.0110
Model description
More information needed
Intended uses & limitations
More information needed
Training and evaluation data
More information needed
Training procedure
Training hyperparameters
The following hyperparameters were used during training:
- learning_rate: 1e-06
- train_batch_size: 2
- eval_batch_size: 1
- seed: 42
- gradient_accumulation_steps: 2
- total_train_batch_size: 4
- optimizer: Adam with betas=(0.9,0.999) and epsilon=1e-08
- lr_scheduler_type: cosine
- lr_scheduler_warmup_steps: 100
- training_steps: 1000
Training results
| Training Loss | Epoch | Step | Validation Loss | Rewards/chosen | Rewards/rejected | Rewards/accuracies | Rewards/margins | Logps/rejected | Logps/chosen | Logits/rejected | Logits/chosen |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 0.7019 | 0.2 | 25 | 0.6786 | -0.4349 | -0.4775 | 0.5800 | 0.0427 | -20.1465 | -19.9838 | -1.0698 | -1.0685 |
| 0.6126 | 0.4 | 50 | 0.3723 | 2.2282 | 1.0718 | 0.8800 | 1.1564 | -14.9821 | -11.1070 | -1.0337 | -1.0340 |
| 0.6918 | 0.6 | 75 | 0.0759 | 3.7913 | -5.7738 | 0.9900 | 9.5651 | -37.8007 | -5.8967 | -1.0561 | -1.0499 |
| 0.4405 | 0.8 | 100 | 0.1383 | 3.7679 | -5.8296 | 0.9800 | 9.5975 | -37.9869 | -5.9747 | -1.0324 | -1.0129 |
| 0.0 | 1.0 | 125 | 0.0000 | 4.4890 | -8.1495 | 1.0 | 12.6386 | -45.7198 | -3.5708 | -1.0484 | -1.0252 |
| 0.3231 | 1.2 | 150 | 0.0000 | 4.0358 | -7.2360 | 1.0 | 11.2718 | -42.6746 | -5.0815 | -1.0250 | -1.0111 |
| 0.0 | 1.4 | 175 | 0.0000 | 4.0896 | -7.5543 | 1.0 | 11.6440 | -43.7358 | -4.9021 | -1.0259 | -1.0117 |
| 0.0 | 1.6 | 200 | 0.0000 | 4.1143 | -7.6011 | 1.0 | 11.7154 | -43.8917 | -4.8197 | -1.0232 | -1.0079 |
| 0.0 | 1.8 | 225 | 0.0000 | 4.1494 | -7.8210 | 1.0 | 11.9704 | -44.6247 | -4.7029 | -1.0248 | -1.0090 |
| 0.0 | 2.0 | 250 | 0.0000 | 4.1728 | -7.9893 | 1.0 | 12.1621 | -45.1857 | -4.6248 | -1.0246 | -1.0084 |
| 0.0 | 2.2 | 275 | 0.0000 | 4.1928 | -8.1237 | 1.0 | 12.3165 | -45.6337 | -4.5581 | -1.0264 | -1.0096 |
| 0.0 | 2.4 | 300 | 0.0000 | 4.2148 | -8.2668 | 1.0 | 12.4816 | -46.1106 | -4.4848 | -1.0260 | -1.0090 |
| 0.0 | 2.6 | 325 | 0.0000 | 4.2269 | -8.3679 | 1.0 | 12.5948 | -46.4476 | -4.4445 | -1.0271 | -1.0096 |
| 0.0 | 2.8 | 350 | 0.0000 | 4.2398 | -8.4655 | 1.0 | 12.7052 | -46.7729 | -4.4017 | -1.0280 | -1.0104 |
| 0.0 | 3.0 | 375 | 0.0000 | 4.2594 | -8.5477 | 1.0 | 12.8071 | -47.0470 | -4.3361 | -1.0290 | -1.0111 |
| 0.0 | 3.2 | 400 | 0.0000 | 4.2724 | -8.6275 | 1.0 | 12.8999 | -47.3132 | -4.2929 | -1.0279 | -1.0097 |
| 0.0 | 3.4 | 425 | 0.0000 | 4.2786 | -8.7058 | 1.0 | 12.9843 | -47.5739 | -4.2724 | -1.0293 | -1.0109 |
| 0.0 | 3.6 | 450 | 0.0000 | 4.2937 | -8.7547 | 1.0 | 13.0484 | -47.7369 | -4.2217 | -1.0293 | -1.0109 |
| 0.0 | 3.8 | 475 | 0.0000 | 4.2991 | -8.8078 | 1.0 | 13.1069 | -47.9139 | -4.2038 | -1.0292 | -1.0105 |
| 0.0 | 4.0 | 500 | 0.0000 | 4.3050 | -8.8538 | 1.0 | 13.1587 | -48.0672 | -4.1843 | -1.0295 | -1.0106 |
| 0.0 | 4.2 | 525 | 0.0000 | 4.3101 | -8.9007 | 1.0 | 13.2108 | -48.2237 | -4.1672 | -1.0296 | -1.0107 |
| 0.0 | 4.4 | 550 | 0.0000 | 4.3169 | -8.9396 | 1.0 | 13.2565 | -48.3533 | -4.1444 | -1.0297 | -1.0107 |
| 0.0 | 4.6 | 575 | 0.0000 | 4.3210 | -8.9802 | 1.0 | 13.3012 | -48.4887 | -4.1310 | -1.0302 | -1.0112 |
| 0.0 | 4.8 | 600 | 0.0000 | 4.3255 | -9.0068 | 1.0 | 13.3324 | -48.5775 | -4.1158 | -1.0313 | -1.0122 |
| 0.0 | 5.0 | 625 | 0.0000 | 4.3270 | -9.0307 | 1.0 | 13.3577 | -48.6569 | -4.1109 | -1.0311 | -1.0119 |
| 0.0 | 5.2 | 650 | 0.0000 | 4.3299 | -9.0577 | 1.0 | 13.3876 | -48.7470 | -4.1011 | -1.0302 | -1.0109 |
| 0.0 | 5.4 | 675 | 0.0000 | 4.3329 | -9.0561 | 1.0 | 13.3890 | -48.7417 | -4.0911 | -1.0311 | -1.0119 |
| 0.0 | 5.6 | 700 | 0.0000 | 4.3363 | -9.0811 | 1.0 | 13.4174 | -48.8251 | -4.0798 | -1.0301 | -1.0108 |
| 0.0 | 5.8 | 725 | 0.0000 | 4.3362 | -9.0984 | 1.0 | 13.4345 | -48.8826 | -4.0804 | -1.0306 | -1.0113 |
| 0.0 | 6.0 | 750 | 0.0000 | 4.3386 | -9.0976 | 1.0 | 13.4362 | -48.8800 | -4.0721 | -1.0307 | -1.0112 |
| 0.0 | 6.2 | 775 | 0.0000 | 4.3370 | -9.1127 | 1.0 | 13.4497 | -48.9305 | -4.0777 | -1.0318 | -1.0123 |
| 0.0 | 6.4 | 800 | 0.0000 | 4.3378 | -9.1143 | 1.0 | 13.4522 | -48.9358 | -4.0749 | -1.0308 | -1.0114 |
| 0.0 | 6.6 | 825 | 0.0000 | 4.3371 | -9.1165 | 1.0 | 13.4536 | -48.9429 | -4.0771 | -1.0310 | -1.0116 |
| 0.0 | 6.8 | 850 | 0.0000 | 4.3373 | -9.1236 | 1.0 | 13.4609 | -48.9667 | -4.0765 | -1.0307 | -1.0113 |
| 0.0 | 7.0 | 875 | 0.0000 | 4.3377 | -9.1190 | 1.0 | 13.4566 | -48.9512 | -4.0753 | -1.0310 | -1.0116 |
| 0.0 | 7.2 | 900 | 0.0000 | 4.3356 | -9.1212 | 1.0 | 13.4568 | -48.9586 | -4.0821 | -1.0310 | -1.0117 |
| 0.0 | 7.4 | 925 | 0.0000 | 4.3352 | -9.1260 | 1.0 | 13.4613 | -48.9748 | -4.0834 | -1.0304 | -1.0110 |
| 0.0 | 7.6 | 950 | 0.0000 | 4.3358 | -9.1251 | 1.0 | 13.4609 | -48.9718 | -4.0815 | -1.0303 | -1.0110 |
| 0.0 | 7.8 | 975 | 0.0000 | 4.3354 | -9.1238 | 1.0 | 13.4592 | -48.9674 | -4.0829 | -1.0304 | -1.0110 |
| 0.0 | 8.0 | 1000 | 0.0000 | 4.3354 | -9.1238 | 1.0 | 13.4592 | -48.9674 | -4.0829 | -1.0304 | -1.0110 |
Framework versions
- Transformers 4.40.2
- Pytorch 2.0.0+cu117
- Datasets 2.19.1
- Tokenizers 0.19.1
- Downloads last month
- 7
Model tree for tsavage68/Transaminitis_L3_1000steps_1e6rate_03beta_CSFTDPO
Base model
meta-llama/Meta-Llama-3-8B-Instruct