Instructions to use testingusera1/Qwen2.5-Coder-7B-CSharp-QLoRA-GGUF with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- llama.cpp
How to use testingusera1/Qwen2.5-Coder-7B-CSharp-QLoRA-GGUF with llama.cpp:
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh # Start a local OpenAI-compatible server with a web UI: llama serve -hf testingusera1/Qwen2.5-Coder-7B-CSharp-QLoRA-GGUF:Q5_K_M # Run inference directly in the terminal: llama cli -hf testingusera1/Qwen2.5-Coder-7B-CSharp-QLoRA-GGUF:Q5_K_M
Install from WinGet (Windows)
winget install llama.cpp # Start a local OpenAI-compatible server with a web UI: llama serve -hf testingusera1/Qwen2.5-Coder-7B-CSharp-QLoRA-GGUF:Q5_K_M # Run inference directly in the terminal: llama cli -hf testingusera1/Qwen2.5-Coder-7B-CSharp-QLoRA-GGUF:Q5_K_M
Use pre-built binary
# Download pre-built binary from: # https://github.com/ggerganov/llama.cpp/releases # Start a local OpenAI-compatible server with a web UI: ./llama-server -hf testingusera1/Qwen2.5-Coder-7B-CSharp-QLoRA-GGUF:Q5_K_M # Run inference directly in the terminal: ./llama-cli -hf testingusera1/Qwen2.5-Coder-7B-CSharp-QLoRA-GGUF:Q5_K_M
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake --build build -j --target llama-server llama-cli # Start a local OpenAI-compatible server with a web UI: ./build/bin/llama-server -hf testingusera1/Qwen2.5-Coder-7B-CSharp-QLoRA-GGUF:Q5_K_M # Run inference directly in the terminal: ./build/bin/llama-cli -hf testingusera1/Qwen2.5-Coder-7B-CSharp-QLoRA-GGUF:Q5_K_M
Use Docker
docker model run hf.co/testingusera1/Qwen2.5-Coder-7B-CSharp-QLoRA-GGUF:Q5_K_M
- LM Studio
- Jan
- Ollama
How to use testingusera1/Qwen2.5-Coder-7B-CSharp-QLoRA-GGUF with Ollama:
ollama run hf.co/testingusera1/Qwen2.5-Coder-7B-CSharp-QLoRA-GGUF:Q5_K_M
- Unsloth Desktop
- Pi
How to use testingusera1/Qwen2.5-Coder-7B-CSharp-QLoRA-GGUF with Pi:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf testingusera1/Qwen2.5-Coder-7B-CSharp-QLoRA-GGUF:Q5_K_M
Configure the model in Pi
# Install Pi: npm install -g @earendil-works/pi-coding-agent # Add to ~/.pi/agent/models.json: { "providers": { "llama-cpp": { "baseUrl": "http://localhost:8080/v1", "api": "openai-completions", "apiKey": "none", "models": [ { "id": "testingusera1/Qwen2.5-Coder-7B-CSharp-QLoRA-GGUF:Q5_K_M" } ] } } }Run Pi
# Start Pi in your project directory: pi
- Docker Model Runner
How to use testingusera1/Qwen2.5-Coder-7B-CSharp-QLoRA-GGUF with Docker Model Runner:
docker model run hf.co/testingusera1/Qwen2.5-Coder-7B-CSharp-QLoRA-GGUF:Q5_K_M
- Lemonade
How to use testingusera1/Qwen2.5-Coder-7B-CSharp-QLoRA-GGUF with Lemonade:
Pull the model
# Download Lemonade from https://lemonade-server.ai/ lemonade pull testingusera1/Qwen2.5-Coder-7B-CSharp-QLoRA-GGUF:Q5_K_M
Run and chat with the model
lemonade run user.Qwen2.5-Coder-7B-CSharp-QLoRA-GGUF-Q5_K_M
List all available models
lemonade list
- Hermes Agent
How to use testingusera1/Qwen2.5-Coder-7B-CSharp-QLoRA-GGUF with Hermes Agent:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf testingusera1/Qwen2.5-Coder-7B-CSharp-QLoRA-GGUF:Q5_K_M
Configure Hermes
# Install Hermes: curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash hermes setup # Point Hermes at the local server: hermes config set model.provider custom hermes config set model.base_url http://127.0.0.1:8080/v1 hermes config set model.default testingusera1/Qwen2.5-Coder-7B-CSharp-QLoRA-GGUF:Q5_K_M
Run Hermes
hermes
- Atomic Chat
- OpenClaw
How to use testingusera1/Qwen2.5-Coder-7B-CSharp-QLoRA-GGUF with OpenClaw:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf testingusera1/Qwen2.5-Coder-7B-CSharp-QLoRA-GGUF:Q5_K_M
Configure OpenClaw
# Install OpenClaw: npm install -g openclaw@latest # Register the local server and set it as the default model: openclaw onboard --non-interactive --mode local \ --auth-choice custom-api-key \ --custom-base-url http://127.0.0.1:8080/v1 \ --custom-model-id "testingusera1/Qwen2.5-Coder-7B-CSharp-QLoRA-GGUF:Q5_K_M" \ --custom-provider-id llama-cpp \ --custom-compatibility openai \ --custom-text-input \ --accept-risk \ --skip-health
Run OpenClaw
openclaw agent --local --agent main --message "Hello from Hugging Face"
Qwen2.5-Coder-7B — C#-дообучение (QLoRA, GGUF-кванты)
Это Qwen/Qwen2.5-Coder-7B-Instruct, дообученный методом QLoRA (LoRA r=64, alpha=32, все 7 проекций) на ~93K примерах с акцентом на C# и русскоязычные диалоги о программировании. В репозитории — GGUF-кванты слитой (merged) модели для llama.cpp / LM Studio / Ollama.
Кванты
| Файл | Размер | Рекомендация |
|---|---|---|
final_Q8_0.gguf |
7.54 ГБ | Максимальное сходство с bf16-оригиналом |
final_Q6_K.gguf |
5.82 ГБ | Практически без потерь |
final_Q5_K_M.gguf |
5.07 ГБ | Оптимум: качество/размер/скорость |
⚠️ Не используйте Q4_K_M для этой модели: на нём стирается эффект дообучения (ответы совпадают с базовой моделью). Начиная с Q5_K_M преимущества адаптера сохраняются.
Как тестировалась модель
MultiPL-E (humaneval-cs 158 + mbpp-cs 386 задач, greedy, компиляция через dotnet 9, Debug.Assert-тесты):
| Модель | humaneval-cs | mbpp-cs |
|---|---|---|
| Базовая Qwen2.5-Coder-7B (bf16) | 50.6% | 47.4% |
| Эта модель (bf16 merged) | 48.1% | 46.6% |
| Эта модель (Q5_K_M) | 47.5% | 48.5% |
Различия статистически незначимы (тест Макнемара, p 0.08–0.87): на англоязычном бенчмарке в стиле MultiPL-E модель ведёт себя на уровне базы.
Качественный тест на русскоязычных задачах (5 задач: багфикс ×2, консольное приложение, LINQ, рефакторинг; greedy):
| Модель | Компилируемость ответов |
|---|---|
| Базовая (bf16) | 3/5 |
| Эта модель (bf16, Q5/Q6/Q8) | 5/5 |
Дообученная модель даёт более компактные и идиоматичные ответы, реже допускает ошибки компиляции (именованные кортежи через :, корректные пространства имён). На Q5_K_M/Q6_K/Q8_0 это преимущество сохраняется; на Q4_K_M — исчезает.
Обучение
- Метод: QLoRA (4-bit NF4 база), LoRA r=64, alpha=32, dropout 0.05, target: q/k/v/o/gate/up/down проекции
- Данные: ~93K примеров (54.9M токенов): C#-ядро ~57% (Magicoder, CommitPackFT, OpenCodeInstruct, CodeFeedback), русскоязычные диалоги ~30% (ru_stackoverflow, WildChat, ru_turbo_alpaca), агентские задачи ~8.5% (hermes-function-calling)
- График: 2 эпохи, 23242 шага, эффективный батч 8, seq len 2048
- eval_loss: 0.598 → минимум 0.5626 (середина 1-й эпохи) → 0.5793 в конце
Использование
# llama.cpp
llama-server -m final_Q5_K_M.gguf -ngl 99 -c 4096 --port 8080
# Или llama-cli в интерактивном режиме
llama-cli -m final_Q5_K_M.gguf -ngl 99 --chat-template qwen
Модель использует стандартный chat-шаблон Qwen (ChatML). Промпты на русском работают нативно — модель дообучалась в том числе на русскоязычных диалогах о C#/.NET.
Лицензия и ограничения
- База Qwen2.5-Coder-7B-Instruct — Apache 2.0
- Часть обучающих данных имеет некоммерческие ограничения (research/non-commercial) — при коммерческом использовании проверьте состав смеси
- Модель может галлюцинировать API и генерировать небезопасный код — стандартные оговорки для кодовых LLM
- Downloads last month
- 651
5-bit
6-bit
8-bit