How to use from the
Use from the
Transformers library
# Load model directly
from transformers import AutoModel
model = AutoModel.from_pretrained("Vaultek/Quartz-R1-8B-Genesis-GGUF", device_map="auto")
Quick Links

Квантизованная версия Quartz-R1-8B-Genesis. Информация о модели доступна в основном репозитории: Quartz-R1-8B-Genesis.

Использование с помощью llama.cpp

Для начала нужно собрать llama.cpp (или обновить, если уже есть):

git clone https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
cmake -B build
cmake --build build --config Release -j$(nproc)
cd ..

Запуск модели в интерактивном режиме:

llama.cpp/build/bin/llama-cli -m quartz_r1_genesis_clean.Q4_K_M.gguf -c 32768 -np 4

Запуск сервера:

llama.cpp/build/bin/llama-server -m quartz_r1_genesis_clean.Q4_K_M.gguf -c 32768 -np 4

Если позволяют ресурсы, можно ускорить инференс, добавив -t 10.

Квантизации и их качество

Вот созданный ikawrakow график, сравнивающий квантизации (на его странице, но данные совпадают) types (lower is better):

image.png

And here are Artefact2's thoughts on the matter: https://gist.github.com/Artefact2/b5f810600771265fc1e39442288e8ec9

Link Type Size/GB
GGUF_Q2_K Q2_K 3.18
GGUF_Q3_K_M Q3_K_M 4.02
GGUF_Q4_K_M Q4_K_M 4.92
GGUF_Q5_K_M Q5_K_M 5.73
GGUF_Q8_0 Q8_0 8.54
GGUF_F16 f16 16.2
Downloads last month
225
GGUF
Model size
8B params
Architecture
llama
Hardware compatibility
Log In to add your hardware

2-bit

3-bit

4-bit

5-bit

8-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Vaultek/Quartz-R1-8B-Genesis-GGUF

Quantized
(3)
this model