File size: 2,434 Bytes
961d240
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
---
base_model:
- Vaultek/Quartz-R1-8B-Genesis
tags:
- GGUF
language:
- ru
- en
library_name: transformers
---

Квантизованная версия Quartz-R1-8B-Genesis. Информация о модели доступна в основном репозитории: [`Quartz-R1-8B-Genesis`](https://huggingface.co/Vaultek/Quartz-R1-8B-Genesis/).

# Использование с помощью llama.cpp
Для начала нужно собрать [llama.cpp](https://github.com/ggml-org/llama.cpp) (или обновить, если уже есть):
```bash
git clone https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
cmake -B build
cmake --build build --config Release -j$(nproc)
cd ..
```

Запуск модели в интерактивном режиме:
```bash
llama.cpp/build/bin/llama-cli -m quartz_r1_genesis_clean.Q4_K_M.gguf -c 32768 -np 4
```

Запуск сервера:
```bash
llama.cpp/build/bin/llama-server -m quartz_r1_genesis_clean.Q4_K_M.gguf -c 32768 -np 4
```
Если позволяют ресурсы, можно ускорить инференс, добавив `-t 10`.

# Квантизации и их качество

Вот созданный ikawrakow график, сравнивающий квантизации (на его странице, но данные совпадают)
types (lower is better):

![image.png](https://www.nethype.de/huggingface_embed/quantpplgraph.png)

And here are Artefact2's thoughts on the matter:
https://gist.github.com/Artefact2/b5f810600771265fc1e39442288e8ec9

| Link | Type | Size/GB |
|:-----|:-----|--------:|
| [GGUF_Q2_K](https://huggingface.co/Vaultek/Quartz-R1-8B-Genesis-GGUF/resolve/main/quartz_r1_genesis_clean.Q2_K.gguf) | Q2_K | 3.18 |
| [GGUF_Q3_K_M](https://huggingface.co/Vaultek/Quartz-R1-8B-Genesis-GGUF/resolve/main/quartz_r1_genesis_clean.Q3_K_M.gguf) | Q3_K_M | 4.02 |
| [GGUF_Q4_K_M](https://huggingface.co/Vaultek/Quartz-R1-8B-Genesis-GGUF/resolve/main/quartz_r1_genesis_clean.Q4_K_M.gguf) | Q4_K_M | 4.92 |
| [GGUF_Q5_K_M](https://huggingface.co/Vaultek/Quartz-R1-8B-Genesis-GGUF/resolve/main/quartz_r1_genesis_clean.Q5_K_M.gguf) | Q5_K_M | 5.73 |
| [GGUF_Q8_0](https://huggingface.co/Vaultek/Quartz-R1-8B-Genesis-GGUF/resolve/main/quartz_r1_genesis_clean.Q8_0.gguf) | Q8_0 | 8.54 |
| [GGUF_F16](https://huggingface.co/mradermacher/Quartz-R1-8B-Genesis-GGUF/resolve/main/Quartz-R1-8B-Genesis.f16.gguf) | f16 | 16.2 |