debugdll commited on
Commit
75fa45b
·
verified ·
1 Parent(s): 5b58bb7

Upload README.md with huggingface_hub

Browse files
Files changed (1) hide show
  1. README.md +74 -0
README.md ADDED
@@ -0,0 +1,74 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ license: apache-2.0
3
+ base_model: openai/gpt-oss-20b
4
+ language:
5
+ - ru
6
+ - en
7
+ tags:
8
+ - llama.cpp
9
+ - gguf
10
+ - moe
11
+ - conversational
12
+ - russian
13
+ pipeline_tag: text-generation
14
+ ---
15
+
16
+ # Blind Text Models
17
+
18
+ Коллекция языковых моделей семейства **Blind**. Назван так за фокус на текстовых задачах — от разговора до генерации контента.
19
+
20
+ ## Где модель? (пока одна)
21
+
22
+ | Модель | Параметры | Квантование | Размер файла | Контекст | Направление |
23
+ |---|---|---|---|---|---|
24
+ | **Blind Text 1** (`blind-1.gguf`) | **20.9B** (MoE, 32 эксперта, 4 активных) | MXFP4 + Q8_0 | 11.3 GB | 131 072 (128K) | Универсальный ассистент, силён в общении, объяснениях и генерации на русском и английском |
25
+
26
+ Сейчас в коллекции одна модель. Новые версии будут добавляться в эту же таблицу.
27
+
28
+ ## Архитектура
29
+
30
+ - Базовая архитектура: **gpt-oss-20b** (MoE)
31
+ - 24 блока, размер эмбеддингов 2880
32
+ - 32 эксперта, 4 активных на токен
33
+ - Контекст до **128K токенов**
34
+ - Квантование: MXFP4 (веса экспертов) + Q8_0 (эмбеддинги/выход)
35
+ - Формат: GGUF, запускается через llama.cpp / Ollama / llama-cpp-python
36
+
37
+ ## На что она заточена
38
+
39
+ - **Живое общение** — естественные ответы, разговорное и деловое общение на русском и английском
40
+ - **Объяснения** — понятно раскладывает сложные темы
41
+ - **Генерация текста** — письма, посты, статьи, краткие выжимки
42
+ - **Инструкции и вопросы** — уверенно держит контекст, умеет уточнять и отвечать по делу
43
+
44
+ > Модель позиционирует себя как **Blind 1** — так она представляется при знакомстве. Это особенность сборки.
45
+
46
+ ## Бенчмарки
47
+
48
+ Инструментальные метрики (MMLU и подобные) — в процессе измерения, будут добавлены сюда. Скорость работы уже замерена:
49
+
50
+ | Окружение | Генерация |
51
+ |---|---|
52
+ | NVIDIA RTX 5080 (16GB), llama.cpp | ≈ **10 ток/с** (100 токенов за ~10 c, с учётом reasoning-префикса) |
53
+
54
+ Оценка параметров:
55
+ - Общее число параметров: **20 914 757 184 (~20.9B)** — посчитано по тензорам модели
56
+ - Параметры без эмбеддингов и выходного слоя: **19.76B**
57
+
58
+ ## Запуск
59
+
60
+ ```bash
61
+ # llama.cpp
62
+ llama-cli -m blind-1.gguf -p "Привет, кто ты?"
63
+ ```
64
+
65
+ ```python
66
+ # llama-cpp-python
67
+ from llama_cpp import Llama
68
+ llm = Llama(model_path="blind-1.gguf", n_ctx=8192, n_gpu_layers=-1)
69
+ print(llm.create_chat_completion(messages=[{"role": "user", "content": "Кто ты?"}]))
70
+ ```
71
+
72
+ ## Лицензия
73
+
74
+ Оригинальные веса gpt-oss распространяются по лицензии Apache 2.0. Сборка и квантование — в том же духе.