simba9 commited on
Commit
c640d2a
·
verified ·
1 Parent(s): 2a076e4

model card

Browse files
Files changed (1) hide show
  1. README.md +24 -5
README.md CHANGED
@@ -22,7 +22,9 @@ Institute of Technology) — full-stream zero-shot TTS поверх кодека
22
  (12.5 Гц), с динамическим управлением темпом речи и клонированием голоса по
23
  3–10 секундам записи.
24
 
25
- **Демо:** HF Space (см. ссылку в шапке репозитория).
 
 
26
 
27
  ## Лицензия и условия использования
28
 
@@ -40,6 +42,14 @@ Institute of Technology) — full-stream zero-shot TTS поверх кодека
40
  Клонирование голоса допускается только для собственного голоса или с явного
41
  разрешения владельца голоса. Полный текст ограничений — в файле LICENSE.
42
 
 
 
 
 
 
 
 
 
43
  ## Что внутри
44
 
45
  - Фонемный словарь расширен под русский: 166 токенов espeak-IPA с ударениями
@@ -64,14 +74,23 @@ Institute of Technology) — full-stream zero-shot TTS поверх кодека
64
  ## Использование
65
 
66
  Модель требует модифицированный пакет `voxtream` и русский инференс-стек
67
- (фонемизатор RUAccent+espeak, вставка sil, проклитики/междометия) берите
68
- код из HF Space этой модели (папка целиком самодостаточна):
 
69
 
70
  ```bash
71
- python app.py --model-dir <папка с model.safetensors>
72
- # либо env MODEL_REPO=<этот репозиторий> python app.py
 
 
 
 
73
  ```
74
 
 
 
 
 
75
  Файлы: `model.safetensors` (462M параметров), `config.json`,
76
  `phoneme_to_token.json`, `ru_tokens.json`. VRAM ~4 ГБ (bf16), 24 кГц.
77
 
 
22
  (12.5 Гц), с динамическим управлением темпом речи и клонированием голоса по
23
  3–10 секундам записи.
24
 
25
+ **Демо:** самодостаточный код Gradio-демо лежит в этом репозитории в папке
26
+ [`demo/`](https://huggingface.co/simba9/voxtream2-ru/tree/main/demo) — запуск локально
27
+ описан ниже. Онлайн-версия (HF Space) — по ссылке в шапке репозитория, если она есть.
28
 
29
  ## Лицензия и условия использования
30
 
 
42
  Клонирование голоса допускается только для собственного голоса или с явного
43
  разрешения владельца голоса. Полный текст ограничений — в файле LICENSE.
44
 
45
+ **Атрибуция.** Код базовой модели — MIT; компонент Depth Transformer (SesameAI CSM)
46
+ — Apache-2.0 (см. `demo/LICENSE-MIT`, `demo/LICENSE-APACHE`, `demo/NOTICE`). Веса
47
+ базовой модели обучены на [Emilia](https://huggingface.co/datasets/amphion/Emilia-Dataset)
48
+ и [HiFiTTS-2](https://huggingface.co/datasets/nvidia/hifitts-2) (обе CC BY 4.0) — при
49
+ использовании и распространении этих весов и производных от них требуется указывать
50
+ авторов датасетов. Русские данные дообучения — открытые наборы русской речи
51
+ (~1870 ч после фильтрации).
52
+
53
  ## Что внутри
54
 
55
  - Фонемный словарь расширен под русский: 166 токенов espeak-IPA с ударениями
 
74
  ## Использование
75
 
76
  Модель требует модифицированный пакет `voxtream` и русский инференс-стек
77
+ (фонемизатор RUAccent+espeak, вставка sil, проклитики/междометия, RUNorm для цифр)
78
+ всё это лежит в папке `demo/` этого репозитория (самодостаточна, с GitHub ничего
79
+ ставить не нужно). Нужна GPU (~4 ГБ VRAM), Python 3.11:
80
 
81
  ```bash
82
+ git lfs install && git clone https://huggingface.co/simba9/voxtream2-ru
83
+ cd voxtream2-ru/demo
84
+ sudo apt install espeak-ng # см. packages.txt
85
+ pip install -r requirements.txt
86
+ python app.py --model-dir .. # Gradio на http://127.0.0.1:7860
87
+ # без клона весов: MODEL_REPO=simba9/voxtream2-ru python app.py
88
  ```
89
 
90
+ Интерфейс: запись 3–10 с голоса + текст; ударение вручную — `+` перед гласной
91
+ (з+амок / зам+ок); look-ahead 30 по умолчанию (`full` — вся фраза, лучше интонация);
92
+ слайдер темпа (слог/с) работает прямо во время синтеза. API — `/synthesize_fn`.
93
+
94
  Файлы: `model.safetensors` (462M параметров), `config.json`,
95
  `phoneme_to_token.json`, `ru_tokens.json`. VRAM ~4 ГБ (bf16), 24 кГц.
96