File size: 5,117 Bytes
0a48f9f c640d2a 208ce83 2783550 208ce83 0a48f9f c640d2a 0a48f9f c640d2a 0a48f9f c640d2a 0a48f9f c640d2a | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 67 68 69 70 71 72 73 74 75 76 77 78 79 80 81 82 83 84 | ---
language:
- ru
license: openrail
license_name: openrail-m
library_name: voxtream
pipeline_tag: text-to-speech
tags:
- tts
- text-to-speech
- russian
- streaming
- voice-cloning
- mimi
base_model: herimor/voxtream2
---
# VoXtream2-RU — потоковый русский TTS с клонированием голоса
Русский файнтюн [VoXtream2](https://arxiv.org/abs/2603.13518) (KTH Royal
Institute of Technology) — full-stream zero-shot TTS поверх кодека Mimi
(12.5 Гц), с динамическим управлением темпом речи и клонированием голоса по
3–10 секундам записи.
**Демо:** самодостаточный код Gradio-демо лежит в этом репозитории в папке
[`demo/`](https://huggingface.co/simba9/voxtream2-ru/tree/main/demo) — запуск локально
описан ниже. Страница модели с [примерами синтеза](https://simba9-voxtream2-ru.static.hf.space/samples.html)
(разные голоса, look-ahead, темп, типы текста) — [HF Space](https://simba9-voxtream2-ru.static.hf.space/index.html).
**Статьи о том, как это делалось** (разбор VoXtream, подготовка данных, MFA, ошибки):
[Habr (RU)](https://habr.com/ru/articles/1075298/) · [Medium (EN)](https://medium.com/@sokolilia56/teaching-a-streaming-tts-to-speak-russian-voxtream-explained-data-preparation-mfa-and-the-5f2b98bfa30b).
**Автор:** Telegram-канал [@decent_researcher](https://t.me/decent_researcher) — там новости
о модели и разборы.
## Лицензия и условия использования
Модель публикуется **в научных и исследовательских целях** под лицензией
**OpenRAIL-M** (Responsible AI License — открытая лицензия с ограничениями
использования). Базовая модель [herimor/voxtream2](https://huggingface.co/herimor/voxtream2)
распространяется под MIT; её условия сохраняются.
**Запрещено** использовать модель и производные от неё:
- для любых противоправных действий, обмана, мошенничества, выдачи себя за другое лицо;
- для создания дипфейков и синтеза голоса реальных людей без их явного согласия;
- для дезинформации, домогательств, дискриминации, вреда людям и группам;
- в системах, принимающих юридически значимые решения о людях без надзора человека.
Клонирование голоса допускается только для собственного голоса или с явного
разрешения владельца голоса. Полный текст ограничений — в файле LICENSE.
**Атрибуция.** Код базовой модели — MIT; компонент Depth Transformer (SesameAI CSM)
— Apache-2.0 (см. `demo/LICENSE-MIT`, `demo/LICENSE-APACHE`, `demo/NOTICE`). Веса
базовой модели обучены на [Emilia](https://huggingface.co/datasets/amphion/Emilia-Dataset)
и [HiFiTTS-2](https://huggingface.co/datasets/nvidia/hifitts-2) (обе CC BY 4.0) — при
использовании и распространении этих весов и производных от них требуется указывать
авторов датасетов. Русские данные дообучения — открытые наборы русской речи
(~1870 ч после фильтрации).
## Метрики (бытовые записи незнакомых дикторов, GigaAM-v3)
| | CER | Переключения голоса | Темп (слог/с) | Паузы (медиана) |
|---|---|---|---|---|
| **v10-DPO (эта модель)** | **~0.01** | **0–2%** | 5.1–5.2 | 0.4–0.5 с |
## Использование
Модель требует модифицированный пакет `voxtream` и русский инференс-стек
(фонемизатор RUAccent+espeak, вставка sil, проклитики/междометия, RUNorm для цифр)
— всё это лежит в папке `demo/` этого репозитория (самодостаточна, с GitHub ничего
ставить не нужно). Нужна GPU (~4 ГБ VRAM), Python 3.11:
```bash
git lfs install && git clone https://huggingface.co/simba9/voxtream2-ru
cd voxtream2-ru/demo
sudo apt install espeak-ng # см. packages.txt
pip install -r requirements.txt
python app.py --model-dir .. # Gradio на http://127.0.0.1:7860
# без клона весов: MODEL_REPO=simba9/voxtream2-ru python app.py
```
|