voxtream2-ru / README.md
simba9's picture
model card
2783550 verified
|
Raw
History Blame Contribute Delete
5.12 kB
---
language:
- ru
license: openrail
license_name: openrail-m
library_name: voxtream
pipeline_tag: text-to-speech
tags:
- tts
- text-to-speech
- russian
- streaming
- voice-cloning
- mimi
base_model: herimor/voxtream2
---
# VoXtream2-RU — потоковый русский TTS с клонированием голоса
Русский файнтюн [VoXtream2](https://arxiv.org/abs/2603.13518) (KTH Royal
Institute of Technology) — full-stream zero-shot TTS поверх кодека Mimi
(12.5 Гц), с динамическим управлением темпом речи и клонированием голоса по
3–10 секундам записи.
**Демо:** самодостаточный код Gradio-демо лежит в этом репозитории в папке
[`demo/`](https://huggingface.co/simba9/voxtream2-ru/tree/main/demo) — запуск локально
описан ниже. Страница модели с [примерами синтеза](https://simba9-voxtream2-ru.static.hf.space/samples.html)
(разные голоса, look-ahead, темп, типы текста) — [HF Space](https://simba9-voxtream2-ru.static.hf.space/index.html).
**Статьи о том, как это делалось** (разбор VoXtream, подготовка данных, MFA, ошибки):
[Habr (RU)](https://habr.com/ru/articles/1075298/) · [Medium (EN)](https://medium.com/@sokolilia56/teaching-a-streaming-tts-to-speak-russian-voxtream-explained-data-preparation-mfa-and-the-5f2b98bfa30b).
**Автор:** Telegram-канал [@decent_researcher](https://t.me/decent_researcher) — там новости
о модели и разборы.
## Лицензия и условия использования
Модель публикуется **в научных и исследовательских целях** под лицензией
**OpenRAIL-M** (Responsible AI License — открытая лицензия с ограничениями
использования). Базовая модель [herimor/voxtream2](https://huggingface.co/herimor/voxtream2)
распространяется под MIT; её условия сохраняются.
**Запрещено** использовать модель и производные от неё:
- для любых противоправных действий, обмана, мошенничества, выдачи себя за другое лицо;
- для создания дипфейков и синтеза голоса реальных людей без их явного согласия;
- для дезинформации, домогательств, дискриминации, вреда людям и группам;
- в системах, принимающих юридически значимые решения о людях без надзора человека.
Клонирование голоса допускается только для собственного голоса или с явного
разрешения владельца голоса. Полный текст ограничений — в файле LICENSE.
**Атрибуция.** Код базовой модели — MIT; компонент Depth Transformer (SesameAI CSM)
— Apache-2.0 (см. `demo/LICENSE-MIT`, `demo/LICENSE-APACHE`, `demo/NOTICE`). Веса
базовой модели обучены на [Emilia](https://huggingface.co/datasets/amphion/Emilia-Dataset)
и [HiFiTTS-2](https://huggingface.co/datasets/nvidia/hifitts-2) (обе CC BY 4.0) — при
использовании и распространении этих весов и производных от них требуется указывать
авторов датасетов. Русские данные дообучения — открытые наборы русской речи
(~1870 ч после фильтрации).
## Метрики (бытовые записи незнакомых дикторов, GigaAM-v3)
| | CER | Переключения голоса | Темп (слог/с) | Паузы (медиана) |
|---|---|---|---|---|
| **v10-DPO (эта модель)** | **~0.01** | **0–2%** | 5.1–5.2 | 0.4–0.5 с |
## Использование
Модель требует модифицированный пакет `voxtream` и русский инференс-стек
(фонемизатор RUAccent+espeak, вставка sil, проклитики/междометия, RUNorm для цифр)
— всё это лежит в папке `demo/` этого репозитория (самодостаточна, с GitHub ничего
ставить не нужно). Нужна GPU (~4 ГБ VRAM), Python 3.11:
```bash
git lfs install && git clone https://huggingface.co/simba9/voxtream2-ru
cd voxtream2-ru/demo
sudo apt install espeak-ng # см. packages.txt
pip install -r requirements.txt
python app.py --model-dir .. # Gradio на http://127.0.0.1:7860
# без клона весов: MODEL_REPO=simba9/voxtream2-ru python app.py
```