| --- |
| language: |
| - ru |
| license: openrail |
| license_name: openrail-m |
| library_name: voxtream |
| pipeline_tag: text-to-speech |
| tags: |
| - tts |
| - text-to-speech |
| - russian |
| - streaming |
| - voice-cloning |
| - mimi |
| base_model: herimor/voxtream2 |
| --- |
| |
| # VoXtream2-RU — потоковый русский TTS с клонированием голоса |
|
|
| Русский файнтюн [VoXtream2](https://arxiv.org/abs/2603.13518) (KTH Royal |
| Institute of Technology) — full-stream zero-shot TTS поверх кодека Mimi |
| (12.5 Гц), с динамическим управлением темпом речи и клонированием голоса по |
| 3–10 секундам записи. |
|
|
| **Демо:** самодостаточный код Gradio-демо лежит в этом репозитории в папке |
| [`demo/`](https://huggingface.co/simba9/voxtream2-ru/tree/main/demo) — запуск локально |
| описан ниже. Страница модели с [примерами синтеза](https://simba9-voxtream2-ru.static.hf.space/samples.html) |
| (разные голоса, look-ahead, темп, типы текста) — [HF Space](https://simba9-voxtream2-ru.static.hf.space/index.html). |
|
|
| **Статьи о том, как это делалось** (разбор VoXtream, подготовка данных, MFA, ошибки): |
| [Habr (RU)](https://habr.com/ru/articles/1075298/) · [Medium (EN)](https://medium.com/@sokolilia56/teaching-a-streaming-tts-to-speak-russian-voxtream-explained-data-preparation-mfa-and-the-5f2b98bfa30b). |
|
|
| **Автор:** Telegram-канал [@decent_researcher](https://t.me/decent_researcher) — там новости |
| о модели и разборы. |
|
|
| ## Лицензия и условия использования |
|
|
| Модель публикуется **в научных и исследовательских целях** под лицензией |
| **OpenRAIL-M** (Responsible AI License — открытая лицензия с ограничениями |
| использования). Базовая модель [herimor/voxtream2](https://huggingface.co/herimor/voxtream2) |
| распространяется под MIT; её условия сохраняются. |
|
|
| **Запрещено** использовать модель и производные от неё: |
| - для любых противоправных действий, обмана, мошенничества, выдачи себя за другое лицо; |
| - для создания дипфейков и синтеза голоса реальных людей без их явного согласия; |
| - для дезинформации, домогательств, дискриминации, вреда людям и группам; |
| - в системах, принимающих юридически значимые решения о людях без надзора человека. |
|
|
| Клонирование голоса допускается только для собственного голоса или с явного |
| разрешения владельца голоса. Полный текст ограничений — в файле LICENSE. |
|
|
| **Атрибуция.** Код базовой модели — MIT; компонент Depth Transformer (SesameAI CSM) |
| — Apache-2.0 (см. `demo/LICENSE-MIT`, `demo/LICENSE-APACHE`, `demo/NOTICE`). Веса |
| базовой модели обучены на [Emilia](https://huggingface.co/datasets/amphion/Emilia-Dataset) |
| и [HiFiTTS-2](https://huggingface.co/datasets/nvidia/hifitts-2) (обе CC BY 4.0) — при |
| использовании и распространении этих весов и производных от них требуется указывать |
| авторов датасетов. Русские данные дообучения — открытые наборы русской речи |
| (~1870 ч после фильтрации). |
|
|
|
|
| ## Метрики (бытовые записи незнакомых дикторов, GigaAM-v3) |
|
|
| | | CER | Переключения голоса | Темп (слог/с) | Паузы (медиана) | |
| |---|---|---|---|---| |
| | **v10-DPO (эта модель)** | **~0.01** | **0–2%** | 5.1–5.2 | 0.4–0.5 с | |
|
|
| ## Использование |
|
|
| Модель требует модифицированный пакет `voxtream` и русский инференс-стек |
| (фонемизатор RUAccent+espeak, вставка sil, проклитики/междометия, RUNorm для цифр) |
| — всё это лежит в папке `demo/` этого репозитория (самодостаточна, с GitHub ничего |
| ставить не нужно). Нужна GPU (~4 ГБ VRAM), Python 3.11: |
|
|
| ```bash |
| git lfs install && git clone https://huggingface.co/simba9/voxtream2-ru |
| cd voxtream2-ru/demo |
| sudo apt install espeak-ng # см. packages.txt |
| pip install -r requirements.txt |
| python app.py --model-dir .. # Gradio на http://127.0.0.1:7860 |
| # без клона весов: MODEL_REPO=simba9/voxtream2-ru python app.py |
| ``` |
|
|
|
|
|
|