--- language: - ru license: openrail license_name: openrail-m library_name: voxtream pipeline_tag: text-to-speech tags: - tts - text-to-speech - russian - streaming - voice-cloning - mimi base_model: herimor/voxtream2 --- # VoXtream2-RU — потоковый русский TTS с клонированием голоса Русский файнтюн [VoXtream2](https://arxiv.org/abs/2603.13518) (KTH Royal Institute of Technology) — full-stream zero-shot TTS поверх кодека Mimi (12.5 Гц), с динамическим управлением темпом речи и клонированием голоса по 3–10 секундам записи. **Демо:** самодостаточный код Gradio-демо лежит в этом репозитории в папке [`demo/`](https://huggingface.co/simba9/voxtream2-ru/tree/main/demo) — запуск локально описан ниже. Страница модели с [примерами синтеза](https://simba9-voxtream2-ru.static.hf.space/samples.html) (разные голоса, look-ahead, темп, типы текста) — [HF Space](https://simba9-voxtream2-ru.static.hf.space/index.html). **Статьи о том, как это делалось** (разбор VoXtream, подготовка данных, MFA, ошибки): [Habr (RU)](https://habr.com/ru/articles/1075298/) · [Medium (EN)](https://medium.com/@sokolilia56/teaching-a-streaming-tts-to-speak-russian-voxtream-explained-data-preparation-mfa-and-the-5f2b98bfa30b). **Автор:** Telegram-канал [@decent_researcher](https://t.me/decent_researcher) — там новости о модели и разборы. ## Лицензия и условия использования Модель публикуется **в научных и исследовательских целях** под лицензией **OpenRAIL-M** (Responsible AI License — открытая лицензия с ограничениями использования). Базовая модель [herimor/voxtream2](https://huggingface.co/herimor/voxtream2) распространяется под MIT; её условия сохраняются. **Запрещено** использовать модель и производные от неё: - для любых противоправных действий, обмана, мошенничества, выдачи себя за другое лицо; - для создания дипфейков и синтеза голоса реальных людей без их явного согласия; - для дезинформации, домогательств, дискриминации, вреда людям и группам; - в системах, принимающих юридически значимые решения о людях без надзора человека. Клонирование голоса допускается только для собственного голоса или с явного разрешения владельца голоса. Полный текст ограничений — в файле LICENSE. **Атрибуция.** Код базовой модели — MIT; компонент Depth Transformer (SesameAI CSM) — Apache-2.0 (см. `demo/LICENSE-MIT`, `demo/LICENSE-APACHE`, `demo/NOTICE`). Веса базовой модели обучены на [Emilia](https://huggingface.co/datasets/amphion/Emilia-Dataset) и [HiFiTTS-2](https://huggingface.co/datasets/nvidia/hifitts-2) (обе CC BY 4.0) — при использовании и распространении этих весов и производных от них требуется указывать авторов датасетов. Русские данные дообучения — открытые наборы русской речи (~1870 ч после фильтрации). ## Метрики (бытовые записи незнакомых дикторов, GigaAM-v3) | | CER | Переключения голоса | Темп (слог/с) | Паузы (медиана) | |---|---|---|---|---| | **v10-DPO (эта модель)** | **~0.01** | **0–2%** | 5.1–5.2 | 0.4–0.5 с | ## Использование Модель требует модифицированный пакет `voxtream` и русский инференс-стек (фонемизатор RUAccent+espeak, вставка sil, проклитики/междометия, RUNorm для цифр) — всё это лежит в папке `demo/` этого репозитория (самодостаточна, с GitHub ничего ставить не нужно). Нужна GPU (~4 ГБ VRAM), Python 3.11: ```bash git lfs install && git clone https://huggingface.co/simba9/voxtream2-ru cd voxtream2-ru/demo sudo apt install espeak-ng # см. packages.txt pip install -r requirements.txt python app.py --model-dir .. # Gradio на http://127.0.0.1:7860 # без клона весов: MODEL_REPO=simba9/voxtream2-ru python app.py ```