voxtream2-ru / index.html
simba9's picture
VoXtream2-RU space (static)
1395fba verified
Raw
History Blame Contribute Delete
6.82 kB
<!doctype html><html lang="ru"><head><meta charset="utf-8">
<meta name="viewport" content="width=device-width, initial-scale=1">
<title>VoXtream2-RU</title>
<style>
body{max-width:860px;margin:0 auto;padding:24px 16px;font:16px/1.55 system-ui,-apple-system,Segoe UI,Roboto,sans-serif;color:#1f2328;background:#fff}
h1{font-size:1.7em} h2{margin-top:1.6em;border-bottom:1px solid #d0d7de;padding-bottom:.2em}
code,pre{font-family:ui-monospace,SFMono-Regular,Menlo,monospace;font-size:.92em}
pre{background:#f6f8fa;padding:12px;border-radius:6px;overflow-x:auto} code{background:#f6f8fa;padding:1px 4px;border-radius:4px}
pre code{background:none;padding:0}
table{border-collapse:collapse;margin:1em 0;display:block;overflow-x:auto} th,td{border:1px solid #d0d7de;padding:6px 10px}
.links{background:#eef2ff;padding:10px 14px;border-radius:8px}
@media (prefers-color-scheme:dark){body{background:#0d1117;color:#e6edf3} pre,code{background:#161b22} th,td{border-color:#30363d} h2{border-color:#30363d} .links{background:#1b2440} a{color:#8ab4ff}}
</style></head><body><p class="links"><a href="samples.html">🔊 Примеры синтеза</a> · <a href="https://huggingface.co/simba9/voxtream2-ru">Модель и код демо на HF</a> · <a href="https://herimor.github.io/voxtream2/">VoXtream2 (KTH)</a> · <a href="https://arxiv.org/abs/2603.13518">arXiv:2603.13518</a></p><h1>VoXtream2-RU — потоковый русский TTS с клонированием голоса</h1>
<p>Русский файнтюн <a href="https://arxiv.org/abs/2603.13518">VoXtream2</a> (KTH Royal
Institute of Technology) — full-stream zero-shot TTS поверх кодека Mimi
(12.5 Гц), с динамическим управлением темпом речи и клонированием голоса по
3–10 секундам записи.</p>
<p><strong>Демо:</strong> самодостаточный код Gradio-демо лежит в этом репозитории в папке
<a href="https://huggingface.co/simba9/voxtream2-ru/tree/main/demo"><code>demo/</code></a> — запуск локально
описан ниже. Страница модели с <a href="https://simba9-voxtream2-ru.static.hf.space/samples.html">примерами синтеза</a>
(разные голоса, look-ahead, темп, типы текста) — <a href="https://simba9-voxtream2-ru.static.hf.space/index.html">HF Space</a>.</p>
<p><strong>Статьи о том, как это делалось</strong> (разбор VoXtream, подготовка данных, MFA, ошибки):
<a href="https://habr.com/ru/articles/1075298/">Habr (RU)</a> · <a href="https://medium.com/@sokolilia56/teaching-a-streaming-tts-to-speak-russian-voxtream-explained-data-preparation-mfa-and-the-5f2b98bfa30b">Medium (EN)</a>.</p>
<p><strong>Автор:</strong> Telegram-канал <a href="https://t.me/decent_researcher">@decent_researcher</a> — там новости
о модели и разборы.</p>
<h2>Лицензия и условия использования</h2>
<p>Модель публикуется <strong>в научных и исследовательских целях</strong> под лицензией
<strong>OpenRAIL-M</strong> (Responsible AI License — открытая лицензия с ограничениями
использования). Базовая модель <a href="https://huggingface.co/herimor/voxtream2">herimor/voxtream2</a>
распространяется под MIT; её условия сохраняются.</p>
<p><strong>Запрещено</strong> использовать модель и производные от неё:
- для любых противоправных действий, обмана, мошенничества, выдачи себя за другое лицо;
- для создания дипфейков и синтеза голоса реальных людей без их явного согласия;
- для дезинформации, домогательств, дискриминации, вреда людям и группам;
- в системах, принимающих юридически значимые решения о людях без надзора человека.</p>
<p>Клонирование голоса допускается только для собственного голоса или с явного
разрешения владельца голоса. Полный текст ограничений — в файле LICENSE.</p>
<p><strong>Атрибуция.</strong> Код базовой модели — MIT; компонент Depth Transformer (SesameAI CSM)
— Apache-2.0 (см. <code>demo/LICENSE-MIT</code>, <code>demo/LICENSE-APACHE</code>, <code>demo/NOTICE</code>). Веса
базовой модели обучены на <a href="https://huggingface.co/datasets/amphion/Emilia-Dataset">Emilia</a>
и <a href="https://huggingface.co/datasets/nvidia/hifitts-2">HiFiTTS-2</a> (обе CC BY 4.0) — при
использовании и распространении этих весов и производных от них требуется указывать
авторов датасетов. Русские данные дообучения — открытые наборы русской речи
(~1870 ч после фильтрации).</p>
<h2>Метрики (бытовые записи незнакомых дикторов, GigaAM-v3)</h2>
<table>
<thead>
<tr>
<th></th>
<th>CER</th>
<th>Переключения голоса</th>
<th>Темп (слог/с)</th>
<th>Паузы (медиана)</th>
</tr>
</thead>
<tbody>
<tr>
<td><strong>v10-DPO (эта модель)</strong></td>
<td><strong>~0.01</strong></td>
<td><strong>0–2%</strong></td>
<td>5.1–5.2</td>
<td>0.4–0.5 с</td>
</tr>
</tbody>
</table>
<h2>Использование</h2>
<p>Модель требует модифицированный пакет <code>voxtream</code> и русский инференс-стек
(фонемизатор RUAccent+espeak, вставка sil, проклитики/междометия, RUNorm для цифр)
— всё это лежит в папке <code>demo/</code> этого репозитория (самодостаточна, с GitHub ничего
ставить не нужно). Нужна GPU (~4 ГБ VRAM), Python 3.11:</p>
<pre><code class="language-bash">git lfs install &amp;&amp; git clone https://huggingface.co/simba9/voxtream2-ru
cd voxtream2-ru/demo
sudo apt install espeak-ng # см. packages.txt
pip install -r requirements.txt
python app.py --model-dir .. # Gradio на http://127.0.0.1:7860
# без клона весов: MODEL_REPO=simba9/voxtream2-ru python app.py
</code></pre></body></html>