Spaces:
Running
Running
VoXtream2-RU space (static)
Browse files- .gitattributes +2 -0
- index.html +1 -1
- samples.html +21 -0
- samples/A_f1.mp3 +0 -0
- samples/A_f2.mp3 +0 -0
- samples/A_m1.mp3 +0 -0
- samples/A_m2.mp3 +0 -0
- samples/B_la30.mp3 +0 -0
- samples/B_la5.mp3 +0 -0
- samples/B_lafull.mp3 +0 -0
- samples/C_rate2.5.mp3 +0 -0
- samples/C_rate3.5.mp3 +0 -0
- samples/C_rate4.5.mp3 +0 -0
- samples/C_rate6.0.mp3 +0 -0
- samples/C_rateoff.mp3 +0 -0
- samples/D_digits.mp3 +0 -0
- samples/D_homograph.mp3 +0 -0
- samples/D_long.mp3 +3 -0
- samples/D_proclitic.mp3 +0 -0
- samples/D_xling.mp3 +0 -0
- samples/E_default_cfg1.0.mp3 +0 -0
- samples/E_default_cfg3.0.mp3 +0 -0
- samples/E_default_t0.6.mp3 +0 -0
- samples/E_default_t1.0.mp3 +0 -0
- samples/prompt_en.mp3 +3 -0
- samples/prompt_f1.mp3 +0 -0
- samples/prompt_f2.mp3 +0 -0
- samples/prompt_m1.mp3 +0 -0
- samples/prompt_m2.mp3 +0 -0
.gitattributes
CHANGED
|
@@ -33,3 +33,5 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
|
|
| 33 |
*.zip filter=lfs diff=lfs merge=lfs -text
|
| 34 |
*.zst filter=lfs diff=lfs merge=lfs -text
|
| 35 |
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
|
|
|
|
|
|
|
|
| 33 |
*.zip filter=lfs diff=lfs merge=lfs -text
|
| 34 |
*.zst filter=lfs diff=lfs merge=lfs -text
|
| 35 |
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
| 36 |
+
samples/D_long.mp3 filter=lfs diff=lfs merge=lfs -text
|
| 37 |
+
samples/prompt_en.mp3 filter=lfs diff=lfs merge=lfs -text
|
index.html
CHANGED
|
@@ -10,7 +10,7 @@ pre code{background:none;padding:0}
|
|
| 10 |
table{border-collapse:collapse;margin:1em 0;display:block;overflow-x:auto} th,td{border:1px solid #d0d7de;padding:6px 10px}
|
| 11 |
.links{background:#eef2ff;padding:10px 14px;border-radius:8px}
|
| 12 |
@media (prefers-color-scheme:dark){body{background:#0d1117;color:#e6edf3} pre,code{background:#161b22} th,td{border-color:#30363d} h2{border-color:#30363d} .links{background:#1b2440} a{color:#8ab4ff}}
|
| 13 |
-
</style></head><body><p class="links"><a href="https://huggingface.co/simba9/voxtream2-ru">Модель и код демо на HF</a> · <a href="https://herimor.github.io/voxtream2/">VoXtream2 (KTH)</a> · <a href="https://arxiv.org/abs/2603.13518">arXiv:2603.13518</a></p><h1>VoXtream2-RU — потоковый русский TTS с клонированием голоса</h1>
|
| 14 |
<p>Русский файнтюн <a href="https://arxiv.org/abs/2603.13518">VoXtream2</a> (KTH Royal
|
| 15 |
Institute of Technology) — full-stream zero-shot TTS поверх кодека Mimi
|
| 16 |
(12.5 Гц), с динамическим управлением темпом речи и клонированием голоса по
|
|
|
|
| 10 |
table{border-collapse:collapse;margin:1em 0;display:block;overflow-x:auto} th,td{border:1px solid #d0d7de;padding:6px 10px}
|
| 11 |
.links{background:#eef2ff;padding:10px 14px;border-radius:8px}
|
| 12 |
@media (prefers-color-scheme:dark){body{background:#0d1117;color:#e6edf3} pre,code{background:#161b22} th,td{border-color:#30363d} h2{border-color:#30363d} .links{background:#1b2440} a{color:#8ab4ff}}
|
| 13 |
+
</style></head><body><p class="links"><a href="samples.html">🔊 Примеры синтеза</a> · <a href="https://huggingface.co/simba9/voxtream2-ru">Модель и код демо на HF</a> · <a href="https://herimor.github.io/voxtream2/">VoXtream2 (KTH)</a> · <a href="https://arxiv.org/abs/2603.13518">arXiv:2603.13518</a></p><h1>VoXtream2-RU — потоковый русский TTS с клонированием голоса</h1>
|
| 14 |
<p>Русский файнтюн <a href="https://arxiv.org/abs/2603.13518">VoXtream2</a> (KTH Royal
|
| 15 |
Institute of Technology) — full-stream zero-shot TTS поверх кодека Mimi
|
| 16 |
(12.5 Гц), с динамическим управлением темпом речи и клонированием голоса по
|
samples.html
ADDED
|
@@ -0,0 +1,21 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
<!doctype html><html lang="ru"><head><meta charset="utf-8"><meta name="viewport" content="width=device-width, initial-scale=1">
|
| 2 |
+
<title>VoXtream2-RU — примеры</title>
|
| 3 |
+
<style>
|
| 4 |
+
body{max-width:960px;margin:0 auto;padding:24px 16px;font:16px/1.55 system-ui,-apple-system,Segoe UI,Roboto,sans-serif;color:#1f2328;background:#fff}
|
| 5 |
+
h1{font-size:1.6em} h2{margin-top:1.8em;border-bottom:1px solid #d0d7de;padding-bottom:.2em}
|
| 6 |
+
.links{background:#eef2ff;padding:10px 14px;border-radius:8px} .muted{color:#6b7280;font-size:.9em}
|
| 7 |
+
.text{background:#f6f8fa;padding:8px 12px;border-radius:6px;margin:.5em 0} .texts li{margin:.3em 0}
|
| 8 |
+
.tbl{overflow-x:auto} table{border-collapse:collapse;width:100%;margin:.6em 0} th,td{border:1px solid #d0d7de;padding:6px 10px;vertical-align:middle}
|
| 9 |
+
td.lbl{min-width:180px} audio{width:280px;max-width:100%;display:block}
|
| 10 |
+
@media (prefers-color-scheme:dark){body{background:#0d1117;color:#e6edf3} .text,{} .text{background:#161b22} th,td{border-color:#30363d} h2{border-color:#30363d} .links{background:#1b2440} a{color:#8ab4ff}}
|
| 11 |
+
</style></head><body>
|
| 12 |
+
<p class="links"><a href="index.html">← О модели</a> · <a href="https://huggingface.co/simba9/voxtream2-ru">Модель и код демо на HF</a> · <a href="#A">Голоса</a> · <a href="#B">Look-ahead</a> · <a href="#C">Темп (SRC — speaking rate control)</a> · <a href="#D">Типы текста</a> · <a href="#E">Семплирование</a></p>
|
| 13 |
+
<h1>VoXtream2-RU — примеры синтеза</h1>
|
| 14 |
+
<p>Все примеры сгенерированы финальной моделью (v10-DPO) через тот же инференс-стек, что в демо. Голоса — четыре диктора из
|
| 15 |
+
открытого корпуса <a href="https://github.com/salute-developers/golos/tree/master/dusha">DUSHA</a> (SberDevices), которые
|
| 16 |
+
<b>не попали в обучающую выборку</b> (отсеяны фильтрами качества), то есть для модели это незнакомые голоса; промпт каждого
|
| 17 |
+
склеен из 2–4 коротких реплик по VAD. Английский промпт — из демо-материалов VoXtream2 (KTH). Аудио 24 кГц, MP3.</p>
|
| 18 |
+
<section id="A"><h2>Голоса</h2><p>Один и тот же текст четырьмя голосами, настройки по умолчанию: look-ahead 30, темп 3.5 слог/с (SRC), best-of-2, temperature 0.8, top-k 50, CFG 1.5.</p><p class="text">«Добрый день. Сегодня расскажу, как устроен потоковый синтез речи: модель начинает говорить, не дожидаясь конца фразы.»</p><div class="tbl"><table><thead><tr><th>Параметр</th><th>Промпт (голос)</th><th>Синтез</th></tr></thead><tbody><tr><td class="lbl">Мужской голос 1 <span class="muted">(10.2 с)</span></td><td><audio controls preload="none" src="samples/prompt_m1.mp3"></audio></td><td><audio controls preload="none" src="samples/A_m1.mp3"></audio></td></tr><tr><td class="lbl">Женский голос 1 <span class="muted">(10.6 с)</span></td><td><audio controls preload="none" src="samples/prompt_f1.mp3"></audio></td><td><audio controls preload="none" src="samples/A_f1.mp3"></audio></td></tr><tr><td class="lbl">Мужской голос 2 <span class="muted">(10.2 с)</span></td><td><audio controls preload="none" src="samples/prompt_m2.mp3"></audio></td><td><audio controls preload="none" src="samples/A_m2.mp3"></audio></td></tr><tr><td class="lbl">Женский голос 2 <span class="muted">(12.0 с)</span></td><td><audio controls preload="none" src="samples/prompt_f2.mp3"></audio></td><td><audio controls preload="none" src="samples/A_f2.mp3"></audio></td></tr></tbody></table></div></section><section id="B"><h2>Look-ahead</h2><p>Сколько фонем вперёд видит Phoneme Transformer. 5 — почти чистый стриминг, 30 — потоковый режим по умолчанию (плотная сетка обучения), full — вся фраза известна заранее (офлайн-режим: лучше интонация, особенно вопросительная). Текст с двумя вопросами.</p><p class="muted">Промпт: Женский голос 1 <audio controls preload="none" src="samples/prompt_f1.mp3"></audio></p><p class="text">«Ты правда думаешь, что мы успеем до вечера? А если пойдёт дождь, что тогда?»</p><div class="tbl"><table><thead><tr><th>Параметр</th><th>Синтез</th></tr></thead><tbody><tr><td class="lbl">look-ahead 5 <span class="muted">(7.6 с)</span></td><td><audio controls preload="none" src="samples/B_la5.mp3"></audio></td></tr><tr><td class="lbl">look-ahead 30 (по умолчанию) <span class="muted">(7.3 с)</span></td><td><audio controls preload="none" src="samples/B_la30.mp3"></audio></td></tr><tr><td class="lbl">look-ahead full (офлайн) <span class="muted">(7.1 с)</span></td><td><audio controls preload="none" src="samples/B_lafull.mp3"></audio></td></tr></tbody></table></div></section><section id="C"><h2>Темп (SRC — speaking rate control)</h2><p>Перевзвешивание логитов duration-токенов под целевую гистограмму длительностей; «выкл» — естественный темп модели. Тот же голос и текст; в скобках — фактический темп (гласные буквы / длительность аудио).</p><p class="muted">Промпт: Мужской голос 1 <audio controls preload="none" src="samples/prompt_m1.mp3"></audio></p><p class="text">«Скорость речи можно менять прямо во время синтеза, не останавливая генерацию.»</p><div class="tbl"><table><thead><tr><th>Параметр</th><th>Синтез</th></tr></thead><tbody><tr><td class="lbl">SRC выкл (естественный темп) <span class="muted">(4.9 слог/с, 5.8 с)</span></td><td><audio controls preload="none" src="samples/C_rateoff.mp3"></audio></td></tr><tr><td class="lbl">SRC 2.5 слог/с <span class="muted">(3.8 слог/с, 7.4 с)</span></td><td><audio controls preload="none" src="samples/C_rate2.5.mp3"></audio></td></tr><tr><td class="lbl">SRC 3.5 слог/с (по умолчанию) <span class="muted">(4.9 слог/с, 5.7 с)</span></td><td><audio controls preload="none" src="samples/C_rate3.5.mp3"></audio></td></tr><tr><td class="lbl">SRC 4.5 слог/с <span class="muted">(4.7 слог/с, 6.0 с)</span></td><td><audio controls preload="none" src="samples/C_rate4.5.mp3"></audio></td></tr><tr><td class="lbl">SRC 6.0 слог/с <span class="muted">(5.6 слог/с, 5.0 с)</span></td><td><audio controls preload="none" src="samples/C_rate6.0.mp3"></audio></td></tr></tbody></table></div></section><section id="D"><h2>Типы текста</h2><p>Цифры (RUNorm на инференсе), омографы с ручным ударением «+», длинный многопредложенческий текст (синтез по предложениям с повторной привязкой к промпту), проклитики «в/к/с» и междометие «хм», а также кросс-язычный промпт: английская запись → русская речь.</p><ul class="texts"><li><b>Цифры:</b> «В 2024 году добавили 16 кодбуков, а задержка снизилась со 102 до 74 миллисекунд.»</li><li><b>Омографы: з+амок / зам+ок:</b> «Старый з+амок стоял на холме, а на воротах висел ржавый зам+ок.»</li><li><b>Длинный текст, 5 предложений:</b> «Утро выдалось тихим. Над рекой стоял туман, и лодки у берега казались нарисованными. Где-то далеко залаяла собака, потом снова стало тихо. Он допил чай, надел куртку и вышел на крыльцо. День обещал быть долгим!»</li><li><b>Проклитики и междометие:</b> «Хм, в общем, к вечеру с работы я так и не ушёл.»</li><li><b>Английский промпт → русская речь:</b> «Добрый день. Сегодня расскажу, как устроен потоковый синтез речи: модель начинает говорить, не дожидаясь конца фразы.»</li></ul><div class="tbl"><table><thead><tr><th>Параметр</th><th>Промпт (голос)</th><th>Синтез</th></tr></thead><tbody><tr><td class="lbl">Цифры <span class="muted">(8.9 с)</span></td><td><audio controls preload="none" src="samples/prompt_m2.mp3"></audio></td><td><audio controls preload="none" src="samples/D_digits.mp3"></audio></td></tr><tr><td class="lbl">Омографы: з+амок / зам+ок <span class="muted">(5.8 с)</span></td><td><audio controls preload="none" src="samples/prompt_f2.mp3"></audio></td><td><audio controls preload="none" src="samples/D_homograph.mp3"></audio></td></tr><tr><td class="lbl">Длинный текст, 5 предложений <span class="muted">(17.8 с)</span></td><td><audio controls preload="none" src="samples/prompt_m2.mp3"></audio></td><td><audio controls preload="none" src="samples/D_long.mp3"></audio></td></tr><tr><td class="lbl">Проклитики и междометие <span class="muted">(4.4 с)</span></td><td><audio controls preload="none" src="samples/prompt_f2.mp3"></audio></td><td><audio controls preload="none" src="samples/D_proclitic.mp3"></audio></td></tr><tr><td class="lbl">Английский промпт → русская речь <span class="muted">(10.9 с)</span></td><td><audio controls preload="none" src="samples/prompt_en.mp3"></audio></td><td><audio controls preload="none" src="samples/D_xling.mp3"></audio></td></tr></tbody></table></div></section><section id="E"><h2>Семплирование</h2><p>Тот же голос и текст при разных temperature и CFG (classifier-free guidance). По умолчанию temperature 0.8 / CFG 1.5.</p><p class="muted">Промпт: Женский голос 1 <audio controls preload="none" src="samples/prompt_f1.mp3"></audio></p><p class="text">«Добрый день. Сегодня расскажу, как устроен потоковый синтез речи: модель начинает говорить, не дожидаясь конца фразы.»</p><div class="tbl"><table><thead><tr><th>Параметр</th><th>Синтез</th></tr></thead><tbody><tr><td class="lbl">temperature 0.8, CFG 1.5 (по умолчанию) <span class="muted">(10.6 с)</span></td><td><audio controls preload="none" src="samples/A_f1.mp3"></audio></td></tr><tr><td class="lbl">CFG 1.0 (без guidance) <span class="muted">(11.2 с)</span></td><td><audio controls preload="none" src="samples/E_default_cfg1.0.mp3"></audio></td></tr><tr><td class="lbl">CFG 3.0 <span class="muted">(10.9 с)</span></td><td><audio controls preload="none" src="samples/E_default_cfg3.0.mp3"></audio></td></tr><tr><td class="lbl">temperature 0.6 <span class="muted">(10.6 с)</span></td><td><audio controls preload="none" src="samples/E_default_t0.6.mp3"></audio></td></tr><tr><td class="lbl">temperature 1.0 <span class="muted">(11.5 с)</span></td><td><audio controls preload="none" src="samples/E_default_t1.0.mp3"></audio></td></tr></tbody></table></div></section>
|
| 19 |
+
<hr><p class="muted">Модель опубликована в научных целях под лицензией OpenRAIL-M; клонирование голоса реальных людей без их согласия запрещено.
|
| 20 |
+
Промпты — фрагменты открытых датасетов, использованы только для демонстрации.</p>
|
| 21 |
+
</body></html>
|
samples/A_f1.mp3
ADDED
|
Binary file (88.9 kB). View file
|
|
|
samples/A_f2.mp3
ADDED
|
Binary file (99.5 kB). View file
|
|
|
samples/A_m1.mp3
ADDED
|
Binary file (88.2 kB). View file
|
|
|
samples/A_m2.mp3
ADDED
|
Binary file (90 kB). View file
|
|
|
samples/B_la30.mp3
ADDED
|
Binary file (61.7 kB). View file
|
|
|
samples/B_la5.mp3
ADDED
|
Binary file (63.1 kB). View file
|
|
|
samples/B_lafull.mp3
ADDED
|
Binary file (58.9 kB). View file
|
|
|
samples/C_rate2.5.mp3
ADDED
|
Binary file (66.2 kB). View file
|
|
|
samples/C_rate3.5.mp3
ADDED
|
Binary file (52.7 kB). View file
|
|
|
samples/C_rate4.5.mp3
ADDED
|
Binary file (54.8 kB). View file
|
|
|
samples/C_rate6.0.mp3
ADDED
|
Binary file (46.2 kB). View file
|
|
|
samples/C_rateoff.mp3
ADDED
|
Binary file (56.2 kB). View file
|
|
|
samples/D_digits.mp3
ADDED
|
Binary file (79.4 kB). View file
|
|
|
samples/D_homograph.mp3
ADDED
|
Binary file (48.9 kB). View file
|
|
|
samples/D_long.mp3
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:48c4ac28ba779a9ab41dbf19b51cf4ba7622ec9ccb2f863fda943c7d39f5e621
|
| 3 |
+
size 159381
|
samples/D_proclitic.mp3
ADDED
|
Binary file (35.1 kB). View file
|
|
|
samples/D_xling.mp3
ADDED
|
Binary file (94.4 kB). View file
|
|
|
samples/E_default_cfg1.0.mp3
ADDED
|
Binary file (94.4 kB). View file
|
|
|
samples/E_default_cfg3.0.mp3
ADDED
|
Binary file (92.3 kB). View file
|
|
|
samples/E_default_t0.6.mp3
ADDED
|
Binary file (89.1 kB). View file
|
|
|
samples/E_default_t1.0.mp3
ADDED
|
Binary file (95.7 kB). View file
|
|
|
samples/prompt_en.mp3
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:bdcffde1b5cbd4e723f17d062bbd34ab45534f071252b742ad2f4cdc23266a88
|
| 3 |
+
size 134349
|
samples/prompt_f1.mp3
ADDED
|
Binary file (74 kB). View file
|
|
|
samples/prompt_f2.mp3
ADDED
|
Binary file (96.4 kB). View file
|
|
|
samples/prompt_m1.mp3
ADDED
|
Binary file (98.5 kB). View file
|
|
|
samples/prompt_m2.mp3
ADDED
|
Binary file (86.7 kB). View file
|
|
|