voxtream2-ru / samples.html
simba9's picture
VoXtream2-RU space (static)
74fd378 verified
Raw
History Blame Contribute Delete
14.5 kB
<!doctype html><html lang="ru"><head><meta charset="utf-8"><meta name="viewport" content="width=device-width, initial-scale=1">
<title>VoXtream2-RU — примеры</title>
<style>
body{max-width:960px;margin:0 auto;padding:24px 16px;font:16px/1.55 system-ui,-apple-system,Segoe UI,Roboto,sans-serif;color:#1f2328;background:#fff}
h1{font-size:1.6em} h2{margin-top:1.8em;border-bottom:1px solid #d0d7de;padding-bottom:.2em}
.links{background:#eef2ff;padding:10px 14px;border-radius:8px} .muted{color:#6b7280;font-size:.9em}
.text{background:#f6f8fa;padding:8px 12px;border-radius:6px;margin:.5em 0} .texts li{margin:.3em 0}
.tbl{overflow-x:auto} table{border-collapse:collapse;width:100%;margin:.6em 0} th,td{border:1px solid #d0d7de;padding:6px 10px;vertical-align:middle}
td.lbl{min-width:180px} audio{width:280px;max-width:100%;display:block}
@media (prefers-color-scheme:dark){body{background:#0d1117;color:#e6edf3} .text,{} .text{background:#161b22} th,td{border-color:#30363d} h2{border-color:#30363d} .links{background:#1b2440} a{color:#8ab4ff}}
</style></head><body>
<p class="links"><a href="index.html">← О модели</a> · <a href="https://huggingface.co/simba9/voxtream2-ru">Модель и код демо на HF</a> · <a href="#A">Голоса</a> · <a href="#B">Look-ahead</a> · <a href="#C">Темп (SRC — speaking rate control)</a> · <a href="#D">Типы текста</a> · <a href="#E">Семплирование</a></p>
<h1>VoXtream2-RU — примеры синтеза</h1>
<p>Все примеры сгенерированы финальной моделью (v10-DPO) через тот же инференс-стек, что в демо. Голоса — четыре диктора из
открытого корпуса <a href="https://github.com/salute-developers/golos/tree/master/dusha">DUSHA</a> (SberDevices), которые
<b>не попали в обучающую выборку</b> (отсеяны фильтрами качества), то есть для модели это незнакомые голоса; промпт каждого
склеен из 2–4 коротких реплик по VAD. Английский промпт — из демо-материалов VoXtream2 (KTH). Аудио 24 кГц, MP3.</p>
<section id="A"><h2>Голоса</h2><p>Один и тот же текст четырьмя голосами, настройки по умолчанию: look-ahead 30, темп 3.5 слог/с (SRC), best-of-2, temperature 0.8, top-k 50, CFG 1.5.</p><p class="text">«Добрый день. Сегодня расскажу, как устроен потоковый синтез речи: модель начинает говорить, не дожидаясь конца фразы.»</p><div class="tbl"><table><thead><tr><th>Параметр</th><th>Промпт (голос)</th><th>Синтез</th></tr></thead><tbody><tr><td class="lbl">Мужской голос 1 <span class="muted">(10.2 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_m1.mp3"></audio></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/A_m1.mp3"></audio></td></tr><tr><td class="lbl">Женский голос 1 <span class="muted">(10.6 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_f1.mp3"></audio></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/A_f1.mp3"></audio></td></tr><tr><td class="lbl">Мужской голос 2 <span class="muted">(10.2 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_m2.mp3"></audio></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/A_m2.mp3"></audio></td></tr><tr><td class="lbl">Женский голос 2 <span class="muted">(12.0 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_f2.mp3"></audio></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/A_f2.mp3"></audio></td></tr></tbody></table></div></section><section id="B"><h2>Look-ahead</h2><p>Сколько фонем вперёд видит Phoneme Transformer. 5 — почти чистый стриминг, 30 — потоковый режим по умолчанию (плотная сетка обучения), full — вся фраза известна заранее (офлайн-режим: лучше интонация, особенно вопросительная). Текст с двумя вопросами.</p><p class="muted">Промпт: Женский голос 1 <audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_f1.mp3"></audio></p><p class="text">«Ты правда думаешь, что мы успеем до вечера? А если пойдёт дождь, что тогда?»</p><div class="tbl"><table><thead><tr><th>Параметр</th><th>Синтез</th></tr></thead><tbody><tr><td class="lbl">look-ahead 5 <span class="muted">(7.6 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/B_la5.mp3"></audio></td></tr><tr><td class="lbl">look-ahead 30 (по умолчанию) <span class="muted">(7.3 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/B_la30.mp3"></audio></td></tr><tr><td class="lbl">look-ahead full (офлайн) <span class="muted">(7.1 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/B_lafull.mp3"></audio></td></tr></tbody></table></div></section><section id="C"><h2>Темп (SRC — speaking rate control)</h2><p>Перевзвешивание логитов duration-токенов под целевую гистограмму длительностей; «выкл» — естественный темп модели. Тот же голос и текст; в скобках — фактический темп (гласные буквы / длительность аудио).</p><p class="muted">Промпт: Мужской голос 1 <audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_m1.mp3"></audio></p><p class="text">«Скорость речи можно менять прямо во время синтеза, не останавливая генерацию.»</p><div class="tbl"><table><thead><tr><th>Параметр</th><th>Синтез</th></tr></thead><tbody><tr><td class="lbl">SRC выкл (естественный темп) <span class="muted">(4.9 слог/с, 5.8 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/C_rateoff.mp3"></audio></td></tr><tr><td class="lbl">SRC 2.5 слог/с <span class="muted">(3.8 слог/с, 7.4 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/C_rate2.5.mp3"></audio></td></tr><tr><td class="lbl">SRC 3.5 слог/с (по умолчанию) <span class="muted">(4.9 слог/с, 5.7 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/C_rate3.5.mp3"></audio></td></tr><tr><td class="lbl">SRC 4.5 слог/с <span class="muted">(4.7 слог/с, 6.0 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/C_rate4.5.mp3"></audio></td></tr><tr><td class="lbl">SRC 6.0 слог/с <span class="muted">(5.6 слог/с, 5.0 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/C_rate6.0.mp3"></audio></td></tr></tbody></table></div></section><section id="D"><h2>Типы текста</h2><p>Цифры (RUNorm на инференсе), омографы с ручным ударением «+», длинный многопредложенческий текст (синтез по предложениям с повторной привязкой к промпту), проклитики «в/к/с» и междометие «хм», а также кросс-язычный промпт: английская запись → русская речь.</p><ul class="texts"><li><b>Цифры:</b> «В 2024 году добавили 16 кодбуков, а задержка снизилась со 102 до 74 миллисекунд.»</li><li><b>Омографы: з+амок / зам+ок:</b> «Старый з+амок стоял на холме, а на воротах висел ржавый зам+ок.»</li><li><b>Длинный текст, 5 предложений:</b> «Утро выдалось тихим. Над рекой стоял туман, и лодки у берега казались нарисованными. Где-то далеко залаяла собака, потом снова стало тихо. Он допил чай, надел куртку и вышел на крыльцо. День обещал быть долгим!»</li><li><b>Проклитики и междометие:</b> «Хм, в общем, к вечеру с работы я так и не ушёл.»</li><li><b>Английский промпт → русская речь:</b> «Добрый день. Сегодня расскажу, как устроен потоковый синтез речи: модель начинает говорить, не дожидаясь конца фразы.»</li></ul><div class="tbl"><table><thead><tr><th>Параметр</th><th>Промпт (голос)</th><th>Синтез</th></tr></thead><tbody><tr><td class="lbl">Цифры <span class="muted">(8.9 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_m2.mp3"></audio></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/D_digits.mp3"></audio></td></tr><tr><td class="lbl">Омографы: з+амок / зам+ок <span class="muted">(5.8 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_f2.mp3"></audio></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/D_homograph.mp3"></audio></td></tr><tr><td class="lbl">Длинный текст, 5 предложений <span class="muted">(17.8 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_m2.mp3"></audio></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/D_long.mp3"></audio></td></tr><tr><td class="lbl">Проклитики и междометие <span class="muted">(4.4 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_f2.mp3"></audio></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/D_proclitic.mp3"></audio></td></tr><tr><td class="lbl">Английский промпт → русская речь <span class="muted">(10.9 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_en.mp3"></audio></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/D_xling.mp3"></audio></td></tr></tbody></table></div></section><section id="E"><h2>Семплирование</h2><p>Тот же голос и текст при разных temperature и CFG (classifier-free guidance). По умолчанию temperature 0.8 / CFG 1.5.</p><p class="muted">Промпт: Женский голос 1 <audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_f1.mp3"></audio></p><p class="text">«Добрый день. Сегодня расскажу, как устроен потоковый синтез речи: модель начинает говорить, не дожидаясь конца фразы.»</p><div class="tbl"><table><thead><tr><th>Параметр</th><th>Синтез</th></tr></thead><tbody><tr><td class="lbl">temperature 0.8, CFG 1.5 (по умолчанию) <span class="muted">(10.6 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/A_f1.mp3"></audio></td></tr><tr><td class="lbl">CFG 1.0 (без guidance) <span class="muted">(11.2 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/E_default_cfg1.0.mp3"></audio></td></tr><tr><td class="lbl">CFG 3.0 <span class="muted">(10.9 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/E_default_cfg3.0.mp3"></audio></td></tr><tr><td class="lbl">temperature 0.6 <span class="muted">(10.6 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/E_default_t0.6.mp3"></audio></td></tr><tr><td class="lbl">temperature 1.0 <span class="muted">(11.5 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/E_default_t1.0.mp3"></audio></td></tr></tbody></table></div></section>
<hr><p class="muted">Модель опубликована в научных целях под лицензией OpenRAIL-M; клонирование голоса реальных людей без их согласия запрещено.
Промпты — фрагменты открытых датасетов, использованы только для демонстрации.</p>
</body></html>