Spaces:
Running
Running
| <html lang="ru"><head><meta charset="utf-8"><meta name="viewport" content="width=device-width, initial-scale=1"> | |
| <title>VoXtream2-RU — примеры</title> | |
| <style> | |
| body{max-width:960px;margin:0 auto;padding:24px 16px;font:16px/1.55 system-ui,-apple-system,Segoe UI,Roboto,sans-serif;color:#1f2328;background:#fff} | |
| h1{font-size:1.6em} h2{margin-top:1.8em;border-bottom:1px solid #d0d7de;padding-bottom:.2em} | |
| .links{background:#eef2ff;padding:10px 14px;border-radius:8px} .muted{color:#6b7280;font-size:.9em} | |
| .text{background:#f6f8fa;padding:8px 12px;border-radius:6px;margin:.5em 0} .texts li{margin:.3em 0} | |
| .tbl{overflow-x:auto} table{border-collapse:collapse;width:100%;margin:.6em 0} th,td{border:1px solid #d0d7de;padding:6px 10px;vertical-align:middle} | |
| td.lbl{min-width:180px} audio{width:280px;max-width:100%;display:block} | |
| @media (prefers-color-scheme:dark){body{background:#0d1117;color:#e6edf3} .text,{} .text{background:#161b22} th,td{border-color:#30363d} h2{border-color:#30363d} .links{background:#1b2440} a{color:#8ab4ff}} | |
| </style></head><body> | |
| <p class="links"><a href="index.html">← О модели</a> · <a href="https://huggingface.co/simba9/voxtream2-ru">Модель и код демо на HF</a> · <a href="#A">Голоса</a> · <a href="#B">Look-ahead</a> · <a href="#C">Темп (SRC — speaking rate control)</a> · <a href="#D">Типы текста</a> · <a href="#E">Семплирование</a></p> | |
| <h1>VoXtream2-RU — примеры синтеза</h1> | |
| <p>Все примеры сгенерированы финальной моделью (v10-DPO) через тот же инференс-стек, что в демо. Голоса — четыре диктора из | |
| открытого корпуса <a href="https://github.com/salute-developers/golos/tree/master/dusha">DUSHA</a> (SberDevices), которые | |
| <b>не попали в обучающую выборку</b> (отсеяны фильтрами качества), то есть для модели это незнакомые голоса; промпт каждого | |
| склеен из 2–4 коротких реплик по VAD. Английский промпт — из демо-материалов VoXtream2 (KTH). Аудио 24 кГц, MP3.</p> | |
| <section id="A"><h2>Голоса</h2><p>Один и тот же текст четырьмя голосами, настройки по умолчанию: look-ahead 30, темп 3.5 слог/с (SRC), best-of-2, temperature 0.8, top-k 50, CFG 1.5.</p><p class="text">«Добрый день. Сегодня расскажу, как устроен потоковый синтез речи: модель начинает говорить, не дожидаясь конца фразы.»</p><div class="tbl"><table><thead><tr><th>Параметр</th><th>Промпт (голос)</th><th>Синтез</th></tr></thead><tbody><tr><td class="lbl">Мужской голос 1 <span class="muted">(10.2 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_m1.mp3"></audio></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/A_m1.mp3"></audio></td></tr><tr><td class="lbl">Женский голос 1 <span class="muted">(10.6 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_f1.mp3"></audio></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/A_f1.mp3"></audio></td></tr><tr><td class="lbl">Мужской голос 2 <span class="muted">(10.2 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_m2.mp3"></audio></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/A_m2.mp3"></audio></td></tr><tr><td class="lbl">Женский голос 2 <span class="muted">(12.0 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_f2.mp3"></audio></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/A_f2.mp3"></audio></td></tr></tbody></table></div></section><section id="B"><h2>Look-ahead</h2><p>Сколько фонем вперёд видит Phoneme Transformer. 5 — почти чистый стриминг, 30 — потоковый режим по умолчанию (плотная сетка обучения), full — вся фраза известна заранее (офлайн-режим: лучше интонация, особенно вопросительная). Текст с двумя вопросами.</p><p class="muted">Промпт: Женский голос 1 <audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_f1.mp3"></audio></p><p class="text">«Ты правда думаешь, что мы успеем до вечера? А если пойдёт дождь, что тогда?»</p><div class="tbl"><table><thead><tr><th>Параметр</th><th>Синтез</th></tr></thead><tbody><tr><td class="lbl">look-ahead 5 <span class="muted">(7.6 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/B_la5.mp3"></audio></td></tr><tr><td class="lbl">look-ahead 30 (по умолчанию) <span class="muted">(7.3 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/B_la30.mp3"></audio></td></tr><tr><td class="lbl">look-ahead full (офлайн) <span class="muted">(7.1 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/B_lafull.mp3"></audio></td></tr></tbody></table></div></section><section id="C"><h2>Темп (SRC — speaking rate control)</h2><p>Перевзвешивание логитов duration-токенов под целевую гистограмму длительностей; «выкл» — естественный темп модели. Тот же голос и текст; в скобках — фактический темп (гласные буквы / длительность аудио).</p><p class="muted">Промпт: Мужской голос 1 <audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_m1.mp3"></audio></p><p class="text">«Скорость речи можно менять прямо во время синтеза, не останавливая генерацию.»</p><div class="tbl"><table><thead><tr><th>Параметр</th><th>Синтез</th></tr></thead><tbody><tr><td class="lbl">SRC выкл (естественный темп) <span class="muted">(4.9 слог/с, 5.8 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/C_rateoff.mp3"></audio></td></tr><tr><td class="lbl">SRC 2.5 слог/с <span class="muted">(3.8 слог/с, 7.4 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/C_rate2.5.mp3"></audio></td></tr><tr><td class="lbl">SRC 3.5 слог/с (по умолчанию) <span class="muted">(4.9 слог/с, 5.7 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/C_rate3.5.mp3"></audio></td></tr><tr><td class="lbl">SRC 4.5 слог/с <span class="muted">(4.7 слог/с, 6.0 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/C_rate4.5.mp3"></audio></td></tr><tr><td class="lbl">SRC 6.0 слог/с <span class="muted">(5.6 слог/с, 5.0 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/C_rate6.0.mp3"></audio></td></tr></tbody></table></div></section><section id="D"><h2>Типы текста</h2><p>Цифры (RUNorm на инференсе), омографы с ручным ударением «+», длинный многопредложенческий текст (синтез по предложениям с повторной привязкой к промпту), проклитики «в/к/с» и междометие «хм», а также кросс-язычный промпт: английская запись → русская речь.</p><ul class="texts"><li><b>Цифры:</b> «В 2024 году добавили 16 кодбуков, а задержка снизилась со 102 до 74 миллисекунд.»</li><li><b>Омографы: з+амок / зам+ок:</b> «Старый з+амок стоял на холме, а на воротах висел ржавый зам+ок.»</li><li><b>Длинный текст, 5 предложений:</b> «Утро выдалось тихим. Над рекой стоял туман, и лодки у берега казались нарисованными. Где-то далеко залаяла собака, потом снова стало тихо. Он допил чай, надел куртку и вышел на крыльцо. День обещал быть долгим!»</li><li><b>Проклитики и междометие:</b> «Хм, в общем, к вечеру с работы я так и не ушёл.»</li><li><b>Английский промпт → русская речь:</b> «Добрый день. Сегодня расскажу, как устроен потоковый синтез речи: модель начинает говорить, не дожидаясь конца фразы.»</li></ul><div class="tbl"><table><thead><tr><th>Параметр</th><th>Промпт (голос)</th><th>Синтез</th></tr></thead><tbody><tr><td class="lbl">Цифры <span class="muted">(8.9 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_m2.mp3"></audio></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/D_digits.mp3"></audio></td></tr><tr><td class="lbl">Омографы: з+амок / зам+ок <span class="muted">(5.8 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_f2.mp3"></audio></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/D_homograph.mp3"></audio></td></tr><tr><td class="lbl">Длинный текст, 5 предложений <span class="muted">(17.8 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_m2.mp3"></audio></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/D_long.mp3"></audio></td></tr><tr><td class="lbl">Проклитики и междометие <span class="muted">(4.4 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_f2.mp3"></audio></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/D_proclitic.mp3"></audio></td></tr><tr><td class="lbl">Английский промпт → русская речь <span class="muted">(10.9 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_en.mp3"></audio></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/D_xling.mp3"></audio></td></tr></tbody></table></div></section><section id="E"><h2>Семплирование</h2><p>Тот же голос и текст при разных temperature и CFG (classifier-free guidance). По умолчанию temperature 0.8 / CFG 1.5.</p><p class="muted">Промпт: Женский голос 1 <audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_f1.mp3"></audio></p><p class="text">«Добрый день. Сегодня расскажу, как устроен потоковый синтез речи: модель начинает говорить, не дожидаясь конца фразы.»</p><div class="tbl"><table><thead><tr><th>Параметр</th><th>Синтез</th></tr></thead><tbody><tr><td class="lbl">temperature 0.8, CFG 1.5 (по умолчанию) <span class="muted">(10.6 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/A_f1.mp3"></audio></td></tr><tr><td class="lbl">CFG 1.0 (без guidance) <span class="muted">(11.2 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/E_default_cfg1.0.mp3"></audio></td></tr><tr><td class="lbl">CFG 3.0 <span class="muted">(10.9 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/E_default_cfg3.0.mp3"></audio></td></tr><tr><td class="lbl">temperature 0.6 <span class="muted">(10.6 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/E_default_t0.6.mp3"></audio></td></tr><tr><td class="lbl">temperature 1.0 <span class="muted">(11.5 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/E_default_t1.0.mp3"></audio></td></tr></tbody></table></div></section> | |
| <hr><p class="muted">Модель опубликована в научных целях под лицензией OpenRAIL-M; клонирование голоса реальных людей без их согласия запрещено. | |
| Промпты — фрагменты открытых датасетов, использованы только для демонстрации.</p> | |
| </body></html> |