simba9 commited on
Commit
74fd378
·
verified ·
1 Parent(s): 98f8309

VoXtream2-RU space (static)

Browse files
Files changed (1) hide show
  1. samples.html +1 -1
samples.html CHANGED
@@ -15,7 +15,7 @@ td.lbl{min-width:180px} audio{width:280px;max-width:100%;display:block}
15
  открытого корпуса <a href="https://github.com/salute-developers/golos/tree/master/dusha">DUSHA</a> (SberDevices), которые
16
  <b>не попали в обучающую выборку</b> (отсеяны фильтрами качества), то есть для модели это незнакомые голоса; промпт каждого
17
  склеен из 2–4 коротких реплик по VAD. Английский промпт — из демо-материалов VoXtream2 (KTH). Аудио 24 кГц, MP3.</p>
18
- <section id="A"><h2>Голоса</h2><p>Один и тот же текст четырьмя голосами, настройки по умолчанию: look-ahead 30, темп 3.5 слог/с (SRC), best-of-2, temperature 0.8, top-k 50, CFG 1.5.</p><p class="text">«Добрый день. Сегодня расскажу, как устроен потоковый синтез речи: модель начинает говорить, не дожидаясь конца фразы.»</p><div class="tbl"><table><thead><tr><th>Параметр</th><th>Промпт (голос)</th><th>Синтез</th></tr></thead><tbody><tr><td class="lbl">Мужской голос 1 <span class="muted">(10.2 с)</span></td><td><audio controls preload="none" src="samples/prompt_m1.mp3"></audio></td><td><audio controls preload="none" src="samples/A_m1.mp3"></audio></td></tr><tr><td class="lbl">Женский голос 1 <span class="muted">(10.6 с)</span></td><td><audio controls preload="none" src="samples/prompt_f1.mp3"></audio></td><td><audio controls preload="none" src="samples/A_f1.mp3"></audio></td></tr><tr><td class="lbl">Мужской голос 2 <span class="muted">(10.2 с)</span></td><td><audio controls preload="none" src="samples/prompt_m2.mp3"></audio></td><td><audio controls preload="none" src="samples/A_m2.mp3"></audio></td></tr><tr><td class="lbl">Женский голос 2 <span class="muted">(12.0 с)</span></td><td><audio controls preload="none" src="samples/prompt_f2.mp3"></audio></td><td><audio controls preload="none" src="samples/A_f2.mp3"></audio></td></tr></tbody></table></div></section><section id="B"><h2>Look-ahead</h2><p>Сколько фонем вперёд видит Phoneme Transformer. 5 — почти чистый стриминг, 30 — потоковый режим по умолчанию (плотная сетка обучения), full — вся фраза известна заранее (офлайн-режим: лучше интонация, особенно вопросительная). Текст с двумя вопросами.</p><p class="muted">Промпт: Женский голос 1 <audio controls preload="none" src="samples/prompt_f1.mp3"></audio></p><p class="text">«Ты правда думаешь, что мы успеем до вечера? А если пойдёт дождь, что тогда?»</p><div class="tbl"><table><thead><tr><th>Параметр</th><th>Синтез</th></tr></thead><tbody><tr><td class="lbl">look-ahead 5 <span class="muted">(7.6 с)</span></td><td><audio controls preload="none" src="samples/B_la5.mp3"></audio></td></tr><tr><td class="lbl">look-ahead 30 (по умолчанию) <span class="muted">(7.3 с)</span></td><td><audio controls preload="none" src="samples/B_la30.mp3"></audio></td></tr><tr><td class="lbl">look-ahead full (офлайн) <span class="muted">(7.1 с)</span></td><td><audio controls preload="none" src="samples/B_lafull.mp3"></audio></td></tr></tbody></table></div></section><section id="C"><h2>Темп (SRC — speaking rate control)</h2><p>Перевзвешивание логитов duration-токенов под целевую гистограмму длительностей; «выкл» — естественный темп модели. Тот же голос и текст; в скобках — фактический темп (гласные буквы / длительность аудио).</p><p class="muted">Промпт: Мужской голос 1 <audio controls preload="none" src="samples/prompt_m1.mp3"></audio></p><p class="text">«Скорость речи можно менять прямо во время синтеза, не останавливая генерацию.»</p><div class="tbl"><table><thead><tr><th>Параметр</th><th>Синтез</th></tr></thead><tbody><tr><td class="lbl">SRC выкл (естественный темп) <span class="muted">(4.9 слог/с, 5.8 с)</span></td><td><audio controls preload="none" src="samples/C_rateoff.mp3"></audio></td></tr><tr><td class="lbl">SRC 2.5 слог/с <span class="muted">(3.8 слог/с, 7.4 с)</span></td><td><audio controls preload="none" src="samples/C_rate2.5.mp3"></audio></td></tr><tr><td class="lbl">SRC 3.5 слог/с (по умолчанию) <span class="muted">(4.9 слог/с, 5.7 с)</span></td><td><audio controls preload="none" src="samples/C_rate3.5.mp3"></audio></td></tr><tr><td class="lbl">SRC 4.5 слог/с <span class="muted">(4.7 слог/с, 6.0 с)</span></td><td><audio controls preload="none" src="samples/C_rate4.5.mp3"></audio></td></tr><tr><td class="lbl">SRC 6.0 слог/с <span class="muted">(5.6 слог/с, 5.0 с)</span></td><td><audio controls preload="none" src="samples/C_rate6.0.mp3"></audio></td></tr></tbody></table></div></section><section id="D"><h2>Типы текста</h2><p>Цифры (RUNorm на инференсе), омографы с ручным ударением «+», длинный многопредложенческий текст (синтез по предложениям с повторной привязкой к промпту), проклитики «в/к/с» и междометие «хм», а также кросс-язычный промпт: английская запись → русская речь.</p><ul class="texts"><li><b>Цифры:</b> «В 2024 году добавили 16 кодбуков, а задержка снизилась со 102 до 74 миллисекунд.»</li><li><b>Омографы: з+амок / зам+ок:</b> «Старый з+амок стоял на холме, а на воротах висел ржавый зам+ок.»</li><li><b>Длинный текст, 5 предложений:</b> «Утро выдалось тихим. Над рекой стоял туман, и лодки у берега казались нарисованными. Где-то далеко залаяла собака, потом снова стало тихо. Он допил чай, надел куртку и вышел на крыльцо. День обещал быть долгим!»</li><li><b>Проклитики и междометие:</b> «Хм, в общем, к вечеру с работы я так и не ушёл.»</li><li><b>Английский промпт → русская речь:</b> «Добрый день. Сегодня расскажу, как устроен потоковый синтез речи: модель начинает говорить, не дожидаясь конца фразы.»</li></ul><div class="tbl"><table><thead><tr><th>Параметр</th><th>Промпт (голос)</th><th>Синтез</th></tr></thead><tbody><tr><td class="lbl">Цифры <span class="muted">(8.9 с)</span></td><td><audio controls preload="none" src="samples/prompt_m2.mp3"></audio></td><td><audio controls preload="none" src="samples/D_digits.mp3"></audio></td></tr><tr><td class="lbl">Омографы: з+амок / зам+ок <span class="muted">(5.8 с)</span></td><td><audio controls preload="none" src="samples/prompt_f2.mp3"></audio></td><td><audio controls preload="none" src="samples/D_homograph.mp3"></audio></td></tr><tr><td class="lbl">Длинный текст, 5 предложений <span class="muted">(17.8 с)</span></td><td><audio controls preload="none" src="samples/prompt_m2.mp3"></audio></td><td><audio controls preload="none" src="samples/D_long.mp3"></audio></td></tr><tr><td class="lbl">Проклитики и междометие <span class="muted">(4.4 с)</span></td><td><audio controls preload="none" src="samples/prompt_f2.mp3"></audio></td><td><audio controls preload="none" src="samples/D_proclitic.mp3"></audio></td></tr><tr><td class="lbl">Английский промпт → русская речь <span class="muted">(10.9 с)</span></td><td><audio controls preload="none" src="samples/prompt_en.mp3"></audio></td><td><audio controls preload="none" src="samples/D_xling.mp3"></audio></td></tr></tbody></table></div></section><section id="E"><h2>Семплирование</h2><p>Тот же голос и текст при разных temperature и CFG (classifier-free guidance). По умолчанию temperature 0.8 / CFG 1.5.</p><p class="muted">Промпт: Женский голос 1 <audio controls preload="none" src="samples/prompt_f1.mp3"></audio></p><p class="text">«Добрый день. Сегодня расскажу, как устроен потоковый синтез речи: модель начинает говорить, не дожидаясь конца фразы.»</p><div class="tbl"><table><thead><tr><th>Параметр</th><th>Синтез</th></tr></thead><tbody><tr><td class="lbl">temperature 0.8, CFG 1.5 (по умолчанию) <span class="muted">(10.6 с)</span></td><td><audio controls preload="none" src="samples/A_f1.mp3"></audio></td></tr><tr><td class="lbl">CFG 1.0 (без guidance) <span class="muted">(11.2 с)</span></td><td><audio controls preload="none" src="samples/E_default_cfg1.0.mp3"></audio></td></tr><tr><td class="lbl">CFG 3.0 <span class="muted">(10.9 с)</span></td><td><audio controls preload="none" src="samples/E_default_cfg3.0.mp3"></audio></td></tr><tr><td class="lbl">temperature 0.6 <span class="muted">(10.6 с)</span></td><td><audio controls preload="none" src="samples/E_default_t0.6.mp3"></audio></td></tr><tr><td class="lbl">temperature 1.0 <span class="muted">(11.5 с)</span></td><td><audio controls preload="none" src="samples/E_default_t1.0.mp3"></audio></td></tr></tbody></table></div></section>
19
  <hr><p class="muted">Модель опубликована в научных целях под лицензией OpenRAIL-M; клонирование голоса реальных людей без их согласия запрещено.
20
  Промпты — фрагменты открытых датасетов, использованы только для демонстрации.</p>
21
  </body></html>
 
15
  открытого корпуса <a href="https://github.com/salute-developers/golos/tree/master/dusha">DUSHA</a> (SberDevices), которые
16
  <b>не попали в обучающую выборку</b> (отсеяны фильтрами качества), то есть для модели это незнакомые голоса; промпт каждого
17
  склеен из 2–4 коротких реплик по VAD. Английский промпт — из демо-материалов VoXtream2 (KTH). Аудио 24 кГц, MP3.</p>
18
+ <section id="A"><h2>Голоса</h2><p>Один и тот же текст четырьмя голосами, настройки по умолчанию: look-ahead 30, темп 3.5 слог/с (SRC), best-of-2, temperature 0.8, top-k 50, CFG 1.5.</p><p class="text">«Добрый день. Сегодня расскажу, как устроен потоковый синтез речи: модель начинает говорить, не дожидаясь конца фразы.»</p><div class="tbl"><table><thead><tr><th>Параметр</th><th>Промпт (голос)</th><th>Синтез</th></tr></thead><tbody><tr><td class="lbl">Мужской голос 1 <span class="muted">(10.2 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_m1.mp3"></audio></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/A_m1.mp3"></audio></td></tr><tr><td class="lbl">Женский голос 1 <span class="muted">(10.6 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_f1.mp3"></audio></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/A_f1.mp3"></audio></td></tr><tr><td class="lbl">Мужской голос 2 <span class="muted">(10.2 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_m2.mp3"></audio></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/A_m2.mp3"></audio></td></tr><tr><td class="lbl">Женский голос 2 <span class="muted">(12.0 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_f2.mp3"></audio></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/A_f2.mp3"></audio></td></tr></tbody></table></div></section><section id="B"><h2>Look-ahead</h2><p>Сколько фонем вперёд видит Phoneme Transformer. 5 — почти чистый стриминг, 30 — потоковый режим по умолчанию (плотная сетка обучения), full — вся фраза известна заранее (офлайн-режим: лучше интонация, особенно вопросительная). Текст с двумя вопросами.</p><p class="muted">Промпт: Женский голос 1 <audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_f1.mp3"></audio></p><p class="text">«Ты правда думаешь, что мы успеем до вечера? А если пойдёт дождь, что тогда?»</p><div class="tbl"><table><thead><tr><th>Параметр</th><th>Синтез</th></tr></thead><tbody><tr><td class="lbl">look-ahead 5 <span class="muted">(7.6 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/B_la5.mp3"></audio></td></tr><tr><td class="lbl">look-ahead 30 (по умолчанию) <span class="muted">(7.3 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/B_la30.mp3"></audio></td></tr><tr><td class="lbl">look-ahead full (офлайн) <span class="muted">(7.1 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/B_lafull.mp3"></audio></td></tr></tbody></table></div></section><section id="C"><h2>Темп (SRC — speaking rate control)</h2><p>Перевзвешивание логитов duration-токенов под целевую гистограмму длительностей; «выкл» — естественный темп модели. Тот же голос и текст; в скобках — фактический темп (гласные буквы / длительность аудио).</p><p class="muted">Промпт: Мужской голос 1 <audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_m1.mp3"></audio></p><p class="text">«Скорость речи можно менять прямо во время синтеза, не останавливая генерацию.»</p><div class="tbl"><table><thead><tr><th>Параметр</th><th>Синтез</th></tr></thead><tbody><tr><td class="lbl">SRC выкл (естественный темп) <span class="muted">(4.9 слог/с, 5.8 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/C_rateoff.mp3"></audio></td></tr><tr><td class="lbl">SRC 2.5 слог/с <span class="muted">(3.8 слог/с, 7.4 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/C_rate2.5.mp3"></audio></td></tr><tr><td class="lbl">SRC 3.5 слог/с (по умолчанию) <span class="muted">(4.9 слог/с, 5.7 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/C_rate3.5.mp3"></audio></td></tr><tr><td class="lbl">SRC 4.5 слог/с <span class="muted">(4.7 слог/с, 6.0 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/C_rate4.5.mp3"></audio></td></tr><tr><td class="lbl">SRC 6.0 слог/с <span class="muted">(5.6 слог/с, 5.0 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/C_rate6.0.mp3"></audio></td></tr></tbody></table></div></section><section id="D"><h2>Типы текста</h2><p>Цифры (RUNorm на инференсе), омографы с ручным ударением «+», длинный многопредложенческий текст (синтез по предложениям с повторной привязкой к промпту), проклитики «в/к/с» и междометие «хм», а также кросс-язычный промпт: английская запись → русская речь.</p><ul class="texts"><li><b>Цифры:</b> «В 2024 году добавили 16 кодбуков, а задержка снизилась со 102 до 74 миллисекунд.»</li><li><b>Омографы: з+амок / зам+ок:</b> «Старый з+амок стоял на холме, а на воротах висел ржавый зам+ок.»</li><li><b>Длинный текст, 5 предложений:</b> «Утро выдалось тихим. Над рекой стоял туман, и лодки у берега казались нарисованными. Где-то далеко залаяла собака, потом снова стало тихо. Он допил чай, надел куртку и вышел на крыльцо. День обещал быть долгим!»</li><li><b>Проклитики и междометие:</b> «Хм, в общем, к вечеру с работы я так и не ушёл.»</li><li><b>Английский промпт → русская речь:</b> «Добрый день. Сегодня расскажу, как устроен потоковый синтез речи: модель начинает говорить, не дожидаясь конца фразы.»</li></ul><div class="tbl"><table><thead><tr><th>Параметр</th><th>Промпт (голос)</th><th>Синтез</th></tr></thead><tbody><tr><td class="lbl">Цифры <span class="muted">(8.9 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_m2.mp3"></audio></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/D_digits.mp3"></audio></td></tr><tr><td class="lbl">Омографы: з+амок / зам+ок <span class="muted">(5.8 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_f2.mp3"></audio></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/D_homograph.mp3"></audio></td></tr><tr><td class="lbl">Длинный текст, 5 предложений <span class="muted">(17.8 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_m2.mp3"></audio></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/D_long.mp3"></audio></td></tr><tr><td class="lbl">Проклитики и междометие <span class="muted">(4.4 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_f2.mp3"></audio></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/D_proclitic.mp3"></audio></td></tr><tr><td class="lbl">Английский промпт → русская речь <span class="muted">(10.9 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_en.mp3"></audio></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/D_xling.mp3"></audio></td></tr></tbody></table></div></section><section id="E"><h2>Семплирование</h2><p>Тот же голос и текст при разных temperature и CFG (classifier-free guidance). По умолчанию temperature 0.8 / CFG 1.5.</p><p class="muted">Промпт: Женский голос 1 <audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/prompt_f1.mp3"></audio></p><p class="text">«Добрый день. Сегодня расскажу, как устроен потоковый синтез речи: модель начинает говорить, не дожидаясь конца фразы.»</p><div class="tbl"><table><thead><tr><th>Параметр</th><th>Синтез</th></tr></thead><tbody><tr><td class="lbl">temperature 0.8, CFG 1.5 (по умолчанию) <span class="muted">(10.6 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/A_f1.mp3"></audio></td></tr><tr><td class="lbl">CFG 1.0 (без guidance) <span class="muted">(11.2 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/E_default_cfg1.0.mp3"></audio></td></tr><tr><td class="lbl">CFG 3.0 <span class="muted">(10.9 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/E_default_cfg3.0.mp3"></audio></td></tr><tr><td class="lbl">temperature 0.6 <span class="muted">(10.6 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/E_default_t0.6.mp3"></audio></td></tr><tr><td class="lbl">temperature 1.0 <span class="muted">(11.5 с)</span></td><td><audio controls preload="none" src="https://huggingface.co/spaces/simba9/voxtream2-ru/resolve/main/samples/E_default_t1.0.mp3"></audio></td></tr></tbody></table></div></section>
19
  <hr><p class="muted">Модель опубликована в научных целях под лицензией OpenRAIL-M; клонирование голоса реальных людей без их согласия запрещено.
20
  Промпты — фрагменты открытых датасетов, использованы только для демонстрации.</p>
21
  </body></html>