voice-tts / README.md
Dimitrius174's picture
Голос Владимира Еремина: референс + скрипт F5-TTS с нормализацией
519256c verified
|
Raw
History Blame Contribute Delete
2.65 kB

Голос Владимира Еремина — TTS (F5-TTS_RUSSIAN)

Zero-shot клон голоса диктора Владимира Еремина (рекламные ролики ЖК «Лайф Варшавская», «Ес-резиденс» от группы «Пионер»).

Работает на CPU и GPU, с полной нормализацией чисел, дат и процентов.

Состав набора

Файл Назначение
ref_eremin.wav Референс-аудио (10 сек чистого голоса, 24kHz)
eremin_tts.py Скрипт синтеза (нормализация + разбиение)

Установка

pip install f5-tts num2words soundfile torch torchaudio

Русская модель скачается автоматически с Hugging Face: Misha24-10/F5-TTS_RUSSIAN (~1.3GB, первый запуск).

Использование

# Простая озвучка
python eremin_tts.py "Добрый день! Это Владимир Еремин."

# С числами (нормализация автоматическая)
python eremin_tts.py "Квартира стоит 129 990 рублей, скидка 25%. Дата 15.03.2025."

# Настройки
python eremin_tts.py "Текст" --out result.wav --speed 1.2 --steps 64

Нормализация (встроенная)

Ввод Произносится
129 990 сто двадцать девять тысяч девятьсот девяносто
25% двадцать пять процентов
2024 две тысячи двадцать четыре
15.03.2025 пятнадцатое марта две тысячи двадцать пятого года
3.12 три точка двенадцать (версии)

Разбиение на предложения по . ; ! ? и переносам строк — каждое синтезируется отдельно и склеивается.

Ограничения

  • Англицизмы (Python, iPhone) произносятся русской транскрипцией («пайсон», «айфон») — для точных брендов пишите фонетически.

Лицензия

Голос — личные аудиоданные. Код — MIT.

Связанное