| # Голос Владимира Еремина — TTS (F5-TTS_RUSSIAN) |
| |
| Zero-shot клон голоса диктора **Владимира Еремина** (рекламные ролики ЖК «Лайф |
| Варшавская», «Ес-резиденс» от группы «Пионер»). |
| |
| Работает на **CPU и GPU**, с полной нормализацией чисел, дат и процентов. |
| |
| ## Состав набора |
| | Файл | Назначение | |
| |------|-----------| |
| | [`ref_eremin.wav`](ref_eremin.wav) | Референс-аудио (10 сек чистого голоса, 24kHz) | |
| | [`eremin_tts.py`](eremin_tts.py) | Скрипт синтеза (нормализация + разбиение) | |
| |
| ## Установка |
| ```bash |
| pip install f5-tts num2words soundfile torch torchaudio |
| ``` |
| Русская модель скачается автоматически с Hugging Face: |
| `Misha24-10/F5-TTS_RUSSIAN` (~1.3GB, первый запуск). |
|
|
| ## Использование |
| ```bash |
| # Простая озвучка |
| python eremin_tts.py "Добрый день! Это Владимир Еремин." |
| |
| # С числами (нормализация автоматическая) |
| python eremin_tts.py "Квартира стоит 129 990 рублей, скидка 25%. Дата 15.03.2025." |
| |
| # Настройки |
| python eremin_tts.py "Текст" --out result.wav --speed 1.2 --steps 64 |
| ``` |
|
|
| ## Нормализация (встроенная) |
| | Ввод | Произносится | |
| |------|-------------| |
| | `129 990` | сто двадцать девять тысяч девятьсот девяносто | |
| | `25%` | двадцать пять процентов | |
| | `2024` | две тысячи двадцать четыре | |
| | `15.03.2025` | пятнадцатое марта две тысячи двадцать пятого года | |
| | `3.12` | три точка двенадцать (версии) | |
|
|
| Разбиение на предложения по `. ; ! ?` и переносам строк — каждое |
| синтезируется отдельно и склеивается. |
|
|
| ## Ограничения |
| - Англицизмы (Python, iPhone) произносятся русской транскрипцией |
| («пайсон», «айфон») — для точных брендов пишите фонетически. |
|
|
| ## Лицензия |
| Голос — личные аудиоданные. Код — MIT. |
|
|
| ## Связанное |
| - База: [Misha24-10/F5-TTS_RUSSIAN](https://huggingface.co/Misha24-10/F5-TTS_RUSSIAN) |
| - Автор клона: [Dimitrius174](https://huggingface.co/Dimitrius174) |
|
|