# Голос Владимира Еремина — TTS (F5-TTS_RUSSIAN) Zero-shot клон голоса диктора **Владимира Еремина** (рекламные ролики ЖК «Лайф Варшавская», «Ес-резиденс» от группы «Пионер»). Работает на **CPU и GPU**, с полной нормализацией чисел, дат и процентов. ## Состав набора | Файл | Назначение | |------|-----------| | [`ref_eremin.wav`](ref_eremin.wav) | Референс-аудио (10 сек чистого голоса, 24kHz) | | [`eremin_tts.py`](eremin_tts.py) | Скрипт синтеза (нормализация + разбиение) | ## Установка ```bash pip install f5-tts num2words soundfile torch torchaudio ``` Русская модель скачается автоматически с Hugging Face: `Misha24-10/F5-TTS_RUSSIAN` (~1.3GB, первый запуск). ## Использование ```bash # Простая озвучка python eremin_tts.py "Добрый день! Это Владимир Еремин." # С числами (нормализация автоматическая) python eremin_tts.py "Квартира стоит 129 990 рублей, скидка 25%. Дата 15.03.2025." # Настройки python eremin_tts.py "Текст" --out result.wav --speed 1.2 --steps 64 ``` ## Нормализация (встроенная) | Ввод | Произносится | |------|-------------| | `129 990` | сто двадцать девять тысяч девятьсот девяносто | | `25%` | двадцать пять процентов | | `2024` | две тысячи двадцать четыре | | `15.03.2025` | пятнадцатое марта две тысячи двадцать пятого года | | `3.12` | три точка двенадцать (версии) | Разбиение на предложения по `. ; ! ?` и переносам строк — каждое синтезируется отдельно и склеивается. ## Ограничения - Англицизмы (Python, iPhone) произносятся русской транскрипцией («пайсон», «айфон») — для точных брендов пишите фонетически. ## Лицензия Голос — личные аудиоданные. Код — MIT. ## Связанное - База: [Misha24-10/F5-TTS_RUSSIAN](https://huggingface.co/Misha24-10/F5-TTS_RUSSIAN) - Автор клона: [Dimitrius174](https://huggingface.co/Dimitrius174)