Instructions to use ArtShtorm/Shtorm-PocketTTS-RU with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Pocket-TTS
How to use ArtShtorm/Shtorm-PocketTTS-RU with Pocket-TTS:
from pocket_tts import TTSModel import scipy.io.wavfile tts_model = TTSModel.load_model("ArtShtorm/Shtorm-PocketTTS-RU") voice_state = tts_model.get_state_for_audio_prompt( "hf://kyutai/tts-voices/alba-mackenna/casual.wav" ) audio = tts_model.generate_audio(voice_state, "Hello world, this is a test.") # Audio is a 1D torch tensor containing PCM data. scipy.io.wavfile.write("output.wav", tts_model.sample_rate, audio.numpy()) - Notebooks
- Google Colab
- Kaggle
Shtorm-PocketTTS-RU v2 «версия 2, 01.10.2026»
Русская модель для pocket-tts (Kyutai), заточенная под чтение книг: ровная книжная подача, живая интонация, клонирование голоса по короткому рефу.
- архитектура оригинального pocket-tts: 6 слоёв, ~100M параметров — быстро и на CPU;
- токенизатор SentencePiece на русском корпусе (4000 токенов), общий для обеих моделей.
Две модели: fast и slow
Разница в подаче, а не в качестве:
- fast (
config_fast.yaml, он жеconfig.yaml) — бодрее и живее: шире интонация, медленные голоса не тянут. На быстрых голосах может строчить. - slow (
config_slow.yaml) — спокойнее: свободнее паузы, ровнее тон. На медленных голосах может тянуть.
На одной и той же главе разница около 7% по времени (11:01 против 11:48). Какая лучше — зависит от голоса и вкуса, попробуйте обе.
Предыдущие версии
v1 (26.09.2026) — первая версия: спокойная, размеренная книжная подача. Подача спокойнее и ровнее, чем у v2, но на медленных голосах и длинных фразах может «тянуть» и затухать к концу куска. Если она вам нравилась больше — она никуда не делась:
- файлы в папке
v1/, запуск черезv1/config.yaml; - или целиком прежнее состояние репозитория по тегу
v1.
Токенизатор у v1 и v2 одинаковый.
Цифры
7 голосов x 5 сидов, книжный абзац / диалог:
| CER (разборчивость) | UTMOS (качество звука) | обрывы |
|---|---|---|
| 1.6% / 4.0% | 3.64 / 3.52 | 0 из 70 |
Запуск
from pocket_tts import TTSModel
import scipy.io.wavfile
model = TTSModel.load_model(config="hf://ArtShtorm/Shtorm-PocketTTS-RU/config.yaml")
voice = model.get_state_for_audio_prompt("my_voice.wav")
audio = model.generate_audio(voice, "Се́рое не́бо висе́ло над го́родом.")
scipy.io.wavfile.write("out.wav", model.sample_rate, audio.numpy())
Советы:
- ударения — знаком акута (U+0301), как в примере: модель училась на размеченном тексте;
- реф — 5 с чистой речи, законченная фраза: модель копирует из него тембр, темп и полосу;
- куски до ~120-180 знаков: на длинных громкость к концу проседает.
- Латиница пока не поддерживается — английские слова и цифры перед синтезом нужно нормализовать (записать по-русски). Поддержка латиницы — в планах.
Ограничения
- паузы на знаках препинания местами длинноваты;
- на длинных кусках — затухание громкости (лечится выравниванием громкости на выходе).
Лицензия и использование
CC-BY-4.0. Основа — Kyutai pocket-tts © Kyutai Labs. Клонирование голоса — только с явного согласия его владельца; не использовать для выдачи себя за другого человека, дезинформации и иного вредного или незаконного использования.
- Downloads last month
- -
Model tree for ArtShtorm/Shtorm-PocketTTS-RU
Base model
kyutai/pocket-tts