Sinhala multi-speaker VITS (4 speakers)

Coqui-TTS VITS trained on TriLingDATA/SinhalaTTS_4speaker (10.057 h train), character-level Sinhala input. Initialised from: vctk (coqui tts_models/en/vctk/vits acoustic layers; new Sinhala character + speaker embeddings). Exported from checkpoint_50374.pth at step 50374. Speakers: Dinithi, Harini, Isuru, Yasindu.

Text is normalised by sinhala_text.normalise() (NFC, zero-width joiners removed, quote/dash cleanup). Always use it at inference -- infer_vits.py does this for you.

# pip install "coqui-tts[codec]" "transformers>=4.57,<5" "huggingface_hub<1.0"
from huggingface_hub import snapshot_download
import sys, soundfile as sf
d = snapshot_download("TriLinSL/vits-sinhala-4speaker", allow_patterns=["*.py", "*.json", "model.pth"])
sys.path.insert(0, d)
from infer_vits import SinhalaVITS
tts = SinhalaVITS.from_dir(d)
wav = tts.tts("ආයුබෝවන්! ඔබ කොහොමද?", speaker="Dinithi")
sf.write("out.wav", wav, tts.sample_rate)
speaker text sample
Dinithi ආයුබෝවන්! ඔබ කොහොමද? samples/Dinithi_0.wav
Dinithi අද කාලගුණය ඉතා හොඳයි. samples/Dinithi_1.wav
Dinithi ශ්‍රී ලංකාව ලස්සන රටකි. samples/Dinithi_2.wav
Harini ආයුබෝවන්! ඔබ කොහොමද? samples/Harini_0.wav
Harini අද කාලගුණය ඉතා හොඳයි. samples/Harini_1.wav
Harini ශ්‍රී ලංකාව ලස්සන රටකි. samples/Harini_2.wav
Isuru ආයුබෝවන්! ඔබ කොහොමද? samples/Isuru_0.wav
Isuru අද කාලගුණය ඉතා හොඳයි. samples/Isuru_1.wav
Isuru ශ්‍රී ලංකාව ලස්සන රටකි. samples/Isuru_2.wav
Yasindu ආයුබෝවන්! ඔබ කොහොමද? samples/Yasindu_0.wav
Yasindu අද කාලගුණය ඉතා හොඳයි. samples/Yasindu_1.wav
Yasindu ශ්‍රී ලංකාව ලස්සන රටකි. samples/Yasindu_2.wav

Training resume state lives in last_checkpoint/; TensorBoard logs in runs/.

Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Dataset used to train TriLinSL/vits-sinhala-4speaker