TriLingDATA/SinhalaTTS_4speaker
Viewer • Updated • 5.52k • 14
Coqui-TTS VITS trained on TriLingDATA/SinhalaTTS_4speaker (10.057 h train), character-level Sinhala input.
Initialised from: vctk (coqui tts_models/en/vctk/vits acoustic layers; new Sinhala character + speaker embeddings).
Exported from checkpoint_50374.pth at step 50374. Speakers: Dinithi, Harini, Isuru, Yasindu.
Text is normalised by sinhala_text.normalise() (NFC, zero-width joiners removed, quote/dash cleanup).
Always use it at inference -- infer_vits.py does this for you.
# pip install "coqui-tts[codec]" "transformers>=4.57,<5" "huggingface_hub<1.0"
from huggingface_hub import snapshot_download
import sys, soundfile as sf
d = snapshot_download("TriLinSL/vits-sinhala-4speaker", allow_patterns=["*.py", "*.json", "model.pth"])
sys.path.insert(0, d)
from infer_vits import SinhalaVITS
tts = SinhalaVITS.from_dir(d)
wav = tts.tts("ආයුබෝවන්! ඔබ කොහොමද?", speaker="Dinithi")
sf.write("out.wav", wav, tts.sample_rate)
| speaker | text | sample |
|---|---|---|
| Dinithi | ආයුබෝවන්! ඔබ කොහොමද? | samples/Dinithi_0.wav |
| Dinithi | අද කාලගුණය ඉතා හොඳයි. | samples/Dinithi_1.wav |
| Dinithi | ශ්රී ලංකාව ලස්සන රටකි. | samples/Dinithi_2.wav |
| Harini | ආයුබෝවන්! ඔබ කොහොමද? | samples/Harini_0.wav |
| Harini | අද කාලගුණය ඉතා හොඳයි. | samples/Harini_1.wav |
| Harini | ශ්රී ලංකාව ලස්සන රටකි. | samples/Harini_2.wav |
| Isuru | ආයුබෝවන්! ඔබ කොහොමද? | samples/Isuru_0.wav |
| Isuru | අද කාලගුණය ඉතා හොඳයි. | samples/Isuru_1.wav |
| Isuru | ශ්රී ලංකාව ලස්සන රටකි. | samples/Isuru_2.wav |
| Yasindu | ආයුබෝවන්! ඔබ කොහොමද? | samples/Yasindu_0.wav |
| Yasindu | අද කාලගුණය ඉතා හොඳයි. | samples/Yasindu_1.wav |
| Yasindu | ශ්රී ලංකාව ලස්සන රටකි. | samples/Yasindu_2.wav |
Training resume state lives in last_checkpoint/; TensorBoard logs in runs/.