Text-to-Speech
VoxCPM
Laz
Turkish
tts
speech-synthesis
audio
laz
lazca
lazuri
lora
low-resource
endangered-languages
turkey
mozilla-common-voice
Instructions to use Anadilorg/MozilLaz with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- VoxCPM
How to use Anadilorg/MozilLaz with VoxCPM:
import soundfile as sf from voxcpm import VoxCPM model = VoxCPM.from_pretrained("Anadilorg/MozilLaz") wav = model.generate( text="VoxCPM is an innovative end-to-end TTS model from ModelBest, designed to generate highly expressive speech.", prompt_wav_path=None, # optional: path to a prompt speech for voice cloning prompt_text=None, # optional: reference text cfg_value=2.0, # LM guidance on LocDiT, higher for better adherence to the prompt, but maybe worse inference_timesteps=10, # LocDiT inference timesteps, higher for better result, lower for fast speed normalize=True, # enable external TN tool denoise=True, # enable external Denoise tool retry_badcase=True, # enable retrying mode for some bad cases (unstoppable) retry_badcase_max_times=3, # maximum retrying times retry_badcase_ratio_threshold=6.0, # maximum length restriction for bad case detection (simple but effective), it could be adjusted for slow pace speech ) sf.write("output.wav", wav, 16000) print("saved: output.wav") - Notebooks
- Google Colab
- Kaggle
File size: 5,359 Bytes
3f5cb06 109e5bc f0eaf74 3f5cb06 a75e3ff f0eaf74 a75e3ff f0eaf74 109e5bc f0eaf74 a75e3ff 3f5cb06 f0eaf74 3f5cb06 f0eaf74 a75e3ff 3f5cb06 a75e3ff 3f5cb06 a75e3ff 3f5cb06 f0eaf74 3f5cb06 f0eaf74 109e5bc a75e3ff 3f5cb06 a75e3ff 109e5bc 3f5cb06 109e5bc 3f5cb06 7e46847 3f5cb06 9f0d55f | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 67 68 69 70 71 72 73 74 75 76 77 78 79 80 81 82 83 84 85 86 87 88 89 90 91 92 93 94 95 96 97 98 99 100 101 102 103 104 105 106 107 108 109 110 111 112 113 114 115 116 117 118 119 120 121 122 123 124 125 126 127 128 129 130 131 132 133 134 135 136 137 138 139 140 141 142 143 144 | ---
license: mit
language:
- lzz
- tr
library_name: voxcpm
pipeline_tag: text-to-speech
base_model: openbmb/VoxCPM2
base_model_relation: adapter
tags:
- text-to-speech
- tts
- speech-synthesis
- audio
- laz
- lazca
- lazuri
- voxcpm
- lora
- low-resource
- endangered-languages
- turkey
- mozilla-common-voice
---
# MozilLaz — Lazcanın Açık Kaynak Text-to-Speech Modeli
**MozilLaz**, [openbmb/VoxCPM2](https://huggingface.co/openbmb/VoxCPM2) temel modeli üzerine **LoRA** (Low-Rank Adaptation) ile ince ayar yapılmış, **Lazca (Lazuri, ISO 639-3: `lzz`)** için açık kaynak bir konuşma sentezi (text-to-speech) modelidir. Mozilla'nın açık kaynak Lazca ses veri setlerinden derlenen ~21.000 segment ile eğitilmiştir.
*MozilLaz is an open-source text-to-speech LoRA adapter for the Laz language (`lzz`), fine-tuned on top of [VoxCPM2](https://huggingface.co/openbmb/VoxCPM2) using ~21k segments from Mozilla's open Laz speech data. Try it live in the [🚀 Space demo](https://huggingface.co/spaces/Anadilorg/MozilLaz-demo) (ZeroGPU).*
👉 **Canlı demo (ZeroGPU):** [Anadilorg/MozilLaz-demo](https://huggingface.co/spaces/Anadilorg/MozilLaz-demo)
## 🔊 Örnek Sesler
| # | Metin | Ses |
|---|---|---|
| 1 | Mehmet manişa dulya komenç̌elu do oxorimuşişa igzalu. | <audio controls preload="none" src="https://huggingface.co/Anadilorg/MozilLaz/resolve/main/sample/1.wav"></audio> |
| 2 | Mektebişa oxtimu na gyoç̆ǩu orape var şuns. | <audio controls preload="none" src="https://huggingface.co/Anadilorg/MozilLaz/resolve/main/sample/2.wav"></audio> |
| 3 | Ngolaşa uluri? | <audio controls preload="none" src="https://huggingface.co/Anadilorg/MozilLaz/resolve/main/sample/3.wav"></audio> |
| 4 | --- | <audio controls preload="none" src="https://huggingface.co/Anadilorg/MozilLaz/resolve/main/sample/4.wav"></audio> |
| 5 | Xelaǩaoba, manebrape! | <audio controls preload="none" src="https://huggingface.co/Anadilorg/MozilLaz/resolve/main/sample/5.wav"></audio> |
## 📋 Model Bilgileri
| Özellik | Detay |
|---|---|
| Dil | Lazca (`lzz`) |
| Konuşucu | `spk_tmp_001` (Mozilla Lazca veri setinden) |
| Temel model | [openbmb/VoxCPM2](https://huggingface.co/openbmb/VoxCPM2) |
| Yöntem | LoRA (r=32, α=32, LM + DiT katmanları) |
| Eğitim verisi | ~21.071 segment — Mozilla açık kaynak Lazca veri setleri |
| Eğitim adımı | 2.000 |
| Adapter boyutu | ~70 MB (18,1M parametre, F32) |
| Sample rate | 16 kHz giriş / 48 kHz çıkış |
| Lisans | MIT |
## ⚡ Hızlı Başlangıç
```bash
pip install torch torchaudio soundfile safetensors numpy voxcpm
git clone https://huggingface.co/Anadilorg/MozilLaz
cd MozilLaz
python inference.py --text "[speaker:spk_tmp_001 language:lzz] Ngolaşa uluri?"
```
### Python API
```python
from voxcpm import VoxCPM
from voxcpm.model.voxcpm import LoRAConfig
import json, soundfile as sf
lora_cfg_dict = json.load(open("lora_config.json"))["lora_config"]
lora_cfg = LoRAConfig(**{k: v for k, v in lora_cfg_dict.items() if k in LoRAConfig.model_fields})
model = VoxCPM.from_pretrained(
"openbmb/VoxCPM2",
load_denoiser=False,
lora_config=lora_cfg,
lora_weights_path="lora_weights.safetensors",
device="cuda", # veya "mps" / "cpu"
)
model.load_lora("lora_weights.safetensors")
audio = model.generate(
text="[speaker:spk_tmp_001 language:lzz] Ngolaşa uluri?",
inference_timesteps=10,
cfg_value=2.0,
)
sf.write("output.wav", audio, 48000)
```
### Gradio arayüzü (yerel)
```bash
pip install gradio
python demo.py
```
Tarayıcı olmadan denemek isterseniz, aşağıdaki **ZeroGPU destekli Space**'i kullanabilirsiniz — kurulum gerekmez:
👉 **https://huggingface.co/spaces/Anadilorg/MozilLaz-demo**
## 🧩 Metin Formatı
Girdi metni şu formatta olmalı: `[speaker:spk_tmp_001 language:lzz] <metin>`
## 🖥️ Donanım Gereksinimleri
- Disk: ~4,7 GB (VoxCPM2 temel model + LoRA ağırlıkları)
- RAM/VRAM: float32 çıkarım için ~9 GB; CUDA GPU'da bfloat16 ile daha az
- CUDA GPU önerilir; Apple Silicon (≥24 GB birleşik bellek) desteklenir ama daha yavaştır
## ⚠️ Sınırlamalar
- Tek konuşucu (`spk_tmp_001`) ile eğitilmiştir; ses klonlama için ayrıca fine-tuning gerekir.
- ~21K segmentlik göreli küçük bir veri setiyle eğitildiğinden, uzun/nadir kelimelerde telaffuz tutarsızlıkları olabilir.
- Model, VoxCPM2'nin `voxcpm` paketine bağımlıdır; Hugging Face'in otomatik Inference API/widget'ı bu özel kütüphaneyi desteklemediği için model sayfasında canlı bir "Hosted inference" widget'ı **görünmez** — bunun yerine yukarıdaki ZeroGPU Space'i kullanın.
## 📚 Kaynaklar
- Temel model: [openbmb/VoxCPM2](https://huggingface.co/openbmb/VoxCPM2)
- LoRA yöntemi: [Hu et al., 2021 — LoRA: Low-Rank Adaptation of Large Language Models](https://huggingface.co/papers/2106.09685)
- Eğitim verisi: Mozilla'nın açık kaynak Lazca ses veri setleri
## 📄 Lisans
MIT — bkz. [LICENSE](LICENSE)
## 🤝 Katkı ve İletişim
Sorun, geri bildirim veya katkı için lütfen bu deponun **Community/Discussions** sekmesini kullanın.
## Citation
```bibtex
@misc{mozillaz2026,
title = {MozilLaz: An Open-Source Text-to-Speech LoRA Adapter for the Laz Language},
author = {Anadilorg},
year = {2026},
howpublished = {\url{https://huggingface.co/Anadilorg/MozilLaz}}
}
``` |