Text-to-Speech
VoxCPM
Laz
Turkish
tts
speech-synthesis
audio
laz
lazca
lazuri
lora
low-resource
endangered-languages
turkey
mozilla-common-voice
Instructions to use Anadilorg/MozilLaz with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- VoxCPM
How to use Anadilorg/MozilLaz with VoxCPM:
import soundfile as sf from voxcpm import VoxCPM model = VoxCPM.from_pretrained("Anadilorg/MozilLaz") wav = model.generate( text="VoxCPM is an innovative end-to-end TTS model from ModelBest, designed to generate highly expressive speech.", prompt_wav_path=None, # optional: path to a prompt speech for voice cloning prompt_text=None, # optional: reference text cfg_value=2.0, # LM guidance on LocDiT, higher for better adherence to the prompt, but maybe worse inference_timesteps=10, # LocDiT inference timesteps, higher for better result, lower for fast speed normalize=True, # enable external TN tool denoise=True, # enable external Denoise tool retry_badcase=True, # enable retrying mode for some bad cases (unstoppable) retry_badcase_max_times=3, # maximum retrying times retry_badcase_ratio_threshold=6.0, # maximum length restriction for bad case detection (simple but effective), it could be adjusted for slow pace speech ) sf.write("output.wav", wav, 16000) print("saved: output.wav") - Notebooks
- Google Colab
- Kaggle
| license: mit | |
| language: | |
| - lzz | |
| - tr | |
| library_name: voxcpm | |
| pipeline_tag: text-to-speech | |
| base_model: openbmb/VoxCPM2 | |
| base_model_relation: adapter | |
| tags: | |
| - text-to-speech | |
| - tts | |
| - speech-synthesis | |
| - audio | |
| - laz | |
| - lazca | |
| - lazuri | |
| - voxcpm | |
| - lora | |
| - low-resource | |
| - endangered-languages | |
| - turkey | |
| - mozilla-common-voice | |
| # MozilLaz — Lazcanın Açık Kaynak Text-to-Speech Modeli | |
| **MozilLaz**, [openbmb/VoxCPM2](https://huggingface.co/openbmb/VoxCPM2) temel modeli üzerine **LoRA** (Low-Rank Adaptation) ile ince ayar yapılmış, **Lazca (Lazuri, ISO 639-3: `lzz`)** için açık kaynak bir konuşma sentezi (text-to-speech) modelidir. Mozilla'nın açık kaynak Lazca ses veri setlerinden derlenen ~21.000 segment ile eğitilmiştir. | |
| *MozilLaz is an open-source text-to-speech LoRA adapter for the Laz language (`lzz`), fine-tuned on top of [VoxCPM2](https://huggingface.co/openbmb/VoxCPM2) using ~21k segments from Mozilla's open Laz speech data. Try it live in the [🚀 Space demo](https://huggingface.co/spaces/Anadilorg/MozilLaz-demo) (ZeroGPU).* | |
| 👉 **Canlı demo (ZeroGPU):** [Anadilorg/MozilLaz-demo](https://huggingface.co/spaces/Anadilorg/MozilLaz-demo) | |
| ## 🔊 Örnek Sesler | |
| | # | Metin | Ses | | |
| |---|---|---| | |
| | 1 | Mehmet manişa dulya komenç̌elu do oxorimuşişa igzalu. | <audio controls preload="none" src="https://huggingface.co/Anadilorg/MozilLaz/resolve/main/sample/1.wav"></audio> | | |
| | 2 | Mektebişa oxtimu na gyoç̆ǩu orape var şuns. | <audio controls preload="none" src="https://huggingface.co/Anadilorg/MozilLaz/resolve/main/sample/2.wav"></audio> | | |
| | 3 | Ngolaşa uluri? | <audio controls preload="none" src="https://huggingface.co/Anadilorg/MozilLaz/resolve/main/sample/3.wav"></audio> | | |
| | 4 | --- | <audio controls preload="none" src="https://huggingface.co/Anadilorg/MozilLaz/resolve/main/sample/4.wav"></audio> | | |
| | 5 | Xelaǩaoba, manebrape! | <audio controls preload="none" src="https://huggingface.co/Anadilorg/MozilLaz/resolve/main/sample/5.wav"></audio> | | |
| ## 📋 Model Bilgileri | |
| | Özellik | Detay | | |
| |---|---| | |
| | Dil | Lazca (`lzz`) | | |
| | Konuşucu | `spk_tmp_001` (Mozilla Lazca veri setinden) | | |
| | Temel model | [openbmb/VoxCPM2](https://huggingface.co/openbmb/VoxCPM2) | | |
| | Yöntem | LoRA (r=32, α=32, LM + DiT katmanları) | | |
| | Eğitim verisi | ~21.071 segment — Mozilla açık kaynak Lazca veri setleri | | |
| | Eğitim adımı | 2.000 | | |
| | Adapter boyutu | ~70 MB (18,1M parametre, F32) | | |
| | Sample rate | 16 kHz giriş / 48 kHz çıkış | | |
| | Lisans | MIT | | |
| ## ⚡ Hızlı Başlangıç | |
| ```bash | |
| pip install torch torchaudio soundfile safetensors numpy voxcpm | |
| git clone https://huggingface.co/Anadilorg/MozilLaz | |
| cd MozilLaz | |
| python inference.py --text "[speaker:spk_tmp_001 language:lzz] Ngolaşa uluri?" | |
| ``` | |
| ### Python API | |
| ```python | |
| from voxcpm import VoxCPM | |
| from voxcpm.model.voxcpm import LoRAConfig | |
| import json, soundfile as sf | |
| lora_cfg_dict = json.load(open("lora_config.json"))["lora_config"] | |
| lora_cfg = LoRAConfig(**{k: v for k, v in lora_cfg_dict.items() if k in LoRAConfig.model_fields}) | |
| model = VoxCPM.from_pretrained( | |
| "openbmb/VoxCPM2", | |
| load_denoiser=False, | |
| lora_config=lora_cfg, | |
| lora_weights_path="lora_weights.safetensors", | |
| device="cuda", # veya "mps" / "cpu" | |
| ) | |
| model.load_lora("lora_weights.safetensors") | |
| audio = model.generate( | |
| text="[speaker:spk_tmp_001 language:lzz] Ngolaşa uluri?", | |
| inference_timesteps=10, | |
| cfg_value=2.0, | |
| ) | |
| sf.write("output.wav", audio, 48000) | |
| ``` | |
| ### Gradio arayüzü (yerel) | |
| ```bash | |
| pip install gradio | |
| python demo.py | |
| ``` | |
| Tarayıcı olmadan denemek isterseniz, aşağıdaki **ZeroGPU destekli Space**'i kullanabilirsiniz — kurulum gerekmez: | |
| 👉 **https://huggingface.co/spaces/Anadilorg/MozilLaz-demo** | |
| ## 🧩 Metin Formatı | |
| Girdi metni şu formatta olmalı: `[speaker:spk_tmp_001 language:lzz] <metin>` | |
| ## 🖥️ Donanım Gereksinimleri | |
| - Disk: ~4,7 GB (VoxCPM2 temel model + LoRA ağırlıkları) | |
| - RAM/VRAM: float32 çıkarım için ~9 GB; CUDA GPU'da bfloat16 ile daha az | |
| - CUDA GPU önerilir; Apple Silicon (≥24 GB birleşik bellek) desteklenir ama daha yavaştır | |
| ## ⚠️ Sınırlamalar | |
| - Tek konuşucu (`spk_tmp_001`) ile eğitilmiştir; ses klonlama için ayrıca fine-tuning gerekir. | |
| - ~21K segmentlik göreli küçük bir veri setiyle eğitildiğinden, uzun/nadir kelimelerde telaffuz tutarsızlıkları olabilir. | |
| - Model, VoxCPM2'nin `voxcpm` paketine bağımlıdır; Hugging Face'in otomatik Inference API/widget'ı bu özel kütüphaneyi desteklemediği için model sayfasında canlı bir "Hosted inference" widget'ı **görünmez** — bunun yerine yukarıdaki ZeroGPU Space'i kullanın. | |
| ## 📚 Kaynaklar | |
| - Temel model: [openbmb/VoxCPM2](https://huggingface.co/openbmb/VoxCPM2) | |
| - LoRA yöntemi: [Hu et al., 2021 — LoRA: Low-Rank Adaptation of Large Language Models](https://huggingface.co/papers/2106.09685) | |
| - Eğitim verisi: Mozilla'nın açık kaynak Lazca ses veri setleri | |
| ## 📄 Lisans | |
| MIT — bkz. [LICENSE](LICENSE) | |
| ## 🤝 Katkı ve İletişim | |
| Sorun, geri bildirim veya katkı için lütfen bu deponun **Community/Discussions** sekmesini kullanın. | |
| ## Citation | |
| ```bibtex | |
| @misc{mozillaz2026, | |
| title = {MozilLaz: An Open-Source Text-to-Speech LoRA Adapter for the Laz Language}, | |
| author = {Anadilorg}, | |
| year = {2026}, | |
| howpublished = {\url{https://huggingface.co/Anadilorg/MozilLaz}} | |
| } | |
| ``` |