Instructions to use Anadilorg/MozilLaz with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- VoxCPM
How to use Anadilorg/MozilLaz with VoxCPM:
import soundfile as sf from voxcpm import VoxCPM model = VoxCPM.from_pretrained("Anadilorg/MozilLaz") wav = model.generate( text="VoxCPM is an innovative end-to-end TTS model from ModelBest, designed to generate highly expressive speech.", prompt_wav_path=None, # optional: path to a prompt speech for voice cloning prompt_text=None, # optional: reference text cfg_value=2.0, # LM guidance on LocDiT, higher for better adherence to the prompt, but maybe worse inference_timesteps=10, # LocDiT inference timesteps, higher for better result, lower for fast speed normalize=True, # enable external TN tool denoise=True, # enable external Denoise tool retry_badcase=True, # enable retrying mode for some bad cases (unstoppable) retry_badcase_max_times=3, # maximum retrying times retry_badcase_ratio_threshold=6.0, # maximum length restriction for bad case detection (simple but effective), it could be adjusted for slow pace speech ) sf.write("output.wav", wav, 16000) print("saved: output.wav") - Notebooks
- Google Colab
- Kaggle
license: mit
language:
- lzz
- tr
library_name: voxcpm
pipeline_tag: text-to-speech
base_model: openbmb/VoxCPM2
base_model_relation: adapter
tags:
- text-to-speech
- tts
- speech-synthesis
- audio
- laz
- lazca
- lazuri
- voxcpm
- lora
- low-resource
- endangered-languages
- turkey
- mozilla-common-voice
MozilLaz — Lazcanın Açık Kaynak Text-to-Speech Modeli
MozilLaz, openbmb/VoxCPM2 temel modeli üzerine LoRA (Low-Rank Adaptation) ile ince ayar yapılmış, Lazca (Lazuri, ISO 639-3: lzz) için açık kaynak bir konuşma sentezi (text-to-speech) modelidir. Mozilla'nın açık kaynak Lazca ses veri setlerinden derlenen ~21.000 segment ile eğitilmiştir.
MozilLaz is an open-source text-to-speech LoRA adapter for the Laz language (lzz), fine-tuned on top of VoxCPM2 using ~21k segments from Mozilla's open Laz speech data. Try it live in the 🚀 Space demo (ZeroGPU).
👉 Canlı demo (ZeroGPU): Anadilorg/MozilLaz-demo
🔊 Örnek Sesler
| # | Metin | Ses |
|---|---|---|
| 1 | Mehmet manişa dulya komenç̌elu do oxorimuşişa igzalu. | |
| 2 | Mektebişa oxtimu na gyoç̆ǩu orape var şuns. | |
| 3 | Ngolaşa uluri? | |
| 4 | --- | |
| 5 | Xelaǩaoba, manebrape! |
📋 Model Bilgileri
| Özellik | Detay |
|---|---|
| Dil | Lazca (lzz) |
| Konuşucu | spk_tmp_001 (Mozilla Lazca veri setinden) |
| Temel model | openbmb/VoxCPM2 |
| Yöntem | LoRA (r=32, α=32, LM + DiT katmanları) |
| Eğitim verisi | ~21.071 segment — Mozilla açık kaynak Lazca veri setleri |
| Eğitim adımı | 2.000 |
| Adapter boyutu | ~70 MB (18,1M parametre, F32) |
| Sample rate | 16 kHz giriş / 48 kHz çıkış |
| Lisans | MIT |
⚡ Hızlı Başlangıç
pip install torch torchaudio soundfile safetensors numpy voxcpm
git clone https://huggingface.co/Anadilorg/MozilLaz
cd MozilLaz
python inference.py --text "[speaker:spk_tmp_001 language:lzz] Ngolaşa uluri?"
Python API
from voxcpm import VoxCPM
from voxcpm.model.voxcpm import LoRAConfig
import json, soundfile as sf
lora_cfg_dict = json.load(open("lora_config.json"))["lora_config"]
lora_cfg = LoRAConfig(**{k: v for k, v in lora_cfg_dict.items() if k in LoRAConfig.model_fields})
model = VoxCPM.from_pretrained(
"openbmb/VoxCPM2",
load_denoiser=False,
lora_config=lora_cfg,
lora_weights_path="lora_weights.safetensors",
device="cuda", # veya "mps" / "cpu"
)
model.load_lora("lora_weights.safetensors")
audio = model.generate(
text="[speaker:spk_tmp_001 language:lzz] Ngolaşa uluri?",
inference_timesteps=10,
cfg_value=2.0,
)
sf.write("output.wav", audio, 48000)
Gradio arayüzü (yerel)
pip install gradio
python demo.py
Tarayıcı olmadan denemek isterseniz, aşağıdaki ZeroGPU destekli Space'i kullanabilirsiniz — kurulum gerekmez: 👉 https://huggingface.co/spaces/Anadilorg/MozilLaz-demo
🧩 Metin Formatı
Girdi metni şu formatta olmalı: [speaker:spk_tmp_001 language:lzz] <metin>
🖥️ Donanım Gereksinimleri
- Disk: ~4,7 GB (VoxCPM2 temel model + LoRA ağırlıkları)
- RAM/VRAM: float32 çıkarım için ~9 GB; CUDA GPU'da bfloat16 ile daha az
- CUDA GPU önerilir; Apple Silicon (≥24 GB birleşik bellek) desteklenir ama daha yavaştır
⚠️ Sınırlamalar
- Tek konuşucu (
spk_tmp_001) ile eğitilmiştir; ses klonlama için ayrıca fine-tuning gerekir. - ~21K segmentlik göreli küçük bir veri setiyle eğitildiğinden, uzun/nadir kelimelerde telaffuz tutarsızlıkları olabilir.
- Model, VoxCPM2'nin
voxcpmpaketine bağımlıdır; Hugging Face'in otomatik Inference API/widget'ı bu özel kütüphaneyi desteklemediği için model sayfasında canlı bir "Hosted inference" widget'ı görünmez — bunun yerine yukarıdaki ZeroGPU Space'i kullanın.
📚 Kaynaklar
- Temel model: openbmb/VoxCPM2
- LoRA yöntemi: Hu et al., 2021 — LoRA: Low-Rank Adaptation of Large Language Models
- Eğitim verisi: Mozilla'nın açık kaynak Lazca ses veri setleri
📄 Lisans
MIT — bkz. LICENSE
🤝 Katkı ve İletişim
Sorun, geri bildirim veya katkı için lütfen bu deponun Community/Discussions sekmesini kullanın.
Citation
@misc{mozillaz2026,
title = {MozilLaz: An Open-Source Text-to-Speech LoRA Adapter for the Laz Language},
author = {Anadilorg},
year = {2026},
howpublished = {\url{https://huggingface.co/Anadilorg/MozilLaz}}
}