MozilLaz — Lazcanın Açık Kaynak Text-to-Speech Modeli

MozilLaz, openbmb/VoxCPM2 temel modeli üzerine LoRA (Low-Rank Adaptation) ile ince ayar yapılmış, Lazca (Lazuri, ISO 639-3: lzz) için açık kaynak bir konuşma sentezi (text-to-speech) modelidir. Mozilla'nın açık kaynak Lazca ses veri setlerinden derlenen ~21.000 segment ile eğitilmiştir.

MozilLaz is an open-source text-to-speech LoRA adapter for the Laz language (lzz), fine-tuned on top of VoxCPM2 using ~21k segments from Mozilla's open Laz speech data. Try it live in the 🚀 Space demo (ZeroGPU).

👉 Canlı demo (ZeroGPU): Anadilorg/MozilLaz-demo

🔊 Örnek Sesler

# Metin Ses
1 Mehmet manişa dulya komenç̌elu do oxorimuşişa igzalu.
2 Mektebişa oxtimu na gyoç̆ǩu orape var şuns.
3 Ngolaşa uluri?
4 ---
5 Xelaǩaoba, manebrape!

📋 Model Bilgileri

Özellik Detay
Dil Lazca (lzz)
Konuşucu spk_tmp_001 (Mozilla Lazca veri setinden)
Temel model openbmb/VoxCPM2
Yöntem LoRA (r=32, α=32, LM + DiT katmanları)
Eğitim verisi ~21.071 segment — Mozilla açık kaynak Lazca veri setleri
Eğitim adımı 2.000
Adapter boyutu ~70 MB (18,1M parametre, F32)
Sample rate 16 kHz giriş / 48 kHz çıkış
Lisans MIT

⚡ Hızlı Başlangıç

pip install torch torchaudio soundfile safetensors numpy voxcpm
git clone https://huggingface.co/Anadilorg/MozilLaz
cd MozilLaz
python inference.py --text "[speaker:spk_tmp_001 language:lzz] Ngolaşa uluri?"

Python API

from voxcpm import VoxCPM
from voxcpm.model.voxcpm import LoRAConfig
import json, soundfile as sf

lora_cfg_dict = json.load(open("lora_config.json"))["lora_config"]
lora_cfg = LoRAConfig(**{k: v for k, v in lora_cfg_dict.items() if k in LoRAConfig.model_fields})

model = VoxCPM.from_pretrained(
    "openbmb/VoxCPM2",
    load_denoiser=False,
    lora_config=lora_cfg,
    lora_weights_path="lora_weights.safetensors",
    device="cuda",  # veya "mps" / "cpu"
)
model.load_lora("lora_weights.safetensors")

audio = model.generate(
    text="[speaker:spk_tmp_001 language:lzz] Ngolaşa uluri?",
    inference_timesteps=10,
    cfg_value=2.0,
)
sf.write("output.wav", audio, 48000)

Gradio arayüzü (yerel)

pip install gradio
python demo.py

Tarayıcı olmadan denemek isterseniz, aşağıdaki ZeroGPU destekli Space'i kullanabilirsiniz — kurulum gerekmez: 👉 https://huggingface.co/spaces/Anadilorg/MozilLaz-demo

🧩 Metin Formatı

Girdi metni şu formatta olmalı: [speaker:spk_tmp_001 language:lzz] <metin>

🖥️ Donanım Gereksinimleri

  • Disk: ~4,7 GB (VoxCPM2 temel model + LoRA ağırlıkları)
  • RAM/VRAM: float32 çıkarım için ~9 GB; CUDA GPU'da bfloat16 ile daha az
  • CUDA GPU önerilir; Apple Silicon (≥24 GB birleşik bellek) desteklenir ama daha yavaştır

⚠️ Sınırlamalar

  • Tek konuşucu (spk_tmp_001) ile eğitilmiştir; ses klonlama için ayrıca fine-tuning gerekir.
  • ~21K segmentlik göreli küçük bir veri setiyle eğitildiğinden, uzun/nadir kelimelerde telaffuz tutarsızlıkları olabilir.
  • Model, VoxCPM2'nin voxcpm paketine bağımlıdır; Hugging Face'in otomatik Inference API/widget'ı bu özel kütüphaneyi desteklemediği için model sayfasında canlı bir "Hosted inference" widget'ı görünmez — bunun yerine yukarıdaki ZeroGPU Space'i kullanın.

📚 Kaynaklar

📄 Lisans

MIT — bkz. LICENSE

🤝 Katkı ve İletişim

Sorun, geri bildirim veya katkı için lütfen bu deponun Community/Discussions sekmesini kullanın.

Citation

@misc{mozillaz2026,
  title  = {MozilLaz: An Open-Source Text-to-Speech LoRA Adapter for the Laz Language},
  author = {Anadilorg},
  year   = {2026},
  howpublished = {\url{https://huggingface.co/Anadilorg/MozilLaz}}
}
Downloads last month
25
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Anadilorg/MozilLaz

Base model

openbmb/VoxCPM2
Adapter
(20)
this model

Space using Anadilorg/MozilLaz 1

Paper for Anadilorg/MozilLaz