--- license: mit language: - lzz - tr library_name: voxcpm pipeline_tag: text-to-speech base_model: openbmb/VoxCPM2 base_model_relation: adapter tags: - text-to-speech - tts - speech-synthesis - audio - laz - lazca - lazuri - voxcpm - lora - low-resource - endangered-languages - turkey - mozilla-common-voice --- # MozilLaz — Lazcanın Açık Kaynak Text-to-Speech Modeli **MozilLaz**, [openbmb/VoxCPM2](https://huggingface.co/openbmb/VoxCPM2) temel modeli üzerine **LoRA** (Low-Rank Adaptation) ile ince ayar yapılmış, **Lazca (Lazuri, ISO 639-3: `lzz`)** için açık kaynak bir konuşma sentezi (text-to-speech) modelidir. Mozilla'nın açık kaynak Lazca ses veri setlerinden derlenen ~21.000 segment ile eğitilmiştir. *MozilLaz is an open-source text-to-speech LoRA adapter for the Laz language (`lzz`), fine-tuned on top of [VoxCPM2](https://huggingface.co/openbmb/VoxCPM2) using ~21k segments from Mozilla's open Laz speech data. Try it live in the [🚀 Space demo](https://huggingface.co/spaces/Anadilorg/MozilLaz-demo) (ZeroGPU).* 👉 **Canlı demo (ZeroGPU):** [Anadilorg/MozilLaz-demo](https://huggingface.co/spaces/Anadilorg/MozilLaz-demo) ## 🔊 Örnek Sesler | # | Metin | Ses | |---|---|---| | 1 | Mehmet manişa dulya komenç̌elu do oxorimuşişa igzalu. | | | 2 | Mektebişa oxtimu na gyoç̆ǩu orape var şuns. | | | 3 | Ngolaşa uluri? | | | 4 | --- | | | 5 | Xelaǩaoba, manebrape! | | ## 📋 Model Bilgileri | Özellik | Detay | |---|---| | Dil | Lazca (`lzz`) | | Konuşucu | `spk_tmp_001` (Mozilla Lazca veri setinden) | | Temel model | [openbmb/VoxCPM2](https://huggingface.co/openbmb/VoxCPM2) | | Yöntem | LoRA (r=32, α=32, LM + DiT katmanları) | | Eğitim verisi | ~21.071 segment — Mozilla açık kaynak Lazca veri setleri | | Eğitim adımı | 2.000 | | Adapter boyutu | ~70 MB (18,1M parametre, F32) | | Sample rate | 16 kHz giriş / 48 kHz çıkış | | Lisans | MIT | ## ⚡ Hızlı Başlangıç ```bash pip install torch torchaudio soundfile safetensors numpy voxcpm git clone https://huggingface.co/Anadilorg/MozilLaz cd MozilLaz python inference.py --text "[speaker:spk_tmp_001 language:lzz] Ngolaşa uluri?" ``` ### Python API ```python from voxcpm import VoxCPM from voxcpm.model.voxcpm import LoRAConfig import json, soundfile as sf lora_cfg_dict = json.load(open("lora_config.json"))["lora_config"] lora_cfg = LoRAConfig(**{k: v for k, v in lora_cfg_dict.items() if k in LoRAConfig.model_fields}) model = VoxCPM.from_pretrained( "openbmb/VoxCPM2", load_denoiser=False, lora_config=lora_cfg, lora_weights_path="lora_weights.safetensors", device="cuda", # veya "mps" / "cpu" ) model.load_lora("lora_weights.safetensors") audio = model.generate( text="[speaker:spk_tmp_001 language:lzz] Ngolaşa uluri?", inference_timesteps=10, cfg_value=2.0, ) sf.write("output.wav", audio, 48000) ``` ### Gradio arayüzü (yerel) ```bash pip install gradio python demo.py ``` Tarayıcı olmadan denemek isterseniz, aşağıdaki **ZeroGPU destekli Space**'i kullanabilirsiniz — kurulum gerekmez: 👉 **https://huggingface.co/spaces/Anadilorg/MozilLaz-demo** ## 🧩 Metin Formatı Girdi metni şu formatta olmalı: `[speaker:spk_tmp_001 language:lzz] ` ## 🖥️ Donanım Gereksinimleri - Disk: ~4,7 GB (VoxCPM2 temel model + LoRA ağırlıkları) - RAM/VRAM: float32 çıkarım için ~9 GB; CUDA GPU'da bfloat16 ile daha az - CUDA GPU önerilir; Apple Silicon (≥24 GB birleşik bellek) desteklenir ama daha yavaştır ## ⚠️ Sınırlamalar - Tek konuşucu (`spk_tmp_001`) ile eğitilmiştir; ses klonlama için ayrıca fine-tuning gerekir. - ~21K segmentlik göreli küçük bir veri setiyle eğitildiğinden, uzun/nadir kelimelerde telaffuz tutarsızlıkları olabilir. - Model, VoxCPM2'nin `voxcpm` paketine bağımlıdır; Hugging Face'in otomatik Inference API/widget'ı bu özel kütüphaneyi desteklemediği için model sayfasında canlı bir "Hosted inference" widget'ı **görünmez** — bunun yerine yukarıdaki ZeroGPU Space'i kullanın. ## 📚 Kaynaklar - Temel model: [openbmb/VoxCPM2](https://huggingface.co/openbmb/VoxCPM2) - LoRA yöntemi: [Hu et al., 2021 — LoRA: Low-Rank Adaptation of Large Language Models](https://huggingface.co/papers/2106.09685) - Eğitim verisi: Mozilla'nın açık kaynak Lazca ses veri setleri ## 📄 Lisans MIT — bkz. [LICENSE](LICENSE) ## 🤝 Katkı ve İletişim Sorun, geri bildirim veya katkı için lütfen bu deponun **Community/Discussions** sekmesini kullanın. ## Citation ```bibtex @misc{mozillaz2026, title = {MozilLaz: An Open-Source Text-to-Speech LoRA Adapter for the Laz Language}, author = {Anadilorg}, year = {2026}, howpublished = {\url{https://huggingface.co/Anadilorg/MozilLaz}} } ```