MozilLaz / README.md
Anadilorg's picture
Update README.md
109e5bc verified
|
Raw
History Blame Contribute Delete
5.36 kB
---
license: mit
language:
- lzz
- tr
library_name: voxcpm
pipeline_tag: text-to-speech
base_model: openbmb/VoxCPM2
base_model_relation: adapter
tags:
- text-to-speech
- tts
- speech-synthesis
- audio
- laz
- lazca
- lazuri
- voxcpm
- lora
- low-resource
- endangered-languages
- turkey
- mozilla-common-voice
---
# MozilLaz — Lazcanın Açık Kaynak Text-to-Speech Modeli
**MozilLaz**, [openbmb/VoxCPM2](https://huggingface.co/openbmb/VoxCPM2) temel modeli üzerine **LoRA** (Low-Rank Adaptation) ile ince ayar yapılmış, **Lazca (Lazuri, ISO 639-3: `lzz`)** için açık kaynak bir konuşma sentezi (text-to-speech) modelidir. Mozilla'nın açık kaynak Lazca ses veri setlerinden derlenen ~21.000 segment ile eğitilmiştir.
*MozilLaz is an open-source text-to-speech LoRA adapter for the Laz language (`lzz`), fine-tuned on top of [VoxCPM2](https://huggingface.co/openbmb/VoxCPM2) using ~21k segments from Mozilla's open Laz speech data. Try it live in the [🚀 Space demo](https://huggingface.co/spaces/Anadilorg/MozilLaz-demo) (ZeroGPU).*
👉 **Canlı demo (ZeroGPU):** [Anadilorg/MozilLaz-demo](https://huggingface.co/spaces/Anadilorg/MozilLaz-demo)
## 🔊 Örnek Sesler
| # | Metin | Ses |
|---|---|---|
| 1 | Mehmet manişa dulya komenç̌elu do oxorimuşişa igzalu. | <audio controls preload="none" src="https://huggingface.co/Anadilorg/MozilLaz/resolve/main/sample/1.wav"></audio> |
| 2 | Mektebişa oxtimu na gyoç̆ǩu orape var şuns. | <audio controls preload="none" src="https://huggingface.co/Anadilorg/MozilLaz/resolve/main/sample/2.wav"></audio> |
| 3 | Ngolaşa uluri? | <audio controls preload="none" src="https://huggingface.co/Anadilorg/MozilLaz/resolve/main/sample/3.wav"></audio> |
| 4 | --- | <audio controls preload="none" src="https://huggingface.co/Anadilorg/MozilLaz/resolve/main/sample/4.wav"></audio> |
| 5 | Xelaǩaoba, manebrape! | <audio controls preload="none" src="https://huggingface.co/Anadilorg/MozilLaz/resolve/main/sample/5.wav"></audio> |
## 📋 Model Bilgileri
| Özellik | Detay |
|---|---|
| Dil | Lazca (`lzz`) |
| Konuşucu | `spk_tmp_001` (Mozilla Lazca veri setinden) |
| Temel model | [openbmb/VoxCPM2](https://huggingface.co/openbmb/VoxCPM2) |
| Yöntem | LoRA (r=32, α=32, LM + DiT katmanları) |
| Eğitim verisi | ~21.071 segment — Mozilla açık kaynak Lazca veri setleri |
| Eğitim adımı | 2.000 |
| Adapter boyutu | ~70 MB (18,1M parametre, F32) |
| Sample rate | 16 kHz giriş / 48 kHz çıkış |
| Lisans | MIT |
## ⚡ Hızlı Başlangıç
```bash
pip install torch torchaudio soundfile safetensors numpy voxcpm
git clone https://huggingface.co/Anadilorg/MozilLaz
cd MozilLaz
python inference.py --text "[speaker:spk_tmp_001 language:lzz] Ngolaşa uluri?"
```
### Python API
```python
from voxcpm import VoxCPM
from voxcpm.model.voxcpm import LoRAConfig
import json, soundfile as sf
lora_cfg_dict = json.load(open("lora_config.json"))["lora_config"]
lora_cfg = LoRAConfig(**{k: v for k, v in lora_cfg_dict.items() if k in LoRAConfig.model_fields})
model = VoxCPM.from_pretrained(
"openbmb/VoxCPM2",
load_denoiser=False,
lora_config=lora_cfg,
lora_weights_path="lora_weights.safetensors",
device="cuda", # veya "mps" / "cpu"
)
model.load_lora("lora_weights.safetensors")
audio = model.generate(
text="[speaker:spk_tmp_001 language:lzz] Ngolaşa uluri?",
inference_timesteps=10,
cfg_value=2.0,
)
sf.write("output.wav", audio, 48000)
```
### Gradio arayüzü (yerel)
```bash
pip install gradio
python demo.py
```
Tarayıcı olmadan denemek isterseniz, aşağıdaki **ZeroGPU destekli Space**'i kullanabilirsiniz — kurulum gerekmez:
👉 **https://huggingface.co/spaces/Anadilorg/MozilLaz-demo**
## 🧩 Metin Formatı
Girdi metni şu formatta olmalı: `[speaker:spk_tmp_001 language:lzz] <metin>`
## 🖥️ Donanım Gereksinimleri
- Disk: ~4,7 GB (VoxCPM2 temel model + LoRA ağırlıkları)
- RAM/VRAM: float32 çıkarım için ~9 GB; CUDA GPU'da bfloat16 ile daha az
- CUDA GPU önerilir; Apple Silicon (≥24 GB birleşik bellek) desteklenir ama daha yavaştır
## ⚠️ Sınırlamalar
- Tek konuşucu (`spk_tmp_001`) ile eğitilmiştir; ses klonlama için ayrıca fine-tuning gerekir.
- ~21K segmentlik göreli küçük bir veri setiyle eğitildiğinden, uzun/nadir kelimelerde telaffuz tutarsızlıkları olabilir.
- Model, VoxCPM2'nin `voxcpm` paketine bağımlıdır; Hugging Face'in otomatik Inference API/widget'ı bu özel kütüphaneyi desteklemediği için model sayfasında canlı bir "Hosted inference" widget'ı **görünmez** — bunun yerine yukarıdaki ZeroGPU Space'i kullanın.
## 📚 Kaynaklar
- Temel model: [openbmb/VoxCPM2](https://huggingface.co/openbmb/VoxCPM2)
- LoRA yöntemi: [Hu et al., 2021 — LoRA: Low-Rank Adaptation of Large Language Models](https://huggingface.co/papers/2106.09685)
- Eğitim verisi: Mozilla'nın açık kaynak Lazca ses veri setleri
## 📄 Lisans
MIT — bkz. [LICENSE](LICENSE)
## 🤝 Katkı ve İletişim
Sorun, geri bildirim veya katkı için lütfen bu deponun **Community/Discussions** sekmesini kullanın.
## Citation
```bibtex
@misc{mozillaz2026,
title = {MozilLaz: An Open-Source Text-to-Speech LoRA Adapter for the Laz Language},
author = {Anadilorg},
year = {2026},
howpublished = {\url{https://huggingface.co/Anadilorg/MozilLaz}}
}
```