AnadilAdygheTTS — Adığecenin (Çerkesçe) Açık Kaynak Text-to-Speech Modeli

AnadilAdygheTTS, openbmb/VoxCPM2 temel modeli üzerine LoRA (Low-Rank Adaptation) ile ince ayar yapılmış, Adığece (Adyghe / Batı Çerkesçesi, ISO 639-3: ady) için açık kaynak bir konuşma sentezi (text-to-speech) modelidir. 54.004 segmentlik tek konuşmacılı bir veri setiyle eğitilmiştir — bu, "Anadil" ailesindeki (Lazca, Zazaca, Adığece) en büyük ve en olgun modeldir.

AnadilAdygheTTS is an open-source text-to-speech LoRA adapter for Adyghe (West Circassian, ady), fine-tuned on top of VoxCPM2 on 54,004 single-speaker utterances — the largest and most-trained model in the "Anadil" family of endangered-language TTS adapters (alongside sibling models for Laz and Zaza). UNESCO classifies Adyghe as "vulnerable" (2009 Atlas of the World's Languages in Danger); among Circassians in Turkey, fluency below age 50 has dropped to roughly 5%. This model is part of an effort to keep the language's sound alive in digital tools.

📋 Model Bilgileri

Özellik Detay
Dil Adığece (ady)
Konuşucu spk_tmp_001 (tek konuşmacı)
Temel model openbmb/VoxCPM2
Yöntem LoRA (r=32, α=32, LM + DiT katmanları)
Eğitim verisi 54.004 segment — Anadil ailesinin en büyük veri seti
Eğitim adımı 5.000
Adapter boyutu ~69 MB (384 tensor, ~18,1M parametre, F32)
Sample rate 16 kHz giriş / 48 kHz çıkış
Lisans MIT

🔊 Örnek Sesler — Orijinal ve Sentez Karşılaştırması

Aşağıda orijinal referans ses (gerçek konuşmacı) ile modelin ürettiği sentez (TTS) arasındaki farkları duyabilirsiniz:

1. Сыд фэдэ мэзха тиреспубликэ итхэр?

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

2. Нанэ гыкӏэзэ орэд къеӏо.

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

3. Пшъашъэм зы гукъао иӏагъ, гъогу тетыми, унэм исыми, гъолъыжьыгъэми а гупшысэр ышъхьэ илъ зэпытыгъ.

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

4. Умар иорэдхэр цӀыфхэм лъэшэу шӀу алъэгъух, агъэлъапӀэх.

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

5. Спутникым къытӀупщырэ нэрмылъэгъу орхэр тыгъэм ифэмэ-бжьымэ къатырихьэу къыхэкӀы.

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

⚡ Hızlı Başlangıç

pip install torch torchaudio soundfile safetensors numpy voxcpm
git clone https://huggingface.co/Anadilorg/AnadilAdygheTTS
cd AnadilAdygheTTS
python inference.py --text "[speaker:spk_tmp_001 language:ady] Сыд фэдэ мэзха тиреспубликэ итхэр?"

Python API

from voxcpm import VoxCPM
from voxcpm.model.voxcpm import LoRAConfig
from inference import to_train_time_tag
import json, soundfile as sf

lora_cfg_dict = json.load(open("lora_config.json"))["lora_config"]
lora_cfg = LoRAConfig(**{k: v for k, v in lora_cfg_dict.items() if k in LoRAConfig.model_fields})

model = VoxCPM.from_pretrained(
    "openbmb/VoxCPM2",
    load_denoiser=False,
    lora_config=lora_cfg,
    lora_weights_path="lora_weights.safetensors",
    device="cuda",  # veya "mps" / "cpu"
)
model.load_lora("lora_weights.safetensors")

text = to_train_time_tag("[speaker:spk_tmp_001 language:ady] Сыд фэдэ мэзха тиреспубликэ итхэр?")
audio = model.generate(text=text, inference_timesteps=10, cfg_value=2.0)
sf.write("output.wav", audio, 48000)

Gradio arayüzü (yerel)

pip install gradio
python demo.py

Bu proje için barındırılan bir Hugging Face Space bilinçli olarak oluşturulmadı; demo.py yalnızca kendi bilgisayarınızda/sunucunuzda çalıştırmak içindir.

Hızlı doğrulama (smoke test)

python test_smoke.py --weights-only   # sadece ağırlık bütünlüğü, saniyeler sürer
python test_smoke.py                  # tam test (model indirme + gerçek ses üretimi)

🧩 Metin Formatı

Girdi metni şu formatta olmalı: [speaker:spk_tmp_001 language:ady] <metin>inference.py/demo.py bu etiketi otomatik olarak modelin beklediği forma çevirir.

🖥️ Donanım Gereksinimleri

  • Disk: ~4,7 GB (VoxCPM2 temel model + LoRA ağırlıkları)
  • RAM/VRAM: float32 çıkarım için ~9 GB; CUDA GPU'da bfloat16 ile daha az
  • CUDA GPU önerilir; Apple Silicon (≥24 GB birleşik bellek) desteklenir ama daha yavaştır

🌍 Neden Önemli

UNESCO, Adığeceyi 2009 tarihli Atlas of the World's Languages in Danger'da "vulnerable" (kırılgan) statüsünde sınıflandırmıştır. Dünya genelinde yaklaşık 600 bin konuşucusu bulunsa da, özellikle 1864 sürgünü sonrası Türkiye başta olmak üzere diasporada yaşayan Çerkesler arasında kuşaklar arası aktarım ciddi biçimde zayıflamıştır — Türkiye'deki Çerkesler arasında 50 yaş altında akıcı konuşabilenlerin oranı yaklaşık %5'e kadar gerilemiştir (Wikipedia). Bu model, Adığecenin dijital araçlarda (sesli asistanlar, eğitim materyalleri, erişilebilirlik uygulamaları) var olabilmesi için açık kaynak bir temel sunmayı amaçlıyor.

📚 Kaynaklar

📄 Lisans

MIT — bkz. LICENSE

🤝 Katkı ve İletişim

Sorun, geri bildirim veya katkı için lütfen bu deponun Community/Discussions sekmesini kullanın. Anadil.Org adresinden bizimle iletişime geçebilirsiniz.

Citation

@misc{anadiladyghetts2026,
  title  = {AnadilAdygheTTS: An Open-Source Text-to-Speech LoRA Adapter for Adyghe (West Circassian)},
  author = {Anadilorg},
  year   = {2026},
  howpublished = {\url{https://huggingface.co/Anadilorg/AnadilAdygheTTS}}
}
Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Anadilorg/AnadilAdygheTTS

Base model

openbmb/VoxCPM2
Adapter
(20)
this model

Paper for Anadilorg/AnadilAdygheTTS