--- license: apache-2.0 language: - tr library_name: PyLate pipeline_tag: sentence-similarity base_model: moganai/MoganBERT-Embed tags: - ColBERT - arxiv:2608.26344 - PyLate - sentence-transformers - late-interaction - retrieval - turkish - loss:Distillation ---
Averaged over the five datasets: 31.81 nDCG@10, 35.53 nDCG@100, 56.98 Recall@100, 25.13 mAP. The benchmark evaluates at `document_length=300` while the model was trained at 512, so these are a lower bound.
## Model Family
| Model | Params | Purpose |
|---|---:|---|
| [MoganBERT-TR](https://huggingface.co/moganai/MoganBERT-TR) | 149.4M | Base encoder |
| [MoganBERT-Embed](https://huggingface.co/moganai/MoganBERT-Embed) | 149M | Single-vector embeddings |
| [**Mogan-ColBERT-TR**](https://huggingface.co/moganai/Mogan-ColBERT-TR) | 148.9M | Multi-vector retrieval (this model) |
## Citation
```bibtex
@article{yilmaz2026mogancolbert,
title = {MoganColBERT-TR: A Late-Interaction Multi-Vector Retrieval Model for Turkish},
author = {Furkan Yilmaz and Habibe Aleyna Tasdemir and Muhammed Faruk Gozay},
year = {2026}
}
```
---
---
# Mogan-ColBERT-TR (Türkçe)
Mogan-ColBERT-TR, geç etkileşimli, 148.9M parametreli bir Türkçe çok vektörlü retriever'dır. Metin başına tek vektör yerine temsili 768→128 izdüşümü ile token seviyesinde tutar ve MaxSim ile skorlar. Sorgular `[MASK]` ile 32 tokena tamamlanır, belgeler 512'ye kadar kodlanır.
[MoganBERT-Embed](https://huggingface.co/moganai/MoganBERT-Embed)'den başlatılmıştır — tamamen Türkçe bir külliyat üzerinde sıfırdan eğitilmiş bir ModernBERT; yabancı bir modelin ince ayarı değil.
## Kullanım
```bash
pip install -U pylate
```
```python
from pylate import indexes, models, retrieve
model = models.ColBERT(model_name_or_path="moganai/Mogan-ColBERT-TR")
index = indexes.PLAID(index_folder="pylate-index", index_name="index", override=True)
belge_idleri = ["1", "2", "3"]
belgeler = ["birinci belge metni", "ikinci belge metni", "üçüncü belge metni"]
index.add_documents(
documents_ids=belge_idleri,
documents_embeddings=model.encode(belgeler, batch_size=32, is_query=False),
)
retriever = retrieve.ColBERT(index=index)
sorgu_gommeleri = model.encode(["örnek sorgu"], batch_size=32, is_query=True)
print(retriever.retrieve(queries_embeddings=sorgu_gommeleri, k=10))
```
Yeniden sıralama için `pylate.rank.rerank` kullanın. Çok vektörlü indeks yoğun bir indeksten onlarca kat büyüktür; üretimde önerilen kurulum iki aşamalıdır: aday üretimi [MoganBERT-Embed](https://huggingface.co/moganai/MoganBERT-Embed) ile, yeniden sıralama bu model ile.
## Eğitim
1×H100 üzerinde, `bge-reranker-v2-m3` çapraz kodlayıcısından 1 pozitif ve 7 zor negatif üzerinde tek epoch'luk KL damıtma. Optimizasyon iki parametre grubu kullanır — encoder 1e-5, izdüşüm 1e-4 — çünkü izdüşüm rastgele başlarken encoder başlamaz.
Eğitim verisi, ön-eğitim külliyatımızdan çıkarılan başlık→pasaj çiftleri ve iki Türkçe soru tabanlı retrieval kümesidir. Pasajlar, kesilmiş token listeleri decode edilerek değil, karakter alanında cümle sınırlarından bölünür. Negatifler MoganBERT-Embed gömme uzayında çıkarılır ve üç kural birlikte uygulanarak filtrelenir: ilk 10'u atla, sorgunun grup kimliğini paylaşan adayları düşür, 0.95 kosinüsün üstündekileri düşür. Grup maskesi önemlidir — aynı belgeden çıkan ikinci pasaj aynı başlık için üst sıralara çıkar ve negatif değildir.
## Sonuçlar
TurkColBERT, resmî hat (PLAID indeksi, tam MaxSim, `document_length=300`, `k=100`). Beş veri kümesinin hiçbiri eğitim havuzunda yer almaz, dolayısıyla tüm sonuçlar temiz sıfır-atıştır.
Beş veri kümesinin ortalaması: 31.81 nDCG@10, 35.53 nDCG@100, 56.98 Recall@100, 25.13 mAP. Kıyaslama `document_length=300` ile ölçüm yapar, model ise 512 ile eğitildi; bu sayılar bir alt sınırdır.
## Model Ailesi
| Model | Parametre | Amaç |
|---|---:|---|
| [MoganBERT-TR](https://huggingface.co/moganai/MoganBERT-TR) | 149.4M | Temel encoder |
| [MoganBERT-Embed](https://huggingface.co/moganai/MoganBERT-Embed) | 149M | Tek vektörlü gömme |
| [**Mogan-ColBERT-TR**](https://huggingface.co/moganai/Mogan-ColBERT-TR) | 148.9M | Çok vektörlü retrieval (bu model) |
## Atıf
```bibtex
@article{yilmaz2026mogancolbert,
title = {MoganColBERT-TR: A Late-Interaction Multi-Vector Retrieval Model for Turkish},
author = {Furkan Yilmaz and Habibe Aleyna Tasdemir and Muhammed Faruk Gozay},
year = {2026}
}
```