DizgeBERT-Dep
Türkçe bağımlılık çözümleme (dependency parsing) modeli. Biaffine Parser mimarisi kullanılarak Turkish ELECTRA encoder üzerine eğitilmiştir.
DizgeBERT model serisinin bir parçasıdır.
Model Detayları
| Özellik | Değer |
|---|---|
| Encoder | dbmdz/electra-base-turkish-cased-discriminator |
| Mimari | Biaffine Dependency Parser |
| Çözücü (Decoder) | MST (Minimum Spanning Tree) |
| Eğitim Verisi | UD Turkish-BOUN + UD Turkish-IMST (~11,125 cümle) |
| Parametre | ~111M |
| Dil | Türkçe |
Performans
BOUN Treebank test seti üzerinde değerlendirilmiştir (979 cümle, 11,231 token):
| Metrik | Değer |
|---|---|
| UAS (Unlabeled Attachment Score) | 82.72% |
| LAS (Labeled Attachment Score) | 74.21% |
Karşılaştırma
| Model | UAS | LAS |
|---|---|---|
| DizgeBERT-Dep (bu model) | 82.72% | 74.21% |
| Turkish BERT + Biaffine (V8_ft) | 82.51% | 74.10% |
| Türk et al. (LREC 2022) — BERT | ~83–84% | — |
Eğitim Yöntemi
2 aşamalı ince ayar (two-stage fine-tuning) kullanılmıştır:
- Aşama 1: BOUN + IMST birleşik verisi üzerinde eğitim (
lr=2e-5, 30 epoch) - Aşama 2: BOUN temiz verisi üzerinde ince ayar (
lr=5e-6, 10 epoch)
Bu yaklaşım UDify (Kondratyuk & Straka, EMNLP 2019) çalışmasındaki 2-aşamalı stratejiye benzerdir.
Kullanım
Model, train_dep_simple.py içindeki BiaffineParser sınıfı ile çalışır. Çıkarım için infer_dep.py kullanılabilir:
python infer_dep.py \
--model iatagun/DizgeBERT-Dep \
--sentence "Atatürk, 23 Nisan'da Büyük Millet Meclisi'ni açtı."
Örnek Çıktı
GİRİŞ: Atatürk, 23 Nisan'da Büyük Millet Meclisi'ni açtı.
ID KELİME BAĞLI→ İLİŞKİ
──────────────────────────────────────────────────
1 Atatürk açtı nsubj
2 , açtı punct
3 23 Nisan'da nummod
4 Nisan'da açtı obl:tmod
5 Büyük Millet amod
6 Millet Meclisi'ni nmod:poss
7 Meclisi'ni açtı obj
8 açtı KÖK root
9 . açtı punct
Desteklenen Bağımlılık Etiketleri
Model 55 UD ilişki etiketi tanır:
root, nsubj, nsubj:outer, obj, iobj, csubj, ccomp, xcomp, aux, aux:q, acl, amod, appos, clf, det, nmod, nmod:poss, nummod, advcl, advmod, advmod:emph, obl, obl:tmod, dislocated, vocative, discourse, discourse:q, case, cc, cc:preconj, mark, cop, compound, compound:lvc, compound:redup, fixed, flat, conj, list, parataxis, orphan, dep, dep:der, punct ve diğerleri.
Sınırlılıklar
- Çok uzun cümleler (30+ token) performans düşüşü yaşayabilir
- Özel isimler ve yabancı kökenli sözcükler bazı yapısal karmaşıklıklara yol açabilir
- Model Universal Dependencies standardını (v2) esas almaktadır
Alıntı
Bu modeli kullanıyorsanız lütfen atıfta bulunun:
@misc{DizgeBERT-Dep-2025,
author = {iatagun},
title = {DizgeBERT-Dep: Turkish Biaffine Dependency Parser},
year = {2025},
publisher = {Hugging Face},
url = {https://huggingface.co/iatagun/DizgeBERT-Dep}
}
Lisans
Apache 2.0
- Downloads last month
- 1
Space using iatagun/DizgeBERT-Dep 1
Evaluation results
- UAS on UD Turkish-BOUN (test)self-reported82.720
- LAS on UD Turkish-BOUN (test)self-reported74.210