Laya TR: Türkçe karar modeli
English summary. A Turkish fine-tune of convaiinnovations/laya-multilingual,
the non-autoregressive "System 1" decision model of Laya: it answers typed
choice, noul (yes/no) and score questions about a text in a single forward pass and returns calibrated
probabilities. Trained for 2 epochs on 285,363 decisions (machine-translated bev-decision-150K, its English
originals and native Turkish MASSIVE, XNLI and movie reviews). On 89,838 held-out test decisions accuracy goes
from 0.432 to 0.681 and ECE from 0.277 to 0.070.
Bu model, Laya'nın çok dilli kontrol noktası
convaiinnovations/laya-multilingual (mmBERT tabanlı) üzerine
Türkçe karar verisiyle ince ayar yapılmış halidir. Laya metin üretmez: bir metin (state) ve tipli sorular alır, her soru
için tek ileri geçişte kalibre edilmiş olasılıklar döndürür.
- choice: seçeneklerden biri (ör. hangi departman, hangi niyet),
- noul: bir ifadenin doğru olma olasılığı (evet/hayır),
- score: sıralı seviyelerden biri (ör. 1-5 memnuniyet).
Kullanım
import laya
agent = laya.load("hayriyigit/laya-tr-test", token="hf_...") # private repo: okuma yetkili bir token
state = "Siparişim iki haftadır gelmedi, kargo takip numarası da çalışmıyor. Paramı geri istiyorum."
questions = {
"birim": {
"type": "choice",
"instructions": "Bu talebi hangi birim ele almalı?",
"criteria": {"fatura": "ödeme, iade, fatura", "kargo": "teslimat ve takip", "teknik": "uygulama veya site hataları"},
},
"iade": {"type": "noul", "instructions": "Müşteri para iadesi istiyor."},
"memnuniyet": {
"type": "score",
"instructions": "Müşteri ne kadar memnun?",
"criteria": ["Çok memnuniyetsiz", "Memnuniyetsiz", "Nötr", "Memnun", "Çok memnun"],
},
}
answers = agent.predict(state, questions)["answers"]
Bu modelin bu örnekteki cevabı:
| Soru | Cevap | Olasılık |
|---|---|---|
| birim | kargo |
0,949 |
| iade | evet | 0,927 |
| memnuniyet | Çok memnuniyetsiz (seviye 0) | 0,771 |
Her cevapta tüm seçeneklerin olasılıkları (probabilities) ve eşik koymak için answer_confidence da döner.
Soru başına bağlam 8.192 token (soru ve seçenekler için 768); kısa girdiler yalnızca kendi uzunlukları kadar işlenir. Sıcaklıklar (choice, score, noul) eğitimde görülmemiş Türkçe kararlarda kalibre edildi: 0,909, 1,236, 0,870.
Değerlendirme
Test kararlarının hiçbiri eğitimde görülmedi; metni bir test satırında da geçen eğitim satırları, İngilizce orijinaller
üzerinden eşleştirilerek eğitimden çıkarıldı (aşağıda). "Önce" sütunu ince ayar öncesi laya-multilingual'dır.
Kaynağa göre
| Test seti | Karar | Doğruluk (önce) | Doğruluk (sonra) | Fark (puan) | ECE (önce) | ECE (sonra) |
|---|---|---|---|---|---|---|
| bev-decision-150K-tr test (makine çevirisi) | 46.320 | 0,444 | 0,771 | +32,7 | 0,275 | 0,031 |
| bev-decision-150K test, İngilizce orijinal | 5.761 | 0,472 | 0,775 | +30,3 | 0,243 | 0,036 |
| jev-bench-tr (benchmark, makine çevirisi) | 22.773 | 0,402 | 0,490 | +8,8 | 0,295 | 0,171 |
| jev-bench, İngilizce orijinal | 2.000 | 0,499 | 0,578 | +7,8 | 0,246 | 0,105 |
| MASSIVE tr-TR (ana dili Türkçe) | 2.974 | 0,355 | 0,781 | +42,6 | 0,285 | 0,063 |
| XNLI Türkçe test (insan çevirisi) | 5.010 | 0,693 | 0,738 | +4,5 | 0,211 | 0,095 |
| beyazperde film yorumları (ana dili Türkçe) | 5.000 | 0,180 | 0,531 | +35,1 | 0,329 | 0,067 |
| Hepsi | 89.838 | 0,432 | 0,681 | +24,8 | 0,277 | 0,070 |
Soru türüne göre
| Tür | Karar | Doğruluk (önce) | Doğruluk (sonra) | ECE (önce) | ECE (sonra) |
|---|---|---|---|---|---|
| choice | 39.617 | 0,448 | 0,662 | 0,246 | 0,090 |
| noul | 27.493 | 0,599 | 0,823 | 0,281 | 0,061 |
| score | 22.728 | 0,204 | 0,541 | 0,325 | 0,071 |
Nasıl okunmalı
- Kalibrasyon en büyük kazanç: ECE 0,277 → 0,070. Modelin verdiği olasılıklar eşik koymak için kullanılabilir hale geldi.
- İngilizce unutulmadı: eğitime İngilizce orijinallerin ~%25'i karıştırıldı; bev ve jev-bench'in İngilizce testlerinde de doğruluk arttı. Diğer diller ölçülmedi.
- En bağımsız sinyal XNLI (+4,5 puan): ayrı kaynaklı, insan çevirisi bir test. MASSIVE ve beyazperde'deki büyük artışlar kısmen bu kaynakların train bölümlerinin eğitimde olmasından gelir.
- Bazı jev-bench alt setleri kötüleşti: civil_comments −8,2, paws −6,7, boolq −5,4, mmlu −1,7 puan. Nedeni ayrıca incelenmedi.
- jev-bench bev ile aynı görev ailelerinden (ör. MASSIVE, CLINC150, SST-5, BoolQ) beslenir; birebir aynı metinler çıkarıldı, ama tamamen bağımsız bir test değildir.
bev-decision alanları (Türkçe test)
| Alan | Karar | Doğruluk (önce) | Doğruluk (sonra) | ECE (sonra) |
|---|---|---|---|---|
| Sentiment, emotion, and moderation | 11.526 | 0,616 | 0,853 | 0,032 |
| Spatial and logical reasoning | 8.384 | 0,320 | 0,582 | 0,087 |
| Retail, product, and shopping | 6.601 | 0,287 | 0,938 | 0,064 |
| Response preference and quality | 3.176 | 0,324 | 0,570 | 0,039 |
| Support and intent routing | 2.858 | 0,677 | 0,970 | 0,054 |
| Tool and workflow decisions | 2.307 | 0,770 | 0,986 | 0,065 |
| Software security | 2.240 | 0,415 | 0,653 | 0,088 |
| Game-state decisions | 2.039 | 0,345 | 0,856 | 0,070 |
| Software engineering and code | 2.039 | 0,322 | 0,611 | 0,137 |
| Financial reporting and banking | 1.740 | 0,166 | 0,599 | 0,042 |
| Reading comprehension | 1.422 | 0,629 | 0,705 | 0,145 |
| Scientific and paper understanding | 508 | 0,372 | 0,827 | 0,062 |
| Contract evidence | 320 | 0,334 | 0,700 | 0,043 |
| Browser interaction | 286 | 0,276 | 0,745 | 0,089 |
| Spam detection | 271 | 0,550 | 0,956 | 0,047 |
| Civic and safety operations | 261 | 0,253 | 0,701 | 0,076 |
| Sensory quality rating | 260 | 0,073 | 0,450 | 0,072 |
| Engagement and ranking | 82 | 0,549 | 0,573 | 0,159 |
jev-bench-tr alt setleri
| Alt set | Karar | Doğruluk (önce) | Doğruluk (sonra) |
|---|---|---|---|
| arc_challenge | 1.000 | 0,249 | 0,254 |
| banking77 | 1.000 | 0,270 | 0,323 |
| boolq | 1.000 | 0,687 | 0,633 |
| chaosnli | 1.599 | 0,477 | 0,570 |
| civil_comments | 2.000 | 0,912 | 0,831 |
| clinc150 | 1.000 | 0,250 | 0,387 |
| fever_evidence | 1.000 | 0,551 | 0,752 |
| go_emotions | 1.000 | 0,278 | 0,308 |
| helpsteer2_helpfulness | 1.000 | 0,150 | 0,156 |
| helpsteer2_verbosity | 1.000 | 0,211 | 0,299 |
| ledgar | 1.000 | 0,087 | 0,089 |
| massive | 1.000 | 0,375 | 0,792 |
| measuring_hate_speech | 1.000 | 0,313 | 0,602 |
| mmlu | 1.000 | 0,275 | 0,258 |
| mnli | 1.000 | 0,720 | 0,769 |
| paws | 1.000 | 0,528 | 0,461 |
| sms_spam | 800 | 0,328 | 0,955 |
| sst5 | 1.000 | 0,286 | 0,374 |
| strategyqa_closed | 687 | 0,517 | 0,512 |
| strategyqa_grounded | 687 | 0,549 | 0,547 |
| stsb | 1.000 | 0,158 | 0,207 |
| yelp5 | 1.000 | 0,185 | 0,436 |
banking77 (77) ve clinc150 (150 seçenek) gibi çok seçenekli sorularda seçenekler 768 tokenlık soru bütçesine sığmak için kısalır; bu, Laya'nın bilinen bir sınırıdır (#394).
Eğitim sırasında doğrulama
Eğitimden ayrılan, metne göre gruplanmış 1.518 Türkçe karar (sıcaklık kalibrasyonu öncesi):
| Epoch | Doğruluk | NLL | Brier | ECE |
|---|---|---|---|---|
| 1 | 0,784 | 0,571 | 0,300 | 0,057 |
| 2 | 0,785 | 0,569 | 0,296 | 0,072 |
İkinci epoch çok az katkı verdi; daha fazla epoch önerilmez.
Eğitim verisi
| Kaynak | Satır | Karar | choice / noul / score |
|---|---|---|---|
| bev-decision-150K-tr train (Türkçe, makine çevirisi) | 102.784 | 206.166 | 69.041 / 89.653 / 47.472 |
| bev-decision-150K train, İngilizce orijinal (Türkçe satırların ikizleri) | 34.261 | 68.714 | 22.974 / 29.958 / 15.782 |
| MASSIVE tr-TR train (ana dili Türkçe) | 5.000 | 5.000 | 5.000 / 0 / 0 |
| XNLI Türkçe validation (insan çevirisi) | 2.490 | 2.490 | 2.490 / 0 / 0 |
| beyazperde film yorumları train (ana dili Türkçe) | 5.000 | 5.000 | 0 / 0 / 5.000 |
| Toplam | 149.535 | 287.370 |
Bunlardan metne göre gruplanmış 1.518 Türkçe karar doğrulama ve kalibrasyon için ayrıldı; bu kararların İngilizce ikizleri de eğitimden çıkarıldı. Eğitimde 285.363 karar kullanıldı.
Hedefler: Etiketler sorulardan çıkarılıp hedef olasılıklara çevrildi. Sert etiketler 0,1 ile yumuşatıldı (doğru cevaba 0,9;
scoresorularında kalan pay komşu seviyelere). Laya'nın eğitim yöntemi (RLCD) bu dağılımları hedefler.Alan dengesi: Türkçenin sinyal taşımadığı ya da etiketlerin gürültülü olduğu bev alanlarından eğitim satırlarının bir kısmı tutuldu:
Alan Tutulan oran Çıkarılan satır Software engineering and code 0,3 4.376 Spatial and logical reasoning 0,3 11.581 Browser interaction 0,3 3.202 Engagement and ranking 0,2 3.318 Örtüşme temizliği: Bir test satırında da geçen metni içeren eğitim satırları çıkarıldı:
Eğitim kaynağı Test kaynağı Çıkarılan eğitim satırı bev-decision-tr jev-bench-tr 337 bev-decision-tr beyazperde 6 bev-decision-tr MASSIVE tr-TR 10 MASSIVE tr-TR bev-decision-tr 477 MASSIVE tr-TR jev-bench-tr 16 MASSIVE tr-TR MASSIVE tr-TR 16 beyazperde beyazperde 76 Bağlam bütçesi: Hiçbir eğitim kararı 8.192 tokena sığmadığı ya da doğru seçeneği kısaltılınca başka bir seçenekle aynı göründüğü için çıkarılmadı. Eğitim kararlarının token uzunluğu: medyan 177, %90 494, %99 1.521, en fazla 7.430.
bev-decision-150K'nın Türkçesi bir LLM ile alan bazında çevrildi; kod blokları, tanımlayıcılar, URL'ler ve Mind2Web sayfa öğeleri İngilizce bırakıldı. Ayrıntılar: hayriyigit/bev-decision-150K-tr.
Eğitim
| Taban model | convaiinnovations/laya-multilingual (mmBERT-base encoder + Laya karar başlığı) |
| Yöntem | Laya'nın RLCD tarifi: gürültülü logit örnekleri üzerinde proper scoring ödülüyle policy gradient + yumuşak cross-entropy |
| Epoch / güncelleme | 2 / 17.836 (her güncellemede 32 karar) |
| Öğrenme hızı | encoder 1e-5, karar başlığı 1e-4; AdamW, cosine |
| Hassasiyet | bf16, gradient checkpointing |
| Bağlam | max_len 8.192, head_max_len 768 |
| Donanım ve süre | 1 × NVIDIA GeForce RTX 5090 (32 GB); eğitim ~1 sa 13 dk, veri hazırlığı ve değerlendirmeyle ~1 sa 28 dk |
| Yazılım | torch 2.14.1, transformers 5.18.0, laya 0.3.24 (commit fa9a2a7) |
Eğitim config'i, eğitim kaydı ve veri manifest'i training/ klasöründe; tüm metrikler eval_report.json'da.
Sınırlamalar
- Eğitim verisinin çoğu makine çevirisidir; model çeviri dilinin izlerini taşıyabilir. Ana dili Türkçe veri sınırlıdır (~12 bin satır).
- Kod, teknik tanımlayıcılar ve web sayfası öğeleri eğitimde İngilizce kaldı; bu tür girdilerde karışık dil beklenir.
- Yalnızca Türkçe ve İngilizce değerlendirildi; diğer dillerdeki performans ince ayar öncesine göre düşmüş olabilir.
- Kalibrasyon Türkçe veriyle yapıldı; farklı bir alanda kullanmadan önce kendi verinizle eşikleri kontrol edin.
- 77'den fazla seçenekli sorularda seçenek açıklamaları kısalır.
Lisans
Taban model Apache-2.0'dır. Eğitim verilerinin lisansları farklıdır; ayrıntılar LICENSE.md'de.
Ticari kullanımdan önce kontrol edin.
- Downloads last month
- -
Model tree for hayriyigit/laya-tr
Base model
convaiinnovations/laya-multilingual