Laya TR: Türkçe karar modeli

English summary. A Turkish fine-tune of convaiinnovations/laya-multilingual, the non-autoregressive "System 1" decision model of Laya: it answers typed choice, noul (yes/no) and score questions about a text in a single forward pass and returns calibrated probabilities. Trained for 2 epochs on 285,363 decisions (machine-translated bev-decision-150K, its English originals and native Turkish MASSIVE, XNLI and movie reviews). On 89,838 held-out test decisions accuracy goes from 0.432 to 0.681 and ECE from 0.277 to 0.070.

Bu model, Laya'nın çok dilli kontrol noktası convaiinnovations/laya-multilingual (mmBERT tabanlı) üzerine Türkçe karar verisiyle ince ayar yapılmış halidir. Laya metin üretmez: bir metin (state) ve tipli sorular alır, her soru için tek ileri geçişte kalibre edilmiş olasılıklar döndürür.

  • choice: seçeneklerden biri (ör. hangi departman, hangi niyet),
  • noul: bir ifadenin doğru olma olasılığı (evet/hayır),
  • score: sıralı seviyelerden biri (ör. 1-5 memnuniyet).

Kullanım

import laya

agent = laya.load("hayriyigit/laya-tr-test", token="hf_...")   # private repo: okuma yetkili bir token

state = "Siparişim iki haftadır gelmedi, kargo takip numarası da çalışmıyor. Paramı geri istiyorum."
questions = {
    "birim": {
        "type": "choice",
        "instructions": "Bu talebi hangi birim ele almalı?",
        "criteria": {"fatura": "ödeme, iade, fatura", "kargo": "teslimat ve takip", "teknik": "uygulama veya site hataları"},
    },
    "iade": {"type": "noul", "instructions": "Müşteri para iadesi istiyor."},
    "memnuniyet": {
        "type": "score",
        "instructions": "Müşteri ne kadar memnun?",
        "criteria": ["Çok memnuniyetsiz", "Memnuniyetsiz", "Nötr", "Memnun", "Çok memnun"],
    },
}
answers = agent.predict(state, questions)["answers"]

Bu modelin bu örnekteki cevabı:

Soru Cevap Olasılık
birim kargo 0,949
iade evet 0,927
memnuniyet Çok memnuniyetsiz (seviye 0) 0,771

Her cevapta tüm seçeneklerin olasılıkları (probabilities) ve eşik koymak için answer_confidence da döner.

Soru başına bağlam 8.192 token (soru ve seçenekler için 768); kısa girdiler yalnızca kendi uzunlukları kadar işlenir. Sıcaklıklar (choice, score, noul) eğitimde görülmemiş Türkçe kararlarda kalibre edildi: 0,909, 1,236, 0,870.

Değerlendirme

Test kararlarının hiçbiri eğitimde görülmedi; metni bir test satırında da geçen eğitim satırları, İngilizce orijinaller üzerinden eşleştirilerek eğitimden çıkarıldı (aşağıda). "Önce" sütunu ince ayar öncesi laya-multilingual'dır.

Kaynağa göre

Test seti Karar Doğruluk (önce) Doğruluk (sonra) Fark (puan) ECE (önce) ECE (sonra)
bev-decision-150K-tr test (makine çevirisi) 46.320 0,444 0,771 +32,7 0,275 0,031
bev-decision-150K test, İngilizce orijinal 5.761 0,472 0,775 +30,3 0,243 0,036
jev-bench-tr (benchmark, makine çevirisi) 22.773 0,402 0,490 +8,8 0,295 0,171
jev-bench, İngilizce orijinal 2.000 0,499 0,578 +7,8 0,246 0,105
MASSIVE tr-TR (ana dili Türkçe) 2.974 0,355 0,781 +42,6 0,285 0,063
XNLI Türkçe test (insan çevirisi) 5.010 0,693 0,738 +4,5 0,211 0,095
beyazperde film yorumları (ana dili Türkçe) 5.000 0,180 0,531 +35,1 0,329 0,067
Hepsi 89.838 0,432 0,681 +24,8 0,277 0,070

Soru türüne göre

Tür Karar Doğruluk (önce) Doğruluk (sonra) ECE (önce) ECE (sonra)
choice 39.617 0,448 0,662 0,246 0,090
noul 27.493 0,599 0,823 0,281 0,061
score 22.728 0,204 0,541 0,325 0,071

Nasıl okunmalı

  • Kalibrasyon en büyük kazanç: ECE 0,277 → 0,070. Modelin verdiği olasılıklar eşik koymak için kullanılabilir hale geldi.
  • İngilizce unutulmadı: eğitime İngilizce orijinallerin ~%25'i karıştırıldı; bev ve jev-bench'in İngilizce testlerinde de doğruluk arttı. Diğer diller ölçülmedi.
  • En bağımsız sinyal XNLI (+4,5 puan): ayrı kaynaklı, insan çevirisi bir test. MASSIVE ve beyazperde'deki büyük artışlar kısmen bu kaynakların train bölümlerinin eğitimde olmasından gelir.
  • Bazı jev-bench alt setleri kötüleşti: civil_comments −8,2, paws −6,7, boolq −5,4, mmlu −1,7 puan. Nedeni ayrıca incelenmedi.
  • jev-bench bev ile aynı görev ailelerinden (ör. MASSIVE, CLINC150, SST-5, BoolQ) beslenir; birebir aynı metinler çıkarıldı, ama tamamen bağımsız bir test değildir.

bev-decision alanları (Türkçe test)

Alan Karar Doğruluk (önce) Doğruluk (sonra) ECE (sonra)
Sentiment, emotion, and moderation 11.526 0,616 0,853 0,032
Spatial and logical reasoning 8.384 0,320 0,582 0,087
Retail, product, and shopping 6.601 0,287 0,938 0,064
Response preference and quality 3.176 0,324 0,570 0,039
Support and intent routing 2.858 0,677 0,970 0,054
Tool and workflow decisions 2.307 0,770 0,986 0,065
Software security 2.240 0,415 0,653 0,088
Game-state decisions 2.039 0,345 0,856 0,070
Software engineering and code 2.039 0,322 0,611 0,137
Financial reporting and banking 1.740 0,166 0,599 0,042
Reading comprehension 1.422 0,629 0,705 0,145
Scientific and paper understanding 508 0,372 0,827 0,062
Contract evidence 320 0,334 0,700 0,043
Browser interaction 286 0,276 0,745 0,089
Spam detection 271 0,550 0,956 0,047
Civic and safety operations 261 0,253 0,701 0,076
Sensory quality rating 260 0,073 0,450 0,072
Engagement and ranking 82 0,549 0,573 0,159

jev-bench-tr alt setleri

Alt set Karar Doğruluk (önce) Doğruluk (sonra)
arc_challenge 1.000 0,249 0,254
banking77 1.000 0,270 0,323
boolq 1.000 0,687 0,633
chaosnli 1.599 0,477 0,570
civil_comments 2.000 0,912 0,831
clinc150 1.000 0,250 0,387
fever_evidence 1.000 0,551 0,752
go_emotions 1.000 0,278 0,308
helpsteer2_helpfulness 1.000 0,150 0,156
helpsteer2_verbosity 1.000 0,211 0,299
ledgar 1.000 0,087 0,089
massive 1.000 0,375 0,792
measuring_hate_speech 1.000 0,313 0,602
mmlu 1.000 0,275 0,258
mnli 1.000 0,720 0,769
paws 1.000 0,528 0,461
sms_spam 800 0,328 0,955
sst5 1.000 0,286 0,374
strategyqa_closed 687 0,517 0,512
strategyqa_grounded 687 0,549 0,547
stsb 1.000 0,158 0,207
yelp5 1.000 0,185 0,436

banking77 (77) ve clinc150 (150 seçenek) gibi çok seçenekli sorularda seçenekler 768 tokenlık soru bütçesine sığmak için kısalır; bu, Laya'nın bilinen bir sınırıdır (#394).

Eğitim sırasında doğrulama

Eğitimden ayrılan, metne göre gruplanmış 1.518 Türkçe karar (sıcaklık kalibrasyonu öncesi):

Epoch Doğruluk NLL Brier ECE
1 0,784 0,571 0,300 0,057
2 0,785 0,569 0,296 0,072

İkinci epoch çok az katkı verdi; daha fazla epoch önerilmez.

Eğitim verisi

Kaynak Satır Karar choice / noul / score
bev-decision-150K-tr train (Türkçe, makine çevirisi) 102.784 206.166 69.041 / 89.653 / 47.472
bev-decision-150K train, İngilizce orijinal (Türkçe satırların ikizleri) 34.261 68.714 22.974 / 29.958 / 15.782
MASSIVE tr-TR train (ana dili Türkçe) 5.000 5.000 5.000 / 0 / 0
XNLI Türkçe validation (insan çevirisi) 2.490 2.490 2.490 / 0 / 0
beyazperde film yorumları train (ana dili Türkçe) 5.000 5.000 0 / 0 / 5.000
Toplam 149.535 287.370

Bunlardan metne göre gruplanmış 1.518 Türkçe karar doğrulama ve kalibrasyon için ayrıldı; bu kararların İngilizce ikizleri de eğitimden çıkarıldı. Eğitimde 285.363 karar kullanıldı.

  • Hedefler: Etiketler sorulardan çıkarılıp hedef olasılıklara çevrildi. Sert etiketler 0,1 ile yumuşatıldı (doğru cevaba 0,9; score sorularında kalan pay komşu seviyelere). Laya'nın eğitim yöntemi (RLCD) bu dağılımları hedefler.

  • Alan dengesi: Türkçenin sinyal taşımadığı ya da etiketlerin gürültülü olduğu bev alanlarından eğitim satırlarının bir kısmı tutuldu:

    Alan Tutulan oran Çıkarılan satır
    Software engineering and code 0,3 4.376
    Spatial and logical reasoning 0,3 11.581
    Browser interaction 0,3 3.202
    Engagement and ranking 0,2 3.318
  • Örtüşme temizliği: Bir test satırında da geçen metni içeren eğitim satırları çıkarıldı:

    Eğitim kaynağı Test kaynağı Çıkarılan eğitim satırı
    bev-decision-tr jev-bench-tr 337
    bev-decision-tr beyazperde 6
    bev-decision-tr MASSIVE tr-TR 10
    MASSIVE tr-TR bev-decision-tr 477
    MASSIVE tr-TR jev-bench-tr 16
    MASSIVE tr-TR MASSIVE tr-TR 16
    beyazperde beyazperde 76
  • Bağlam bütçesi: Hiçbir eğitim kararı 8.192 tokena sığmadığı ya da doğru seçeneği kısaltılınca başka bir seçenekle aynı göründüğü için çıkarılmadı. Eğitim kararlarının token uzunluğu: medyan 177, %90 494, %99 1.521, en fazla 7.430.

bev-decision-150K'nın Türkçesi bir LLM ile alan bazında çevrildi; kod blokları, tanımlayıcılar, URL'ler ve Mind2Web sayfa öğeleri İngilizce bırakıldı. Ayrıntılar: hayriyigit/bev-decision-150K-tr.

Eğitim

Taban model convaiinnovations/laya-multilingual (mmBERT-base encoder + Laya karar başlığı)
Yöntem Laya'nın RLCD tarifi: gürültülü logit örnekleri üzerinde proper scoring ödülüyle policy gradient + yumuşak cross-entropy
Epoch / güncelleme 2 / 17.836 (her güncellemede 32 karar)
Öğrenme hızı encoder 1e-5, karar başlığı 1e-4; AdamW, cosine
Hassasiyet bf16, gradient checkpointing
Bağlam max_len 8.192, head_max_len 768
Donanım ve süre 1 × NVIDIA GeForce RTX 5090 (32 GB); eğitim ~1 sa 13 dk, veri hazırlığı ve değerlendirmeyle ~1 sa 28 dk
Yazılım torch 2.14.1, transformers 5.18.0, laya 0.3.24 (commit fa9a2a7)

Eğitim config'i, eğitim kaydı ve veri manifest'i training/ klasöründe; tüm metrikler eval_report.json'da.

Sınırlamalar

  • Eğitim verisinin çoğu makine çevirisidir; model çeviri dilinin izlerini taşıyabilir. Ana dili Türkçe veri sınırlıdır (~12 bin satır).
  • Kod, teknik tanımlayıcılar ve web sayfası öğeleri eğitimde İngilizce kaldı; bu tür girdilerde karışık dil beklenir.
  • Yalnızca Türkçe ve İngilizce değerlendirildi; diğer dillerdeki performans ince ayar öncesine göre düşmüş olabilir.
  • Kalibrasyon Türkçe veriyle yapıldı; farklı bir alanda kullanmadan önce kendi verinizle eşikleri kontrol edin.
  • 77'den fazla seçenekli sorularda seçenek açıklamaları kısalır.

Lisans

Taban model Apache-2.0'dır. Eğitim verilerinin lisansları farklıdır; ayrıntılar LICENSE.md'de. Ticari kullanımdan önce kontrol edin.

Downloads last month
-
Safetensors
Model size
0.3B params
Tensor type
F16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for hayriyigit/laya-tr

Finetuned
(53)
this model

Datasets used to train hayriyigit/laya-tr