Banka Diyalog Asistanı — Gemma 3 4B LoRA Adaptörü

unsloth/gemma-3-4b-it temel modeli üzerine, Türkçe bankacılık/finans müşteri asistanı olarak fine-tune edilmiş LoRA adaptörü.

Detaylar

  • Temel model: unsloth/gemma-3-4b-it
  • Yöntem: LoRA (r=32, lora_alpha=32), unsloth ile
  • Eğitim verisi: Resad2173/Banka_Diyalog_Magibu (742 train / 100 test)
  • Epoch: 2
  • Son train loss: ~0.47
  • Eval loss (test seti): ~0.616

Genel Benchmark Sonuçları (MMLU-TR / TruthfulQA-TR)

Fine-tune edilmiş model (banka_model), taban model (gemma3:4b) ile Ollama üzerinden karşılaştırıldı.

Benchmark Banka Modeli Taban Model (gemma3:4b) Fark
MMLU-TR (62 bölümden stratified 6200 soru) %58.00 %59.58 -1.58
TruthfulQA-TR (816 soru, malhajar/truthfull_qa-tr) %61.76 %56.86 +4.90

Yorum: Fine-tuning, genel akademik bilgide (MMLU) küçük bir gerilemeye yol açtı — bu, literatürde "catastrophic forgetting" olarak bilinen, domain-spesifik fine-tuning'in bilinen bir yan etkisidir. Ancak doğruluk/halüsinasyon direncini ölçen TruthfulQA'da banka modeli taban modelden daha iyi performans gösterdi; bu, eğitim verisindeki temkinli, aşırı iddialı olmayan cevap tarzının modelin yanıltıcı bilgi üretme eğilimini azaltmış olabileceğini düşündürüyor.

Kullanım

from unsloth import FastLanguageModel

model, tokenizer = FastLanguageModel.from_pretrained(
    model_name="Resad2173/Gemma3_Banka_LoRA_Magibu",
    max_seq_length=2048,
    load_in_4bit=True,
)
FastLanguageModel.for_inference(model)

Örnek Çıktılar (Genel)

Test setinden rastgele seçilen sorular, model hiç görmediği veriyle test edildi:

Soru: Kredi kartımdaki kampanya ve fırsatları nasıl öğrenebilirim? Model cevabı: Kampanyaları öğrenmek için bankanızın web sitesini kontrol edebilir, mobil uygulamanızdaki güncellemeleri takip edebilir ya da müşteri hizmetleriyle iletişime geçebilirsiniz.

Soru: DASK poliçemi yıllık mı, aylık mı ödeyebilirim? Model cevabı: DASK poliçesi genellikle yıllık olarak ödenir. Ancak bazı sigorta şirketleri aylık ödeme seçenekleri sunabilir.

Soru: Hangi kredileri alabileceğimi nasıl öğrenebilirim? Model cevabı: Hangi kredileri alabileceğinizi öğrenmek için bankanızın web sitesini ziyaret edebilir veya müşteri hizmetleri ile iletişime geçebilirsiniz.

Soru: Vadeli hesabımın faizi ne zaman yatacak? Model cevabı: Vadeli hesabınızın faizi, başvurduğunuz süreye bağlı olarak nakite çevrilip alınabilir. Çevrim süresi bankanıza göre değişiklik gösterebilir.


Özel Benchmark: Bankacılık Senaryosu Değerlendirmesi

Genel amaçlı MMLU ve TruthfulQA testlerine ek olarak, modelin kendi hedef senaryosunda (Türkçe bankacılık/finans müşteri asistanlığı) nasıl performans gösterdiğini ölçmek için özel bir benchmark oluşturuldu.

Test Seti

  • 100 soruBanka_Diyalog_Magibu veri setinin eğitimde hiç kullanılmamış test split'inden 83 soru + benchmark için özel olarak elle yazılmış 17 soru
  • 17 elle yazılmış soru (source: "handwritten-benchmark"), gerçek bankacılık senaryolarını (ortak hesap, haciz, veraset, kurumsal kart, otomatik ödeme talimatı gibi) kapsayacak şekilde düşünülerek hazırlandı
  • Her soru bir referans (doğru) cevap içeriyor, bu da modellerin cevaplarını nesnel olarak değerlendirmeyi mümkün kılıyor

Karşılaştırılan 5 Model

Model Tür Not
banka_model Bu projede fine-tune edilen model Gemma 3 4B + LoRA
gemma3:4b Taban model Fine-tune öncesi karşılaştırma
aya:8b Cohere Aya 23 (8B) Resmi olarak Türkçe dahil 23 dil destekliyor
gemma3:1b Gemma 3'ün küçük versiyonu Resmi olarak 140+ dil destekliyor
qwen3:1.7b Qwen3'ün küçük versiyonu Resmi olarak 119 dil (Türkçe dahil) destekliyor

Not: İlk denemede Qwen2.5-1.5B, Llama 3.2 1B ve Gemma 2 2B seçilmişti, ancak bu üç modelin resmi dil desteği listelerinde Türkçe bulunmadığı sonradan fark edildi (üretilen cevaplarda Japonca'ya kayma, dil karışımı gibi belirtiler gözlemlendi). Bu üçü, resmi olarak Türkçe desteği doğrulanmış modellerle (Aya 23, Gemma 3 1B, Qwen3 1.7B) değiştirildi.

Yöntem

Tüm modeller, Google Colab'in ücretsiz T4 GPU'su üzerinde Ollama aracılığıyla çalıştırıldı:

  1. Fine-tune edilmiş LoRA modeli unsloth ile yüklenip, GGUF formatına (Q4_K_M quantization) dönüştürüldü
  2. Ollama sunucusu Colab içinde başlatılıp, GGUF model + 4 karşılaştırma modeli (ollama pull) yüklendi
  3. Her model için 100 soru sorulup cevaplar toplandı (num_predict=200 ile tüm modellerde tutarlı bir üst token sınırı uygulandı)
  4. Her cevap iki yöntemle puanlandı:
    • Anlamsal benzerlik: paraphrase-multilingual-mpnet-base-v2 embedding modeliyle, cevabın referansa anlam olarak yakınlığı (0-100)
    • LLM hakemliği: GPT-4o-mini'ye, referans cevap + 5 modelin cevabı tek bir istekte birlikte gönderilip her biri referansa göre bağımsız olarak 1-100 puanlandı (modeller birbiriyle değil, sabit referansla karşılaştırıldı)
  5. İki puanın ortalaması, nihai "birleşik puan" olarak alındı

T4 GPU Üzerinde Karşılaşılan Zorluklar

Bu benchmark'ı çalıştırmak, birkaç teknik engelin aşılmasını gerektirdi:

  • GGUF dönüşümü CPU-yoğun ve yavaş — quantization adımı tek başına ~10-15 dakika sürdü
  • Ollama kurulumu zstd bağımlılığı gerektiriyordu, Colab'de varsayılan olarak kurulu değildi, kurulum ilk denemede bu yüzden başarısız oldu
  • Ollama sunucusu birkaç kez beklenmedik şekilde çöktü (model runner has unexpectedly stopped), muhtemelen unsloth'un GGUF dönüşümü için yüklediği orijinal modelin GPU belleğinde kalıp Ollama ile çakışmasından kaynaklandı; del model + torch.cuda.empty_cache() ile bellek boşaltılarak çözüldü
  • Tutarsız üretim ayarları — bazı cevaplar token sınırı olmadan, bazıları sonradan eklenen num_predict=200 sınırıyla üretilmişti; fark edilince tüm modellerin cevapları tutarlı ayarla sıfırdan yeniden üretildi
  • Colab oturumu internet kesintisi nedeniyle koptu, GGUF dönüşümü yarım kaldı, ertesi gün sıfırdan tekrarlanması gerekti
  • Ücretsiz Colab GPU kotası bir noktada doldu ("Colab'deki kullanım sınırları nedeniyle GPU'ya bağlanamazsınız"), farklı bir hesapla devam edildi
  • Birden fazla model aynı anda GPU belleğinde tutulduğunda yavaşlama yaşandı, ollama stop <model> ile modeller fazlar arasında tek tek boşaltılarak çözüldü

Örnek Cevaplar (Özel Benchmark)

Soru: Kredi kartımdaki kampanya ve fırsatları nasıl öğrenebilirim? Referans cevap: Kampanya ve fırsatları bankanın mobil uygulaması veya web sitesinden takip edebilirsin.

Model Cevap
banka_model Kampanya ve fırsatlarını mobil uygulama üzerinden veya bankanın resmi web sitesinden takip edebilirsin. Ayrıca, e-posta bildirimleri kurduysan bu güncellemeleri de alırsın.
aya:8b Kredi kartınızdaki kampanyalar ve fırsatlar genellikle kartınızla ilişkili bankanın web sitesi veya mobil uygulaması aracılığıyla erişilebilir... (uzun, maddeli açıklama)
gemma3:1b Kredi kartının kampanyaları ve fırsatı hakkında bilgi edinmek için yapabiliyorum... (bazı gramer hataları içeriyor)

Soru: DASK poliçemi yıllık mı, aylık mı ödeyebilirim? Referans cevap: DASK poliçenizi genellikle yıllık olarak tek seferde ödemeniz gerekiyor. Ancak bazı sigorta şirketleri aylık ödeme seçeneği de sunabilir.

Model Cevap
banka_model DASK poliçeniz genellikle bir yıl içerisinde tüm primi tek seferde ödemek üzere düzenlenmiştir. Ayrıca, bazı sigorta şirketleri aylık ödeme seçeneği sunabilmektedir.
aya:8b DASK poliçelerini, yıllık olarak ödeyebilirsiniz.
qwen3:1.7b (tutarsız/kendi içinde çelişen bir cevap üretti — bkz. Sınırlamalar)

Özel Benchmark Sonuçları

Model Anlamsal Benzerlik LLM Hakemi Birleşik Ortalama
aya:8b 74.43 75.35 74.89
banka_model 79.31 69.20 74.26
gemma3:4b 64.10 78.80 71.45
gemma3:1b 62.98 59.95 61.47
qwen3:1.7b 64.47 55.68 60.08

Yorum:

  • banka_model, anlamsal benzerlikte en yüksek skoru aldı (79.31) — fine-tuning'in modeli, referans cevaplara üslup ve içerik olarak en yakın, kısa ve öz cevaplar vermeye başarıyla yönlendirdiğinin somut kanıtı.
  • LLM hakemi (GPT-4o-mini) daha detaylı/kapsamlı cevapları (aya:8b, gemma3:4b) görece daha yüksek puanladı — bu, kısa/öz cevap tarzı ile "eksiksizlik" algısı arasındaki bilinen bir gerilimi yansıtıyor.
  • Birleşik ortalamada aya:8b ile banka_model arasındaki fark sadece 0.63 puan — yani 4B parametrelik, bankacılığa özel fine-tune edilmiş modelimiz, 8B parametrelik, özel olarak çok dilliliğe odaklanmış bir modelle neredeyse eş düzeyde performans gösterdi.
  • 1-2B parametreli küçük modeller (gemma3:1b, qwen3:1.7b), resmi Türkçe desteklerine rağmen belirgin şekilde daha düşük performans gösterdi — bu, dil desteği iddiasının tek başına yeterli olmadığını, model boyutunun da kaliteyi doğrudan etkilediğini gösteriyor.

Sınırlamalar (Özel Benchmark)

  • Test setindeki 83 soru, orijinal 825 satırlık veri setinden rastgele ayrılmıştı; 17'si ise özellikle bu benchmark için elle eklendi
  • qwen3:1.7b, bazı sorularda kendi içinde çelişen ya da tekrar döngüsüne giren (aynı kelimeyi art arda tekrarlama) cevaplar üretti — bu, küçük modellerde bilinen bir davranış, repeat_penalty gibi ek ayarlarla iyileştirilebilir
  • LLM hakemliği (GPT-4o-mini) kendi başına mükemmel bir ölçüt değil; bu yüzden anlamsal benzerlikle birlikte, iki farklı açıdan bakılarak dengelendi

Kaynaklar

  • Ham cevaplar: ozel_benchmark_ham_cevaplar/ klasörü
  • Puanlanmış sonuçlar: ozel_benchmark_puanlanmis/ klasörü
  • Test/puanlama kodu: ozel_benchmark.py
  • Kullanılan test seti: Resad2173/Banka_Diyalog_Magibu (test split)

Genel Sınırlamalar

  • Eğitim verisi sentetik olarak (GPT-4o-mini ile) üretildiği için, bazı yanıtlarda nadiren hatalı/karışık bilgi (halüsinasyon) görülebilir.
  • Model, belirli bir bankanın güncel kampanya/politika bilgisini değil, genel bankacılık pratiğini yansıtır.

Maintenance

Hazırlayan: Resad2173

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Resad2173/Gemma3_Banka_LoRA_Magibu

Adapter
(28)
this model