Instructions to use Resad2173/Gemma3_Banka_LoRA_Magibu with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Local Apps Settings
- Unsloth Studio
How to use Resad2173/Gemma3_Banka_LoRA_Magibu with Unsloth Studio:
Install Unsloth Studio (macOS, Linux, WSL)
curl -fsSL https://unsloth.ai/install.sh | sh # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for Resad2173/Gemma3_Banka_LoRA_Magibu to start chatting
Install Unsloth Studio (Windows)
irm https://unsloth.ai/install.ps1 | iex # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for Resad2173/Gemma3_Banka_LoRA_Magibu to start chatting
Using HuggingFace Spaces for Unsloth
# No setup required # Open https://huggingface.co/spaces/unsloth/studio in your browser # Search for Resad2173/Gemma3_Banka_LoRA_Magibu to start chatting
Load model with FastModel
pip install unsloth from unsloth import FastModel model, tokenizer = FastModel.from_pretrained( model_name="Resad2173/Gemma3_Banka_LoRA_Magibu", max_seq_length=2048, )
Banka Diyalog Asistanı — Gemma 3 4B LoRA Adaptörü
unsloth/gemma-3-4b-it temel modeli üzerine, Türkçe bankacılık/finans müşteri asistanı olarak fine-tune edilmiş LoRA adaptörü.
Detaylar
- Temel model: unsloth/gemma-3-4b-it
- Yöntem: LoRA (r=32, lora_alpha=32), unsloth ile
- Eğitim verisi: Resad2173/Banka_Diyalog_Magibu (742 train / 100 test)
- Epoch: 2
- Son train loss: ~0.47
- Eval loss (test seti): ~0.616
Genel Benchmark Sonuçları (MMLU-TR / TruthfulQA-TR)
Fine-tune edilmiş model (banka_model), taban model (gemma3:4b) ile Ollama üzerinden karşılaştırıldı.
| Benchmark | Banka Modeli | Taban Model (gemma3:4b) | Fark |
|---|---|---|---|
| MMLU-TR (62 bölümden stratified 6200 soru) | %58.00 | %59.58 | -1.58 |
| TruthfulQA-TR (816 soru, malhajar/truthfull_qa-tr) | %61.76 | %56.86 | +4.90 |
Yorum: Fine-tuning, genel akademik bilgide (MMLU) küçük bir gerilemeye yol açtı — bu, literatürde "catastrophic forgetting" olarak bilinen, domain-spesifik fine-tuning'in bilinen bir yan etkisidir. Ancak doğruluk/halüsinasyon direncini ölçen TruthfulQA'da banka modeli taban modelden daha iyi performans gösterdi; bu, eğitim verisindeki temkinli, aşırı iddialı olmayan cevap tarzının modelin yanıltıcı bilgi üretme eğilimini azaltmış olabileceğini düşündürüyor.
Kullanım
from unsloth import FastLanguageModel
model, tokenizer = FastLanguageModel.from_pretrained(
model_name="Resad2173/Gemma3_Banka_LoRA_Magibu",
max_seq_length=2048,
load_in_4bit=True,
)
FastLanguageModel.for_inference(model)
Örnek Çıktılar (Genel)
Test setinden rastgele seçilen sorular, model hiç görmediği veriyle test edildi:
Soru: Kredi kartımdaki kampanya ve fırsatları nasıl öğrenebilirim? Model cevabı: Kampanyaları öğrenmek için bankanızın web sitesini kontrol edebilir, mobil uygulamanızdaki güncellemeleri takip edebilir ya da müşteri hizmetleriyle iletişime geçebilirsiniz.
Soru: DASK poliçemi yıllık mı, aylık mı ödeyebilirim? Model cevabı: DASK poliçesi genellikle yıllık olarak ödenir. Ancak bazı sigorta şirketleri aylık ödeme seçenekleri sunabilir.
Soru: Hangi kredileri alabileceğimi nasıl öğrenebilirim? Model cevabı: Hangi kredileri alabileceğinizi öğrenmek için bankanızın web sitesini ziyaret edebilir veya müşteri hizmetleri ile iletişime geçebilirsiniz.
Soru: Vadeli hesabımın faizi ne zaman yatacak? Model cevabı: Vadeli hesabınızın faizi, başvurduğunuz süreye bağlı olarak nakite çevrilip alınabilir. Çevrim süresi bankanıza göre değişiklik gösterebilir.
Özel Benchmark: Bankacılık Senaryosu Değerlendirmesi
Genel amaçlı MMLU ve TruthfulQA testlerine ek olarak, modelin kendi hedef senaryosunda (Türkçe bankacılık/finans müşteri asistanlığı) nasıl performans gösterdiğini ölçmek için özel bir benchmark oluşturuldu.
Test Seti
- 100 soru —
Banka_Diyalog_Magibuveri setinin eğitimde hiç kullanılmamıştestsplit'inden 83 soru + benchmark için özel olarak elle yazılmış 17 soru - 17 elle yazılmış soru (
source: "handwritten-benchmark"), gerçek bankacılık senaryolarını (ortak hesap, haciz, veraset, kurumsal kart, otomatik ödeme talimatı gibi) kapsayacak şekilde düşünülerek hazırlandı - Her soru bir referans (doğru) cevap içeriyor, bu da modellerin cevaplarını nesnel olarak değerlendirmeyi mümkün kılıyor
Karşılaştırılan 5 Model
| Model | Tür | Not |
|---|---|---|
banka_model |
Bu projede fine-tune edilen model | Gemma 3 4B + LoRA |
gemma3:4b |
Taban model | Fine-tune öncesi karşılaştırma |
aya:8b |
Cohere Aya 23 (8B) | Resmi olarak Türkçe dahil 23 dil destekliyor |
gemma3:1b |
Gemma 3'ün küçük versiyonu | Resmi olarak 140+ dil destekliyor |
qwen3:1.7b |
Qwen3'ün küçük versiyonu | Resmi olarak 119 dil (Türkçe dahil) destekliyor |
Not: İlk denemede Qwen2.5-1.5B, Llama 3.2 1B ve Gemma 2 2B seçilmişti, ancak bu üç modelin resmi dil desteği listelerinde Türkçe bulunmadığı sonradan fark edildi (üretilen cevaplarda Japonca'ya kayma, dil karışımı gibi belirtiler gözlemlendi). Bu üçü, resmi olarak Türkçe desteği doğrulanmış modellerle (Aya 23, Gemma 3 1B, Qwen3 1.7B) değiştirildi.
Yöntem
Tüm modeller, Google Colab'in ücretsiz T4 GPU'su üzerinde Ollama aracılığıyla çalıştırıldı:
- Fine-tune edilmiş LoRA modeli unsloth ile yüklenip, GGUF formatına (Q4_K_M quantization) dönüştürüldü
- Ollama sunucusu Colab içinde başlatılıp, GGUF model + 4 karşılaştırma modeli (
ollama pull) yüklendi - Her model için 100 soru sorulup cevaplar toplandı (
num_predict=200ile tüm modellerde tutarlı bir üst token sınırı uygulandı) - Her cevap iki yöntemle puanlandı:
- Anlamsal benzerlik:
paraphrase-multilingual-mpnet-base-v2embedding modeliyle, cevabın referansa anlam olarak yakınlığı (0-100) - LLM hakemliği: GPT-4o-mini'ye, referans cevap + 5 modelin cevabı tek bir istekte birlikte gönderilip her biri referansa göre bağımsız olarak 1-100 puanlandı (modeller birbiriyle değil, sabit referansla karşılaştırıldı)
- Anlamsal benzerlik:
- İki puanın ortalaması, nihai "birleşik puan" olarak alındı
T4 GPU Üzerinde Karşılaşılan Zorluklar
Bu benchmark'ı çalıştırmak, birkaç teknik engelin aşılmasını gerektirdi:
- GGUF dönüşümü CPU-yoğun ve yavaş — quantization adımı tek başına ~10-15 dakika sürdü
- Ollama kurulumu
zstdbağımlılığı gerektiriyordu, Colab'de varsayılan olarak kurulu değildi, kurulum ilk denemede bu yüzden başarısız oldu - Ollama sunucusu birkaç kez beklenmedik şekilde çöktü (
model runner has unexpectedly stopped), muhtemelen unsloth'un GGUF dönüşümü için yüklediği orijinal modelin GPU belleğinde kalıp Ollama ile çakışmasından kaynaklandı;del model+torch.cuda.empty_cache()ile bellek boşaltılarak çözüldü - Tutarsız üretim ayarları — bazı cevaplar token sınırı olmadan, bazıları sonradan eklenen
num_predict=200sınırıyla üretilmişti; fark edilince tüm modellerin cevapları tutarlı ayarla sıfırdan yeniden üretildi - Colab oturumu internet kesintisi nedeniyle koptu, GGUF dönüşümü yarım kaldı, ertesi gün sıfırdan tekrarlanması gerekti
- Ücretsiz Colab GPU kotası bir noktada doldu ("Colab'deki kullanım sınırları nedeniyle GPU'ya bağlanamazsınız"), farklı bir hesapla devam edildi
- Birden fazla model aynı anda GPU belleğinde tutulduğunda yavaşlama yaşandı,
ollama stop <model>ile modeller fazlar arasında tek tek boşaltılarak çözüldü
Örnek Cevaplar (Özel Benchmark)
Soru: Kredi kartımdaki kampanya ve fırsatları nasıl öğrenebilirim? Referans cevap: Kampanya ve fırsatları bankanın mobil uygulaması veya web sitesinden takip edebilirsin.
| Model | Cevap |
|---|---|
banka_model |
Kampanya ve fırsatlarını mobil uygulama üzerinden veya bankanın resmi web sitesinden takip edebilirsin. Ayrıca, e-posta bildirimleri kurduysan bu güncellemeleri de alırsın. |
aya:8b |
Kredi kartınızdaki kampanyalar ve fırsatlar genellikle kartınızla ilişkili bankanın web sitesi veya mobil uygulaması aracılığıyla erişilebilir... (uzun, maddeli açıklama) |
gemma3:1b |
Kredi kartının kampanyaları ve fırsatı hakkında bilgi edinmek için yapabiliyorum... (bazı gramer hataları içeriyor) |
Soru: DASK poliçemi yıllık mı, aylık mı ödeyebilirim? Referans cevap: DASK poliçenizi genellikle yıllık olarak tek seferde ödemeniz gerekiyor. Ancak bazı sigorta şirketleri aylık ödeme seçeneği de sunabilir.
| Model | Cevap |
|---|---|
banka_model |
DASK poliçeniz genellikle bir yıl içerisinde tüm primi tek seferde ödemek üzere düzenlenmiştir. Ayrıca, bazı sigorta şirketleri aylık ödeme seçeneği sunabilmektedir. |
aya:8b |
DASK poliçelerini, yıllık olarak ödeyebilirsiniz. |
qwen3:1.7b |
(tutarsız/kendi içinde çelişen bir cevap üretti — bkz. Sınırlamalar) |
Özel Benchmark Sonuçları
| Model | Anlamsal Benzerlik | LLM Hakemi | Birleşik Ortalama |
|---|---|---|---|
| aya:8b | 74.43 | 75.35 | 74.89 |
| banka_model | 79.31 | 69.20 | 74.26 |
| gemma3:4b | 64.10 | 78.80 | 71.45 |
| gemma3:1b | 62.98 | 59.95 | 61.47 |
| qwen3:1.7b | 64.47 | 55.68 | 60.08 |
Yorum:
banka_model, anlamsal benzerlikte en yüksek skoru aldı (79.31) — fine-tuning'in modeli, referans cevaplara üslup ve içerik olarak en yakın, kısa ve öz cevaplar vermeye başarıyla yönlendirdiğinin somut kanıtı.- LLM hakemi (GPT-4o-mini) daha detaylı/kapsamlı cevapları (aya:8b, gemma3:4b) görece daha yüksek puanladı — bu, kısa/öz cevap tarzı ile "eksiksizlik" algısı arasındaki bilinen bir gerilimi yansıtıyor.
- Birleşik ortalamada
aya:8bilebanka_modelarasındaki fark sadece 0.63 puan — yani 4B parametrelik, bankacılığa özel fine-tune edilmiş modelimiz, 8B parametrelik, özel olarak çok dilliliğe odaklanmış bir modelle neredeyse eş düzeyde performans gösterdi. - 1-2B parametreli küçük modeller (gemma3:1b, qwen3:1.7b), resmi Türkçe desteklerine rağmen belirgin şekilde daha düşük performans gösterdi — bu, dil desteği iddiasının tek başına yeterli olmadığını, model boyutunun da kaliteyi doğrudan etkilediğini gösteriyor.
Sınırlamalar (Özel Benchmark)
- Test setindeki 83 soru, orijinal 825 satırlık veri setinden rastgele ayrılmıştı; 17'si ise özellikle bu benchmark için elle eklendi
qwen3:1.7b, bazı sorularda kendi içinde çelişen ya da tekrar döngüsüne giren (aynı kelimeyi art arda tekrarlama) cevaplar üretti — bu, küçük modellerde bilinen bir davranış,repeat_penaltygibi ek ayarlarla iyileştirilebilir- LLM hakemliği (GPT-4o-mini) kendi başına mükemmel bir ölçüt değil; bu yüzden anlamsal benzerlikle birlikte, iki farklı açıdan bakılarak dengelendi
Kaynaklar
- Ham cevaplar:
ozel_benchmark_ham_cevaplar/klasörü - Puanlanmış sonuçlar:
ozel_benchmark_puanlanmis/klasörü - Test/puanlama kodu:
ozel_benchmark.py - Kullanılan test seti: Resad2173/Banka_Diyalog_Magibu (
testsplit)
Genel Sınırlamalar
- Eğitim verisi sentetik olarak (GPT-4o-mini ile) üretildiği için, bazı yanıtlarda nadiren hatalı/karışık bilgi (halüsinasyon) görülebilir.
- Model, belirli bir bankanın güncel kampanya/politika bilgisini değil, genel bankacılık pratiğini yansıtır.
Maintenance
Hazırlayan: Resad2173