Uploaded finetuned model

  • Developed by: uzcaliskan
  • License: cc-by-nc-nd-4.0
  • Finetuned from model : unsloth/qwen3-8b-unsloth-bnb-4bit

This qwen3 model was trained 2x faster with Unsloth and Huggingface's TRL library.


base_model: unsloth/qwen3-8b-unsloth-bnb-4bit tags: - text-generation-inference - transformers - unsloth - qwen3 license: apache-2.0 language: - en

Model Karşılaştırma Sonuçları (son güncelleme: 2026-07-28 03:38)

Bu 7 model, uzcaliskan/kth-tekop-sondaj-mmlu-testi veri setindeki 100 soruluk sondaj MMLU test setinde karşılaştırılmıştır.

1. Genel Sonuçlar

Sıra Model Parametre Sayısı Boyut (GB) Kuantizasyon Doğru Toplam Başarı % %95 Güven Aralığı
1 gemma4:12b 11.9B 7.04 Q4_K_M 80 100 80.00 [71.1, 86.7]
2 qwen3:latest 8.2B 4.87 Q4_K_M 79 100 79.00 [70.0, 85.8]
3 qwen3.5:latest 9.7B 6.14 Q4_K_M 75 100 75.00 [65.7, 82.5]
4 kth_tekop_sondaj:latest (thinking) 8.2B 4.68 Q4_K_M 74 100 74.00 [64.6, 81.6]
5 kth_tekop_sondaj:latest 8.2B 4.68 Q4_K_M 72 100 72.00 [62.5, 79.9]
6 llama3.1:8b 8.0B 4.58 Q4_K_M 70 100 70.00 [60.4, 78.1]
7 phi3:mini 3.8B 2.03 Q4_0 34 100 34.00 [25.5, 43.7]

2. Kategori Bazlı Kırılım (doğru/toplam)

Kategori Toplam gemma4:12b qwen3:latest qwen3.5:latest kth_tekop_sondaj:latest (thinking) kth_tekop_sondaj:latest llama3.1:8b phi3:mini
centralizer 9 5/9 (%56) 7/9 (%78) 5/9 (%56) 7/9 (%78) 7/9 (%78) 7/9 (%78) 5/9 (%56)
dst_log_operasyonu 9 9/9 (%100) 8/9 (%89) 6/9 (%67) 9/9 (%100) 9/9 (%100) 8/9 (%89) 4/9 (%44)
durum_tespiti 10 9/10 (%90) 10/10 (%100) 9/10 (%90) 9/10 (%90) 8/10 (%80) 8/10 (%80) 2/10 (%20)
fishing 4 3/4 (%75) 3/4 (%75) 4/4 (%100) 4/4 (%100) 4/4 (%100) 2/4 (%50) 1/4 (%25)
guncel_faz 10 9/10 (%90) 9/10 (%90) 9/10 (%90) 8/10 (%80) 9/10 (%90) 5/10 (%50) 4/10 (%40)
kacak_durumu 10 8/10 (%80) 7/10 (%70) 7/10 (%70) 8/10 (%80) 5/10 (%50) 6/10 (%60) 1/10 (%10)
kuyudaki_casing 10 9/10 (%90) 10/10 (%100) 9/10 (%90) 10/10 (%100) 10/10 (%100) 9/10 (%90) 4/10 (%40)
sapma_acisi 6 6/6 (%100) 6/6 (%100) 6/6 (%100) 6/6 (%100) 6/6 (%100) 6/6 (%100) 2/6 (%33)
siradaki_casing 10 5/10 (%50) 3/10 (%30) 6/10 (%60) 2/10 (%20) 1/10 (%10) 5/10 (%50) 3/10 (%30)
siradaki_operasyon 22 17/22 (%77) 16/22 (%73) 14/22 (%64) 11/22 (%50) 13/22 (%59) 14/22 (%64) 8/22 (%36)

3. Soru Bazlı Cevaplar

ID Kategori Doğru Cevap gemma4:12b qwen3:latest qwen3.5:latest kth_tekop_sondaj:latest (thinking) kth_tekop_sondaj:latest llama3.1:8b phi3:mini
1 kuyudaki_casing A A ✓ A ✓ A ✓ A ✓ A ✓ A ✓ D ✗
2 kuyudaki_casing D D ✓ D ✓ D ✓ D ✓ D ✓ D ✓ Soru: Aşağıdaki günlük sondaj raporuna göre, kuyudaki son (en son inilmiş) casing çap ✓
3 kuyudaki_casing A A ✓ A ✓ C ✗ A ✓ A ✓ A ✓ Soru: Aşağıdaki günlük sondaj raporuna göre, kuyudaki son (en son inilmiş) casing ç ✗
4 kuyudaki_casing E E ✓ E ✓ E ✓ E ✓ E ✓ B ✗ Answer: E - Since the question asks for only one correct choice and gives detailed information about a shoe track concrete job including measurements, we can look at relevant data to find answers. The "Kuyud ✗
5 kuyudaki_casing D A ✗ D ✓ D ✓ D ✓ D ✓ D ✓ Soru: Aşağıdaki günlük sondaj raporuna göre, kuyudaki son (en son inilmiş) casing çap ✗
6 guncel_faz D D ✓ D ✓ D ✓ A ✗ D ✓ C ✗ D: 12 1/4 ✓
7 guncel_faz B B ✓ B ✓ B ✓ B ✓ B ✓ B ✓ B: 17 1/2 ✓
8 guncel_faz C D ✗ D ✗ D ✗ D ✗ D ✗ D ✗ Soru: Aşağıdaki günlük sondaj raporuna göre, kuyuda güncel olarak hangi çapta sondaj ✗
9 guncel_faz D D ✓ D ✓ D ✓ D ✓ D ✓ B ✗ B: 7
10 guncel_faz B B ✓ B ✓ B ✓ B ✓ B ✓ B ✓ B: 7 ✓
11 kacak_durumu E E ✓ E ✓ E ✓ B ✗ B ✗ B ✗ A: Evet, kaçak var (hafif/orta seviyede) - Bu sorunda bu cevabini oluşturmaktadır. A ✗
12 kacak_durumu D D ✓ D ✓ B ✗ A ✗ A ✗ B ✗ C: Evet, kaçak var (şiddetli seviyede, ≥5dependently on the specific context of a given region). In an area where illegal oil siphoning ✗
13 kacak_durumu D D ✓ D ✓ E ✓ A ✓ A ✓ E ✓ C: Kaçak var ama miktarı belirtilmemiş
14 kacak_durumu A A ✓ A ✓ A ✓ A ✓ A ✓ A ✓ B: Evet, kaçak var (hafif/orta seviyede)
15 kacak_durumu C B ✗ B ✗ B ✗ C ✓ C ✓ C ✓ B: Hayır, kaçak yok. Açıklama: Bu sorunu gözde ayaktağın kuyusuz durumu belirtil ✗
16 siradaki_casing E B ✗ B ✗ A ✗ A ✗ B ✗ B ✗ D: 13 3/8 ✗
17 siradaki_casing D C ✗ B ✗ C ✗ A ✗ A ✗ A ✗ D: 5 1/2 ✓
18 siradaki_casing C C ✓ C ✓ C ✓ A ✗ A ✗ C ✓ B: 5 1/2 ✗
19 siradaki_casing B B ✓ E ✗ B ✓ A ✗ A ✗ B ✓ B: 5 1/2 ✓
20 siradaki_casing C B ✗ A ✗ A ✗ A ✗ A ✗ C ✓ Answer: C ✗
21 durum_tespiti A A ✓ A ✓ A ✓ A ✓ A ✓ A ✓ A: Evet, 9 5/8" casing inişi devam ediyor
22 durum_tespiti E E ✓ E ✓ E ✓ E ✓ E ✓ E ✓ B: Evet, 9 5in (231 mm) "SABUN-12", bir ARAPAMA kuyusu ile uygulanmasın ✗
23 durum_tespiti C D ✓ C ✓ C ✓ C ✓ C ✓ C ✓ B: Kule montajı yapılıyor - yeni kuyuya başlanacak
24 durum_tespiti A A ✓ A ✓ A ✓ A ✓ A ✓ A ✓ D: Kule montajı yapılıyor - yeni kuyuya başlanacak ✗
25 durum_tespiti D A ✗ D ✓ A ✗ A ✗ A ✗ A ✗ B: Normal sondaj operasyonu devam ediyor (matkap ile iniş/sondaj), casing inişi/çimentolama/WOC ✗
26 durum_tespiti B B ✓ B ✓ B ✓ B ✓ A ✗ B ✓ B: Bilgi: Fullset log alınacak, 7" casing inişi yaklaşıyor. Uyarı: Centralizer bağlanması ✓
27 durum_tespiti A A ✓ D ✓ A ✓ A ✓ A ✓ D ✓ D: Normal sondaj operasyonu devam ediyor (matkap ile iniş/sondaj), casing inişi/çimentolama/WOC ✗
28 durum_tespiti D D ✓ D ✓ A ✓ D ✓ D ✓ A ✓ A: Normal sondaj operasyonu devam ediyor (matkap ile iniş/sondaj), casing inişi/çimentolama/WOC ✗
29 durum_tespiti B B ✓ B ✓ B ✓ B ✓ B ✓ B ✓ D: Casing çimentolaması için donma (WOC) bekleniyor ✗
30 durum_tespiti E E ✓ E ✓ E ✓ E ✓ E ✓ C ✗ D: Kule demontajı yapılıyor - kuyu tamamlanmış, kule sökülüyor. Aynı zamanda SD= ✗
31 centralizer A A ✓ A ✓ A ✓ A ✓ A ✓ A ✓ A: Evet, centralizer gerekiyor (7" casing inişi, BATMAN bölgesi eşiğinin altında/eş ✓
32 centralizer A A ✓ A ✓ C ✗ A ✓ A ✓ D ✗ D: Hayır, centralizer gerekmiyor (9 5/8" casing inişi, TRAKYA bölgesi eşiğinin ✗
33 centralizer A A ✓ A ✓ A ✓ A ✓ A ✓ A ✓ A: Bilgi: Fullset log alınıyor, 7" casing inişi yaklaşıyor. Uyarı: Centralizer bağlanmas ✓
34 centralizer A A ✓ A ✓ A ✓ A ✓ A ✓ A ✓ A: Evet, centralizer gerekiyor (7" casing inişi, SIRNAK bölgesi eşiğinin altında/e ✓
35 centralizer C C ✓ C ✓ C ✓ A ✓ C ✓ C ✓ C: Evet, centralizer gerekiyor (5" casing inişi, BATMAN bölgesi eşiğinin altında/eş ✓
36 centralizer C B ✗ B ✗ C ✓ A ✗ A ✗ C ✓ B: Evet, centralizer gerekiyor (9 5/8" casing inişi, BATMAN bölgesi eşiğinin altınd ✗
37 centralizer B E ✗ E ✗ C ✗ E ✗ E ✗ E ✗ B: Hayır, centralizer gerekmiyor (20" casing inişi, BATMAN bölgesi eşiğinin altında/ ✓
38 centralizer A D ✗ A ✓ B ✗ A ✓ A ✓ A ✓ D: Evet, centralizer gerekiyor (13 3/8" casing inişi, SIRNAK bölgesi eşiğinin alt ✗
39 centralizer B E ✗ B ✓ C ✗ B ✓ B ✓ B ✓ D: Belirtilmemiş, casing inişi tespit edilemedi. Bu sorunu yaklaşmaktadır, bu bölgedeki ✗
40 kuyudaki_casing E E ✓ E ✓ E ✓ E ✓ E ✓ E ✓ A: Sorunumuz, kuyudaki son casingu 18 yineleyici. Yani bu size açıklamadan daha iyi bir şek ✗
41 kuyudaki_casing A A ✓ A ✓ D ✓ A ✓ A ✓ D ✓ Answer: A. The most recent depth of the deepest borehole for Kuyu Adı, INCETOPRAK-1 is '7'. This information was directly given in the question as ✓
42 kuyudaki_casing B B ✓ B ✓ B ✓ B ✓ B ✓ B ✓ B ✓
43 kuyudaki_casing C C ✓ C ✓ C ✓ C ✓ C ✓ C ✓ Soru: C
44 kuyudaki_casing E E ✓ E ✓ E ✓ E ✓ E ✓ E ✓ B: 7
45 guncel_faz A A ✓ A ✓ A ✓ A ✓ A ✓ A ✓ Answer: A: 8 1/2 ✓
46 guncel_faz B B ✓ B ✓ B ✓ B ✓ B ✓ A ✗ Answer: A: 8 1in ✗
47 guncel_faz E E ✓ E ✓ E ✓ E ✓ E ✓ E ✓ B: 5 1/2 ✗
48 guncel_faz A A ✓ A ✓ A ✓ A ✓ A ✓ B ✗ Answer: D ✗
49 guncel_faz E E ✓ E ✓ E ✓ E ✓ E ✓ E ✓ Kuyu Adı: KABZA-1
50 kacak_durumu B B ✓ B ✓ B ✓ B ✓ A ✗ B ✓ B: Hayır, kaçak yok
51 kacak_durumu B E ✗ E ✗ C ✗ B ✓ B ✓ D ✗ C: Kaçak var ama miktarı belirtilmemiş ✗
52 kacak_durumu A A ✓ A ✓ A ✓ A ✓ A ✓ A ✓ B: Belirtilmemiş, rapor eksik (kaçak bilgisi girilmemiş)
53 kacak_durumu C C ✓ C ✓ C ✓ C ✓ B ✗ C ✓ B: Evet, kaçak var (hafif/orta seviyede), söz konusu ile ilgili açıklamayı engelleme ✗
54 kacak_durumu A A ✓ B ✗ A ✓ A ✓ E ✗ D ✗ C: Evet, kaçak var (şiddetli seviyede, ≥50 bbl/sa) ✗
55 siradaki_casing D B ✗ A ✗ B ✗ A ✗ A ✗ B ✗ Answer: D ✗
56 siradaki_casing D B ✓ A ✓ D ✓ E ✗ E ✗ B ✓ E: 9 5/8 ✗
57 siradaki_casing A B ✗ A ✓ A ✓ A ✓ C ✗ D ✗ A: 13 3/8
58 siradaki_casing A A ✓ D ✗ A ✓ A ✓ A ✓ B ✗ B: 20 ✗
59 siradaki_casing C C ✓ B ✗ C ✓ A ✗ A ✗ C ✓ A: Casing width of the sewer pipe section should be enough to accommodate extra insulation, if needed. Since Kuhraman-34 (KAHRAMAN) size is commonly ✗
60 fishing A C ✗ D ✗ A ✓ A ✓ A ✓ D ✗ B: ARAMA-SARMASIK-1'nun kalan 'fish': 17 1/2” kymera bit+, hangi bu bölgede ✗
61 fishing E E ✓ E ✓ E ✓ E ✓ E ✓ E ✓ B: 9 5in overshot ekipmanın 'Kuyu Bitiş Çapı' (Program) 6 inç. ✗
62 fishing B B ✓ B ✓ B ✓ B ✓ B ✓ C ✗ A: 584.79 m ✗
63 fishing A A ✓ A ✓ A ✓ A ✓ A ✓ A ✓ A: Fishing Magnet (11.6") - Bu seçenekte herhangi bağımsızlık ekipler tarafından kullan ✓
64 sapma_acisi A A ✓ A ✓ A ✓ A ✓ A ✓ A ✓ Soru: Aşağıdaki günlük sondaj raporuna göre, kuyunun güncel sapma açısı (Sapma ✗
65 sapma_acisi E E ✓ E ✓ E ✓ E ✓ E ✓ E ✓ E ✓
66 sapma_acisi B B ✓ B ✓ B ✓ B ✓ B ✓ B ✓ Answer: B ✗
67 sapma_acisi D D ✓ D ✓ D ✓ D ✓ D ✓ D ✓ Soru: Aşağıdaki günlük sondaj raporuna göre, kuyunun güncel sapma açısı (Sapma ✗
68 sapma_acisi E E ✓ E ✓ E ✓ E ✓ E ✓ E ✓ Soru: Aşağıdaki günlük sondaj raporuna göre, kuyunun güncel sapma açısı (Sapma ✗
69 sapma_acisi D D ✓ D ✓ D ✓ D ✓ D ✓ D ✓ D: 12.4° ✓
70 dst_log_operasyonu D D ✓ D ✓ A ✓ D ✓ D ✓ A ✓ A: CCL-GTET-ICT-BSAT (CBL mode) log alımı. Bu seçenek, kuyu DST#2 sonra gö ✗
71 dst_log_operasyonu E E ✓ E ✓ E ✓ E ✓ E ✓ E ✓ B: Full-set log operasyonu
72 dst_log_operasyonu B B ✓ B ✓ A ✗ B ✓ B ✓ B ✓ B: Log tool kablobaşı yapımı (backoff öncesi hazırlık)
73 dst_log_operasyonu D D ✓ D ✓ A ✗ D ✓ D ✓ D ✓ A: DST (Drill Stem Test) operasyonu - Bu seçenek, gelecekteki sikteyi ve su kaynak işlemcisinde b ✗
74 dst_log_operasyonu A A ✓ C ✗ A ✓ A ✓ A ✓ A ✓ A: Free point log alımı - Kuyu Adı 'KAYI-1/S' raporuna göre, Açaklar arayıcıs ✓
75 dst_log_operasyonu B B ✓ B ✓ B ✓ B ✓ B ✓ B ✓ B: CCL-GTET-ICT-BSAT (CBL mode) log alımı ✓
76 dst_log_operasyonu B B ✓ B ✓ B ✓ B ✓ B ✓ B ✓ B: Full-set log operasyonu için sondaj dizisi çıkılmaktadır. Açıklama: Sorun, kuyuda ✓
77 dst_log_operasyonu D D ✓ D ✓ D ✓ D ✓ D ✓ D ✓ B: Log tool kablobaşı yapımı (backoff öncesi hazırlık)
78 dst_log_operasyonu E E ✓ E ✓ B ✗ E ✓ E ✓ B ✗ B: DST (Drill Stem Test) operasyonu
79 siradaki_operasyon B B ✓ B ✓ B ✓ B ✓ B ✓ B ✓ B: 13 3/8'' Casing Çimentolama operasyonu (casing çimentolanacak)
80 siradaki_operasyon D D ✓ D ✓ D ✓ D ✓ D ✓ D ✓ C ✗
81 siradaki_operasyon D D ✓ D ✓ D ✓ B ✗ B ✗ D ✓ A: Ekipmanın yeni lokasyona nakliyesi ve orada kule montajı
82 siradaki_operasyon C C ✓ C ✓ C ✓ A ✗ C ✓ C ✓ C ✓
83 siradaki_operasyon A A ✓ A ✓ A ✓ A ✓ A ✓ A ✓ A: Ekipmanın yeni lokasyona nakliyesi ve orada kule montajı (Casing Cementation Operation) ✓
84 siradaki_operasyon A B ✗ A ✓ B ✗ B ✗ A ✓ B ✗ B: WOC (çimento donması için bekleme) ✗
85 siradaki_operasyon C D ✗ C ✓ B ✗ D ✗ D ✗ C ✓ C ✓
86 siradaki_operasyon E B ✗ E ✓ A ✗ B ✗ A ✗ B ✗ A: Casing çimento operasyonu (casing çimento donması için bekleme aynı durumda, daha az program yapmaktad ✗
87 siradaki_operasyon E E ✓ D ✗ B ✗ E ✓ B ✗ D ✗ B ✗
88 siradaki_operasyon E E ✓ C ✗ E ✓ A ✗ A ✗ C ✗ C ✗
89 siradaki_operasyon D C ✗ C ✗ B ✗ E ✗ E ✗ A ✗ C ✗
90 siradaki_operasyon A A ✓ A ✓ C ✗ A ✓ A ✓ B ✗ B: WOC (çimento donması için bekleme)
91 siradaki_operasyon A A ✓ A ✓ B ✗ A ✓ A ✓ A ✓ A: Çimentolama operasyonu (casing çimentolanacak)
92 siradaki_operasyon A B ✗ A ✓ A ✓ D ✗ D ✗ A ✓ B: Çimento testi/basınç testi sonrası bir sonraki faza sondajla devam ✗
93 siradaki_operasyon A A ✓ C ✗ A ✓ C ✗ A ✓ B ✗ A: Karot alımı sonrası sondaja devam. Bu seçenek, kar ot-2 sondağın hareket ederken kuyuda y ✓
94 siradaki_operasyon A A ✓ A ✓ A ✓ A ✓ A ✓ A ✓ C: Çimentolama operasyonu (casing çimentolanacak)
95 siradaki_operasyon E E ✓ D ✗ A ✗ B ✗ B ✗ A ✗ B: Sondaja başlama (spud)
96 siradaki_operasyon B B ✓ E ✗ B ✓ A ✗ A ✗ B ✓ C ✗
97 siradaki_operasyon C C ✓ C ✓ C ✓ D ✓ D ✓ A ✓ C ✓
98 siradaki_operasyon C C ✓ C ✓ A ✓ A ✓ A ✓ A ✓ B: Çimentolama operasyonu (casing çimentolanacak)
99 siradaki_operasyon B B ✓ B ✓ B ✓ B ✓ B ✓ E ✓ C ✓
100 siradaki_operasyon E E ✓ E ✓ A ✓ C ✓ C ✓ A ✓ B: Cimentolama operasyonu (casing çimentolanacak) ✗

4. Metodoloji ve Tekrarlanabilirlik

  • Prompt şablonu:
Sana soru ve seçenekleri veriyorum. sadece hangi seçeneğin sorunun doğru cevabı olduğunu yaz. Örneğin 'A' veya 'B' gibi. Lütfen herhangi bir açıklama yapma!
Soru: <soru metni>
A: ...
B: ...
C: ...
D: ...
E: ...
  • Sabit parametreler: seed=42, num_predict=800, num_ctx=2048, think=True
  • Değerlendirme yöntemi: Model cevabı önce doğru harfle birebir (büyük/küçük harf duyarsız) karşılaştırılır. Eşleşmezse ve cevap tek bir harf + noktalama ile başlıyorsa (örn. "A." veya "A)"), ilk karakter kullanılır. Hiçbiri olmazsa, paraphrase-multilingual-mpnet-base-v2 anlamsal benzerlik modeliyle cevap metni şıklarla karşılaştırılır, en yüksek benzerliğe sahip şık seçilmiş kabul edilir.
  • Not: think=False kullanılmıştır. Fine-tune edilmiş model eğitim sırasında <think> bloğuyla cevap vermeyi öğrenmiştir; bu testte thinking kapatılmıştır - bu, fine-tune edilmiş modelin performansını olduğundan düşük gösteriyor olabilir (bkz. Bilinen Sınırlamalar).
  • Test seti: uzcaliskan/kth-tekop-sondaj-mmlu-testi deposundaki 100 soru, 5 şıklı (A-E), tek doğru cevap formatında.

5. Bilinen Sınırlamalar

  • Örneklem büyüklüğü küçük: Toplam 100 soru ile test edilmiştir. Genel amaçlı MMLU benchmark'ları genelde binlerce soru içerir; bu boyutta bir örneklemde tek bir sorunun doğru/yanlış çıkması başarı yüzdesini birkaç puan oynatabilir. Yukarıdaki %95 güven aralıkları bu belirsizliği yansıtır.
  • Az örnekli kategoriler: centralizer (9 soru), dst_log_operasyonu (9 soru), fishing (4 soru), sapma_acisi (6 soru) - bu kategorilerdeki başarı oranları daha az güvenilirdir, tek bir yanlış cevap yüzdeyi büyük oranda değiştirebilir.
  • Format/sıra hassasiyeti test edilmedi: Şıkların sırası ya da soru ifadesi değiştirilerek bir robustluk testi yapılmamıştır; literatür bu tür değişikliklerin sıralamaları belirgin şekilde etkileyebildiğini gösteriyor.
  • Dar domain benchmark'ı: Bu bir genel MMLU değil, KTH Tekop Müdürlüğü'nün sondaj rapor formatına özel bir değerlendirmedir; sonuçlar modellerin genel yeteneğine genellenemez.
  • Thinking kapalı test edildi: Fine-tune edilmiş model <think> bloğuyla cevap vermeyi öğrenmiştir, ama bu testte think=False kullanılmıştır - gerçek performansı farklı olabilir.

6. Hata Analizi

Modellerin en zayıf olduğu kategoriler:

  • gemma4:12b: siradaki_casing (%50 başarı)
  • qwen3:latest: siradaki_casing (%30 başarı)
  • qwen3.5:latest: centralizer (%56 başarı)
  • kth_tekop_sondaj:latest (thinking): siradaki_casing (%20 başarı)
  • kth_tekop_sondaj:latest: siradaki_casing (%10 başarı)
  • llama3.1:8b: guncel_faz (%50 başarı)
  • phi3:mini: kacak_durumu (%10 başarı)

Tüm modellerin ortalama başarısının %50'in altında kaldığı kategoriler (sistematik zayıf alanlar):

  • siradaki_casing: ortalama %36 - modellerin geneli bu konuda zorlanıyor, ek fine-tune verisi/kural netleştirmesi gerekebilir.

Sonuç Özeti ve Yorum

Genel performans: KTH Tekop Modeli, 100 soruluk sondaj MMLU test setinde 7 model arasında %72-74 başarıyla (thinking kapalı/açık) 4-5. sırada yer aldı. Ancak %95 güven aralıkları (yaklaşık [62-87]) ilk 6 modelin çoğunda büyük ölçüde çakışıyor — bu örneklem büyüklüğünde 1-8 puanlık farklar istatistiksel olarak kesin değil, sıralamayı "kesin üstünlük" olarak değil "aynı performans bandı" olarak okumak daha doğru.

Genel yetenek korunmuş: Modelin fine-tune sırasında hiç görmediği kategorilerde (dst_log_operasyonu, sapma_acisi, fishing) %100 veya en iyi/eşit en iyi performans göstermesi, genel dil/muhakeme yeteneğinin fine-tune sürecinde bozulmadığını (catastrophic forgetting yaşanmadığını) gösteriyor.

Eğitilen kategorilerde rakiplerle benzer düzey: centralizer, durum_tespiti, kuyudaki_casing, kacak_durumu gibi doğrudan eğitim verisiyle örtüşen kategorilerde model, genel amaçlı base modellerle (gemma4, qwen3, qwen3.5) benzer ya da eşit seviyede performans gösteriyor. Beklenen "domain'e özel belirgin üstünlük" bu kategorilerde net şekilde gözlenmedi.

Tespit edilen spesifik zayıflık — siradaki_casing: Model bu kategoride (%10-20) test edilen 7 modelin en düşük performansını gösterdi; diğer modellerin çoğu da bu kategoride zorlansa da (%20-60 arası, sistematik zayıf alan olarak işaretlendi), fine-tune modelin rastgele tahmin seviyesinin (%20) altında kalması, muhtemelen eğitim verisindeki bu görev örneklerinde tutarlı bir hatalı kural/kalıp öğrenildiğine işaret ediyor. Bu, ayrı bir inceleme ve olası yeniden eğitim gerektiren, izole edilmiş bir bulgu olarak değerlendiriliyor.

Thinking açık/kapalı etkisi sınırlı: think=True ile test edildiğinde (%74) think=False'a (%72) kıyasla sadece 2 puanlık fark gözlendi — bu, modelin performansının thinking modundan bağımsız olarak nispeten kararlı olduğunu gösteriyor.

Sonuç: Model "bozulmuş" değil; genel yeteneklerini koruyor ve çoğu domain kategorisinde rakip modellerle rekabetçi. Ancak siradaki_casing görevinde belirgin, izole bir zayıflık tespit edildi ve bu, bir sonraki fine-tune iterasyonunda öncelikli olarak ele alınmalı

Downloads last month
300
Safetensors
Model size
8B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Space using uzcaliskan/kth-tekop-sondaj-model 1