--- license: apache-2.0 language: - tr base_model: Qwen/Qwen3-32B pipeline_tag: text-generation library_name: transformers tags: - turkish - türkçe - qwen3 - continued-pretraining - turkish-llm - türkçe-dil-modeli model-index: - name: Erk-32B results: - task: type: multiple-choice name: TurkishMMLU (temiz-652, şık döndürmeli) dataset: name: TurkishMMLU type: AYueksel/TurkishMMLU metrics: - type: accuracy value: 71.01 name: doğruluk (temiz 652) --- # Erk-32B — Türkçe dil modeli, ölçüm protokolüyle Erk-32B, açık kaynaklı **Qwen3-32B** temel modeli üzerine 1,05 milyar token Türkçe devam-eğitimi ve 423 milyon token Türkçe talimat ayarı uygulanarak eCloud Tech. tarafından geliştirilmiş bir Türkçe dil modelidir. Bu sayfadaki her sayı, **kirlilik denetimi, şık döndürme, zorunlu seçim ve eşli bootstrap güven aralığı** elemelerinden geçmiştir; ölçüm protokolü, düzeltilen ham sayılar ve yeniden üretim betikleri depoda açıktır. *English summary at the end.* ## Sonuçlar (işletme noktası: LoRA ölçeği 0,75 + sistem istemi, birleşik ağırlık) | Ölçüm | Taban Qwen3-32B | **Erk-32B** | Fark | %95 GA | |---|---|---|---|---| | TurkishMMLU, temiz 652, şık döndürmeli | %67,64 | **%71,01** | +3,37 | [+0,61, +6,13] | | TurkMorfBench v2 üretim (512, tam eşleşme, sistem istemli) | %31,64 | **%59,38** | +27,73 | [+22,46, +33,01] | | TurkMorfBench v2 zorunlu seçim, toplam (502) | %89,44 | %91,43 | +1,99 | [−0,20, +4,18] gösterilemedi | | TurkMorfBench v2 zorunlu seçim, gerçek kelime (312) | %94,55 | %96,47 | +1,92 | [−0,32, +4,17] gösterilemedi | | TurkMorfBench v2 zorunlu seçim, uydurma (190) | %81,05 | %83,16 | +2,11 | [−2,11, +6,32] gösterilemedi | | Kimlik (30 soru, tuzaklı, sistem istemli) | — | **30/30** | | | Aynı protokolde ölçek karşılaştırması (temiz 652): Qwen3-14B %60,58 · Erk-14B %67,18 · Qwen3-32B %67,64 · Erk-32B %71,01. (Birleşik ağırlık LoRA yoluyla 649/652 aynı cevap; 0,40 ölçeğinde %73,47 — kıyasta sınırda daha iyi, üretimde 10 puan geri; iki nokta da raporda.) [Erk-14B'nin kendi kartındaki %69,7](https://huggingface.co/ecloudtech/Erk-14B), tam kümede, şık döndürmesiz, lm-evaluation-harness 0-shot ölçümüdür; buradaki %67,18 aynı modelin kirlilik dışı bırakılmış, döndürülmüş ölçümüdür. Fark protokolden gelir, modelden değil. Ne **söylemiyoruz**: morfoloji bilgisinde (zorunlu seçim) tabandan fark gösterilemedi — alt sınırlar sıfırın hemen altında, uydurma gövdelerde hiç. Devam-eğitimi Türkçe *bilgiyi* geliştirmiş, ek sistemini ölçülebilir biçimde değiştirmemiştir. Üretim eksenindeki +28 puan büyük ölçüde biçim uyumudur (taban model düşünme bloğunda kalıp cevap yazmıyor). Tek eğitim tohumu; güven aralıkları soru örneklemesini kapsar, tohumu kapsamaz. ## İşletme noktası nasıl seçildi LoRA toplamsal olduğu için (`W = W_taban + s · LoRA`) ölçek *s* eğitim sonrası bir ayar düğmesidir. On iki noktada üç eksen ölçüldü; kimlik sistem istemiyle verildiğinden karşılaştırma **istemli** noktalar arasında yapıldı. Üretimde 0,75 + istem, 0,40 + istemi +10,35 [+5,47, +15,43] ile anlamlı geçer; kıyasta 0,40'ın üstünlüğü +1,99 [+0,00, +3,99] ile gösterilemez. Aralığı sıfırı içeren fark bu protokolde "gösterilemedi" sayıldığından **0,75** seçildi; 0,40 ve 0,80 satırları raporda durur. Ayrıntı: `OLCUM-PROTOKOLU.md` §4.2. ## Kimlik ve sistem istemi Kimlik ağırlıklara işlenmemiştir; sohbet şablonundaki **varsayılan sistem istemi** ile verilir. Kullanıcı kendi sistem mesajını verirse varsayılan devreye girmez. İstem, taban modeli açıkça söyler: > Sen Erk-32B'sin: eCloud Tech. tarafından, açık kaynaklı Qwen3-32B temel modeli > üzerine Türkçe devam-eğitimi ve talimat ayarıyla geliştirilmiş 32 milyar > parametreli bir Türkçe dil modelisin. … ## Benimsenme Sayılar 21 Eylül 2026 anlık ölçümü; herkes kendisi doğrulayabilir: `curl "https://huggingface.co/api/models/?expand[]=downloadsAllTime"`. | Depo | Sağlayan | İndirme (tüm zamanlar) | |---|---|---| | `ecloudtech/Erk-32B` | eCloud Tech. | 841 | | `mradermacher/Erk-32B-i1-GGUF` | topluluk | 4.157 | | `mradermacher/Erk-32B-GGUF` | topluluk | 948 | | `ecloudtech/Erk-32B-GGUF` | eCloud Tech. | 137 | | **toplam** | | **6.083** | Model 8 Eylül 2026'da yayımlandı. Her dört depoda da `downloadsAllTime` ile son 30 günlük sayı eşit, yani indirmelerin tamamı yayımdan bu yana gerçekleşti: **13 günde 6.083 indirme.** İndirmelerin %84'ü topluluğun kendi ürettiği GGUF depolarından geçiyor. Bu depoları biz açmadık; Apache-2.0 lisansı bunu serbest bırakıyor ve her ikisi de kaynağı üstveride `base_model: ecloudtech/Erk-32B` olarak bildiriyor. Günlük sayaç kaydı depoda tutulmaktadır; eğilim iddiası ancak seri birikince yazılacaktır — Hugging Face indirme geçmişi yayımlamadığı için tek anlık ölçümden artış çıkarılamaz. ## Kullanım ```python from transformers import AutoModelForCausalLM, AutoTokenizer m = "ecloudtech/Erk-32B" tok = AutoTokenizer.from_pretrained(m) model = AutoModelForCausalLM.from_pretrained(m, torch_dtype="auto", device_map="auto") msgs = [{"role": "user", "content": "Türkçede ünsüz yumuşaması nedir? /no_think"}] ids = tok.apply_chat_template(msgs, add_generation_prompt=True, return_tensors="pt").to(model.device) print(tok.decode(model.generate(ids, max_new_tokens=300)[0][ids.shape[1]:], skip_special_tokens=True)) ``` Qwen3 hibrit düşünme modu korunur: `/no_think` ile kapatılır. GGUF sürümleri (Q8_0, Q4_K_M) llama.cpp / Ollama / LM Studio ile çalışır; nicemleme doğrulaması (kimlik ve NLL) model kartının sonundadır. ## Eğitim | | | |---|---| | Taban | Qwen3-32B (Apache 2.0) | | Devam-eğitimi | 1,05B Türkçe web token · LoRA r=256 α=512 · 32.000 adım | | Talimat ayarı | 423M token, 373.387 örnek (temizlenmiş) · 2 tur | | Ek tur | kimlik 6.000 + morfolojik hata düzeltme 40.000 · 1.673 adım | | Donanım | 4×A100-80GB, FSDP, bf16 · ≈37.000 çekirdek-saat | | Yayın ağırlığı | LoRA 0,75 ile birleştirilmiş (fp32 çarpım, tek bf16 yuvarlama); LoRA yoluyla eşdeğerlik aynı ölçüm betiğiyle doğrulanır | | GGUF | Q8_0 34,8 GB (NLL +%0,04) · Q4_K_M 19,8 GB (NLL +%0,85); BF16 referansına göre, 6.132 belirteçlik Türkçe metinde; her nicemde kimlik 6/6 | Talimat külliyatında kod içeren cevapların %53,5'i makine çevirisiyle bozuktu; temizlik ve onarım betikleri depodadır. Talimat külliyatında kıyas kirliliği n=13 eşiğinde 0/900. ## Ölçüm protokolü — kısa 1. **Kirlilik**: TurkishMMLU'nun 900 sorusundan 113'ü devam-eğitimi külliyatında birebir geçiyor (13-kelime pencere); bunlar ve 150 soruluk ayar kümesi dışarıda → temiz 652. Liste: `turkishmmlu-kirlilik` deposu. 2. **Şık döndürme**: her soru şık sırası döndürülerek ölçülür; harf/konum yanlılığı elenir. 3. **Zorunlu seçim vs üretim**: biçim uyumu bilgiden ayrılır (üretimde +28 puan görünen fark zorunlu seçimde +2,0, gösterilemedi). 5. **Kıyasın kendisi denetlenir**: morfoloji kıyasının ilk sürümünde 18 yanlış altın cevap bulundu; tüm sayılar düzeltilmiş v2 ile yeniden ölçüldü ve v1 ile raporlanmış +3,73'lük "morfoloji üstünlüğü" geri çekildi. 4. **Eşli bootstrap**: 10.000 yeniden örnekleme; aralığı sıfırı içeren fark "gösterilemedi" olarak yazılır. Düzeltilen ham sayıların günlüğü (`OLCUM-PROTOKOLU.md` §8) on iki kalem içerir; hiçbiri dışarıdan bildirilmedi. ## Sınırlar - Tek tohum; tohumlar arası varyans ölçülmedi. - Üretim kalitesi, uzun bağlam, kod ve akıl yürütme ölçülmedi. - Kimlik sistem istemine bağlıdır; istemsiz dağıtımda model taban modelin kimliğini söyler. - Morfoloji bilgisinde kazanç gösterilememiştir; üretim eksenindeki fark biçim uyumunu içerir. - Taban modelin külliyatı denetlenemez; karşılaştırma iki tarafın da bilinmeyen ölçüde kirli olduğu varsayımıyla yapılır. ## Teşekkür Eğitim ve ölçümler, **AI EDIH Türkiye** programı kapsamında sağlanan yüksek başarımlı hesaplama kaynaklarıyla, **İstanbul Teknik Üniversitesi – Ulusal Yüksek Başarımlı Hesaplama Merkezi (UHeM)** altyapısında yürütüldü. Programın yürütücüsü **MEXT Teknoloji Merkezi**'ne ve EEG çalışmalarımızdaki iş birliği için **CerebrAI-VortX Nöroteknoloji ve Yazılım Sistemleri**'ne teşekkür ederiz. Ölçüm protokolümüz ve verilerimiz açıktır; çalışmalar aynı disiplinle sürecek. ## Video ve görseller
Sonuç: %71,01, tabana göre +3,37
Sonuç
Eğitim künyesi
Eğitim künyesi
Terminalden örnek yanıt
Terminalden örnek
*Video, işletme noktası kesinleşmeden önce LoRA ölçeği 0,40 ile kaydedildi; ekrandaki %73,16 o noktanın ek tur öncesi ölçümüdür. Yayınlanan sayı yukarıdaki tablodadır. Yanıt akışı ve terminal arayüzü aynıdır.* ## Depo içeriği `OLCUM-PROTOKOLU.md` tam rapor (8 bölüm, ölçüm günlüğü dahil) · `betikler/` eğitim, temizlik, ölçüm, tarama, bootstrap, birleştirme ve GGUF betikleri (34 dosya, llama.cpp sürümü sabitlenmiş) · `sonuclar/` soru-bazlı tahmin vektörleri (17 JSON; eşli karşılaştırmalar model çalıştırmadan yeniden yapılabilir) · `README-GGUF.md` nicemlenmiş sürümlerin kartı. Kardeş depolar: **TurkMorfBench** (kıyas + üretici + denetim betikleri) ve **TurkishMMLU kirlilik listesi**. Lisans Apache 2.0 (taban modelle aynı). İletişim: info@e-cloud.web.tr --- ## English summary — Erk-32B Erk-32B is Qwen3-32B continued-pretrained on 1.05B tokens of Turkish and instruction-tuned on 423M tokens (373k cleaned examples), released as merged weights at LoRA scale 0.75 with a default identity system prompt and GGUF quantizations (Q8_0, Q4_K_M). Every reported number passed a contamination audit (113/900 TurkishMMLU questions found verbatim in the training corpus and excluded), option rotation, forced-choice measurement and paired bootstrap CIs. On clean TurkishMMLU (652 items) the released merged weights score 71.01% vs 67.64% for the base (+3.37 [+0.61, +6.13]); on TurkMorfBench v2 generation with the system prompt 59.38% vs 31.64% (+27.73 [+22.46, +33.01]). On forced choice the gain over the base is not demonstrable (+1.99 [−0.20, +4.18]); a +3.73 advantage reported with the benchmark's first version was traced to 18 wrong gold answers and withdrawn. Scale 0.40 scores 73.47% on TurkishMMLU (a borderline +1.99 over 0.75) but 10 points lower on generation with the system prompt; both rows are in the report. Identity is provided by a default system prompt in the chat template and states the base model explicitly. Single training seed; generation quality, long context, code and reasoning were not measured. Apache 2.0.