aigencydev commited on
Commit
bfd8a1a
·
verified ·
1 Parent(s): ee90d96

Upload README.md with huggingface_hub

Browse files
Files changed (1) hide show
  1. README.md +55 -46
README.md CHANGED
@@ -27,7 +27,6 @@ model-index:
27
  value: 69.7
28
  name: TurkishMMLU (0-shot, 9 ders ortalaması)
29
  ---
30
-
31
  <div align="center">
32
 
33
  # Erk
@@ -39,13 +38,13 @@ model-index:
39
 
40
  <br>
41
 
42
- [![TurkishMMLU](https://img.shields.io/badge/TurkishMMLU-%25_69.7_🥇-2ea043?style=for-the-badge)](#-değerlendirme--evaluation)
 
43
  [![Parametre](https://img.shields.io/badge/Parametre-14B-2563eb?style=for-the-badge)](#)
44
- [![Dil](https://img.shields.io/badge/Dil-Türkçe-e30a17?style=for-the-badge)](#)
45
 
46
  **Açık Türkçe modeller arasında TurkishMMLU birincisi**
47
 
48
- [Türkçe](#türkçe) · [English](#english) · [eCloud Tech.](https://www.e-cloud.web.tr)
49
 
50
  </div>
51
 
@@ -56,27 +55,31 @@ model-index:
56
  ### Erk nedir?
57
 
58
  **Erk**, [eCloud Yazılım Teknolojileri](https://www.e-cloud.web.tr) tarafından
59
- geliştirilen, **14 milyar parametreli**, Türkçe'ye özel bir büyük dil modelidir.
60
 
61
- Bugün Türkçe kullanan yapay zekâ modellerinin neredeyse tamamı İngilizce için tasarlandı
62
- ve Türkçe onlara sonradan öğretildi. Bu yaklaşımın bedelini her Türkçe kullanıcı öder:
63
- model, Türkçe'nin sondan eklemeli yapısını tanımaz, kelimeleri anlamsız parçalara böler,
64
- daha yavaş ve daha pahalı çalışır.
 
 
 
65
 
66
- Erk bu yaklaşımı tersine çevirir. **Türkçe-native bir tokenizer**, **Türkçe derlemde
67
- ön-eğitim** ve **gerçek belgelerle beslenen talimat ayarı** ile Erk, Türkçe'yi bir
68
- ikinci dil olarak değil, ana dili olarak öğrenir.
 
69
 
70
- ### 🏆 Değerlendirme — Evaluation
71
 
72
  Erk, bağımsız ve kamuya açık **TurkishMMLU** kıyaslamasında (9 ders, 0-shot doğruluk)
73
  test edilen açık Türkçe modellerin **en iyisidir.**
74
 
75
  | Sıra | Model | Ölçek | TurkishMMLU |
76
  |:--:|:---|:--:|:--:|
77
- | 🥇 | **Erk** | **14B** | **%69,7** |
78
- | 🥈 | Qwen3 | 14B | %63,4 |
79
- | 🥉 | Trendyol Asure | 12B | %60,9 |
80
  | 4 | Turkish-Gemma (YTÜ) | 9B | %60,4 |
81
  | 5 | Trendyol v4 | 7B | %53,0 |
82
  | 6 | Kumru (VNGRS) | 2B | %20,1 |
@@ -95,30 +98,34 @@ test edilen açık Türkçe modellerin **en iyisidir.**
95
  > TurkishMMLU test setinde, 0-shot koşulunda ölçülmüştür. Karşılaştırılan tüm modeller
96
  > aynı koşullarda değerlendirilmiş ve şeffaf biçimde birlikte raporlanmıştır.
97
 
98
- ### Neden Erk verimli? Tokenizer
 
 
99
 
100
  Türkçe sondan eklemelidir: *"gözlüklerimizdekilerdenmiş"* gibi tek bir kelimeye onlarca
101
  ek eklenebilir. İngilizce için tasarlanmış tokenizer'lar bu yapıyı tanımaz ve kelimeyi
102
- harf yığınına böler. Erk'in Türkçe-native tokenizer'ı ise kökü ve ekleri tanır.
103
 
104
- Bağımsız test derlemlerinde ölçülen sonuç:
 
 
 
 
105
 
106
- | Model | Kelime başına token (Türkçe) | Göreli maliyet |
107
  |:---|:---:|:---:|
108
- | **Erk** | **1.51** | **1.00×** |
109
  | GPT-4o | 2.26 | 1.50× |
110
  | GPT-4 | 3.01 | **1.99×** |
111
  | Kimi K2 | 3.07 | 2.03× |
112
 
113
- > **GPT-4, aynı Türkçe metni Erk'in iki katı token'a böler.** Bu, aynı içerik için
114
- > iki kat işlem maliyeti, iki kat daha yavaş üretim ve yarı yarıya daralan bağlam
115
- > penceresi demektir. Erk'in tokenizer'ı, test edilen 14 tokenizer'ın (diğer Türkçe
116
- > modeller dahil) tümünü Türkçe'de geçer.
117
 
118
  ### Erk'i ayıran üç ilke
119
 
120
- **1. Kökünden Türkçe.** Türkçe'ye özel tokenizer ve Türkçe derlemde ön-eğitimle, dilin
121
- kendi yapısını temelden anlayan bir dil sezgisi. Uyarlama değil.
122
 
123
  **2. Gerçek bilgiyle beslendi.** Erk yalnızca genel sohbetle değil; gerçek hukuki
124
  belgeler, otoriter akademik kaynaklar, doğrulanmış güncel olaylar ve gerçek kullanıcı
@@ -169,7 +176,6 @@ Erk, yalnızca akıcı Türkçe üretmekle kalmaz; **yanlış öncülleri redded
169
  | Model tipi | Nedensel dil modeli (decoder-only) |
170
  | Parametre | 14 milyar |
171
  | Dil | Türkçe |
172
- | Tokenizer | Türkçe-native byte-level BPE (65.536 sözlük) |
173
  | Bağlam uzunluğu | 32.768 token |
174
  | Bilgi kesim tarihi | Ağustos 2026 |
175
  | Sohbet formatı | ChatML |
@@ -195,7 +201,7 @@ türev çalışmalar (ince ayar, uyarlama) geliştirebilir.
195
  **Ticari kullanım** — Erk'in veya türevlerinin bir ürün, hizmet ya da gelir getirici
196
  faaliyette kullanılması — eCloud Yazılım Teknolojileri'nden yazılı izin gerektirir.
197
 
198
- 📧 Ticari kullanım ve iş birliği: **info@e-cloud.web.tr**
199
 
200
  ### Sırada: Erk-32B
201
 
@@ -226,20 +232,23 @@ Almost every AI model used for Turkish today was designed for English, with Turk
226
  taught to it afterward. Every Turkish user pays the price: the model doesn't understand
227
  Turkish's agglutinative structure, over-splits words, and runs slower and more expensively.
228
 
229
- Erk reverses this. With a **Turkish-native tokenizer**, **pretraining on a Turkish
230
- corpus**, and **instruction tuning grounded in real documents**, Erk learns Turkish as a
231
- first language not a second.
 
 
 
232
 
233
- ### 🏆 Evaluation
234
 
235
  On the independent, public **TurkishMMLU** benchmark (9 subjects, 0-shot accuracy),
236
  Erk is **the best of the open Turkish models tested.**
237
 
238
  | Rank | Model | Size | TurkishMMLU |
239
  |:--:|:---|:--:|:--:|
240
- | 🥇 | **Erk** | **14B** | **69.7%** |
241
- | 🥈 | Qwen3 | 14B | 63.4% |
242
- | 🥉 | Trendyol Asure | 12B | 60.9% |
243
  | 4 | Turkish-Gemma | 9B | 60.4% |
244
  | 5 | Trendyol v4 | 7B | 53.0% |
245
  | 6 | Kumru | 2B | 20.1% |
@@ -248,22 +257,23 @@ Strongest subjects: **Geography 85% · Philosophy 85% · Religion & Ethics 83%
248
  History 76%.** All results measured with `lm-evaluation-harness` on the public
249
  TurkishMMLU test set, 0-shot, with every model evaluated under identical conditions.
250
 
251
- ### Why is Erk efficient?
252
 
253
  Turkish is agglutinative — dozens of suffixes attach to a single root. English-centric
254
- tokenizers over-split Turkish words; Erk's Turkish-native tokenizer recognizes roots and
255
- suffixes.
 
 
256
 
257
- | Model | Tokens per word (Turkish) | Relative cost |
258
  |:---|:---:|:---:|
259
- | **Erk** | **1.51** | **1.00×** |
260
  | GPT-4o | 2.26 | 1.50× |
261
  | GPT-4 | 3.01 | **1.99×** |
262
  | Kimi K2 | 3.07 | 2.03× |
263
 
264
- **GPT-4 splits the same Turkish text into twice as many tokens as Erk** — meaning 2×
265
- the cost, 2× slower generation, and half the effective context. Erk's tokenizer
266
- outperforms all 14 tokenizers tested (including other Turkish models) on Turkish.
267
 
268
  ### Usage
269
 
@@ -290,7 +300,6 @@ print(tokenizer.decode(out[0][inputs.input_ids.shape[1]:], skip_special_tokens=T
290
  | Type | Causal decoder-only LM |
291
  | Parameters | 14 billion |
292
  | Language | Turkish |
293
- | Tokenizer | Turkish-native byte-level BPE (65,536 vocab) |
294
  | Context length | 32,768 tokens |
295
  | Knowledge cutoff | August 2026 |
296
  | Chat format | ChatML |
@@ -309,7 +318,7 @@ print(tokenizer.decode(out[0][inputs.input_ids.shape[1]:], skip_special_tokens=T
309
  Erk is **open source**: anyone may download, run, study and build derivatives.
310
  **Commercial use** requires written permission from eCloud Yazılım Teknolojileri.
311
 
312
- 📧 Commercial use & partnerships: **info@e-cloud.web.tr**
313
 
314
  The full training recipe is open at
315
  [nanosohbet](https://github.com/ecloudtechnology/nanosohbet).
 
27
  value: 69.7
28
  name: TurkishMMLU (0-shot, 9 ders ortalaması)
29
  ---
 
30
  <div align="center">
31
 
32
  # Erk
 
38
 
39
  <br>
40
 
41
+ [![Hugging Face](https://img.shields.io/badge/🤗_Model-ecloudtech%2FErk--14B-ffcc00?style=for-the-badge)](https://huggingface.co/ecloudtech/Erk-14B)
42
+ [![TurkishMMLU](https://img.shields.io/badge/TurkishMMLU-%25_69.7-2ea043?style=for-the-badge)](degerlendirme/turkishmmlu.md)
43
  [![Parametre](https://img.shields.io/badge/Parametre-14B-2563eb?style=for-the-badge)](#)
 
44
 
45
  **Açık Türkçe modeller arasında TurkishMMLU birincisi**
46
 
47
+ [Modeli indir (🤗)](https://huggingface.co/ecloudtech/Erk-14B) · [Türkçe](#türkçe) · [English](#english) · [eCloud Tech.](https://www.e-cloud.web.tr)
48
 
49
  </div>
50
 
 
55
  ### Erk nedir?
56
 
57
  **Erk**, [eCloud Yazılım Teknolojileri](https://www.e-cloud.web.tr) tarafından
58
+ geliştirilen, **14 milyar parametreli**, Türkçe odaklı bir büyük dil modelidir.
59
 
60
+ > **"Sıfırdan" ne demek?** Erk'i, açık bir temel model üzerinde **sıfırdan kurduğumuz
61
+ > bir Türkçe eğitim hattıyla** geliştirdik: sıfırdan oluşturduğumuz Türkçe derlem,
62
+ > milyarlarca token'lık Türkçe sürekli ön-eğitim ve gerçek belgelerle talimat ayarı.
63
+ > Amacımız tekerleği yeniden icat etmek değil, **Türkçe'yi en iyi anlayan modeli**
64
+ > üretmekti. Sektördeki güçlü Türkçe modellerin çoğu gibi biz de güçlü bir açık temelden
65
+ > yola çıktık; asıl değeri katan ise Türkçe'ye özel geliştirme sürecimizdir — ve
66
+ > TurkishMMLU'da bu temeli geçerek bunu kanıtladık.
67
 
68
+ Bugün Türkçe kullanan yapay zekâ modellerinin çoğu İngilizce için tasarlandı ve Türkçe'ye
69
+ sonradan uyarlandı. Erk ise baştan sona Türkçe düşünülerek geliştirildi: kapsamlı Türkçe
70
+ ön-eğitim ve gerçek belgelerle beslenen talimat ayarıyla, Türkçe'yi bir ikinci dil olarak
71
+ değil, öncelikli dili olarak işler.
72
 
73
+ ### Değerlendirme — Evaluation
74
 
75
  Erk, bağımsız ve kamuya açık **TurkishMMLU** kıyaslamasında (9 ders, 0-shot doğruluk)
76
  test edilen açık Türkçe modellerin **en iyisidir.**
77
 
78
  | Sıra | Model | Ölçek | TurkishMMLU |
79
  |:--:|:---|:--:|:--:|
80
+ | | **Erk** | **14B** | **%69,7** |
81
+ | | Qwen3 | 14B | %63,4 |
82
+ | | Trendyol Asure | 12B | %60,9 |
83
  | 4 | Turkish-Gemma (YTÜ) | 9B | %60,4 |
84
  | 5 | Trendyol v4 | 7B | %53,0 |
85
  | 6 | Kumru (VNGRS) | 2B | %20,1 |
 
98
  > TurkishMMLU test setinde, 0-shot koşulunda ölçülmüştür. Karşılaştırılan tüm modeller
99
  > aynı koşullarda değerlendirilmiş ve şeffaf biçimde birlikte raporlanmıştır.
100
 
101
+ Tüm ders skorları ve metodoloji: [`degerlendirme/turkishmmlu.md`](degerlendirme/turkishmmlu.md)
102
+
103
+ ### Türkçe tokenizasyon araştırmamız
104
 
105
  Türkçe sondan eklemelidir: *"gözlüklerimizdekilerdenmiş"* gibi tek bir kelimeye onlarca
106
  ek eklenebilir. İngilizce için tasarlanmış tokenizer'lar bu yapıyı tanımaz ve kelimeyi
107
+ gereksiz parçalara böler.
108
 
109
+ Açık eğitim reçetemiz [nanosohbet](https://github.com/ecloudtechnology/nanosohbet)
110
+ kapsamında, Türkçe'ye özel bir tokenizer eğitip 14 tokenizer'la karşılaştırdık.
111
+ Ürettiğimiz Türkçe-native tokenizer, aynı Türkçe metni **GPT-4'ün yarısı kadar token'a
112
+ böler** (kelime başına 1,51'e karşı 3,01) ve test edilen tüm tokenizer'ları Türkçe'de
113
+ geçer.
114
 
115
+ | Tokenizer | Kelime başına token (Türkçe) | Göreli maliyet |
116
  |:---|:---:|:---:|
117
+ | **Türkçe-native (nanosohbet)** | **1.51** | **1.00×** |
118
  | GPT-4o | 2.26 | 1.50× |
119
  | GPT-4 | 3.01 | **1.99×** |
120
  | Kimi K2 | 3.07 | 2.03× |
121
 
122
+ Tam karşılaştırma:
123
+ [nanosohbet/results](https://github.com/ecloudtechnology/nanosohbet/tree/main/results).
 
 
124
 
125
  ### Erk'i ayıran üç ilke
126
 
127
+ **1. Kökünden Türkçe.** Kapsamlı Türkçe sürekli ön-eğitim ve Türkçe'ye özel geliştirme
128
+ sürecimizle, dilin kendi yapısını temelden anlayan bir dil sezgisi.
129
 
130
  **2. Gerçek bilgiyle beslendi.** Erk yalnızca genel sohbetle değil; gerçek hukuki
131
  belgeler, otoriter akademik kaynaklar, doğrulanmış güncel olaylar ve gerçek kullanıcı
 
176
  | Model tipi | Nedensel dil modeli (decoder-only) |
177
  | Parametre | 14 milyar |
178
  | Dil | Türkçe |
 
179
  | Bağlam uzunluğu | 32.768 token |
180
  | Bilgi kesim tarihi | Ağustos 2026 |
181
  | Sohbet formatı | ChatML |
 
201
  **Ticari kullanım** — Erk'in veya türevlerinin bir ürün, hizmet ya da gelir getirici
202
  faaliyette kullanılması — eCloud Yazılım Teknolojileri'nden yazılı izin gerektirir.
203
 
204
+ Ticari kullanım ve iş birliği: **info@e-cloud.web.tr**
205
 
206
  ### Sırada: Erk-32B
207
 
 
232
  taught to it afterward. Every Turkish user pays the price: the model doesn't understand
233
  Turkish's agglutinative structure, over-splits words, and runs slower and more expensively.
234
 
235
+ Erk takes a different path. We built it on a strong open base model, through a
236
+ **Turkish training pipeline we created from scratch**: a from-scratch Turkish corpus,
237
+ extensive Turkish continued pretraining, and instruction tuning grounded in real
238
+ documents. Like most strong Turkish models, we started from a capable open base — the
239
+ value we add is the Turkish-specific development, and we proved it by surpassing that
240
+ base on TurkishMMLU.
241
 
242
+ ### Evaluation
243
 
244
  On the independent, public **TurkishMMLU** benchmark (9 subjects, 0-shot accuracy),
245
  Erk is **the best of the open Turkish models tested.**
246
 
247
  | Rank | Model | Size | TurkishMMLU |
248
  |:--:|:---|:--:|:--:|
249
+ | | **Erk** | **14B** | **69.7%** |
250
+ | | Qwen3 | 14B | 63.4% |
251
+ | | Trendyol Asure | 12B | 60.9% |
252
  | 4 | Turkish-Gemma | 9B | 60.4% |
253
  | 5 | Trendyol v4 | 7B | 53.0% |
254
  | 6 | Kumru | 2B | 20.1% |
 
257
  History 76%.** All results measured with `lm-evaluation-harness` on the public
258
  TurkishMMLU test set, 0-shot, with every model evaluated under identical conditions.
259
 
260
+ ### Turkish tokenization research
261
 
262
  Turkish is agglutinative — dozens of suffixes attach to a single root. English-centric
263
+ tokenizers over-split Turkish. As part of our open recipe
264
+ [nanosohbet](https://github.com/ecloudtechnology/nanosohbet), we trained a Turkish-native
265
+ tokenizer and compared 14 tokenizers: ours splits the same Turkish text into **half the
266
+ tokens of GPT-4** and beats every tokenizer tested.
267
 
268
+ | Tokenizer | Tokens per word (Turkish) | Relative cost |
269
  |:---|:---:|:---:|
270
+ | **Turkish-native (nanosohbet)** | **1.51** | **1.00×** |
271
  | GPT-4o | 2.26 | 1.50× |
272
  | GPT-4 | 3.01 | **1.99×** |
273
  | Kimi K2 | 3.07 | 2.03× |
274
 
275
+ Full comparison:
276
+ [nanosohbet/results](https://github.com/ecloudtechnology/nanosohbet/tree/main/results).
 
277
 
278
  ### Usage
279
 
 
300
  | Type | Causal decoder-only LM |
301
  | Parameters | 14 billion |
302
  | Language | Turkish |
 
303
  | Context length | 32,768 tokens |
304
  | Knowledge cutoff | August 2026 |
305
  | Chat format | ChatML |
 
318
  Erk is **open source**: anyone may download, run, study and build derivatives.
319
  **Commercial use** requires written permission from eCloud Yazılım Teknolojileri.
320
 
321
+ Commercial use & partnerships: **info@e-cloud.web.tr**
322
 
323
  The full training recipe is open at
324
  [nanosohbet](https://github.com/ecloudtechnology/nanosohbet).