aigencydev commited on
Commit
c28e1ba
·
verified ·
1 Parent(s): b648ce9

Upload README.md with huggingface_hub

Browse files
Files changed (1) hide show
  1. README.md +256 -29
README.md CHANGED
@@ -13,8 +13,9 @@ tags:
13
  - ecloud
14
  - llm
15
  - conversational
 
16
  model-index:
17
- - name: Erk
18
  results:
19
  - task:
20
  type: text-generation
@@ -24,75 +25,301 @@ model-index:
24
  metrics:
25
  - type: accuracy
26
  value: 69.7
27
- name: TurkishMMLU (0-shot, 9 ders ort.)
28
  ---
29
 
30
  <div align="center">
31
 
32
- # Erk
33
 
34
  ### Türkçe için sıfırdan geliştirilmiş yapay zekâ modeli
35
 
36
- **TurkishMMLU'da test edilen açık Türkçe modellerin en iyisi %69,7**
 
 
 
 
 
 
 
 
 
 
 
37
 
38
  </div>
39
 
40
  ---
41
 
 
 
 
 
42
  **Erk**, [eCloud Yazılım Teknolojileri](https://www.e-cloud.web.tr) tarafından
43
- geliştirilen, Türkçe'ye özel bir büyük dil modelidir (14 milyar parametre). Türkçe-native
44
- tokenizer, Türkçe derlemde ön-eğitim ve gerçek belgelerle beslenen talimat ayarıyla,
45
- Türkçe'yi kökünden anlar.
 
 
 
 
 
 
 
 
 
46
 
47
- ## 🏆 Değerlendirme TurkishMMLU
 
48
 
49
  | Sıra | Model | Ölçek | TurkishMMLU |
50
  |:--:|:---|:--:|:--:|
51
- | 🥇 | **Erk** | 14B | **%69,7** |
52
- | 2 | Qwen3 | 14B | %63,4 |
53
- | 3 | Trendyol Asure | 12B | %60,9 |
54
  | 4 | Turkish-Gemma (YTÜ) | 9B | %60,4 |
55
  | 5 | Trendyol v4 | 7B | %53,0 |
56
  | 6 | Kumru (VNGRS) | 2B | %20,1 |
57
 
58
- Bağımsız, kamuya açık TurkishMMLU (9 ders, 0-shot). Erk'in en güçlü alanları:
59
- **Coğrafya %85 · Felsefe %85 · Din ve Ahlak %83 · Tarih %76.**
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
60
 
61
- ## Kullanım
 
 
 
 
 
 
 
 
 
 
 
 
62
 
63
  ```python
64
  from transformers import AutoModelForCausalLM, AutoTokenizer
65
 
66
- tokenizer = AutoTokenizer.from_pretrained("ecloudtech/erk", trust_remote_code=True)
67
- model = AutoModelForCausalLM.from_pretrained("ecloudtech/erk", trust_remote_code=True)
 
 
 
 
 
68
 
69
- mesaj = [{"role": "user", "content": "Osmanlı Devleti ne zaman kuruldu?"}]
70
- metin = tokenizer.apply_chat_template(mesaj, tokenize=False, add_generation_prompt=True)
71
- girdi = tokenizer(metin, return_tensors="pt")
72
- cikti = model.generate(**girdi, max_new_tokens=256)
 
 
73
  print(tokenizer.decode(cikti[0][girdi.input_ids.shape[1]:], skip_special_tokens=True))
74
  ```
75
 
76
- ## Model kartı
 
 
 
 
 
 
 
 
 
 
77
 
78
  | Özellik | Değer |
79
  |:---|:---|
80
  | Geliştirici | eCloud Yazılım Teknolojileri |
 
81
  | Parametre | 14 milyar |
82
  | Dil | Türkçe |
83
- | Tokenizer | Türkçe-native byte-level BPE (65.536) |
84
- | Bağlam | 32K token |
85
  | Bilgi kesim tarihi | Ağustos 2026 |
86
- | Lisans | eCloud Açık Topluluk Lisansı |
 
 
 
 
 
 
 
 
 
 
 
 
 
87
 
88
- ## Lisans
89
 
90
  Erk **açık kaynaklıdır**: herkes indirebilir, çalıştırabilir, inceleyebilir ve üzerine
91
- türev çalışmalar geliştirebilir. **Ticari kullanım** için eCloud Yazılım
92
- Teknolojileri'nden izin gereklidir. İletişim: info@e-cloud.web.tr
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
93
 
94
- Eğitim reçetesi: [nanosohbet](https://github.com/ecloudtechnology/nanosohbet)
 
 
 
 
 
 
 
 
 
 
 
 
 
95
 
96
  ---
97
 
98
- *Bir [eCloud Yazılım Teknolojileri](https://www.e-cloud.web.tr) projesidir · Yerli zekâ, küresel ölçek.*
 
 
 
 
 
 
 
13
  - ecloud
14
  - llm
15
  - conversational
16
+ - text-generation-inference
17
  model-index:
18
+ - name: Erk-14B
19
  results:
20
  - task:
21
  type: text-generation
 
25
  metrics:
26
  - type: accuracy
27
  value: 69.7
28
+ name: TurkishMMLU (0-shot, 9 ders ortalaması)
29
  ---
30
 
31
  <div align="center">
32
 
33
+ # 🦅 Erk
34
 
35
  ### Türkçe için sıfırdan geliştirilmiş yapay zekâ modeli
36
 
37
+ *Dünya modelleri Türkçe'yi yabancı bir dil gibi harf harf söker.*
38
+ **Erk, dilin kökünü ve eklerini bir bütün olarak anlar.**
39
+
40
+ <br>
41
+
42
+ [![TurkishMMLU](https://img.shields.io/badge/TurkishMMLU-%25_69.7_🥇-2ea043?style=for-the-badge)](#-değerlendirme--evaluation)
43
+ [![Parametre](https://img.shields.io/badge/Parametre-14B-2563eb?style=for-the-badge)](#)
44
+ [![Dil](https://img.shields.io/badge/Dil-Türkçe-e30a17?style=for-the-badge)](#)
45
+
46
+ **Açık Türkçe modeller arasında TurkishMMLU birincisi**
47
+
48
+ [Türkçe](#türkçe) · [English](#english) · [eCloud Tech.](https://www.e-cloud.web.tr)
49
 
50
  </div>
51
 
52
  ---
53
 
54
+ ## Türkçe
55
+
56
+ ### Erk nedir?
57
+
58
  **Erk**, [eCloud Yazılım Teknolojileri](https://www.e-cloud.web.tr) tarafından
59
+ geliştirilen, **14 milyar parametreli**, Türkçe'ye özel bir büyük dil modelidir.
60
+
61
+ Bugün Türkçe kullanan yapay zekâ modellerinin neredeyse tamamı İngilizce için tasarlandı
62
+ ve Türkçe onlara sonradan öğretildi. Bu yaklaşımın bedelini her Türkçe kullanıcı öder:
63
+ model, Türkçe'nin sondan eklemeli yapısını tanımaz, kelimeleri anlamsız parçalara böler,
64
+ daha yavaş ve daha pahalı çalışır.
65
+
66
+ Erk bu yaklaşımı tersine çevirir. **Türkçe-native bir tokenizer**, **Türkçe derlemde
67
+ ön-eğitim** ve **gerçek belgelerle beslenen talimat ayarı** ile Erk, Türkçe'yi bir
68
+ ikinci dil olarak değil, ana dili olarak öğrenir.
69
+
70
+ ### 🏆 Değerlendirme — Evaluation
71
 
72
+ Erk, bağımsız ve kamuya açık **TurkishMMLU** kıyaslamasında (9 ders, 0-shot doğruluk)
73
+ test edilen açık Türkçe modellerin **en iyisidir.**
74
 
75
  | Sıra | Model | Ölçek | TurkishMMLU |
76
  |:--:|:---|:--:|:--:|
77
+ | 🥇 | **Erk** | **14B** | **%69,7** |
78
+ | 🥈 | Qwen3 | 14B | %63,4 |
79
+ | 🥉 | Trendyol Asure | 12B | %60,9 |
80
  | 4 | Turkish-Gemma (YTÜ) | 9B | %60,4 |
81
  | 5 | Trendyol v4 | 7B | %53,0 |
82
  | 6 | Kumru (VNGRS) | 2B | %20,1 |
83
 
84
+ **Ders bazında Erk:**
85
+
86
+ | Ders | Doğruluk | | Ders | Doğruluk |
87
+ |:---|:--:|:--:|:---|:--:|
88
+ | Coğrafya | %85 | | Fizik | %62 |
89
+ | Felsefe | %85 | | Kimya | %61 |
90
+ | Din ve Ahlak | %83 | | Türk Dili ve Edebiyatı | %64 |
91
+ | Tarih | %76 | | Matematik | %40 |
92
+ | Biyoloji | %71 | | | |
93
+
94
+ > **Metodoloji:** Tüm sonuçlar `lm-evaluation-harness` ile, bağımsız ve kamuya açık
95
+ > TurkishMMLU test setinde, 0-shot koşulunda ölçülmüştür. Karşılaştırılan tüm modeller
96
+ > aynı koşullarda değerlendirilmiş ve şeffaf biçimde birlikte raporlanmıştır.
97
+
98
+ ### Neden Erk verimli? — Tokenizer
99
+
100
+ Türkçe sondan eklemelidir: *"gözlüklerimizdekilerdenmiş"* gibi tek bir kelimeye onlarca
101
+ ek eklenebilir. İngilizce için tasarlanmış tokenizer'lar bu yapıyı tanımaz ve kelimeyi
102
+ harf yığınına böler. Erk'in Türkçe-native tokenizer'ı ise kökü ve ekleri tanır.
103
+
104
+ Bağımsız test derlemlerinde ölçülen sonuç:
105
+
106
+ | Model | Kelime başına token (Türkçe) | Göreli maliyet |
107
+ |:---|:---:|:---:|
108
+ | **Erk** | **1.51** | **1.00×** |
109
+ | GPT-4o | 2.26 | 1.50× |
110
+ | GPT-4 | 3.01 | **1.99×** |
111
+ | Kimi K2 | 3.07 | 2.03× |
112
+
113
+ > **GPT-4, aynı Türkçe metni Erk'in iki katı token'a böler.** Bu, aynı içerik için
114
+ > iki kat işlem maliyeti, iki kat daha yavaş üretim ve yarı yarıya daralan bağlam
115
+ > penceresi demektir. Erk'in tokenizer'ı, test edilen 14 tokenizer'ın (diğer Türkçe
116
+ > modeller dahil) tümünü Türkçe'de geçer.
117
+
118
+ ### Erk'i ayıran üç ilke
119
 
120
+ **1. Kökünden Türkçe.** Türkçe'ye özel tokenizer ve Türkçe derlemde ön-eğitimle, dilin
121
+ kendi yapısını temelden anlayan bir dil sezgisi. Uyarlama değil.
122
+
123
+ **2. Gerçek bilgiyle beslendi.** Erk yalnızca genel sohbetle değil; gerçek hukuki
124
+ belgeler, otoriter akademik kaynaklar, doğrulanmış güncel olaylar ve gerçek kullanıcı
125
+ konuşmalarıyla eğitildi. Bu yaklaşım, modelin uydurmaya (halüsinasyon) eğilimini azaltır
126
+ ve yanlış öncülleri reddetme yeteneği kazandırır.
127
+
128
+ **3. Açık ve tekrarlanabilir.** Erk'i doğuran eğitim reçetesinin her adımı —
129
+ tokenizer'dan ön-eğitime, talimat ayarına— [nanosohbet](https://github.com/ecloudtechnology/nanosohbet)
130
+ deposunda açıktır. İsteyen inceler, isteyen kendi Türkçe modelini eğitir.
131
+
132
+ ### Kullanım
133
 
134
  ```python
135
  from transformers import AutoModelForCausalLM, AutoTokenizer
136
 
137
+ tokenizer = AutoTokenizer.from_pretrained("ecloudtech/Erk-14B", trust_remote_code=True)
138
+ model = AutoModelForCausalLM.from_pretrained(
139
+ "ecloudtech/Erk-14B",
140
+ trust_remote_code=True,
141
+ device_map="auto",
142
+ torch_dtype="auto",
143
+ )
144
 
145
+ mesajlar = [
146
+ {"role": "user", "content": "Osmanlı Devleti'nin kuruluşunu kısaca anlatır mısın?"}
147
+ ]
148
+ metin = tokenizer.apply_chat_template(mesajlar, tokenize=False, add_generation_prompt=True)
149
+ girdi = tokenizer(metin, return_tensors="pt").to(model.device)
150
+ cikti = model.generate(**girdi, max_new_tokens=512, temperature=0.6, top_p=0.9)
151
  print(tokenizer.decode(cikti[0][girdi.input_ids.shape[1]:], skip_special_tokens=True))
152
  ```
153
 
154
+ ### Örnek yetenekler
155
+
156
+ Erk, yalnızca akıcı Türkçe üretmekle kalmaz; **yanlış öncülleri reddeder**:
157
+
158
+ > **Kullanıcı:** Fatih İstanbul'u fethederken Toyota marka araçla mı gitti?
159
+ >
160
+ > **Erk:** Hayır. Fatih Sultan Mehmet İstanbul'u 1453'te fethetti; Toyota ise 1937'de
161
+ > Japonya'da kurulan bir otomobil markasıdır ve o dönemde henüz yoktu. Bu nedenle soru
162
+ > tarihî gerçeklerle örtüşmemektedir.
163
+
164
+ ### Model kartı
165
 
166
  | Özellik | Değer |
167
  |:---|:---|
168
  | Geliştirici | eCloud Yazılım Teknolojileri |
169
+ | Model tipi | Nedensel dil modeli (decoder-only) |
170
  | Parametre | 14 milyar |
171
  | Dil | Türkçe |
172
+ | Tokenizer | Türkçe-native byte-level BPE (65.536 sözlük) |
173
+ | Bağlam uzunluğu | 32.768 token |
174
  | Bilgi kesim tarihi | Ağustos 2026 |
175
+ | Sohbet formatı | ChatML |
176
+ | Kesinlik | bfloat16 |
177
+ | TurkishMMLU | **%69,7** (açık Türkçe modellerde 1.) |
178
+ | Lisans | [eCloud Açık Topluluk Lisansı](LICENSE) |
179
+
180
+ ### Sınırlamalar
181
+
182
+ Erk güçlü bir Türkçe modelidir; ancak her dil modeli gibi sınırları vardır:
183
+
184
+ - **Matematik ve sayısal muhakeme** en zayıf olduğu alandır (%40). Karmaşık hesaplama
185
+ gerektiren görevlerde çıktıları doğrulayın.
186
+ - Çok spesifik, güncel olaylara dair ayrıntılarda hata yapabilir.
187
+ - Bilgi kesim tarihi Ağustos 2026'dır; sonraki gelişmeleri bilmez.
188
+ - Üretilen içerik olgusal olarak yanlış olabilir; kritik kullanımlarda doğrulama gerekir.
189
 
190
+ ### Lisans ve ticari kullanım
191
 
192
  Erk **açık kaynaklıdır**: herkes indirebilir, çalıştırabilir, inceleyebilir ve üzerine
193
+ türev çalışmalar (ince ayar, uyarlama) geliştirebilir.
194
+
195
+ **Ticari kullanım** — Erk'in veya türevlerinin bir ürün, hizmet ya da gelir getirici
196
+ faaliyette kullanılması — eCloud Yazılım Teknolojileri'nden yazılı izin gerektirir.
197
+
198
+ 📧 Ticari kullanım ve iş birliği: **info@e-cloud.web.tr**
199
+
200
+ ### Sırada: Erk-32B
201
+
202
+ Erk'in genişletilmiş ölçekli sürümü **Erk-32B** üzerindeki çalışmalar başlıyor. Daha
203
+ büyük kapasite, daha derin muhakeme ve alan uzmanlığı hedefleniyor.
204
+
205
+ ### Atıf
206
+
207
+ ```bibtex
208
+ @misc{erk2026,
209
+ title = {Erk: Türkçe için sıfırdan geliştirilmiş yapay zekâ modeli},
210
+ author = {eCloud Yazılım Teknolojileri},
211
+ year = {2026},
212
+ url = {https://huggingface.co/ecloudtech/Erk-14B}
213
+ }
214
+ ```
215
+
216
+ ---
217
+
218
+ ## English
219
+
220
+ ### What is Erk?
221
+
222
+ **Erk** is a **14-billion-parameter, Turkish-native** large language model developed by
223
+ [eCloud Yazılım Teknolojileri](https://www.e-cloud.web.tr).
224
+
225
+ Almost every AI model used for Turkish today was designed for English, with Turkish
226
+ taught to it afterward. Every Turkish user pays the price: the model doesn't understand
227
+ Turkish's agglutinative structure, over-splits words, and runs slower and more expensively.
228
+
229
+ Erk reverses this. With a **Turkish-native tokenizer**, **pretraining on a Turkish
230
+ corpus**, and **instruction tuning grounded in real documents**, Erk learns Turkish as a
231
+ first language — not a second.
232
+
233
+ ### 🏆 Evaluation
234
+
235
+ On the independent, public **TurkishMMLU** benchmark (9 subjects, 0-shot accuracy),
236
+ Erk is **the best of the open Turkish models tested.**
237
+
238
+ | Rank | Model | Size | TurkishMMLU |
239
+ |:--:|:---|:--:|:--:|
240
+ | 🥇 | **Erk** | **14B** | **69.7%** |
241
+ | 🥈 | Qwen3 | 14B | 63.4% |
242
+ | 🥉 | Trendyol Asure | 12B | 60.9% |
243
+ | 4 | Turkish-Gemma | 9B | 60.4% |
244
+ | 5 | Trendyol v4 | 7B | 53.0% |
245
+ | 6 | Kumru | 2B | 20.1% |
246
+
247
+ Strongest subjects: **Geography 85% · Philosophy 85% · Religion & Ethics 83% ·
248
+ History 76%.** All results measured with `lm-evaluation-harness` on the public
249
+ TurkishMMLU test set, 0-shot, with every model evaluated under identical conditions.
250
+
251
+ ### Why is Erk efficient?
252
+
253
+ Turkish is agglutinative — dozens of suffixes attach to a single root. English-centric
254
+ tokenizers over-split Turkish words; Erk's Turkish-native tokenizer recognizes roots and
255
+ suffixes.
256
+
257
+ | Model | Tokens per word (Turkish) | Relative cost |
258
+ |:---|:---:|:---:|
259
+ | **Erk** | **1.51** | **1.00×** |
260
+ | GPT-4o | 2.26 | 1.50× |
261
+ | GPT-4 | 3.01 | **1.99×** |
262
+ | Kimi K2 | 3.07 | 2.03× |
263
+
264
+ **GPT-4 splits the same Turkish text into twice as many tokens as Erk** — meaning 2×
265
+ the cost, 2× slower generation, and half the effective context. Erk's tokenizer
266
+ outperforms all 14 tokenizers tested (including other Turkish models) on Turkish.
267
+
268
+ ### Usage
269
+
270
+ ```python
271
+ from transformers import AutoModelForCausalLM, AutoTokenizer
272
+
273
+ tokenizer = AutoTokenizer.from_pretrained("ecloudtech/Erk-14B", trust_remote_code=True)
274
+ model = AutoModelForCausalLM.from_pretrained(
275
+ "ecloudtech/Erk-14B", trust_remote_code=True, device_map="auto", torch_dtype="auto"
276
+ )
277
+
278
+ messages = [{"role": "user", "content": "Explain the founding of the Ottoman Empire in Turkish."}]
279
+ text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
280
+ inputs = tokenizer(text, return_tensors="pt").to(model.device)
281
+ out = model.generate(**inputs, max_new_tokens=512, temperature=0.6, top_p=0.9)
282
+ print(tokenizer.decode(out[0][inputs.input_ids.shape[1]:], skip_special_tokens=True))
283
+ ```
284
+
285
+ ### Model details
286
+
287
+ | Property | Value |
288
+ |:---|:---|
289
+ | Developer | eCloud Yazılım Teknolojileri |
290
+ | Type | Causal decoder-only LM |
291
+ | Parameters | 14 billion |
292
+ | Language | Turkish |
293
+ | Tokenizer | Turkish-native byte-level BPE (65,536 vocab) |
294
+ | Context length | 32,768 tokens |
295
+ | Knowledge cutoff | August 2026 |
296
+ | Chat format | ChatML |
297
+ | Precision | bfloat16 |
298
+ | License | eCloud Open Community License |
299
+
300
+ ### Limitations
301
 
302
+ - **Mathematics and numerical reasoning** is the weakest area (40%). Verify outputs on
303
+ computation-heavy tasks.
304
+ - May err on very specific, recent factual details. Knowledge cutoff is August 2026.
305
+ - Generated content can be factually incorrect; verify for critical use.
306
+
307
+ ### License & commercial use
308
+
309
+ Erk is **open source**: anyone may download, run, study and build derivatives.
310
+ **Commercial use** requires written permission from eCloud Yazılım Teknolojileri.
311
+
312
+ 📧 Commercial use & partnerships: **info@e-cloud.web.tr**
313
+
314
+ The full training recipe is open at
315
+ [nanosohbet](https://github.com/ecloudtechnology/nanosohbet).
316
 
317
  ---
318
 
319
+ <div align="center">
320
+
321
+ Bir **[eCloud Yazılım Teknolojileri](https://www.e-cloud.web.tr)** projesidir.
322
+ <br>
323
+ *Yerli zekâ, küresel ölçek.*
324
+
325
+ </div>