aigencydev commited on
Commit
576e3c8
·
verified ·
1 Parent(s): 037ebbb

Seffaflik: temel modeli (Qwen3-14B) acikca belirt; sifirdan/tokenizer iddialarini duzelt

Browse files
Files changed (1) hide show
  1. README.md +49 -58
README.md CHANGED
@@ -6,6 +6,7 @@ license_name: ecloud-open-community-license
6
  license_link: LICENSE
7
  library_name: transformers
8
  pipeline_tag: text-generation
 
9
  tags:
10
  - turkish
11
  - türkçe
@@ -31,7 +32,7 @@ model-index:
31
 
32
  # Erk
33
 
34
- ### Türkçe için sıfırdan geliştirilmiş yapay zekâ modeli
35
 
36
  *Dünya modelleri Türkçe'yi yabancı bir dil gibi harf harf söker.*
37
  **Erk, dilin kökünü ve eklerini bir bütün olarak anlar.**
@@ -57,18 +58,18 @@ model-index:
57
  **Erk**, [eCloud Yazılım Teknolojileri](https://www.e-cloud.web.tr) tarafından
58
  geliştirilen, **14 milyar parametreli**, Türkçe odaklı bir büyük dil modelidir.
59
 
60
- > **"Sıfırdan" ne demek?** Erk'i, açık bir temel model üzerinde **sıfırdan kurduğumuz
61
- > bir Türkçe eğitim hattıyla** geliştirdik: sıfırdan oluşturduğumuz Türkçe derlem,
62
- > milyarlarca token'lık Türkçe sürekli ön-eğitim ve gerçek belgelerle talimat ayarı.
63
- > Amacımız tekerleği yeniden icat etmek değil, **Türkçe'yi en iyi anlayan modeli**
64
- > üretmekti. Sektördeki güçlü Türkçe modellerin çoğu gibi biz de güçlü bir açık temelden
65
- > yola çıktık; asıl değeri katan ise Türkçe'ye özel geliştirme sürecimizdir — ve
66
- > TurkishMMLU'da bu temeli geçerek bunu kanıtladık.
67
 
68
  Bugün Türkçe kullanan yapay zekâ modellerinin çoğu İngilizce için tasarlandı ve Türkçe'ye
69
- sonradan uyarlandı. Erk ise baştan sona Türkçe düşünülerek geliştirildi: kapsamlı Türkçe
70
- ön-eğitim ve gerçek belgelerle beslenen talimat ayarıyla, Türkçe'yi bir ikinci dil olarak
71
- değil, öncelikli dili olarak işler.
72
 
73
  ### Değerlendirme — Evaluation
74
 
@@ -78,7 +79,7 @@ test edilen açık Türkçe modellerin **en iyisidir.**
78
  | Sıra | Model | Ölçek | TurkishMMLU |
79
  |:--:|:---|:--:|:--:|
80
  | | **Erk** | **14B** | **%69,7** |
81
- | | Qwen3 | 14B | %63,4 |
82
  | | Trendyol Asure | 12B | %60,9 |
83
  | 4 | Turkish-Gemma (YTÜ) | 9B | %60,4 |
84
  | 5 | Trendyol v4 | 7B | %53,0 |
@@ -100,32 +101,23 @@ test edilen açık Türkçe modellerin **en iyisidir.**
100
 
101
  Tüm ders skorları ve metodoloji: [`degerlendirme/turkishmmlu.md`](degerlendirme/turkishmmlu.md)
102
 
103
- ### Türkçe tokenizasyon araştırmamız
104
 
105
- Türkçe sondan eklemelidir: *"gözlüklerimizdekilerdenmiş"* gibi tek bir kelimeye onlarca
106
- ek eklenebilir. İngilizce için tasarlanmış tokenizer'lar bu yapıyı tanımaz ve kelimeyi
107
- gereksiz parçalara böler.
108
 
109
- Açık eğitim reçetemiz [nanosohbet](https://github.com/ecloudtechnology/nanosohbet)
110
- kapsamında, Türkçe'ye özel bir tokenizer eğitip 14 tokenizer'la karşılaştırdık.
111
- Ürettiğimiz Türkçe-native tokenizer, aynı Türkçe metni **GPT-4'ün yarısı kadar token'a
112
- böler** (kelime başına 1,51'e karşı 3,01) ve test edilen tüm tokenizer'ları Türkçe'de
113
- geçer.
114
-
115
- | Tokenizer | Kelime başına token (Türkçe) | Göreli maliyet |
116
- |:---|:---:|:---:|
117
- | **Türkçe-native (nanosohbet)** | **1.51** | **1.00×** |
118
- | GPT-4o | 2.26 | 1.50× |
119
- | GPT-4 | 3.01 | **1.99×** |
120
- | Kimi K2 | 3.07 | 2.03× |
121
-
122
- Tam karşılaştırma:
123
- [nanosohbet/results](https://github.com/ecloudtechnology/nanosohbet/tree/main/results).
124
 
125
  ### Erk'i ayıran üç ilke
126
 
127
- **1. Kökünden Türkçe.** Kapsaml�� Türkçe sürekli ön-eğitim ve Türkçe'ye özel geliştirme
128
- sürecimizle, dilin kendi yapısını temelden anlayan bir dil sezgisi.
129
 
130
  **2. Gerçek bilgiyle beslendi.** Erk yalnızca genel sohbetle değil; gerçek hukuki
131
  belgeler, otoriter akademik kaynaklar, doğrulanmış güncel olaylar ve gerçek kullanıcı
@@ -212,7 +204,7 @@ büyük kapasite, daha derin muhakeme ve alan uzmanlığı hedefleniyor.
212
 
213
  ```bibtex
214
  @misc{erk2026,
215
- title = {Erk: Türkçe için sıfırdan geliştirilmiş yapay zekâ modeli},
216
  author = {eCloud Yazılım Teknolojileri},
217
  year = {2026},
218
  url = {https://huggingface.co/ecloudtech/Erk-14B}
@@ -225,19 +217,23 @@ büyük kapasite, daha derin muhakeme ve alan uzmanlığı hedefleniyor.
225
 
226
  ### What is Erk?
227
 
228
- **Erk** is a **14-billion-parameter, Turkish-native** large language model developed by
229
  [eCloud Yazılım Teknolojileri](https://www.e-cloud.web.tr).
230
 
 
 
 
 
 
 
 
 
 
231
  Almost every AI model used for Turkish today was designed for English, with Turkish
232
  taught to it afterward. Every Turkish user pays the price: the model doesn't understand
233
  Turkish's agglutinative structure, over-splits words, and runs slower and more expensively.
234
-
235
- Erk takes a different path. We built it on a strong open base model, through a
236
- **Turkish training pipeline we created from scratch**: a from-scratch Turkish corpus,
237
- extensive Turkish continued pretraining, and instruction tuning grounded in real
238
- documents. Like most strong Turkish models, we started from a capable open base — the
239
- value we add is the Turkish-specific development, and we proved it by surpassing that
240
- base on TurkishMMLU.
241
 
242
  ### Evaluation
243
 
@@ -247,7 +243,7 @@ Erk is **the best of the open Turkish models tested.**
247
  | Rank | Model | Size | TurkishMMLU |
248
  |:--:|:---|:--:|:--:|
249
  | | **Erk** | **14B** | **69.7%** |
250
- | | Qwen3 | 14B | 63.4% |
251
  | | Trendyol Asure | 12B | 60.9% |
252
  | 4 | Turkish-Gemma | 9B | 60.4% |
253
  | 5 | Trendyol v4 | 7B | 53.0% |
@@ -257,23 +253,18 @@ Strongest subjects: **Geography 85% · Philosophy 85% · Religion & Ethics 83%
257
  History 76%.** All results measured with `lm-evaluation-harness` on the public
258
  TurkishMMLU test set, 0-shot, with every model evaluated under identical conditions.
259
 
260
- ### Turkish tokenization research
261
-
262
- Turkish is agglutinative — dozens of suffixes attach to a single root. English-centric
263
- tokenizers over-split Turkish. As part of our open recipe
264
- [nanosohbet](https://github.com/ecloudtechnology/nanosohbet), we trained a Turkish-native
265
- tokenizer and compared 14 tokenizers: ours splits the same Turkish text into **half the
266
- tokens of GPT-4** and beats every tokenizer tested.
267
 
268
- | Tokenizer | Tokens per word (Turkish) | Relative cost |
269
- |:---|:---:|:---:|
270
- | **Turkish-native (nanosohbet)** | **1.51** | **1.00×** |
271
- | GPT-4o | 2.26 | 1.50× |
272
- | GPT-4 | 3.01 | **1.99×** |
273
- | Kimi K2 | 3.07 | 2.03× |
274
 
275
- Full comparison:
276
- [nanosohbet/results](https://github.com/ecloudtechnology/nanosohbet/tree/main/results).
 
 
 
 
 
277
 
278
  ### Usage
279
 
 
6
  license_link: LICENSE
7
  library_name: transformers
8
  pipeline_tag: text-generation
9
+ base_model: Qwen/Qwen3-14B
10
  tags:
11
  - turkish
12
  - türkçe
 
32
 
33
  # Erk
34
 
35
+ ### Türkçe için geliştirilmiş yapay zekâ modeli
36
 
37
  *Dünya modelleri Türkçe'yi yabancı bir dil gibi harf harf söker.*
38
  **Erk, dilin kökünü ve eklerini bir bütün olarak anlar.**
 
58
  **Erk**, [eCloud Yazılım Teknolojileri](https://www.e-cloud.web.tr) tarafından
59
  geliştirilen, **14 milyar parametreli**, Türkçe odaklı bir büyük dil modelidir.
60
 
61
+ > **Temel model ve şeffaflık.** Erk, açık kaynaklı **[Qwen/Qwen3-14B](https://huggingface.co/Qwen/Qwen3-14B)**
62
+ > temel alınarak geliştirilmiştir; mimari, tokenizer ve sohbet formatı bu temelden gelir.
63
+ > eCloud'un kattığı değer, bunun üzerine kurduğumuz **Türkçe geliştirme hattıdır**: kapsamlı
64
+ > Türkçe sürekli ön-eğitim (continued pretraining) ve gerçek belgelerle talimat ayarı (SFT).
65
+ > Sektördeki güçlü Türkçe modellerin çoğu gibi (Trendyol Llama, Turkish-Gemma Gemma) biz de
66
+ > güçlü bir açık temelden yola çıktık; asıl farkı katan Türkçe'ye özel eğitim sürecimizdir — ve
67
+ > TurkishMMLU'da temel modeli **%63,4'ten %69,7'ye** çıkararak bunu kanıtladık.
68
 
69
  Bugün Türkçe kullanan yapay zekâ modellerinin çoğu İngilizce için tasarlandı ve Türkçe'ye
70
+ sonradan uyarlandı. Erk'in Türkçe geliştirme hattı ise Türkçe önceliklidir: kapsamlı Türkçe
71
+ sürekli ön-eğitim ve gerçek belgelerle beslenen talimat ayarıyla, temel modeli Türkçe'de
72
+ belirgin biçimde ileri taşır.
73
 
74
  ### Değerlendirme — Evaluation
75
 
 
79
  | Sıra | Model | Ölçek | TurkishMMLU |
80
  |:--:|:---|:--:|:--:|
81
  | | **Erk** | **14B** | **%69,7** |
82
+ | | Qwen3-14B *(temel model)* | 14B | %63,4 |
83
  | | Trendyol Asure | 12B | %60,9 |
84
  | 4 | Turkish-Gemma (YTÜ) | 9B | %60,4 |
85
  | 5 | Trendyol v4 | 7B | %53,0 |
 
101
 
102
  Tüm ders skorları ve metodoloji: [`degerlendirme/turkishmmlu.md`](degerlendirme/turkishmmlu.md)
103
 
104
+ ### Tokenizer hakkında
105
 
106
+ Erk, temel model **Qwen3-14B'nin tokenizer'ını** kullanır (ChatML formatı, ~152K sözlük).
107
+ Bu, temel modelle tam uyumu korur.
 
108
 
109
+ > **Not — ayrı bir araştırma:** Açık eğitim reçetemiz
110
+ > [nanosohbet](https://github.com/ecloudtechnology/nanosohbet) kapsamında, sıfırdan model
111
+ > eğitimi senaryosu için Türkçe'ye özel bir BPE tokenizer eğittik ve 14 tokenizer'la
112
+ > karşılaştırdık. Bu Türkçe tokenizer aynı Türkçe metni GPT-4'ün yaklaşık yarısı kadar
113
+ > token'a böler (kelime başına 1,51'e karşı 3,01). **Bu tokenizer araştırma amaçlıdır ve
114
+ > Erk-14B'de kullanılmamaktadır** — nanosohbet reçetesiyle sıfırdan model eğitmek isteyenler
115
+ > içindir. Ayrıntı: [nanosohbet/results](https://github.com/ecloudtechnology/nanosohbet/tree/main/results).
 
 
 
 
 
 
 
 
116
 
117
  ### Erk'i ayıran üç ilke
118
 
119
+ **1. Derinlemesine Türkçe.** Kapsamlı Türkçe sürekli ön-eğitim ve Türkçe'ye özel geliştirme
120
+ sürecimizle, temel modelin Türkçe yetkinliğini belirgin biçimde ileri taşıyan bir dil sezgisi.
121
 
122
  **2. Gerçek bilgiyle beslendi.** Erk yalnızca genel sohbetle değil; gerçek hukuki
123
  belgeler, otoriter akademik kaynaklar, doğrulanmış güncel olaylar ve gerçek kullanıcı
 
204
 
205
  ```bibtex
206
  @misc{erk2026,
207
+ title = {Erk: Türkçe için geliştirilmiş yapay zekâ modeli (Qwen3-14B tabanlı)},
208
  author = {eCloud Yazılım Teknolojileri},
209
  year = {2026},
210
  url = {https://huggingface.co/ecloudtech/Erk-14B}
 
217
 
218
  ### What is Erk?
219
 
220
+ **Erk** is a **14-billion-parameter, Turkish-focused** large language model developed by
221
  [eCloud Yazılım Teknolojileri](https://www.e-cloud.web.tr).
222
 
223
+ > **Base model & transparency.** Erk is built on the open-source
224
+ > **[Qwen/Qwen3-14B](https://huggingface.co/Qwen/Qwen3-14B)**; the architecture, tokenizer
225
+ > and chat format come from that base. eCloud's contribution is the **Turkish development
226
+ > pipeline** layered on top: extensive Turkish continued pretraining and instruction tuning
227
+ > (SFT) grounded in real documents. Like most strong Turkish models (Trendyol → Llama,
228
+ > Turkish-Gemma → Gemma), we start from a capable open base — the value we add is the
229
+ > Turkish-specific training, and we proved it by lifting the base from **63.4% to 69.7%**
230
+ > on TurkishMMLU.
231
+
232
  Almost every AI model used for Turkish today was designed for English, with Turkish
233
  taught to it afterward. Every Turkish user pays the price: the model doesn't understand
234
  Turkish's agglutinative structure, over-splits words, and runs slower and more expensively.
235
+ Erk's Turkish pipeline targets exactly this: extensive Turkish continued pretraining and
236
+ instruction tuning that move the base model meaningfully forward in Turkish.
 
 
 
 
 
237
 
238
  ### Evaluation
239
 
 
243
  | Rank | Model | Size | TurkishMMLU |
244
  |:--:|:---|:--:|:--:|
245
  | | **Erk** | **14B** | **69.7%** |
246
+ | | Qwen3-14B *(base model)* | 14B | 63.4% |
247
  | | Trendyol Asure | 12B | 60.9% |
248
  | 4 | Turkish-Gemma | 9B | 60.4% |
249
  | 5 | Trendyol v4 | 7B | 53.0% |
 
253
  History 76%.** All results measured with `lm-evaluation-harness` on the public
254
  TurkishMMLU test set, 0-shot, with every model evaluated under identical conditions.
255
 
256
+ ### About the tokenizer
 
 
 
 
 
 
257
 
258
+ Erk uses the tokenizer of its base model, **Qwen3-14B** (ChatML format, ~152K vocab),
259
+ preserving full compatibility with the base.
 
 
 
 
260
 
261
+ > **Note — separate research:** As part of our open recipe
262
+ > [nanosohbet](https://github.com/ecloudtechnology/nanosohbet), we trained a Turkish-specific
263
+ > BPE tokenizer for the *train-from-scratch* scenario and compared 14 tokenizers: it splits
264
+ > the same Turkish text into about half the tokens of GPT-4 (1.51 vs 3.01 per word).
265
+ > **This tokenizer is research-only and is not used in Erk-14B** — it is for people training
266
+ > their own Turkish model from scratch with the nanosohbet recipe. Details:
267
+ > [nanosohbet/results](https://github.com/ecloudtechnology/nanosohbet/tree/main/results).
268
 
269
  ### Usage
270