- ENGLISH
- AhıskaAI-Experimental-v0.2-235M
- Experimental Scope
- Model Details
- Pre-training Dataset Mixture
- Data Formatting and Pre-training Behavior
- Training Pipeline
- Supervised Fine-Tuning
- Evaluation
- Why Experimental v0.2?
- Known Limitations
- Intended Use
- Lessons Learned
- 1. Dataset formatting can strongly influence model behavior
- 2. Model capacity can reduce, but does not necessarily eliminate, data-induced behavior
- 3. More parameters do not automatically solve data problems
- 4. SFT cannot always completely correct pre-training behavior
- 5. Behavioral evaluation is essential
- 6. Architecture scaling should be evaluated together with data quality
- Future Work
- About AhıskaAI
- Experimental Scope
- TÜRKÇE
- AhıskaAI-Experimental-v0.2-235M
- Deneysel Kapsam
- Model Detayları
- Ön Eğitim Veri Karışımı
- Veri Formatı ve Ön Eğitim Davranışı
- Eğitim Pipeline'ı
- Supervised Fine-Tuning
- Değerlendirme
- Neden Experimental v0.2?
- Bilinen Sınırlamalar
- Kullanım Amacı
- Deneyden Çıkarılan Dersler
- 1. Veri formatı model davranışını güçlü şekilde etkileyebilir
- 2. Model kapasitesi veri kaynaklı davranışları azaltabilir ancak tamamen ortadan kaldırmayabilir
- 3. Daha fazla parametre veri problemlerini otomatik olarak çözmez
- 4. SFT, ön eğitim davranışlarını her zaman tamamen düzeltemez
- 5. Davranışsal değerlendirme kritik öneme sahiptir
- 6. Mimari ölçekleme veri kalitesiyle birlikte değerlendirilmelidir
- Gelecek Çalışmalar
- AhıskaAI Hakkında
- Deneysel Kapsam
Note: Türkçe açıklama sayfanın altındadır. / Turkish description is available at the bottom.
ENGLISH
AhıskaAI-Experimental-v0.2-235M
⚠️ Experimental checkpoint — this model did not meet the quality requirements of the main AhıskaAI v0.x series and was therefore not released as v0.4.
AhıskaAI-Experimental-v0.2-235M is a 235M parameter Small Language Model (SLM) developed from scratch as part of the AhıskaAI Experimental model series.
The model was originally developed as a candidate for the upcoming AhıskaAI v0.4 series. During training and evaluation, however, issues were identified in the model configuration, data formatting and training pipeline.
Compared with the 135M experimental model trained on the same primary dataset mixture, the 235M model demonstrated somewhat stronger resistance to the dominant formatting patterns present in the training corpus. However, these improvements were not sufficient to reach the quality, instruction-following capability, mathematical reliability or conversational behavior required for the main AhıskaAI release series.
Rather than presenting the model as a stable v0.4 release, it is published as an Experimental v0.2 checkpoint to document the experiment and preserve the development history of AhıskaAI.
Experimental Scope
The main purpose of this experiment was to evaluate a larger compact Llama-based architecture on a large mixture of synthetic Turkish and Turkish knowledge/web data.
The experiment focused on:
- Turkish language modeling at the 200M+ parameter scale
- Synthetic mathematical data
- Synthetic web and knowledge data
- Narrative text generation
- Early instruction-following experiments
- Scaling and architecture experiments
- Comparing model capacity within the AhıskaAI experimental series
- Studying the effects of large-scale synthetic Turkish data on small language models
- Investigating whether increased model capacity could reduce unwanted behaviors caused by training-data patterns
The checkpoint should primarily be considered a research and experimentation model.
Model Details
- Architecture:
LlamaForCausalLM - Parameters: ~235M
- Hidden Size: 1024
- Intermediate Size: 2736
- Attention Heads: 16
- Key/Value Heads: 4
- Head Dimension: 64
- Layers: 18
- Context Length: 2048 tokens
- Vocabulary Size: 32,000
- Precision:
bfloat16 - Activation:
SiLU - Normalization: RMSNorm
- RoPE Theta: 10,000
- Model Type: Llama
- Attention Type: Grouped-Query Attention (GQA)
- Weight Tying: Enabled in the original model configuration
- Hardware & Training Time: Trained on Kaggle TPU v5e-8 for 7.6 hours
Pre-training Dataset Mixture
The 135M and 235M experimental models were trained using the same primary dataset mixture.
The training corpus consisted primarily of synthetic Turkish datasets together with Turkish web, knowledge and encyclopedic data.
The major sources used during this experimental training run included:
| Data Source | Approx. Size | Primary Focus |
|---|---|---|
| BILGE Synthetic Web | ~4 GB | General web-style Turkish text, knowledge and language patterns |
| BILGE Synthetic Math | ~3 GB | Mathematical reasoning and synthetic mathematical text |
| BILGE Synthetic Stories | ~6 GB | Narrative generation and story-oriented Turkish text |
| BILGE Wiki-Tr-Plus | ~1 GB | Turkish encyclopedic and knowledge-oriented text |
Dataset repositories:
- BILGEM-AI/BILGE-Synthetic-Web
- BILGEM-AI/BILGE-Synthetic-Math
- BILGEM-AI/BILGE-Synthetic-Stories
- BILGEM-AI/BILGE-Wiki-Tr-Plus
The total raw size of the major datasets was approximately 14 GB.
Approximately 2.8B tokens were processed during the experimental pre-training run.
Data Formatting and Pre-training Behavior
One of the most important findings from this experiment was the effect of repeated formatting patterns in the training corpus.
A significant portion of the training examples followed a structure similar to:
<s>## Title
Document text...
Because this pattern appeared repeatedly throughout a substantial portion of the training corpus, the model was exposed to the \<s>## document-start pattern at very high frequency.
After training, the 235M model demonstrated a strong tendency to reproduce document-like structures when presented with relatively simple prompts.
For example, instead of directly answering a prompt such as:
Türkiye başkenti
the model could interpret the input as the beginning of a new document and produce something resembling:
<s>## Minik Bilimci Ayşe ve Sihirli Tohumlar
Ayşe, minik bir bilimciydi...
The generated subject could be unrelated to the original prompt.
Similar behavior could occur with mathematical and conversational prompts.
The larger 235M architecture appeared to reduce the severity of this behavior compared with the 135M model, but did not eliminate it.
This behavior is considered one of the major limitations of this experimental training run.
Training Pipeline
This checkpoint was produced during an experimental pre-training run followed by supervised fine-tuning experiments.
The pre-training stage used the dataset mixture described above to investigate whether a larger compact model could acquire broader Turkish language-generation capabilities from a large synthetic corpus.
The experiment later revealed issues in the model configuration, data formatting and training pipeline.
In particular, the repeated document-style formatting in the pre-training corpus appears to have strongly influenced the model's generation behavior.
The 235M model was affected by these patterns, although its larger parameter capacity appeared to provide some improvement compared with the 135M model trained on the same data.
This comparison provided an important indication that increased model capacity can reduce some unwanted behaviors, but cannot fully compensate for problematic data formatting and training setup.
Supervised Fine-Tuning
The checkpoint was subsequently subjected to supervised fine-tuning experiments in an attempt to improve instruction-following and conversational behavior.
SFT improved some aspects of generation, but it did not completely remove the behavior learned during pre-training.
After SFT, the model could still:
- Generate unrelated topics
- Continue into long document-like passages
- Fail to directly answer simple questions
- Produce incorrect mathematical answers
- Repeat patterns from the pre-training corpus
- Drift semantically away from the original prompt
- Produce responses that resemble unrelated training documents
The 235M model showed somewhat better behavior than the 135M model in some cases, but the improvement was not sufficient to reach the expected quality level of the AhıskaAI v0.4 series.
Therefore, SFT was not sufficient to make the checkpoint suitable for the main AhıskaAI release series.
Evaluation
The checkpoint was evaluated using basic Turkish generation, question answering, mathematical prompts, conversational prompts and instruction-following tests.
The model demonstrated an improved ability to maintain coherent Turkish text compared with the smaller experimental architecture, but its behavior remained highly inconsistent.
Observed issues included:
- Unreliable instruction following
- Unrelated or off-topic continuations
- Strong document-style generation bias
- Inconsistent question answering
- Poor mathematical reliability
- Long uncontrolled generations
- Repetition
- Semantic drift
- Strong influence from patterns present in the pre-training corpus
For example, simple prompts such as:
bir artı bir kaç eder?
could result in the model generating a mathematics-themed document instead of directly answering the question.
Similarly, prompts such as:
Türkiye başkenti neresidir?
could result in an unrelated Turkish text continuation instead of providing the expected factual answer.
A conversational prompt such as:
Sen neler yapabilirsin?
could also result in a long educational or narrative passage rather than a direct explanation of the model's capabilities.
These results demonstrated that the 235M model had learned substantial Turkish text-generation patterns, but had not developed sufficiently reliable prompt interpretation and instruction-following behavior.
Although the 235M architecture performed better than the 135M architecture in some observed behaviors, the remaining issues were still significant.
Because these issues remained after evaluation and fine-tuning experiments, the checkpoint was not promoted to the main AhıskaAI v0.4 series.
Why Experimental v0.2?
This model was originally intended to be part of the AhıskaAI v0.4 generation.
However, the experiment exposed several problems that made the checkpoint unsuitable for a stable release.
The main issues included:
- Model configuration problems
- Data formatting problems
- Strong document-start pattern bias
- Weak instruction following
- Poor mathematical reliability
- Inconsistent conversational behavior
- Insufficient improvement after SFT
The 235M model performed somewhat better than the 135M model in several areas, but the improvement was not sufficient to meet the requirements of the main AhıskaAI v0.x series.
The AhıskaAI project intentionally preserves these experimental checkpoints instead of removing them.
They provide useful information about unsuccessful or incomplete training configurations and help document the progression toward future models.
Therefore, this model should be understood as:
Experimental → Research → Not production-ready
rather than as a stable AhıskaAI release.
Known Limitations
This model is not recommended for production use.
It may produce:
- Incorrect factual answers
- Incorrect mathematical calculations
- Repetitive text
- Unrelated text
- Unexpected document-style continuations
- Incorrect topic selection
- Incoherent or semantically drifting responses
- Excessively long generations
- Strongly document-oriented output
Generation quality can vary significantly depending on the prompt and decoding parameters.
Intended Use
This checkpoint may be useful for:
- Research
- SLM experimentation
- Turkish language-model experiments
- Studying small-model behavior
- Studying the effects of dataset formatting
- Comparing model architectures
- Comparing 135M and 235M model capacity
- Comparing training configurations
- Reproducing or analyzing the AhıskaAI experimental pipeline
It should not be considered a reliable general-purpose assistant.
Lessons Learned
This experiment provided several important lessons for future AhıskaAI training runs.
1. Dataset formatting can strongly influence model behavior
Repeated structural patterns such as document headers can become highly reinforced when encountered throughout billions of training tokens.
2. Model capacity can reduce, but does not necessarily eliminate, data-induced behavior
The 235M model demonstrated better resistance to some unwanted formatting patterns than the 135M model trained on the same data.
However, the underlying problems remained present.
3. More parameters do not automatically solve data problems
Increasing the model size from approximately 135M to 235M parameters reduced some unwanted behavior, but did not eliminate the underlying data and training issues.
4. SFT cannot always completely correct pre-training behavior
Supervised fine-tuning improved some aspects of the model, but was not sufficient to completely remove the strong generation patterns established during pre-training.
5. Behavioral evaluation is essential
A model can successfully complete a large pre-training run while still failing basic questions and instructions.
Future AhıskaAI releases will therefore place greater emphasis on behavioral evaluation alongside training metrics.
6. Architecture scaling should be evaluated together with data quality
Comparing the 135M and 235M experimental models showed that increasing model capacity can provide measurable improvements, but high-quality data formatting and training methodology remain fundamental.
Future Work
The lessons learned from this experiment will be incorporated into future AhıskaAI releases.
Future training runs will focus on:
- Cleaner dataset preprocessing
- More consistent document boundaries
- Better handling of
<s>and EOS tokens - Improved dataset formatting
- Improved tokenizer and data-packing pipelines
- Better model configuration
- Better dataset mixing strategies
- More rigorous evaluation
- Improved supervised fine-tuning
- Stronger instruction-following behavior
- More systematic scaling experiments
About AhıskaAI
AhıskaAI is an independent initiative focused on developing efficient and capable Small Language Models for the Turkish language ecosystem, with particular interest in Turkish language technologies, low-resource language research and open-source AI.
This experimental checkpoint is part of the ongoing AhıskaAI research and development process.
TÜRKÇE
AhıskaAI-Experimental-v0.2-235M
⚠️ Deneysel checkpoint — Bu model, ana AhıskaAI v0.x serisinin kalite gereksinimlerini karşılamamış ve bu nedenle v0.4 olarak yayınlanmamıştır.
AhıskaAI-Experimental-v0.2-235M, AhıskaAI Experimental model serisinin bir parçası olarak sıfırdan geliştirilen, yaklaşık 235 milyon parametreli bir Küçük Dil Modelidir (SLM).
Model başlangıçta yaklaşan AhıskaAI v0.4 serisi için aday olarak geliştirilmiştir. Ancak eğitim ve değerlendirme süreçlerinde model yapılandırması, veri formatı ve eğitim pipeline'ında çeşitli sorunlar tespit edilmiştir.
Aynı temel veri karışımıyla eğitilen 135M deneysel modelle karşılaştırıldığında 235M model, eğitim verisindeki baskın format örüntülerinden bir miktar daha iyi kurtulabilmiştir. Ancak bu iyileşme; ana AhıskaAI model serisinden beklenen kaliteye, talimatları takip etme yeteneğine, matematiksel güvenilirliğe ve konuşma davranışına ulaşmak için yeterli olmamıştır.
Modeli kararlı bir v0.4 sürümü olarak sunmak yerine, deneyi belgelemek ve AhıskaAI'ın geliştirme sürecini korumak amacıyla Experimental v0.2 checkpoint'i olarak yayınlanmıştır.
Deneysel Kapsam
Bu deneyin temel amacı, sentetik Türkçe veriler ile Türkçe web, bilgi ve ansiklopedik verilerin büyük bir karışımı üzerinde daha büyük bir kompakt Llama tabanlı mimarinin performansını değerlendirmekti.
Deney şu alanlara odaklanmıştır:
- 200M+ parametre ölçeğinde Türkçe dil modelleme
- Sentetik matematik verileri
- Sentetik web ve bilgi verileri
- Anlatı/metin üretimi
- Erken aşama talimat takip etme deneyleri
- Ölçekleme ve mimari deneyleri
- AhıskaAI deneysel serisinde model kapasitesini karşılaştırma
- Büyük ölçekli sentetik Türkçe verilerin küçük dil modelleri üzerindeki etkilerini inceleme
- Model kapasitesindeki artışın eğitim verisinden kaynaklanan istenmeyen davranışları azaltıp azaltamayacağını araştırma
Bu checkpoint öncelikli olarak bir araştırma ve deney modelidir.
Model Detayları
- Mimari:
LlamaForCausalLM - Parametre Sayısı: ~235M
- Gizli Boyut (Hidden Size): 1024
- Ara Katman Boyutu (Intermediate Size): 2736
- Attention Head Sayısı: 16
- Key/Value Head Sayısı: 4
- Head Boyutu: 64
- Katman Sayısı: 18
- Bağlam Uzunluğu: 2048 token
- Kelime Dağarcığı Boyutu: 32.000
- Hassasiyet (Precision):
bfloat16 - Aktivasyon:
SiLU - Normalizasyon: RMSNorm
- RoPE Theta: 10.000
- Model Türü: Llama
- Attention Yapısı: Grouped-Query Attention (GQA)
- Weight Tying: Orijinal model yapılandırmasında etkin
- Donanım ve Eğitim Süresi: Kaggle TPU v5e-8 üzerinde 7.6 saatte eğitilmiştir.
Ön Eğitim Veri Karışımı
135M ve 235M deneysel modelleri aynı temel veri karışımı kullanılarak eğitilmiştir.
Eğitim veri kümesi ağırlıklı olarak sentetik Türkçe veri setlerinden ve Türkçe web, bilgi ve ansiklopedik verilerden oluşturulmuştur.
Bu deneysel eğitim çalışmasında kullanılan başlıca veri kaynakları:
| Veri Kaynağı | Yaklaşık Boyut | Temel Odak |
|---|---|---|
| BILGE Synthetic Web | ~4 GB | Genel web tarzı Türkçe metin, bilgi ve dil örüntüleri |
| BILGE Synthetic Math | ~3 GB | Matematiksel akıl yürütme ve sentetik matematik metinleri |
| BILGE Synthetic Stories | ~6 GB | Anlatı üretimi ve hikâye odaklı Türkçe metin |
| BILGE Wiki-Tr-Plus | ~1 GB | Türkçe ansiklopedik ve bilgi odaklı metin |
Veri setleri:
- BILGEM-AI/BILGE-Synthetic-Web
- BILGEM-AI/BILGE-Synthetic-Math
- BILGEM-AI/BILGE-Synthetic-Stories
- BILGEM-AI/BILGE-Wiki-Tr-Plus
Ana veri kaynaklarının toplam ham boyutu yaklaşık 14 GB'dır.
Deneysel ön eğitim sürecinde yaklaşık 2,8 milyar token işlenmiştir.
Veri Formatı ve Ön Eğitim Davranışı
Bu deneyin en önemli bulgularından biri, eğitim verilerinde tekrar eden format örüntülerinin model davranışı üzerindeki etkisi olmuştur.
Eğitim örneklerinin önemli bir bölümü aşağıdakine benzer bir yapıya sahipti:
<s>## Başlık
Doküman metni...
Bu yapı eğitim veri kümesinin önemli bir bölümünde tekrarlandığından model, \<s>## doküman başlangıcı örüntüsüne çok yoğun şekilde maruz kalmıştır.
Eğitim sonrasında 235M model, basit promptlarla karşılaştığında dahi doküman benzeri yapılar üretmeye yönelik güçlü bir eğilim göstermiştir.
Örneğin:
Türkiye başkenti
gibi basit bir prompta doğrudan cevap vermek yerine model, girdiyi yeni bir dokümanın başlangıcı olarak yorumlayıp aşağıdakine benzer bir çıktı üretebilmektedir:
<s>## Minik Bilimci Ayşe ve Sihirli Tohumlar
Ayşe, minik bir bilimciydi...
Üretilen konu, verilen promptla tamamen ilgisiz olabilir.
Benzer davranış matematiksel ve konuşma tabanlı promptlarda da gözlemlenmiştir.
235M modelin daha büyük mimarisi, 135M modele kıyasla bu davranışın şiddetini bir miktar azaltmış olsa da temel problem ortadan kalkmamıştır.
Bu davranış, söz konusu deneysel eğitim çalışmasının en önemli sınırlamalarından biri olarak değerlendirilmiştir.
Eğitim Pipeline'ı
Bu checkpoint, deneysel bir ön eğitim çalışmasının ardından gerçekleştirilen supervised fine-tuning (SFT) deneyleri sonucunda oluşturulmuştur.
Ön eğitim aşamasında yukarıda açıklanan veri karışımı kullanılarak daha büyük bir kompakt modelin büyük ölçekli sentetik Türkçe veri kümesinden daha geniş kapsamlı Türkçe metin üretme yetenekleri kazanıp kazanamayacağı araştırılmıştır.
Deneyin ilerleyen aşamalarında model yapılandırması, veri formatı ve eğitim pipeline'ında çeşitli sorunlar tespit edilmiştir.
Özellikle ön eğitim veri kümesindeki tekrar eden doküman formatının modelin üretim davranışını güçlü şekilde etkilediği gözlemlenmiştir.
235M model bu örüntülerden 135M modele kıyasla bir miktar daha iyi kurtulabilmiştir. Ancak bu karşılaştırma aynı zamanda model kapasitesindeki artışın problemli veri formatını tek başına çözmeye yeterli olmadığını göstermiştir.
Supervised Fine-Tuning
Checkpoint, talimatları takip etme ve konuşma davranışını iyileştirmek amacıyla supervised fine-tuning deneylerine tabi tutulmuştur.
SFT, üretimin bazı yönlerinde iyileşme sağlamış olsa da ön eğitim sırasında öğrenilen davranışları tamamen ortadan kaldıramamıştır.
SFT sonrasında model hâlâ:
- Konuyla ilgisiz konular üretebilmekte
- Uzun doküman tarzı metinlere devam edebilmekte
- Basit sorulara doğrudan cevap verememekte
- Yanlış matematiksel cevaplar üretebilmekte
- Ön eğitim veri kümesindeki örüntüleri tekrar edebilmekte
- Prompttan anlamsal olarak uzaklaşabilmekte
- İlgisiz eğitim dokümanlarına benzeyen cevaplar üretebilmektedir
235M model bazı durumlarda 135M modele kıyasla daha iyi davranış göstermiştir. Ancak bu iyileşme, checkpoint'i AhıskaAI v0.4 serisi için beklenen kalite seviyesine taşımak için yeterli olmamıştır.
Bu nedenle SFT, checkpoint'i ana AhıskaAI model serisine dahil etmek için yeterli olmamıştır.
Değerlendirme
Checkpoint; temel Türkçe metin üretimi, soru-cevap, matematiksel promptlar, konuşma tabanlı promptlar ve talimat takip etme testleri kullanılarak değerlendirilmiştir.
Model, daha küçük deneysel mimariye kıyasla Türkçe metin bütünlüğünü koruma konusunda bazı iyileşmeler göstermiş olsa da davranışları hâlâ oldukça tutarsızdır.
Gözlemlenen başlıca sorunlar:
- Güvenilir olmayan talimat takibi
- Konuyla ilgisiz veya alakasız devam metinleri
- Güçlü doküman tarzı üretim eğilimi
- Tutarsız soru-cevap performansı
- Zayıf matematiksel güvenilirlik
- Kontrolsüz şekilde uzun metin üretimi
- Tekrarlama
- Anlamsal sapma
- Ön eğitim veri kümesinde bulunan örüntülerden güçlü şekilde etkilenme
Örneğin:
bir artı bir kaç eder?
gibi basit bir prompt, modelin doğrudan cevap vermek yerine matematik temalı ancak soruyla doğrudan ilişkili olmayan uzun bir doküman üretmesine neden olabilmektedir.
Benzer şekilde:
Türkiye başkenti neresidir?
gibi bir prompt, beklenen bilgiye cevap vermek yerine ilgisiz bir Türkçe metin devamı üretilmesine neden olabilmektedir.
Sen neler yapabilirsin?
gibi konuşma tabanlı bir prompt ise modelin kendi yeteneklerini açıklamak yerine uzun bir eğitim veya hikâye metni üretmesine neden olabilmektedir.
Bu sonuçlar, 235M modelin önemli miktarda Türkçe metin üretim örüntüsü öğrendiğini ancak yeterince güvenilir prompt yorumlama ve talimat takip etme davranışı geliştiremediğini göstermiştir.
235M mimarisi bazı gözlemlenen davranışlarda 135M modelden daha iyi performans göstermiş olsa da kalan sorunlar hâlâ önemli seviyededir.
Bu nedenle checkpoint, değerlendirme ve fine-tuning deneylerinden sonra ana AhıskaAI v0.4 serisine dahil edilmemiştir.
Neden Experimental v0.2?
Bu model başlangıçta AhıskaAI v0.4 neslinin bir parçası olarak tasarlanmıştır.
Ancak deney, checkpoint'i kararlı bir sürüm için uygun olmayan çeşitli problemleri ortaya çıkarmıştır.
Başlıca sorunlar:
- Model yapılandırmasıyla ilgili problemler
- Veri formatıyla ilgili problemler
- Güçlü doküman başlangıcı örüntüsü eğilimi
- Zayıf talimat takibi
- Zayıf matematiksel güvenilirlik
- Tutarsız konuşma davranışı
- SFT sonrasında yetersiz iyileşme
235M model, 135M modele kıyasla bazı alanlarda daha iyi performans göstermiştir. Ancak bu iyileşme ana AhıskaAI v0.x serisinin gereksinimlerini karşılamak için yeterli olmamıştır.
AhıskaAI projesi bu deneysel checkpoint'leri silmek yerine bilinçli olarak korumaktadır.
Bu modeller, başarısız veya beklenen sonucu vermeyen eğitim yapılandırmaları hakkında bilgi sağlamakta ve gelecekteki modellerin geliştirme sürecinin belgelenmesine yardımcı olmaktadır.
Bu nedenle model şu şekilde değerlendirilmelidir:
Deneysel → Araştırma → Üretim için uygun değil
ve kararlı bir AhıskaAI sürümü olarak değerlendirilmemelidir.
Bilinen Sınırlamalar
Bu modelin üretim ortamında kullanılması önerilmez.
Model aşağıdaki türde çıktılar üretebilir:
- Yanlış bilgi içeren cevaplar
- Yanlış matematiksel hesaplamalar
- Tekrarlayan metinler
- Konuyla ilgisiz metinler
- Beklenmedik doküman tarzı devamlar
- Yanlış konu seçimi
- Tutarsız veya anlamsal olarak sapan cevaplar
- Gereğinden uzun üretimler
- Güçlü doküman odaklı çıktılar
Üretim kalitesi prompta ve kullanılan decoding parametrelerine bağlı olarak önemli ölçüde değişiklik gösterebilir.
Kullanım Amacı
Bu checkpoint aşağıdaki amaçlarla kullanılabilir:
- Araştırma
- SLM deneyleri
- Türkçe dil modeli deneyleri
- Küçük modellerin davranışlarını inceleme
- Veri formatının model davranışı üzerindeki etkilerini inceleme
- Model mimarilerini karşılaştırma
- 135M ve 235M model kapasitesini karşılaştırma
- Farklı eğitim yapılandırmalarını karşılaştırma
- AhıskaAI deneysel eğitim pipeline'ını yeniden üretme veya analiz etme
Model, güvenilir ve genel amaçlı bir asistan olarak değerlendirilmemelidir.
Deneyden Çıkarılan Dersler
Bu deney, gelecekteki AhıskaAI eğitim çalışmaları açısından önemli sonuçlar ortaya koymuştur.
1. Veri formatı model davranışını güçlü şekilde etkileyebilir
Doküman başlıkları gibi tekrar eden yapısal örüntüler, milyarlarca eğitim tokenı boyunca tekrarlandığında model tarafından güçlü şekilde öğrenilebilir.
2. Model kapasitesi veri kaynaklı davranışları azaltabilir ancak tamamen ortadan kaldırmayabilir
235M model, aynı veriyle eğitilen 135M modele kıyasla bazı istenmeyen format örüntülerine karşı daha dirençli davranmıştır.
Ancak temel problemler 235M modelde de devam etmiştir.
3. Daha fazla parametre veri problemlerini otomatik olarak çözmez
Model boyutunun yaklaşık 135M'den 235M parametreye çıkarılması bazı istenmeyen davranışları azaltmış, ancak veri ve eğitim kaynaklı temel problemleri ortadan kaldırmamıştır.
4. SFT, ön eğitim davranışlarını her zaman tamamen düzeltemez
Supervised fine-tuning modelin bazı yönlerini iyileştirmiş olsa da ön eğitim sırasında oluşan güçlü üretim örüntülerini tamamen ortadan kaldırmak için yeterli olmamıştır.
5. Davranışsal değerlendirme kritik öneme sahiptir
Bir model büyük bir ön eğitim sürecini başarıyla tamamlayabilir ancak buna rağmen basit sorulara ve talimatlara güvenilir şekilde cevap veremeyebilir.
Bu nedenle gelecekteki AhıskaAI sürümlerinde eğitim metriklerinin yanında davranışsal değerlendirmeye de daha fazla önem verilecektir.
6. Mimari ölçekleme veri kalitesiyle birlikte değerlendirilmelidir
135M ve 235M deneysel modellerinin karşılaştırılması, model kapasitesindeki artışın ölçülebilir iyileşmeler sağlayabildiğini ancak kaliteli veri formatı ve eğitim metodolojisinin temel önemini koruduğunu göstermiştir.
Gelecek Çalışmalar
Bu deneyden elde edilen dersler gelecekteki AhıskaAI sürümlerinde kullanılacaktır.
Gelecekteki eğitim çalışmalarında özellikle şu alanlara odaklanılacaktır:
- Daha temiz veri ön işleme
- Daha tutarlı doküman sınırları
<s>ve EOS tokenlarının daha iyi yönetilmesi- İyileştirilmiş veri formatı
- Geliştirilmiş tokenizer ve veri paketleme pipeline'ları
- Daha iyi model yapılandırması
- Daha iyi veri karıştırma stratejileri
- Daha kapsamlı değerlendirme
- Geliştirilmiş supervised fine-tuning
- Daha güçlü talimat takip etme davranışı
- Daha sistematik ölçekleme deneyleri
AhıskaAI Hakkında
AhıskaAI, Türkçe dil ekosistemine yönelik verimli ve yetenekli Küçük Dil Modelleri (SLM) geliştirmeye odaklanan bağımsız bir girişimdir. Proje özellikle Türkçe dil teknolojileri, düşük kaynaklı dil araştırmaları ve açık kaynak yapay zekâ alanlarına odaklanmaktadır.
Bu deneysel checkpoint, devam eden AhıskaAI araştırma ve geliştirme sürecinin bir parçasıdır.
- Downloads last month
- -