- ENGLISH
- AhıskaAI-Experimental-v0.2-235M-IT
- Experimental Scope
- Model Details
- Relationship to the 135M Experimental Model
- Pre-training Dataset Mixture
- Data Formatting and Pre-training Behavior
- Supervised Fine-Tuning
- Evaluation
- Base Model vs. Instruction-Tuned Model
- Why Experimental v0.2-235M-IT?
- Known Limitations
- Intended Use
- Lessons Learned
- Future Work
- About AhıskaAI
- Experimental Scope
- TÜRKÇE
- AhıskaAI-Experimental-v0.2-235M-IT
- Deneysel Kapsam
- Model Detayları
- 135M Deneysel Model ile İlişkisi
- Ön Eğitim Veri Karışımı
- Veri Formatı ve Ön Eğitim Davranışı
- Supervised Fine-Tuning
- Değerlendirme
- Base Model ve Instruction-Tuned Model
- Neden Experimental v0.2-235M-IT?
- Bilinen Sınırlamalar
- Kullanım Amacı
- Deneyden Çıkarılan Dersler
- Gelecek Çalışmalar
- AhıskaAI Hakkında
- Deneysel Kapsam
Note: Türkçe açıklama sayfanın altındadır. / Turkish description is available at the bottom.
ENGLISH
AhıskaAI-Experimental-v0.2-235M-IT
⚠️ Experimental instruction-tuned checkpoint — this model did not meet the quality requirements of the main AhıskaAI v0.x series and was therefore not released as v0.4.
AhıskaAI-Experimental-v0.2-235M-IT is the instruction-tuned (IT) version of the approximately 235M parameter AhıskaAI-Experimental-v0.2-235M Small Language Model.
The model was originally developed as a candidate for the AhıskaAI v0.4 series. During pre-training and evaluation, however, significant issues were identified in the model configuration, data formatting and training pipeline.
The base 235M checkpoint demonstrated somewhat better behavior than the smaller 135M experimental model, but it still did not reach the quality, reliability and instruction-following requirements expected for the main AhıskaAI release series.
A supervised fine-tuning (SFT) stage was subsequently performed using the same type of instruction-tuning data used during the AhıskaAI v0.3 SFT process.
The resulting model is published as Experimental v0.2-235M-IT rather than as a stable v0.4 release in order to document the experiment, preserve the development history and provide a reproducible reference for the limitations encountered during this training run.
Experimental Scope
The purpose of this checkpoint was to investigate whether supervised fine-tuning could improve the instruction-following and conversational behavior of the 235M experimental base model.
The experiment focused on:
- Turkish language modeling
- Small-scale instruction tuning
- Conversational behavior
- Question answering
- Mathematical prompts
- Instruction following
- The effect of SFT on a small Llama-based model
- Evaluating whether SFT could correct undesirable behaviors learned during pre-training
This checkpoint should primarily be considered a research and experimentation model.
Model Details
- Architecture:
LlamaForCausalLM - Parameters: ~235M
- Hidden Size: 1024
- Intermediate Size: 2736
- Attention Heads: 16
- Key/Value Heads: 4
- Head Dimension: 64
- Layers: 18
- Context Length: 2048 tokens
- Vocabulary Size: 32,000
- Precision:
bfloat16 - Activation:
SiLU - Normalization: RMSNorm
- RoPE Theta: 10,000
- Model Type: Llama
- Weight Tying: Enabled in the original model configuration
- Hardware & Pre-training Time: Kaggle TPU v5e-8, approximately 7.6 hours
Relationship to the 135M Experimental Model
The 135M and 235M experimental models were trained using the same primary pre-training dataset mixture.
The main architectural difference was model capacity.
The 235M model demonstrated somewhat better resistance to the dominant formatting patterns present in the training corpus.
However, the additional parameters did not completely eliminate the underlying data-formatting and training-pipeline issues.
The 235M checkpoint therefore provided a useful comparison point for studying how increased model capacity affects the behavior of a small language model trained on the same corpus.
Pre-training Dataset Mixture
The training corpus consisted primarily of synthetic Turkish datasets together with Turkish web, knowledge and encyclopedic data.
The major sources used during the experimental pre-training run included:
| Data Source | Approx. Size | Primary Focus |
|---|---|---|
| BILGE Synthetic Web | ~4 GB | General web-style Turkish text, knowledge and language patterns |
| BILGE Synthetic Math | ~3 GB | Mathematical reasoning and synthetic mathematical text |
| BILGE Synthetic Stories | ~6 GB | Narrative generation and story-oriented Turkish text |
| BILGE Wiki-Tr-Plus | ~1 GB | Turkish encyclopedic and knowledge-oriented text |
Dataset repositories:
- BILGEM-AI/BILGE-Synthetic-Web
- BILGEM-AI/BILGE-Synthetic-Math
- BILGEM-AI/BILGE-Synthetic-Stories
- BILGEM-AI/BILGE-Wiki-Tr-Plus
The total raw size of the major datasets was approximately 14 GB.
Approximately 2.8B tokens were processed during the experimental pre-training run.
Data Formatting and Pre-training Behavior
One of the most important findings of this experiment was the strong effect of repeated formatting patterns in the pre-training corpus.
A significant portion of the training examples followed a structure similar to:
<s>## Title
Document text...
Because this pattern was repeated throughout a substantial portion of the training corpus, the model was exposed to the \<s>## document-start pattern at very high frequency.
After pre-training, the model demonstrated a strong tendency to reproduce this structure when presented with relatively simple prompts.
For example, a prompt such as:
Türkiye başkenti
could result in the model producing an unrelated document-style continuation beginning with a title rather than directly answering the question.
Similar behavior was observed with mathematical and conversational prompts.
The 235M model was able to reduce some of this behavior compared with the 135M model, but the underlying issue remained present.
Supervised Fine-Tuning
After the experimental pre-training stage, the 235M checkpoint was subjected to supervised fine-tuning.
The SFT process used the same instruction-tuning data utilized during the AhıskaAI v0.3 SFT process.
The SFT run lasted approximately 1 epoch, completed in approximately 8 minutes.
The purpose of this stage was to investigate whether a relatively short instruction-tuning stage could correct the undesirable generation patterns learned during pre-training.
The results showed that SFT alone was not sufficient to fully correct the underlying problems.
The model continued to demonstrate:
- Unreliable instruction following
- Off-topic responses
- Long uncontrolled generations
- Incorrect mathematical answers
- Repetition
- Semantic drift
- Document-like continuations
- Difficulty directly answering simple questions
Therefore, the SFT stage should be considered an experimental attempt rather than a successful instruction-tuning process.
Evaluation
The instruction-tuned checkpoint was evaluated using basic Turkish conversational prompts, question answering, mathematical questions and general instruction-following tests.
The model was capable of producing fluent-looking Turkish text, but the generated content frequently failed to correspond to the actual user prompt.
Examples of observed behavior included:
Prompt:
Türkiye başkenti neresidir?
Observed behavior:
The model generated a discussion about people born in Turkey and immigration between countries instead of directly answering the question.
Prompt:
Sen neler yapabilirsin?
Observed behavior:
The model generated a long general discussion about learning, research and educational technology rather than explaining its own capabilities.
Prompt:
2 + 2 = kaç eder?
Observed behavior:
The model produced an incorrect mathematical continuation involving unrelated arithmetic operations.
Prompt:
bir artı bir kaç eder?
Observed behavior:
The model generated a longer mathematical-style passage containing incorrect equations instead of directly answering the question.
These results indicate that the SFT stage did not sufficiently establish reliable instruction-following behavior.
The model learned to generate Turkish text, but it did not reliably learn to interpret a prompt and produce a directly relevant response.
Base Model vs. Instruction-Tuned Model
The IT checkpoint should not be interpreted as a replacement for the base experimental checkpoint.
The base 235M model primarily demonstrates the behavior learned during pre-training, while the IT checkpoint represents an additional attempt to steer that behavior using supervised fine-tuning.
The SFT stage changed the model's generation behavior, but it did not resolve the fundamental problems inherited from pre-training.
This experiment therefore provides an important comparison between:
Pre-training → Base 235M
and
Pre-training → SFT → 235M-IT
The results suggest that the underlying data and pre-training issues were too strong to be completely corrected by the short SFT stage used in this experiment.
Why Experimental v0.2-235M-IT?
This checkpoint was originally part of the development path toward AhıskaAI v0.4.
However, the experimental results did not satisfy the quality requirements for the main AhıskaAI release series.
The main issues included:
- Model configuration problems
- Data formatting problems
- Strong document-start pattern bias
- Weak instruction following
- Poor mathematical reliability
- Off-topic generation
- Semantic drift
- Long uncontrolled generations
- Insufficient improvement after SFT
For this reason, the checkpoint was not promoted to the main AhıskaAI v0.4 series.
Instead, it was released as Experimental v0.2-235M-IT.
The AhıskaAI project intentionally preserves unsuccessful and experimental checkpoints because they document the development process and provide useful reference points for future training experiments.
Known Limitations
This model is not recommended for production use.
It may produce:
- Incorrect factual answers
- Incorrect mathematical calculations
- Unrelated responses
- Repetitive text
- Document-style continuations
- Unexpected topic changes
- Incoherent or semantically drifting responses
- Excessively long generations
- Failure to follow simple instructions
Generation quality can vary significantly depending on the prompt and decoding parameters.
Intended Use
This checkpoint may be useful for:
- Research
- SLM experimentation
- Turkish language-model research
- Instruction-tuning experiments
- Studying small-model behavior
- Studying the effects of dataset formatting
- Comparing base and instruction-tuned checkpoints
- Comparing model architectures
- Reproducing or analyzing the AhıskaAI experimental pipeline
It should not be considered a reliable general-purpose assistant.
Lessons Learned
This experiment provided several important lessons for future AhıskaAI training runs.
1. SFT cannot always fix strong pre-training biases
The model entered the SFT stage with strong generation patterns established during pre-training. A short SFT run was not sufficient to completely overwrite these behaviors.
2. Data formatting matters
Repeated structures such as \<s>## Title can become strongly reinforced when they appear throughout billions of training tokens.
3. Model size helps, but does not solve bad data
The 235M model performed somewhat better than the 135M model on several behaviors, but the underlying data and training problems remained.
4. Instruction tuning needs sufficient training quality
Simply applying SFT does not guarantee reliable instruction following. Dataset quality, formatting, training duration and model initialization all affect the final result.
5. Behavioral evaluation is essential
A model can successfully complete pre-training and SFT while still failing basic questions such as simple arithmetic or factual prompts.
Future AhıskaAI releases will therefore place greater emphasis on behavioral evaluation alongside training metrics.
Future Work
The lessons learned from this experiment will be incorporated into future AhıskaAI releases.
Future training runs will focus on:
- Cleaner dataset preprocessing
- More consistent document boundaries
- Better handling of
<s>and EOS tokens - Improved dataset formatting
- Improved tokenizer and data-packing pipelines
- Better model configuration
- Better dataset mixing strategies
- Higher-quality instruction-tuning datasets
- More appropriate SFT training schedules
- More rigorous evaluation
- Stronger instruction-following behavior
About AhıskaAI
AhıskaAI is an independent initiative focused on developing efficient and capable Small Language Models for the Turkish language ecosystem, with particular interest in Turkish language technologies, low-resource language research and open-source AI.
This experimental instruction-tuned checkpoint is part of the ongoing AhıskaAI research and development process.
TÜRKÇE
AhıskaAI-Experimental-v0.2-235M-IT
⚠️ Deneysel instruction-tuned checkpoint — Bu model, ana AhıskaAI v0.x serisinin kalite gereksinimlerini karşılamamış ve bu nedenle v0.4 olarak yayınlanmamıştır.
AhıskaAI-Experimental-v0.2-235M-IT, yaklaşık 235 milyon parametreli AhıskaAI-Experimental-v0.2-235M modelinin supervised fine-tuning uygulanmış Instruction-Tuned (IT) sürümüdür.
Model başlangıçta AhıskaAI v0.4 serisi için aday olarak geliştirilmiştir. Ancak ön eğitim ve değerlendirme süreçlerinde model yapılandırması, veri formatı ve eğitim pipeline'ı ile ilgili önemli problemler tespit edilmiştir.
235M base model, aynı veriyle eğitilen 135M deneysel modele kıyasla bazı davranışlarda daha iyi sonuç vermiş olsa da ana AhıskaAI model serisi için beklenen kalite, güvenilirlik ve talimat takip etme seviyesine ulaşamamıştır.
Bunun ardından modele supervised fine-tuning (SFT) uygulanmıştır.
SFT sonrasında ortaya çıkan checkpoint, kararlı bir v0.4 sürümü olarak yayınlanmak yerine deneyin sonuçlarını belgelemek ve AhıskaAI geliştirme sürecini korumak amacıyla Experimental v0.2-235M-IT olarak yayınlanmıştır.
Deneysel Kapsam
Bu checkpoint'in temel amacı, supervised fine-tuning işleminin 235M parametreli deneysel base modelin talimat takip etme ve konuşma davranışını ne ölçüde iyileştirebileceğini araştırmaktı.
Deney şu alanlara odaklanmıştır:
- Türkçe dil modelleme
- Küçük ölçekli instruction tuning
- Konuşma davranışı
- Soru-cevap
- Matematiksel promptlar
- Talimat takip etme
- SFT'nin küçük bir Llama tabanlı model üzerindeki etkisi
- Ön eğitim sırasında öğrenilen istenmeyen davranışların SFT ile düzeltilebilirliğinin incelenmesi
Bu checkpoint öncelikli olarak bir araştırma ve deney modelidir.
Model Detayları
- Mimari:
LlamaForCausalLM - Parametre Sayısı: ~235M
- Gizli Boyut (Hidden Size): 1024
- Ara Katman Boyutu (Intermediate Size): 2736
- Attention Head Sayısı: 16
- Key/Value Head Sayısı: 4
- Head Boyutu: 64
- Katman Sayısı: 18
- Bağlam Uzunluğu: 2048 token
- Kelime Dağarcığı Boyutu: 32.000
- Hassasiyet:
bfloat16 - Aktivasyon:
SiLU - Normalizasyon: RMSNorm
- RoPE Theta: 10.000
- Model Türü: Llama
- Weight Tying: Orijinal model yapılandırmasında etkin
- Donanım ve Ön Eğitim Süresi: Kaggle TPU v5e-8 üzerinde yaklaşık 7,6 saat
135M Deneysel Model ile İlişkisi
135M ve 235M deneysel modelleri aynı temel ön eğitim veri karışımı kullanılarak eğitilmiştir.
Temel fark model kapasitesidir.
235M model, eğitim verisindeki baskın format örüntülerine karşı 135M modele kıyasla bir miktar daha dirençli davranmıştır.
Ancak daha fazla parametre, veri formatı ve eğitim pipeline'ından kaynaklanan temel problemleri tamamen ortadan kaldırmamıştır.
Bu nedenle 235M model, aynı veri üzerinde model kapasitesinin küçük dil modeli davranışını nasıl etkilediğini incelemek için önemli bir karşılaştırma noktasıdır.
Ön Eğitim Veri Karışımı
Eğitim veri kümesi ağırlıklı olarak sentetik Türkçe veri setlerinden ve Türkçe web, bilgi ve ansiklopedik verilerden oluşturulmuştur.
Başlıca veri kaynakları:
| Veri Kaynağı | Yaklaşık Boyut | Temel Odak |
|---|---|---|
| BILGE Synthetic Web | ~4 GB | Genel web tarzı Türkçe metin, bilgi ve dil örüntüleri |
| BILGE Synthetic Math | ~3 GB | Matematiksel akıl yürütme ve sentetik matematik metinleri |
| BILGE Synthetic Stories | ~6 GB | Anlatı üretimi ve hikâye odaklı Türkçe metin |
| BILGE Wiki-Tr-Plus | ~1 GB | Türkçe ansiklopedik ve bilgi odaklı metin |
Ana veri kaynaklarının toplam ham boyutu yaklaşık 14 GB'dır.
Deneysel ön eğitim sürecinde yaklaşık 2,8 milyar token işlenmiştir.
Veri Formatı ve Ön Eğitim Davranışı
Bu deneyin en önemli bulgularından biri, ön eğitim verisindeki tekrar eden format örüntülerinin model davranışı üzerindeki güçlü etkisidir.
Eğitim örneklerinin önemli bir bölümü aşağıdakine benzer bir yapıya sahipti:
<s>## Başlık
Doküman metni...
Bu yapı eğitim verisinin önemli bir bölümünde tekrarlandığından model, \<s>## doküman başlangıcı örüntüsüne çok yoğun şekilde maruz kalmıştır.
Ön eğitim sonrasında model, basit promptlarla karşılaştığında dahi bu yapıyı tekrar üretmeye yönelik güçlü bir eğilim göstermiştir.
Örneğin:
Türkiye başkenti
gibi basit bir prompt, modelin doğrudan cevap vermek yerine başlıklı ve doküman tarzı ilgisiz bir metin üretmesine neden olabilmektedir.
235M model bu davranıştan 135M modele göre bir miktar daha fazla kurtulabilmiş olsa da temel problem tamamen ortadan kalkmamıştır.
Supervised Fine-Tuning
Deneysel ön eğitim aşamasından sonra 235M checkpoint'e supervised fine-tuning uygulanmıştır.
SFT sürecinde AhıskaAI v0.3 SFT sürecinde kullanılan veri kullanılmıştır.
SFT eğitimi yaklaşık 1 epoch sürmüş ve yaklaşık 8 dakikada tamamlanmıştır.
Bu aşamanın amacı, ön eğitim sırasında öğrenilen istenmeyen üretim örüntülerinin kısa bir instruction-tuning süreciyle ne ölçüde düzeltilebileceğini araştırmaktı.
Sonuçlar, SFT'nin tek başına temel problemleri tamamen çözmek için yeterli olmadığını göstermiştir.
SFT sonrasında model hâlâ:
- Güvenilir olmayan talimat takibi
- Konuyla ilgisiz cevaplar
- Kontrolsüz uzun üretimler
- Yanlış matematiksel cevaplar
- Tekrarlama
- Anlamsal sapma
- Doküman tarzı devamlar
- Basit sorulara doğrudan cevap verememe
gibi sorunlar göstermiştir.
Bu nedenle SFT aşaması başarılı bir instruction-tuning süreci olarak değil, deneysel bir düzeltme girişimi olarak değerlendirilmelidir.
Değerlendirme
IT checkpoint; temel Türkçe konuşma promptları, soru-cevap, matematiksel sorular ve genel talimat takip etme testleriyle değerlendirilmiştir.
Model akıcı görünebilen Türkçe metinler üretebilmesine rağmen, üretilen içerik çoğu zaman gerçek prompt ile yeterince ilişkili değildir.
Örneğin:
Prompt:
Türkiye başkenti neresidir?
Gözlemlenen davranış:
Model, sorunun cevabını doğrudan vermek yerine Türkiye'de doğum, Amerika'ya göç ve ülkeler arasındaki iletişim hakkında ilgisiz bir metin üretmiştir.
Prompt:
Sen neler yapabilirsin?
Gözlemlenen davranış:
Model kendi yeteneklerini açıklamak yerine öğrenme, araştırma ve eğitim teknolojileri hakkında uzun bir metin üretmiştir.
Prompt:
2 + 2 = kaç eder?
Gözlemlenen davranış:
Model yanlış matematiksel işlemler içeren ilgisiz bir devam üretmiştir.
Prompt:
bir artı bir kaç eder?
Gözlemlenen davranış:
Model doğrudan cevap vermek yerine yanlış denklemler içeren daha uzun bir matematik metni üretmiştir.
Bu sonuçlar SFT aşamasının güvenilir talimat takip etme davranışı oluşturmak için yeterli olmadığını göstermektedir.
Model Türkçe metin üretmeyi öğrenmiş olsa da promptu güvenilir şekilde yorumlayıp doğrudan ilgili cevap üretme konusunda yeterli performansa ulaşamamıştır.
Base Model ve Instruction-Tuned Model
IT checkpoint, base experimental checkpoint'in yerine geçen kararlı bir model olarak değerlendirilmemelidir.
Base 235M model ağırlıklı olarak ön eğitim sırasında öğrenilen davranışları gösterirken, IT checkpoint bu davranışları supervised fine-tuning ile yönlendirmeye yönelik ek bir deneydir.
SFT modelin üretim davranışını belirli ölçülerde değiştirmiş olsa da ön eğitimden miras kalan temel problemleri çözmemiştir.
Bu deney şu iki aşamanın karşılaştırılmasını sağlamaktadır:
Ön Eğitim → Base 235M
ve
Ön Eğitim → SFT → 235M-IT
Sonuçlar, ön eğitim sırasında oluşan veri ve format kaynaklı problemlerin bu deneyde kullanılan kısa SFT süreciyle tamamen düzeltilemeyecek kadar güçlü olduğunu göstermektedir.
Neden Experimental v0.2-235M-IT?
Bu checkpoint başlangıçta AhıskaAI v0.4 geliştirme sürecinin bir parçası olarak tasarlanmıştır.
Ancak deney sonuçları ana AhıskaAI model serisi için belirlenen kalite gereksinimlerini karşılamamıştır.
Başlıca sorunlar:
- Model yapılandırmasıyla ilgili problemler
- Veri formatı problemleri
- Güçlü doküman başlangıcı örüntüsü eğilimi
- Zayıf talimat takibi
- Zayıf matematiksel güvenilirlik
- Konu dışı üretimler
- Anlamsal sapma
- Kontrolsüz uzun üretimler
- SFT sonrasında yetersiz iyileşme
Bu nedenle checkpoint ana AhıskaAI v0.4 serisine dahil edilmemiştir.
Bunun yerine Experimental v0.2-235M-IT olarak yayınlanmıştır.
AhıskaAI projesi başarısız veya deneysel checkpoint'leri silmek yerine bilinçli olarak korumaktadır. Bu modeller geliştirme sürecini belgelemekte ve gelecekteki eğitim deneyleri için önemli karşılaştırma noktaları oluşturmaktadır.
Bilinen Sınırlamalar
Bu modelin üretim ortamında kullanılması önerilmez.
Model aşağıdaki türde çıktılar üretebilir:
- Yanlış bilgi içeren cevaplar
- Yanlış matematiksel hesaplamalar
- Konuyla ilgisiz cevaplar
- Tekrarlayan metinler
- Doküman tarzı devamlar
- Beklenmedik konu değişimleri
- Tutarsız veya anlamsal olarak sapan cevaplar
- Gereğinden uzun üretimler
- Basit talimatları takip edememe
Üretim kalitesi prompta ve kullanılan decoding parametrelerine bağlı olarak önemli ölçüde değişiklik gösterebilir.
Kullanım Amacı
Bu checkpoint aşağıdaki amaçlarla kullanılabilir:
- Araştırma
- SLM deneyleri
- Türkçe dil modeli araştırmaları
- Instruction-tuning deneyleri
- Küçük modellerin davranışlarını inceleme
- Veri formatının model davranışı üzerindeki etkilerini inceleme
- Base ve instruction-tuned checkpoint'leri karşılaştırma
- Farklı model mimarilerini karşılaştırma
- AhıskaAI deneysel eğitim pipeline'ını yeniden üretme veya analiz etme
Model, güvenilir ve genel amaçlı bir asistan olarak değerlendirilmemelidir.
Deneyden Çıkarılan Dersler
1. SFT güçlü ön eğitim önyargılarını her zaman düzeltemez
Model SFT aşamasına, ön eğitim sırasında oluşmuş güçlü üretim örüntüleriyle girmiştir. Kısa bir SFT süreci bu davranışları tamamen değiştirmek için yeterli olmamıştır.
2. Veri formatı kritik öneme sahiptir
\<s>## Başlık gibi tekrar eden yapılar milyarlarca token boyunca kullanıldığında model tarafından güçlü şekilde öğrenilebilir.
3. Model boyutu kötü veriyi tek başına çözmez
235M model, 135M modele kıyasla bazı davranışlarda daha iyi performans göstermiştir. Ancak temel veri ve eğitim problemleri devam etmiştir.
4. Instruction tuning yeterli eğitim kalitesi gerektirir
Bir modele SFT uygulamak otomatik olarak güvenilir talimat takip etme davranışı oluşturmaz. Veri kalitesi, format, eğitim süresi ve model başlangıç durumu nihai sonucu doğrudan etkiler.
5. Davranışsal değerlendirme kritik öneme sahiptir
Bir model ön eğitim ve SFT süreçlerini başarıyla tamamlamış olsa bile basit matematik sorularına veya temel bilgi sorularına güvenilir şekilde cevap veremeyebilir.
Bu nedenle gelecekteki AhıskaAI sürümlerinde eğitim metriklerinin yanında davranışsal değerlendirmeye de daha fazla önem verilecektir.
Gelecek Çalışmalar
Bu deneyden elde edilen dersler gelecekteki AhıskaAI sürümlerinde kullanılacaktır.
Gelecekteki eğitim çalışmalarında özellikle şu alanlara odaklanılacaktır:
- Daha temiz veri ön işleme
- Daha tutarlı doküman sınırları
<s>ve EOS tokenlarının daha iyi yönetilmesi- İyileştirilmiş veri formatı
- Geliştirilmiş tokenizer ve veri paketleme pipeline'ları
- Daha iyi model yapılandırması
- Daha iyi veri karıştırma stratejileri
- Daha kaliteli instruction-tuning verileri
- Daha uygun SFT eğitim planları
- Daha kapsamlı değerlendirme
- Daha güçlü talimat takip etme davranışı
AhıskaAI Hakkında
AhıskaAI, Türkçe dil ekosistemine yönelik verimli ve yetenekli Küçük Dil Modelleri (SLM) geliştirmeye odaklanan bağımsız bir girişimdir. Proje özellikle Türkçe dil teknolojileri, düşük kaynaklı dil araştırmaları ve açık kaynak yapay zekâ alanlarına odaklanmaktadır.
Bu deneysel instruction-tuned checkpoint, devam eden AhıskaAI araştırma ve geliştirme sürecinin bir parçasıdır.
- Downloads last month
- -