You need to agree to share your contact information to access this model

This repository is publicly accessible, but you have to accept the conditions to access its files and content.

Бұл репозиторийге қолжетімділік өтінім бойынша беріледі. Өзіңіз туралы және деректерді қалай қолданатыңыз туралы жазыңыз — өтінімді TilQazyna командасы қарайды. · Доступ к репозиторию выдаётся по заявке. Расскажите о себе и о том, как собираетесь использовать данные — заявку рассматривает команда TilQazyna. · Access to this repository is granted on request. Tell us who you are and how you plan to use the material; the TilQazyna team reviews each application.

Log in or Sign Up to review the conditions and access this model content.

Til-Core-1B

Қазақ тілінің базалық моделі · Базовая модель казахского языка · Kazakh base language model

Қазақша · Русский · English


Қазақша

Til-Core-1B — қазақша мәтінді жалғастыруға арналған 1.246B параметрлі базалық тіл моделі. Репозиторий көлемі — 7.11 ГБ; модель дедупликацияланған қазақ web және мәтін корпусымен басынан бастап үйретілген.

Бұл базалық checkpoint chat нұсқауларын орындауға бапталмаған. Нұсқаулар мен диалогқа Til-Core-1B-Instruct, ал қазақ мәтініндегі қателерге Til-Core-1B-GEC қолданылады.

Құрылымы

Сипаттама Мәні
Архитектура LlamaForCausalLM
Параметр саны 1.246B
Жасырын қабат өлшемі 2048
Қабат саны 16
Attention басы 32
KV басы 8
Аралық қабат өлшемі 5632
Сөздік 256000 токен
Контекст ұзындығы 2048 токен
Дәлдік bf16

Decoder-only модель RoPE, RMSNorm, SwiGLU және GQA қолданады. Кіріс пен шығыс embedding-тері ортақ, tokenizer morpheme-aware BPE қағидасымен жасалған.

Үйрету

Көрсеткіш Мәні
Үйрету токені 6.26B
Epoch 1
Train block 3 057 865
Құжат саны, дедупликацияға дейін 13.19M
Құжат саны, дедупликациядан кейін 11.29M
Сақталған бөлігі 85.6%
Қорытынды train loss ~2.90

Корпус MinHash әдісімен дедупликацияланған. Модель көбіне оқу-ағарту және энциклопедиялық қазақ мәтіндерін көрген, сондықтан генерацияда сирек токен артефактілері кездесуі мүмкін.

Іске қосу

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

repo = "TilQazyna/Til-Core-1B"
tokenizer = AutoTokenizer.from_pretrained(repo)
model = AutoModelForCausalLM.from_pretrained(
    repo, dtype=torch.bfloat16, device_map="auto"
).eval()

inputs = tokenizer("Қазақстан Республикасы — ", return_tensors="pt").to(model.device)
output = model.generate(**inputs, max_new_tokens=50, do_sample=True, temperature=0.8)
print(tokenizer.decode(output[0], skip_special_tokens=True))

Қолжетімділік

Модель карточкасы мен файлдар тізімі ашық. Файлдарды алу үшін беттегі «Request access» батырмасымен өтінім беріледі, жүктеу TilQazyna командасының мақұлдауынан кейін ашылады.

Байланысты репозиторийлер

Нұсқауларға бейімделген нұсқа — Til-Core-1B-Instruct. GEC міндетіне арналған нұсқа — Til-Core-1B-GEC.


Русский

Til-Core-1B — базовая языковая модель на 1.246B параметров для продолжения казахского текста. Репозиторий занимает 7.11 ГБ; модель обучена с нуля на дедуплицированном корпусе казахских web- и других текстов.

Базовый checkpoint не настроен на выполнение chat-инструкций. Для инструкций и диалога подготовлена Til-Core-1B-Instruct, для исправления казахского текста — Til-Core-1B-GEC.

Устройство

Характеристика Значение
Архитектура LlamaForCausalLM
Параметров 1.246B
Размер скрытого слоя 2048
Слоёв 16
Голов attention 32
Голов KV 8
Размер промежуточного слоя 5632
Словарь 256000 токенов
Длина контекста 2048 токенов
Точность bf16

Decoder-only модель использует RoPE, RMSNorm, SwiGLU и GQA. Входные и выходные embedding связаны, tokenizer построен по принципу morpheme-aware BPE.

Обучение

Показатель Значение
Обучающих токенов 6.26B
Epoch 1
Train block 3 057 865
Документов до дедупликации 13.19M
Документов после дедупликации 11.29M
Сохранено 85.6%
Итоговый train loss ~2.90

Корпус прошёл дедупликацию методом MinHash. В обучающих данных преобладают учебные и энциклопедические тексты на казахском языке, поэтому в генерации возможны артефакты редких токенов.

Как запустить

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

repo = "TilQazyna/Til-Core-1B"
tokenizer = AutoTokenizer.from_pretrained(repo)
model = AutoModelForCausalLM.from_pretrained(
    repo, dtype=torch.bfloat16, device_map="auto"
).eval()

inputs = tokenizer("Қазақстан Республикасы — ", return_tensors="pt").to(model.device)
output = model.generate(**inputs, max_new_tokens=50, do_sample=True, temperature=0.8)
print(tokenizer.decode(output[0], skip_special_tokens=True))

Доступ

Карточка модели и список файлов открыты для просмотра. Чтобы скачать файлы, нужно отправить заявку кнопкой «Request access» и дождаться решения команды TilQazyna.

Связанные репозитории

Версия для инструкций — Til-Core-1B-Instruct. Версия для задачи GEC — Til-Core-1B-GEC.


English

Til-Core-1B is a 1.246B-parameter base language model for Kazakh text completion. The repository is 7.11 GB; the model was pretrained from scratch on a deduplicated corpus of Kazakh web and other text.

This base checkpoint is not tuned to follow chat instructions. Til-Core-1B-Instruct handles instructions and dialogue, while Til-Core-1B-GEC targets corrections in Kazakh text.

Architecture

Property Value
Architecture LlamaForCausalLM
Parameters 1.246B
Hidden size 2048
Layers 16
Attention heads 32
KV heads 8
Intermediate size 5632
Vocabulary 256000 tokens
Context length 2048 tokens
Precision bf16

The decoder-only model uses RoPE, RMSNorm, SwiGLU, and GQA. Its input and output embeddings are tied, and the tokenizer follows a morpheme-aware BPE design.

Training

Metric Value
Training tokens 6.26B
Epochs 1
Train blocks 3 057 865
Documents before deduplication 13.19M
Documents after deduplication 11.29M
Documents retained 85.6%
Final train loss ~2.90

The corpus was deduplicated with MinHash. Educational and encyclopedic Kazakh text is prominent in the training material, so generation can occasionally contain rare-token artifacts.

Usage

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

repo = "TilQazyna/Til-Core-1B"
tokenizer = AutoTokenizer.from_pretrained(repo)
model = AutoModelForCausalLM.from_pretrained(
    repo, dtype=torch.bfloat16, device_map="auto"
).eval()

inputs = tokenizer("Қазақстан Республикасы — ", return_tensors="pt").to(model.device)
output = model.generate(**inputs, max_new_tokens=50, do_sample=True, temperature=0.8)
print(tokenizer.decode(output[0], skip_special_tokens=True))

Access

The model card and file listing are publicly visible. Download access starts after the TilQazyna team approves a submission made through the “Request access” button.

Related repositories

The instruction-tuned version is Til-Core-1B-Instruct. The GEC-specific version is Til-Core-1B-GEC.


Лицензия · License: apache-2.0 · TilQazyna

Downloads last month
3
Safetensors
Model size
2B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for TilQazyna/Til-Core-1B

Finetunes
2 models

Dataset used to train TilQazyna/Til-Core-1B

Collection including TilQazyna/Til-Core-1B