Instructions to use TilQazyna/kazakh-terms-seq2seq with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- fastText
How to use TilQazyna/kazakh-terms-seq2seq with fastText:
from huggingface_hub import hf_hub_download import fasttext model = fasttext.load_model(hf_hub_download("TilQazyna/kazakh-terms-seq2seq", "model.bin")) - Notebooks
- Google Colab
- Kaggle
You need to agree to share your contact information to access this model
This repository is publicly accessible, but you have to accept the conditions to access its files and content.
Бұл репозиторийге қолжетімділік өтінім бойынша беріледі. Өзіңіз туралы және деректерді қалай қолданатыңыз туралы жазыңыз — өтінімді TilQazyna командасы қарайды. · Доступ к репозиторию выдаётся по заявке. Расскажите о себе и о том, как собираетесь использовать данные — заявку рассматривает команда TilQazyna. · Access to this repository is granted on request. Tell us who you are and how you plan to use the material; the TilQazyna team reviews each application.
Log in or Sign Up to review the conditions and access this model content.
kazakh-terms-seq2seq
Термин аудару мен тіл анықтауға арналған код · Код перевода терминов и определения языка · Code for term translation and language identification
Қазақша
kazakh-terms-seq2seq — орыс терминдерін қазақшаға аудару не қалыптандыру және орысша-қазақша тілін анықтау эксперименттерінің 0.1 МБ код репозиторийі. Мұнда Seq2Seq пен fastText оқыту скрипттері бар, бірақ дайын checkpoint пен fastText салмақтары жарияланбаған.
Репозиторий құрамы
| Компонент | Қызметі | Файл |
|---|---|---|
| Дерек дайындау | til.csv материалын өңдеу |
preparedata.py |
| Seq2Seq | Орысша терминді қазақшаға аудару не қалыптандыру | train_term.py |
| fastText | Орысша және қазақша тілді ажырату | train.py |
| Түзету pipeline | Модель нәтижесін морфологиялық өңдеу | get_fix_by_model.py |
Seq2Seq скриптінде checkpoint-2300, adafactor, batch size 20, gradient accumulation 128, 100 epoch және 98/2 оқыту-әзірлеу бөлінісі жазылған. fastText бөлігі data/train_2langs.txt файлын оқып, 6langs.bin салмағын шығарады.
Екі компонент терминді өңдеу pipeline ішінде бірін-бірі толықтыратын міндет атқарады.
Қалай жүктейді
from huggingface_hub import snapshot_download
from pathlib import Path
root = Path(snapshot_download("TilQazyna/kazakh-terms-seq2seq"))
code = root / "Shet tildik terminder"
for name in ("preparedata.py", "train_term.py", "train.py", "get_fix_by_model.py"):
print(code / name)
Код барлық зерттеу скрипттерін Hugging Face кэшіне жүктеп, олардың жергілікті жолдарын шығарады. Оқыту немесе inference үшін скрипттер күткен деректер мен салмақтарды бөлек беру қажет.
Қолжетімділік
Карточка мен файл атаулары жалпыға ашық. Репозиторий мазмұнын жүктеу «Request access» өтінімін TilQazyna командасы мақұлдағаннан кейін мүмкін болады.
Байланысты репозиторийлер
Оқыту графында kazakh-terms-evaluation деректер көзі көрсетілген. Туыстас термин моделі — kazakh-terms-gpt.
Русский
kazakh-terms-seq2seq — репозиторий кода объёмом 0.1 МБ для экспериментов по переводу или нормализации русских терминов на казахский и определению русского либо казахского языка. В нём лежат сценарии обучения Seq2Seq и fastText, но готовые checkpoint и веса fastText не опубликованы.
Что внутри
| Компонент | Задача | Файл |
|---|---|---|
| Подготовка данных | Обработка материала из til.csv |
preparedata.py |
| Seq2Seq | Перевод или нормализация русского термина | train_term.py |
| fastText | Различение русского и казахского | train.py |
| Pipeline исправления | Морфологическая обработка результата | get_fix_by_model.py |
Сценарий Seq2Seq указывает checkpoint-2300, adafactor, batch size 20, gradient accumulation 128, 100 эпох и разбиение обучения и разработки 98/2. Часть fastText читает data/train_2langs.txt и записывает веса 6langs.bin.
Как загрузить
from huggingface_hub import snapshot_download
from pathlib import Path
root = Path(snapshot_download("TilQazyna/kazakh-terms-seq2seq"))
code = root / "Shet tildik terminder"
for name in ("preparedata.py", "train_term.py", "train.py", "get_fix_by_model.py"):
print(code / name)
Код скачивает исследовательские сценарии в кэш Hugging Face и печатает локальные пути. Для обучения или inference нужно отдельно предоставить ожидаемые скриптами данные и веса.
Доступ
Карточку и названия файлов можно просматривать свободно. Содержимое репозитория скачивается после одобрения формы «Request access» командой TilQazyna.
Связанные репозитории
В графе обучения указан набор kazakh-terms-evaluation. Родственная модель терминологии — kazakh-terms-gpt.
English
kazakh-terms-seq2seq is a 0.1 MB code repository for experiments in translating or normalizing Russian terms into Kazakh and identifying Russian versus Kazakh text. It contains Seq2Seq and fastText training scripts, but does not publish the trained checkpoint or fastText weights.
Repository contents
| Component | Purpose | File |
|---|---|---|
| Data preparation | Process material from til.csv |
preparedata.py |
| Seq2Seq | Translate or normalize a Russian term | train_term.py |
| fastText | Distinguish Russian from Kazakh | train.py |
| Correction pipeline | Morphologically process model output | get_fix_by_model.py |
The Seq2Seq script records checkpoint-2300, adafactor, batch size 20, gradient accumulation 128, 100 epochs, and a 98/2 train-development split. The fastText component reads data/train_2langs.txt and writes 6langs.bin weights.
How to download
from huggingface_hub import snapshot_download
from pathlib import Path
root = Path(snapshot_download("TilQazyna/kazakh-terms-seq2seq"))
code = root / "Shet tildik terminder"
for name in ("preparedata.py", "train_term.py", "train.py", "get_fix_by_model.py"):
print(code / name)
This downloads the research scripts to the Hugging Face cache and prints their local paths. Training or inference additionally requires the data and weights expected by those scripts.
Access
The card and filenames are publicly visible. Repository content becomes downloadable after the TilQazyna team approves the “Request access” form.
Related repositories
The training graph identifies kazakh-terms-evaluation as a data source. A related terminology model is kazakh-terms-gpt.
Лицензия · License: apache-2.0 · TilQazyna
- Downloads last month
- -