You need to agree to share your contact information to access this model

This repository is publicly accessible, but you have to accept the conditions to access its files and content.

Бұл репозиторийге қолжетімділік өтінім бойынша беріледі. Өзіңіз туралы және деректерді қалай қолданатыңыз туралы жазыңыз — өтінімді TilQazyna командасы қарайды. · Доступ к репозиторию выдаётся по заявке. Расскажите о себе и о том, как собираетесь использовать данные — заявку рассматривает команда TilQazyna. · Access to this repository is granted on request. Tell us who you are and how you plan to use the material; the TilQazyna team reviews each application.

Log in or Sign Up to review the conditions and access this model content.

kazakh-terms-seq2seq

Термин аудару мен тіл анықтауға арналған код · Код перевода терминов и определения языка · Code for term translation and language identification

Қазақша · Русский · English


Қазақша

kazakh-terms-seq2seq — орыс терминдерін қазақшаға аудару не қалыптандыру және орысша-қазақша тілін анықтау эксперименттерінің 0.1 МБ код репозиторийі. Мұнда Seq2Seq пен fastText оқыту скрипттері бар, бірақ дайын checkpoint пен fastText салмақтары жарияланбаған.

Репозиторий құрамы

Компонент Қызметі Файл
Дерек дайындау til.csv материалын өңдеу preparedata.py
Seq2Seq Орысша терминді қазақшаға аудару не қалыптандыру train_term.py
fastText Орысша және қазақша тілді ажырату train.py
Түзету pipeline Модель нәтижесін морфологиялық өңдеу get_fix_by_model.py

Seq2Seq скриптінде checkpoint-2300, adafactor, batch size 20, gradient accumulation 128, 100 epoch және 98/2 оқыту-әзірлеу бөлінісі жазылған. fastText бөлігі data/train_2langs.txt файлын оқып, 6langs.bin салмағын шығарады.

Екі компонент терминді өңдеу pipeline ішінде бірін-бірі толықтыратын міндет атқарады.

Қалай жүктейді

from huggingface_hub import snapshot_download
from pathlib import Path

root = Path(snapshot_download("TilQazyna/kazakh-terms-seq2seq"))
code = root / "Shet tildik terminder"
for name in ("preparedata.py", "train_term.py", "train.py", "get_fix_by_model.py"):
    print(code / name)

Код барлық зерттеу скрипттерін Hugging Face кэшіне жүктеп, олардың жергілікті жолдарын шығарады. Оқыту немесе inference үшін скрипттер күткен деректер мен салмақтарды бөлек беру қажет.

Қолжетімділік

Карточка мен файл атаулары жалпыға ашық. Репозиторий мазмұнын жүктеу «Request access» өтінімін TilQazyna командасы мақұлдағаннан кейін мүмкін болады.

Байланысты репозиторийлер

Оқыту графында kazakh-terms-evaluation деректер көзі көрсетілген. Туыстас термин моделі — kazakh-terms-gpt.


Русский

kazakh-terms-seq2seq — репозиторий кода объёмом 0.1 МБ для экспериментов по переводу или нормализации русских терминов на казахский и определению русского либо казахского языка. В нём лежат сценарии обучения Seq2Seq и fastText, но готовые checkpoint и веса fastText не опубликованы.

Что внутри

Компонент Задача Файл
Подготовка данных Обработка материала из til.csv preparedata.py
Seq2Seq Перевод или нормализация русского термина train_term.py
fastText Различение русского и казахского train.py
Pipeline исправления Морфологическая обработка результата get_fix_by_model.py

Сценарий Seq2Seq указывает checkpoint-2300, adafactor, batch size 20, gradient accumulation 128, 100 эпох и разбиение обучения и разработки 98/2. Часть fastText читает data/train_2langs.txt и записывает веса 6langs.bin.

Как загрузить

from huggingface_hub import snapshot_download
from pathlib import Path

root = Path(snapshot_download("TilQazyna/kazakh-terms-seq2seq"))
code = root / "Shet tildik terminder"
for name in ("preparedata.py", "train_term.py", "train.py", "get_fix_by_model.py"):
    print(code / name)

Код скачивает исследовательские сценарии в кэш Hugging Face и печатает локальные пути. Для обучения или inference нужно отдельно предоставить ожидаемые скриптами данные и веса.

Доступ

Карточку и названия файлов можно просматривать свободно. Содержимое репозитория скачивается после одобрения формы «Request access» командой TilQazyna.

Связанные репозитории

В графе обучения указан набор kazakh-terms-evaluation. Родственная модель терминологии — kazakh-terms-gpt.


English

kazakh-terms-seq2seq is a 0.1 MB code repository for experiments in translating or normalizing Russian terms into Kazakh and identifying Russian versus Kazakh text. It contains Seq2Seq and fastText training scripts, but does not publish the trained checkpoint or fastText weights.

Repository contents

Component Purpose File
Data preparation Process material from til.csv preparedata.py
Seq2Seq Translate or normalize a Russian term train_term.py
fastText Distinguish Russian from Kazakh train.py
Correction pipeline Morphologically process model output get_fix_by_model.py

The Seq2Seq script records checkpoint-2300, adafactor, batch size 20, gradient accumulation 128, 100 epochs, and a 98/2 train-development split. The fastText component reads data/train_2langs.txt and writes 6langs.bin weights.

How to download

from huggingface_hub import snapshot_download
from pathlib import Path

root = Path(snapshot_download("TilQazyna/kazakh-terms-seq2seq"))
code = root / "Shet tildik terminder"
for name in ("preparedata.py", "train_term.py", "train.py", "get_fix_by_model.py"):
    print(code / name)

This downloads the research scripts to the Hugging Face cache and prints their local paths. Training or inference additionally requires the data and weights expected by those scripts.

Access

The card and filenames are publicly visible. Repository content becomes downloadable after the TilQazyna team approves the “Request access” form.

Related repositories

The training graph identifies kazakh-terms-evaluation as a data source. A related terminology model is kazakh-terms-gpt.


Лицензия · License: apache-2.0 · TilQazyna

Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Collection including TilQazyna/kazakh-terms-seq2seq