You need to agree to share your contact information to access this model

This repository is publicly accessible, but you have to accept the conditions to access its files and content.

Бұл репозиторийге қолжетімділік өтінім бойынша беріледі. Өзіңіз туралы және деректерді қалай қолданатыңыз туралы жазыңыз — өтінімді TilQazyna командасы қарайды. · Доступ к репозиторию выдаётся по заявке. Расскажите о себе и о том, как собираетесь использовать данные — заявку рассматривает команда TilQazyna. · Access to this repository is granted on request. Tell us who you are and how you plan to use the material; the TilQazyna team reviews each application.

Log in or Sign Up to review the conditions and access this model content.

OCR

Қазақ құжаттарына арналған OCR моделі · OCR-модель для казахских документов · OCR model for Kazakh documents

Қазақша · Русский · English


Қазақша

OCR — қазақ тіліндегі суреттер мен PDF құжаттардан мәтін шығаруға арналған 184.7 МБ модель репозиторийі. Модель орыс және ағылшын мәтіндерін де өңдейді, сондықтан көптілді скандарды цифрлауға жарайды.

Репозиторий құрамы

Модель doctr негізіндегі арнайы OCR архитектурасын қолданады. Негізгі материал OCR.zip архивінде, ал қосымша код custom бумасында сақталған. Кіріс ретінде JPEG, PNG және PDF файлдары қабылданады; нәтиже мәтін немесе PDF түрінде беріледі.

Қалай жүктейді

from huggingface_hub import snapshot_download
from pathlib import Path
from zipfile import ZipFile

root = Path(snapshot_download("TilQazyna/OCR"))
with ZipFile(root / "OCR.zip") as archive:
    archive.extractall(root / "ocr_model")
print(root / "ocr_model")

Код репозиторийді Hugging Face кэшіне жүктеп, модель архивін ашады. Модельді іске қосу файлдары архив пен custom бумасында орналасқан.

Қолжетімділік

Карточка мен файлдар тізімі баршаға көрінеді. Файлдарды жүктеу үшін репозиторий бетіндегі «Request access» арқылы өтінім беру керек; шешімді TilQazyna командасы қабылдайды.

Байланысты репозиторийлер

OCR сканнан алынатын кітаптармен жұмыс істеуге арналған: Til-Books-KazNEB-raw-scans бастапқы скандарды сақтайды, ал Til-Books өңделген кітап мәтіндерін біріктіреді.


Русский

OCR — репозиторий модели объёмом 184.7 МБ для извлечения казахского текста из изображений и PDF. Модель также обрабатывает русский и английский, что позволяет оцифровывать многоязычные сканы.

Что внутри

Модель использует специальную OCR-архитектуру на основе doctr. Основные материалы упакованы в OCR.zip, вспомогательный код лежит в каталоге custom. На вход принимаются JPEG, PNG и PDF, результат сохраняется как текст или PDF.

Как загрузить

from huggingface_hub import snapshot_download
from pathlib import Path
from zipfile import ZipFile

root = Path(snapshot_download("TilQazyna/OCR"))
with ZipFile(root / "OCR.zip") as archive:
    archive.extractall(root / "ocr_model")
print(root / "ocr_model")

Код загружает снимок репозитория в кэш Hugging Face и распаковывает архив модели. Файлы запуска находятся в архиве и каталоге custom.

Доступ

Карточка и перечень файлов открыты для просмотра. Скачивание становится доступно после одобрения формы «Request access» на странице репозитория; её проверяет команда TilQazyna.

Связанные репозитории

Модель рассчитана на книжные сканы: Til-Books-KazNEB-raw-scans хранит исходные изображения, а Til-Books объединяет подготовленные книжные тексты.


English

OCR is a 184.7 MB model repository for extracting Kazakh text from images and PDF documents. It also supports Russian and English, making it suitable for digitizing multilingual scans.

Repository contents

The model uses a custom OCR architecture based on doctr. Its main material is packaged in OCR.zip, with supporting code under custom. It accepts JPEG, PNG, and PDF inputs and produces plain text or PDF output.

How to download

from huggingface_hub import snapshot_download
from pathlib import Path
from zipfile import ZipFile

root = Path(snapshot_download("TilQazyna/OCR"))
with ZipFile(root / "OCR.zip") as archive:
    archive.extractall(root / "ocr_model")
print(root / "ocr_model")

This downloads a repository snapshot into the Hugging Face cache and extracts the model archive. Runtime files are provided inside the archive and the custom directory.

Access

The model card and file listing are publicly visible. Download access follows approval of the “Request access” form on the repository page, reviewed by the TilQazyna team.

Related repositories

The model is intended for book scans: Til-Books-KazNEB-raw-scans stores source scans, while Til-Books brings together the processed book text.


Лицензия · License: mit · TilQazyna

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Collection including TilQazyna/OCR