OCR / README.md
stukenov's picture
Карточка на трёх языках: қазақша, русский, English
3b33869 verified
|
Raw
History Blame Contribute Delete
7.04 kB
---
license: mit
language:
- kk
- ru
- en
tags:
- kazakh
- ocr
- doctr
extra_gated_prompt: >-
Бұл репозиторийге қолжетімділік өтінім бойынша беріледі. Өзіңіз туралы және
деректерді қалай қолданатыңыз туралы жазыңыз — өтінімді TilQazyna командасы қарайды.
· Доступ к репозиторию выдаётся по заявке. Расскажите о себе и о том, как собираетесь
использовать данные — заявку рассматривает команда TilQazyna.
· Access to this repository is granted on request. Tell us who you are and how you plan
to use the material; the TilQazyna team reviews each application.
extra_gated_fields:
Аты-жөні / ФИО / Full name: text
Ұйым / Организация / Affiliation: text
Мақсаты / Цель использования / Intended use: text
---
# OCR
Қазақ құжаттарына арналған OCR моделі · OCR-модель для казахских документов · OCR model for Kazakh documents
**[Қазақша](#қазақша) · [Русский](#русский) · [English](#english)**
---
## Қазақша
**OCR** — қазақ тіліндегі суреттер мен PDF құжаттардан мәтін шығаруға арналған 184.7 МБ модель репозиторийі. Модель орыс және ағылшын мәтіндерін де өңдейді, сондықтан көптілді скандарды цифрлауға жарайды.
### Репозиторий құрамы
Модель `doctr` негізіндегі арнайы OCR архитектурасын қолданады. Негізгі материал `OCR.zip` архивінде, ал қосымша код `custom` бумасында сақталған. Кіріс ретінде JPEG, PNG және PDF файлдары қабылданады; нәтиже мәтін немесе PDF түрінде беріледі.
### Қалай жүктейді
```python
from huggingface_hub import snapshot_download
from pathlib import Path
from zipfile import ZipFile
root = Path(snapshot_download("TilQazyna/OCR"))
with ZipFile(root / "OCR.zip") as archive:
archive.extractall(root / "ocr_model")
print(root / "ocr_model")
```
Код репозиторийді Hugging Face кэшіне жүктеп, модель архивін ашады. Модельді іске қосу файлдары архив пен `custom` бумасында орналасқан.
### Қолжетімділік
Карточка мен файлдар тізімі баршаға көрінеді. Файлдарды жүктеу үшін репозиторий бетіндегі «Request access» арқылы өтінім беру керек; шешімді TilQazyna командасы қабылдайды.
### Байланысты репозиторийлер
OCR сканнан алынатын кітаптармен жұмыс істеуге арналған: [Til-Books-KazNEB-raw-scans](https://huggingface.co/datasets/TilQazyna/Til-Books-KazNEB-raw-scans) бастапқы скандарды сақтайды, ал [Til-Books](https://huggingface.co/datasets/TilQazyna/Til-Books) өңделген кітап мәтіндерін біріктіреді.
---
## Русский
**OCR** — репозиторий модели объёмом 184.7 МБ для извлечения казахского текста из изображений и PDF. Модель также обрабатывает русский и английский, что позволяет оцифровывать многоязычные сканы.
### Что внутри
Модель использует специальную OCR-архитектуру на основе `doctr`. Основные материалы упакованы в `OCR.zip`, вспомогательный код лежит в каталоге `custom`. На вход принимаются JPEG, PNG и PDF, результат сохраняется как текст или PDF.
### Как загрузить
```python
from huggingface_hub import snapshot_download
from pathlib import Path
from zipfile import ZipFile
root = Path(snapshot_download("TilQazyna/OCR"))
with ZipFile(root / "OCR.zip") as archive:
archive.extractall(root / "ocr_model")
print(root / "ocr_model")
```
Код загружает снимок репозитория в кэш Hugging Face и распаковывает архив модели. Файлы запуска находятся в архиве и каталоге `custom`.
### Доступ
Карточка и перечень файлов открыты для просмотра. Скачивание становится доступно после одобрения формы «Request access» на странице репозитория; её проверяет команда TilQazyna.
### Связанные репозитории
Модель рассчитана на книжные сканы: [Til-Books-KazNEB-raw-scans](https://huggingface.co/datasets/TilQazyna/Til-Books-KazNEB-raw-scans) хранит исходные изображения, а [Til-Books](https://huggingface.co/datasets/TilQazyna/Til-Books) объединяет подготовленные книжные тексты.
---
## English
**OCR** is a 184.7 MB model repository for extracting Kazakh text from images and PDF documents. It also supports Russian and English, making it suitable for digitizing multilingual scans.
### Repository contents
The model uses a custom OCR architecture based on `doctr`. Its main material is packaged in `OCR.zip`, with supporting code under `custom`. It accepts JPEG, PNG, and PDF inputs and produces plain text or PDF output.
### How to download
```python
from huggingface_hub import snapshot_download
from pathlib import Path
from zipfile import ZipFile
root = Path(snapshot_download("TilQazyna/OCR"))
with ZipFile(root / "OCR.zip") as archive:
archive.extractall(root / "ocr_model")
print(root / "ocr_model")
```
This downloads a repository snapshot into the Hugging Face cache and extracts the model archive. Runtime files are provided inside the archive and the `custom` directory.
### Access
The model card and file listing are publicly visible. Download access follows approval of the “Request access” form on the repository page, reviewed by the TilQazyna team.
### Related repositories
The model is intended for book scans: [Til-Books-KazNEB-raw-scans](https://huggingface.co/datasets/TilQazyna/Til-Books-KazNEB-raw-scans) stores source scans, while [Til-Books](https://huggingface.co/datasets/TilQazyna/Til-Books) brings together the processed book text.
---
Лицензия · License: mit · [TilQazyna](https://huggingface.co/TilQazyna)