Instructions to use TilQazyna/OCR with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- docTR
How to use TilQazyna/OCR with docTR:
# No code snippets available yet for this library. # To use this model, check the repository files and the library's documentation. # Want to help? PRs adding snippets are welcome at: # https://github.com/huggingface/huggingface.js
- Notebooks
- Google Colab
- Kaggle
| license: mit | |
| language: | |
| - kk | |
| - ru | |
| - en | |
| tags: | |
| - kazakh | |
| - ocr | |
| - doctr | |
| extra_gated_prompt: >- | |
| Бұл репозиторийге қолжетімділік өтінім бойынша беріледі. Өзіңіз туралы және | |
| деректерді қалай қолданатыңыз туралы жазыңыз — өтінімді TilQazyna командасы қарайды. | |
| · Доступ к репозиторию выдаётся по заявке. Расскажите о себе и о том, как собираетесь | |
| использовать данные — заявку рассматривает команда TilQazyna. | |
| · Access to this repository is granted on request. Tell us who you are and how you plan | |
| to use the material; the TilQazyna team reviews each application. | |
| extra_gated_fields: | |
| Аты-жөні / ФИО / Full name: text | |
| Ұйым / Организация / Affiliation: text | |
| Мақсаты / Цель использования / Intended use: text | |
| # OCR | |
| Қазақ құжаттарына арналған OCR моделі · OCR-модель для казахских документов · OCR model for Kazakh documents | |
| **[Қазақша](#қазақша) · [Русский](#русский) · [English](#english)** | |
| --- | |
| ## Қазақша | |
| **OCR** — қазақ тіліндегі суреттер мен PDF құжаттардан мәтін шығаруға арналған 184.7 МБ модель репозиторийі. Модель орыс және ағылшын мәтіндерін де өңдейді, сондықтан көптілді скандарды цифрлауға жарайды. | |
| ### Репозиторий құрамы | |
| Модель `doctr` негізіндегі арнайы OCR архитектурасын қолданады. Негізгі материал `OCR.zip` архивінде, ал қосымша код `custom` бумасында сақталған. Кіріс ретінде JPEG, PNG және PDF файлдары қабылданады; нәтиже мәтін немесе PDF түрінде беріледі. | |
| ### Қалай жүктейді | |
| ```python | |
| from huggingface_hub import snapshot_download | |
| from pathlib import Path | |
| from zipfile import ZipFile | |
| root = Path(snapshot_download("TilQazyna/OCR")) | |
| with ZipFile(root / "OCR.zip") as archive: | |
| archive.extractall(root / "ocr_model") | |
| print(root / "ocr_model") | |
| ``` | |
| Код репозиторийді Hugging Face кэшіне жүктеп, модель архивін ашады. Модельді іске қосу файлдары архив пен `custom` бумасында орналасқан. | |
| ### Қолжетімділік | |
| Карточка мен файлдар тізімі баршаға көрінеді. Файлдарды жүктеу үшін репозиторий бетіндегі «Request access» арқылы өтінім беру керек; шешімді TilQazyna командасы қабылдайды. | |
| ### Байланысты репозиторийлер | |
| OCR сканнан алынатын кітаптармен жұмыс істеуге арналған: [Til-Books-KazNEB-raw-scans](https://huggingface.co/datasets/TilQazyna/Til-Books-KazNEB-raw-scans) бастапқы скандарды сақтайды, ал [Til-Books](https://huggingface.co/datasets/TilQazyna/Til-Books) өңделген кітап мәтіндерін біріктіреді. | |
| --- | |
| ## Русский | |
| **OCR** — репозиторий модели объёмом 184.7 МБ для извлечения казахского текста из изображений и PDF. Модель также обрабатывает русский и английский, что позволяет оцифровывать многоязычные сканы. | |
| ### Что внутри | |
| Модель использует специальную OCR-архитектуру на основе `doctr`. Основные материалы упакованы в `OCR.zip`, вспомогательный код лежит в каталоге `custom`. На вход принимаются JPEG, PNG и PDF, результат сохраняется как текст или PDF. | |
| ### Как загрузить | |
| ```python | |
| from huggingface_hub import snapshot_download | |
| from pathlib import Path | |
| from zipfile import ZipFile | |
| root = Path(snapshot_download("TilQazyna/OCR")) | |
| with ZipFile(root / "OCR.zip") as archive: | |
| archive.extractall(root / "ocr_model") | |
| print(root / "ocr_model") | |
| ``` | |
| Код загружает снимок репозитория в кэш Hugging Face и распаковывает архив модели. Файлы запуска находятся в архиве и каталоге `custom`. | |
| ### Доступ | |
| Карточка и перечень файлов открыты для просмотра. Скачивание становится доступно после одобрения формы «Request access» на странице репозитория; её проверяет команда TilQazyna. | |
| ### Связанные репозитории | |
| Модель рассчитана на книжные сканы: [Til-Books-KazNEB-raw-scans](https://huggingface.co/datasets/TilQazyna/Til-Books-KazNEB-raw-scans) хранит исходные изображения, а [Til-Books](https://huggingface.co/datasets/TilQazyna/Til-Books) объединяет подготовленные книжные тексты. | |
| --- | |
| ## English | |
| **OCR** is a 184.7 MB model repository for extracting Kazakh text from images and PDF documents. It also supports Russian and English, making it suitable for digitizing multilingual scans. | |
| ### Repository contents | |
| The model uses a custom OCR architecture based on `doctr`. Its main material is packaged in `OCR.zip`, with supporting code under `custom`. It accepts JPEG, PNG, and PDF inputs and produces plain text or PDF output. | |
| ### How to download | |
| ```python | |
| from huggingface_hub import snapshot_download | |
| from pathlib import Path | |
| from zipfile import ZipFile | |
| root = Path(snapshot_download("TilQazyna/OCR")) | |
| with ZipFile(root / "OCR.zip") as archive: | |
| archive.extractall(root / "ocr_model") | |
| print(root / "ocr_model") | |
| ``` | |
| This downloads a repository snapshot into the Hugging Face cache and extracts the model archive. Runtime files are provided inside the archive and the `custom` directory. | |
| ### Access | |
| The model card and file listing are publicly visible. Download access follows approval of the “Request access” form on the repository page, reviewed by the TilQazyna team. | |
| ### Related repositories | |
| The model is intended for book scans: [Til-Books-KazNEB-raw-scans](https://huggingface.co/datasets/TilQazyna/Til-Books-KazNEB-raw-scans) stores source scans, while [Til-Books](https://huggingface.co/datasets/TilQazyna/Til-Books) brings together the processed book text. | |
| --- | |
| Лицензия · License: mit · [TilQazyna](https://huggingface.co/TilQazyna) | |