Update README.md
Browse files
README.md
CHANGED
|
@@ -9,149 +9,45 @@ pinned: false
|
|
| 9 |
|
| 10 |
# Darmm AI
|
| 11 |
|
| 12 |
-
|
| 13 |
-
|
| 14 |
-
## 🇰🇿 Қазақша
|
| 15 |
-
|
| 16 |
-
**Darmm** — қазақ тілі мен Орталық Азия контексіне арналған сөйлеу, көру және тіл AI саласындағы тәуелсіз R&D жоба. Жетекшісі: [R3iwan](https://github.com/R3iwan).
|
| 17 |
-
|
| 18 |
-
Бізің назарымыздағы — жаһандық open-source модельдері сапасы төмендейтін, жергілікті контекст, фонетика және терминология маңызды болатын тілдер мен домендер.
|
| 19 |
-
|
| 20 |
-
Сайт: [darmm.kz](https://darmm.kz) — қазір AI репетитор, біртіндеп жобалар витринасына айналып жатыр.
|
| 21 |
-
|
| 22 |
-
### Не үстінде жұмыс жасаймын
|
| 23 |
-
|
| 24 |
-
* **Қазақ ASR** — Whisper family, Wav2Vec2 модельдерін қазақ деректерінде fine-tune жасау және бенчмарктеу, ашық есептер жариялау.
|
| 25 |
-
* **Қазақ TTS** — мәтін нормализациясы, G2P өңдеу және дауыс клондау эксперименттерін қоса алғанда дауыс синтезі.
|
| 26 |
-
* **Real-time дауыс агенттері** — LiveKit және self-hosted модельдерге негізделген қазақ және орыс тілдеріне арналған end-to-end сөйлеу пайплайндары.
|
| 27 |
-
* **OCR** — қазақ тіліндегі баспа және қолжазба мәтіндерін тану, заң, білім беру және мемлекеттік құжаттарға бейімдеу.
|
| 28 |
-
* **Computer Vision** — Орталық Азия контексіне арналған детекция, классификация және сегментация модельдері.
|
| 29 |
-
* **Мәтін / NLP** — заң және техникалық терминологияға баса назар аудара отырып, қазақ/орыс мәтіні үшін LLM fine-tuning, эмбеддингтер, классификация және генерация.
|
| 30 |
-
|
| 31 |
-
Жұмыстардың көпшілігі Hugging Face-те ашық модельдер мен бенчмарктер ретінде жарияланады. Өндірістік компоненттер жабық күйде қалады.
|
| 32 |
-
|
| 33 |
-
### Техникалық фокус
|
| 34 |
-
|
| 35 |
-
* **Сөйлеу**: Whisper fine-tuning, Faster-Whisper / CTranslate2 inference, VITS-family TTS, VAD-based streaming, LiveKit voice agents.
|
| 36 |
-
* **OCR**: тұрақты және трансформерге негізделген OCR пайплайндары, қазақ алфавитінің кириллица/латын нұсқаларын қолдау.
|
| 37 |
-
* **Computer Vision**: детекция үшін YOLO family, классификация үшін ViT-family, Орталық Азия деректерінде fine-tuning.
|
| 38 |
-
* **Inference**: vLLM serving, квантизация (AWQ, GGUF), өндірістік деплоймент үшін latency оптимизациясы.
|
| 39 |
-
* **LLM адаптациясы**: қазақ/орыс деректерінде LoRA/QLoRA fine-tuning, домен-спецификалық эмбеддингтер, RAG және GraphRAG пайплайндары.
|
| 40 |
-
* **Бағалау**: ASR үшін WER/CER, OCR үшін CER, RAG үшін RAGAS және LLM-as-judge, модельдер қайда жіберетінін адал есептеу.
|
| 41 |
-
|
| 42 |
-
### Неліктен қазақ тілі
|
| 43 |
-
|
| 44 |
-
Қазақ тілі — 20 миллионнан астам адамның ана тілі, мемлекеттік тіл, өскелең цифрлық экономиканың тілі. AI зерттеулерінде ол үнемі ескерусіз қалады.
|
| 45 |
-
|
| 46 |
-
Whisper-large қазақ тілін транскрибациялай алады — бірақ WER-і ағылшын немесе орыс тілімен салыстырғанда айтарлықтай жоғары. TTS сапасы одан да артта. OCR жүйелері қазақ кириллицасын жиі орысша деп қателеседі. CV модельдері жергілікті контекстте нашар жұмыс жасайды. Жалпы мақсаттағы LLM-дер қазақша нұсқаулармен жұмыс жасағанда не орысшаға ауысады, не сапасыз нәтиже береді.
|
| 47 |
-
|
| 48 |
-
Бұл академиялық олқылық емес — нақты пайдаланушыларға, нақты өнімдерге және жақсы инфрақұрылымға лайықты тілге әсер ететін практикалық сәтсіздік. Darmm осы олқылықты жабу үшін жұмыс жасайды: шашыраңқы эксперименттер емес, жүйелі бенчмарктеу, ашық модельдер және ағымдағы жай-күйдің адал есебі.
|
| 49 |
-
|
| 50 |
-
### Жақын арада
|
| 51 |
-
|
| 52 |
-
* Көп��одальды модельдер (vision + language)
|
| 53 |
-
* Қазақ/орыс аудармасы
|
| 54 |
-
* Streaming STT пайплайндары
|
| 55 |
-
* Салалық бейімдеу — заң, медицина, білім беру
|
| 56 |
-
|
| 57 |
-
### Мәртебе
|
| 58 |
-
|
| 59 |
-
Darmm — ерте кезеңдегі R&D жоба, аяқталған өнім желісі емес. Модельдер мен жазбалар дайын болған сайын жарияланады — адал бастапқы деңгейлермен және белгілі шектеулермен. [github.com/R3iwan](https://github.com/R3iwan) арқылы хабарласыңыз.
|
| 60 |
-
|
| 61 |
-
---
|
| 62 |
-
|
| 63 |
-
## 🇷🇺 Русский
|
| 64 |
-
|
| 65 |
-
**Darmm** — независимый R&D проект в области речевого, визуального и языкового AI для казахского языка и Центральноазиатского контекста. Поддерживается [R3iwan](https://github.com/R3iwan).
|
| 66 |
-
|
| 67 |
-
Фокус — недостаточно охваченная часть AI-ландшафта: языки и домены, где качество глобальных open-source моделей падает, а локальный контекст, фонетика и терминология имеют решающее значение.
|
| 68 |
-
|
| 69 |
-
Сайт: [darmm.kz](https://darmm.kz) — сейчас AI-репетитор, постепенно превращается в витрину проектов.
|
| 70 |
-
|
| 71 |
-
### Над чем я работаю
|
| 72 |
-
|
| 73 |
-
* **Казахский ASR** — файн-тюнинг и бенчмаркинг современных open-source ASR (семейство Whisper, Wav2Vec2) на казахских данных, с публичными отчётами об оценке.
|
| 74 |
-
* **Казахский TTS** — синтез голоса для казахского языка, включая нормализацию текста, обработку G2P и эксперименты с клонированием голоса.
|
| 75 |
-
* **Real-time голосовые агенты** — сквозные речевые пайплайны для казахского и русского языков на базе LiveKit и self-hosted моделей.
|
| 76 |
-
* **OCR** — распознавание печатного и рукописного текста на казахском языке, адаптация под юридические, образовательные и государственные документы.
|
| 77 |
-
* **Computer Vision** — модели детекции, классификации и сегментации, адаптированные под Центральноазиатский контекст.
|
| 78 |
-
* **Текст / NLP** — LLM fine-tuning, эмбеддинги, классификация и генерация для казахского/русского текста с упором на юридическую и техническую терминологию.
|
| 79 |
-
|
| 80 |
-
Большинство работ публикуются как открытые модели и бенчмарки на Hugging Face. Производственные компоненты остаются закрытыми.
|
| 81 |
-
|
| 82 |
-
### Технический фокус
|
| 83 |
-
|
| 84 |
-
* **Речь**: Whisper fine-tuning, Faster-Whisper / CTranslate2 inference, VITS-family TTS, VAD-based streaming, LiveKit voice agents.
|
| 85 |
-
* **OCR**: классические и трансформерные OCR-пайплайны, поддержка кириллических и латинских вариантов казахского алфавита.
|
| 86 |
-
* **Computer Vision**: YOLO family для детекции, ViT-family для классификации, файн-тюнинг на центральноазиатских данных.
|
| 87 |
-
* **Inference**: vLLM serving, квантизация (AWQ, GGUF), оптимизация задержки для production-деплоя.
|
| 88 |
-
* **Адаптация LLM**: LoRA/QLoRA fine-tuning на казахских/русских данных, доменно-специфические эмбеддинги, RAG и GraphRAG пайплайны.
|
| 89 |
-
* **Оценка**: WER/CER для ASR, CER для OCR, RAGAS и LLM-as-judge для RAG, честная отчётность о том, где модели дают сбой.
|
| 90 |
-
|
| 91 |
-
### Почему казахский
|
| 92 |
-
|
| 93 |
-
Казахский — родной язык для более чем 20 миллионов человек, государственный язык Казахстана, язык растущей цифровой экономики. В AI-исследованиях он систематически остаётся на обочине.
|
| 94 |
-
|
| 95 |
-
Whisper-large транскрибирует казахский — но с WER заметно хуже, чем для английского или русского. TTS отстаёт ещё сильнее. OCR-системы часто путают казахскую кириллицу с русской. CV-модели плохо работают в локальном контексте. Модели общего назначения при казахских промптах либо переключаются на русский, либо выдают деградированный результат.
|
| 96 |
-
|
| 97 |
-
Это не академический пробел — это практический сбой, затрагивающий реальных пользователей, реальные продукты и язык, который заслуживает лучшей инфраструктуры. Darmm работает над устранением этого пробела: не разрозненные эксперименты, а системный бенчмаркинг, открытые модели и честная отчётность о реальном положении дел.
|
| 98 |
-
|
| 99 |
-
### В планах
|
| 100 |
-
|
| 101 |
-
* Мультимодальные модели (vision + language)
|
| 102 |
-
* Казахско-русский / казахско-английский перевод
|
| 103 |
-
* Streaming STT пайплайны
|
| 104 |
-
* Отраслевая адаптация — юриспруденция, медицина, образование
|
| 105 |
-
|
| 106 |
-
### Статус
|
| 107 |
-
|
| 108 |
-
Darmm — R&D проект на ранней стадии, а не готовая продуктовая линейка. Модели и статьи публикуются по мере готовности — с честными базовыми показателями и известными ограничениями. Связаться: [github.com/R3iwan](https://github.com/R3iwan).
|
| 109 |
-
|
| 110 |
-
---
|
| 111 |
-
|
| 112 |
-
## 🌐 English
|
| 113 |
-
|
| 114 |
-
**Darmm** is an independent R&D effort focused on speech, vision, and language AI for the Kazakh language and the broader Central Asian context. Maintained by [R3iwan](https://github.com/R3iwan).
|
| 115 |
|
| 116 |
-
The focus is the underserved part of the AI landscape: languages and domains where global open-source models drop in quality, and where local context,
|
| 117 |
|
| 118 |
Website: [darmm.kz](https://darmm.kz) — currently AI tutoring, gradually becoming a project showcase.
|
| 119 |
|
| 120 |
-
##
|
| 121 |
|
| 122 |
-
* **Kazakh ASR** — fine-tuning and benchmarking modern open-source ASR (Whisper family, Wav2Vec2) on Kazakh data, with public evaluation reports.
|
| 123 |
-
* **Kazakh TTS** — voice synthesis for Kazakh including text normalization, G2P handling, and voice cloning experiments.
|
| 124 |
-
* **Real-time voice agents** — end-to-end speech pipelines for Kazakh and Russian, built on LiveKit and self-hosted models.
|
| 125 |
-
* **OCR** — recognition of printed and handwritten Kazakh text, adapted for legal, educational, and government documents.
|
| 126 |
-
* **Computer Vision** — detection, classification, and segmentation models adapted for Central Asian context.
|
| 127 |
* **Text / NLP** — LLM fine-tuning, embeddings, classification, and generation for Kazakh/Russian text, with a focus on legal and technical terminology.
|
|
|
|
|
|
|
|
|
|
|
|
|
| 128 |
|
| 129 |
-
Most work is published as open models and benchmarks on Hugging Face. Production-specific components stay closed.
|
| 130 |
|
| 131 |
-
##
|
| 132 |
|
| 133 |
-
* **
|
| 134 |
-
* **OCR**: classical and transformer-based OCR pipelines, support for Cyrillic and Latin variants of the Kazakh alphabet.
|
| 135 |
-
* **
|
| 136 |
* **Inference**: vLLM serving, quantization (AWQ, GGUF), latency optimization for production deployment.
|
| 137 |
-
* **
|
| 138 |
-
* **Evaluation**: WER/CER for ASR, CER for OCR, RAGAS and LLM-as-judge for RAG, honest reporting of where models fail.
|
| 139 |
|
| 140 |
-
##
|
| 141 |
|
| 142 |
Kazakh is the native language of over 20 million people, the state language of Kazakhstan, and the language of a growing digital economy. In AI research, it is consistently treated as an afterthought.
|
| 143 |
|
| 144 |
-
|
| 145 |
|
| 146 |
This is not a niche academic gap. It's a practical failure affecting real users, real products, and a language that deserves better infrastructure. Darmm exists to close that gap — not through scattered experiments, but through systematic benchmarking, open models, and honest reporting of where the current state of the art actually stands.
|
| 147 |
|
| 148 |
-
##
|
| 149 |
|
| 150 |
-
* Multimodal models (vision + language)
|
| 151 |
* Kazakh ↔ Russian / Kazakh ↔ English translation
|
| 152 |
-
*
|
| 153 |
* Domain-specific verticals — legal, medical, education
|
|
|
|
| 154 |
|
| 155 |
-
##
|
| 156 |
|
| 157 |
Darmm is an early-stage R&D effort, not a finished product line. Models and writeups are published as they're ready, with honest baselines and known limitations. Reach out via [github.com/R3iwan](https://github.com/R3iwan).
|
|
|
|
| 9 |
|
| 10 |
# Darmm AI
|
| 11 |
|
| 12 |
+
**Darmm** is an independent R&D effort focused on language and document AI for Kazakh and the broader Central Asian context. Maintained by [R3iwan](https://github.com/R3iwan).
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 13 |
|
| 14 |
+
The focus is the underserved part of the AI landscape: languages and domains where global open-source models drop in quality, and where local context, script, and terminology matter.
|
| 15 |
|
| 16 |
Website: [darmm.kz](https://darmm.kz) — currently AI tutoring, gradually becoming a project showcase.
|
| 17 |
|
| 18 |
+
## What I'm working on
|
| 19 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 20 |
* **Text / NLP** — LLM fine-tuning, embeddings, classification, and generation for Kazakh/Russian text, with a focus on legal and technical terminology.
|
| 21 |
+
* **Kazakh-aware tokenization & adaptation** — measuring and closing the gap between how global models handle Kazakh versus how they should: tokenizer efficiency, vocabulary extension, continued pretraining on Kazakh data.
|
| 22 |
+
* **OCR & document AI** — recognition of printed and handwritten Kazakh text, adapted for legal, educational, and government documents; extraction and validation pipelines on top of it.
|
| 23 |
+
* **Retrieval & RAG** — embedding models, hybrid search, and RAG/GraphRAG pipelines tuned for Kazakh/Russian corpora, evaluated against curated golden sets.
|
| 24 |
+
* **Benchmarks & datasets** — open Kazakh-language datasets and honest, reproducible evaluation reports of where current models actually stand.
|
| 25 |
|
| 26 |
+
Most work is published as open models, datasets, and benchmarks on Hugging Face. Production-specific components stay closed.
|
| 27 |
|
| 28 |
+
## Technical focus
|
| 29 |
|
| 30 |
+
* **LLM adaptation**: LoRA/QLoRA fine-tuning on Kazakh/Russian data, vocabulary extension, domain-specific embeddings, instruction tuning.
|
| 31 |
+
* **OCR**: classical and transformer-based OCR pipelines, support for Cyrillic and Latin variants of the Kazakh alphabet, document layout and field extraction.
|
| 32 |
+
* **Retrieval**: embedding benchmarking, hybrid scoring (BM25 + dense), rerankers, RAG and GraphRAG pipelines.
|
| 33 |
* **Inference**: vLLM serving, quantization (AWQ, GGUF), latency optimization for production deployment.
|
| 34 |
+
* **Evaluation**: CER for OCR, retrieval and generation metrics for RAG (including LLM-as-judge calibrated against human labels), honest reporting of where models fail.
|
|
|
|
| 35 |
|
| 36 |
+
## Why Kazakh
|
| 37 |
|
| 38 |
Kazakh is the native language of over 20 million people, the state language of Kazakhstan, and the language of a growing digital economy. In AI research, it is consistently treated as an afterthought.
|
| 39 |
|
| 40 |
+
Tokenizers of major open models fragment Kazakh text far more than English or Russian, degrading both quality and cost. General-purpose LLMs either slip into Russian when prompted in Kazakh, or produce degraded output. OCR systems regularly confuse Kazakh Cyrillic with Russian. Domain terminology — legal, governmental, technical — is where the drop is sharpest.
|
| 41 |
|
| 42 |
This is not a niche academic gap. It's a practical failure affecting real users, real products, and a language that deserves better infrastructure. Darmm exists to close that gap — not through scattered experiments, but through systematic benchmarking, open models, and honest reporting of where the current state of the art actually stands.
|
| 43 |
|
| 44 |
+
## Coming later
|
| 45 |
|
|
|
|
| 46 |
* Kazakh ↔ Russian / Kazakh ↔ English translation
|
| 47 |
+
* Multimodal document understanding (vision + language)
|
| 48 |
* Domain-specific verticals — legal, medical, education
|
| 49 |
+
* Speech (ASR/TTS) — deliberately parked until the text and document stack is solid
|
| 50 |
|
| 51 |
+
## Status
|
| 52 |
|
| 53 |
Darmm is an early-stage R&D effort, not a finished product line. Models and writeups are published as they're ready, with honest baselines and known limitations. Reach out via [github.com/R3iwan](https://github.com/R3iwan).
|