R3iwan commited on
Commit
502d14d
·
verified ·
1 Parent(s): 36ab7a0

Update README.md

Browse files
Files changed (1) hide show
  1. README.md +19 -123
README.md CHANGED
@@ -9,149 +9,45 @@ pinned: false
9
 
10
  # Darmm AI
11
 
12
- ---
13
-
14
- ## 🇰🇿 Қазақша
15
-
16
- **Darmm** — қазақ тілі мен Орталық Азия контексіне арналған сөйлеу, көру және тіл AI саласындағы тәуелсіз R&D жоба. Жетекшісі: [R3iwan](https://github.com/R3iwan).
17
-
18
- Бізің назарымыздағы — жаһандық open-source модельдері сапасы төмендейтін, жергілікті контекст, фонетика және терминология маңызды болатын тілдер мен домендер.
19
-
20
- Сайт: [darmm.kz](https://darmm.kz) — қазір AI репетитор, біртіндеп жобалар витринасына айналып жатыр.
21
-
22
- ### Не үстінде жұмыс жасаймын
23
-
24
- * **Қазақ ASR** — Whisper family, Wav2Vec2 модельдерін қазақ деректерінде fine-tune жасау және бенчмарктеу, ашық есептер жариялау.
25
- * **Қазақ TTS** — мәтін нормализациясы, G2P өңдеу және дауыс клондау эксперименттерін қоса алғанда дауыс синтезі.
26
- * **Real-time дауыс агенттері** — LiveKit және self-hosted модельдерге негізделген қазақ және орыс тілдеріне арналған end-to-end сөйлеу пайплайндары.
27
- * **OCR** — қазақ тіліндегі баспа және қолжазба мәтіндерін тану, заң, білім беру және мемлекеттік құжаттарға бейімдеу.
28
- * **Computer Vision** — Орталық Азия контексіне арналған детекция, классификация және сегментация модельдері.
29
- * **Мәтін / NLP** — заң және техникалық терминологияға баса назар аудара отырып, қазақ/орыс мәтіні үшін LLM fine-tuning, эмбеддингтер, классификация және генерация.
30
-
31
- Жұмыстардың көпшілігі Hugging Face-те ашық модельдер мен бенчмарктер ретінде жарияланады. Өндірістік компоненттер жабық күйде қалады.
32
-
33
- ### Техникалық фокус
34
-
35
- * **Сөйлеу**: Whisper fine-tuning, Faster-Whisper / CTranslate2 inference, VITS-family TTS, VAD-based streaming, LiveKit voice agents.
36
- * **OCR**: тұрақты және трансформерге негізделген OCR пайплайндары, қазақ алфавитінің кириллица/латын нұсқаларын қолдау.
37
- * **Computer Vision**: детекция үшін YOLO family, классификация үшін ViT-family, Орталық Азия деректерінде fine-tuning.
38
- * **Inference**: vLLM serving, квантизация (AWQ, GGUF), өндірістік деплоймент үшін latency оптимизациясы.
39
- * **LLM адаптациясы**: қазақ/орыс деректерінде LoRA/QLoRA fine-tuning, домен-спецификалық эмбеддингтер, RAG және GraphRAG пайплайндары.
40
- * **Бағалау**: ASR үшін WER/CER, OCR үшін CER, RAG үшін RAGAS және LLM-as-judge, модельдер қайда жіберетінін адал есептеу.
41
-
42
- ### Неліктен қазақ тілі
43
-
44
- Қазақ тілі — 20 миллионнан астам адамның ана тілі, мемлекеттік тіл, өскелең цифрлық экономиканың тілі. AI зерттеулерінде ол үнемі ескерусіз қалады.
45
-
46
- Whisper-large қазақ тілін транскрибациялай алады — бірақ WER-і ағылшын немесе орыс тілімен салыстырғанда айтарлықтай жоғары. TTS сапасы одан да артта. OCR жүйелері қазақ кириллицасын жиі орысша деп қателеседі. CV модельдері жергілікті контекстте нашар жұмыс жасайды. Жалпы мақсаттағы LLM-дер қазақша нұсқаулармен жұмыс жасағанда не орысшаға ауысады, не сапасыз нәтиже береді.
47
-
48
- Бұл академиялық олқылық емес — нақты пайдаланушыларға, нақты өнімдерге және жақсы инфрақұрылымға лайықты тілге әсер ететін практикалық сәтсіздік. Darmm осы олқылықты жабу үшін жұмыс жасайды: шашыраңқы эксперименттер емес, жүйелі бенчмарктеу, ашық модельдер және ағымдағы жай-күйдің адал есебі.
49
-
50
- ### Жақын арада
51
-
52
- * Көп��одальды модельдер (vision + language)
53
- * Қазақ/орыс аудармасы
54
- * Streaming STT пайплайндары
55
- * Салалық бейімдеу — заң, медицина, білім беру
56
-
57
- ### Мәртебе
58
-
59
- Darmm — ерте кезеңдегі R&D жоба, аяқталған өнім желісі емес. Модельдер мен жазбалар дайын болған сайын жарияланады — адал бастапқы деңгейлермен және белгілі шектеулермен. [github.com/R3iwan](https://github.com/R3iwan) арқылы хабарласыңыз.
60
-
61
- ---
62
-
63
- ## 🇷🇺 Русский
64
-
65
- **Darmm** — независимый R&D проект в области речевого, визуального и языкового AI для казахского языка и Центральноазиатского контекста. Поддерживается [R3iwan](https://github.com/R3iwan).
66
-
67
- Фокус — недостаточно охваченная часть AI-ландшафта: языки и домены, где качество глобальных open-source моделей падает, а локальный контекст, фонетика и терминология имеют решающее значение.
68
-
69
- Сайт: [darmm.kz](https://darmm.kz) — сейчас AI-репетитор, постепенно превращается в витрину проектов.
70
-
71
- ### Над чем я работаю
72
-
73
- * **Казахский ASR** — файн-тюнинг и бенчмаркинг современных open-source ASR (семейство Whisper, Wav2Vec2) на казахских данных, с публичными отчётами об оценке.
74
- * **Казахский TTS** — синтез голоса для казахского языка, включая нормализацию текста, обработку G2P и эксперименты с клонированием голоса.
75
- * **Real-time голосовые агенты** — сквозные речевые пайплайны для казахского и русского языков на базе LiveKit и self-hosted моделей.
76
- * **OCR** — распознавание печатного и рукописного текста на казахском языке, адаптация под юридические, образовательные и государственные документы.
77
- * **Computer Vision** — модели детекции, классификации и сегментации, адаптированные под Центральноазиатский контекст.
78
- * **Текст / NLP** — LLM fine-tuning, эмбеддинги, классификация и генерация для казахского/русского текста с упором на юридическую и техническую терминологию.
79
-
80
- Большинство работ публикуются как открытые модели и бенчмарки на Hugging Face. Производственные компоненты остаются закрытыми.
81
-
82
- ### Технический фокус
83
-
84
- * **Речь**: Whisper fine-tuning, Faster-Whisper / CTranslate2 inference, VITS-family TTS, VAD-based streaming, LiveKit voice agents.
85
- * **OCR**: классические и трансформерные OCR-пайплайны, поддержка кириллических и латинских вариантов казахского алфавита.
86
- * **Computer Vision**: YOLO family для детекции, ViT-family для классификации, файн-тюнинг на центральноазиатских данных.
87
- * **Inference**: vLLM serving, квантизация (AWQ, GGUF), оптимизация задержки для production-деплоя.
88
- * **Адаптация LLM**: LoRA/QLoRA fine-tuning на казахских/русских данных, доменно-специфические эмбеддинги, RAG и GraphRAG пайплайны.
89
- * **Оценка**: WER/CER для ASR, CER для OCR, RAGAS и LLM-as-judge для RAG, честная отчётность о том, где модели дают сбой.
90
-
91
- ### Почему казахский
92
-
93
- Казахский — родной язык для более чем 20 миллионов человек, государственный язык Казахстана, язык растущей цифровой экономики. В AI-исследованиях он систематически остаётся на обочине.
94
-
95
- Whisper-large транскрибирует казахский — но с WER заметно хуже, чем для английского или русского. TTS отстаёт ещё сильнее. OCR-системы часто путают казахскую кириллицу с русской. CV-модели плохо работают в локальном контексте. Модели общего назначения при казахских промптах либо переключаются на русский, либо выдают деградированный результат.
96
-
97
- Это не академический пробел — это практический сбой, затрагивающий реальных пользователей, реальные продукты и язык, который заслуживает лучшей инфраструктуры. Darmm работает над устранением этого пробела: не разрозненные эксперименты, а системный бенчмаркинг, открытые модели и честная отчётность о реальном положении дел.
98
-
99
- ### В планах
100
-
101
- * Мультимодальные модели (vision + language)
102
- * Казахско-русский / казахско-английский перевод
103
- * Streaming STT пайплайны
104
- * Отраслевая адаптация — юриспруденция, медицина, образование
105
-
106
- ### Статус
107
-
108
- Darmm — R&D проект на ранней стадии, а не готовая продуктовая линейка. Модели и статьи публикуются по мере готовности — с честными базовыми показателями и известными ограничениями. Связаться: [github.com/R3iwan](https://github.com/R3iwan).
109
-
110
- ---
111
-
112
- ## 🌐 English
113
-
114
- **Darmm** is an independent R&D effort focused on speech, vision, and language AI for the Kazakh language and the broader Central Asian context. Maintained by [R3iwan](https://github.com/R3iwan).
115
 
116
- The focus is the underserved part of the AI landscape: languages and domains where global open-source models drop in quality, and where local context, phonetics, and terminology matter.
117
 
118
  Website: [darmm.kz](https://darmm.kz) — currently AI tutoring, gradually becoming a project showcase.
119
 
120
- ### What I'm working on
121
 
122
- * **Kazakh ASR** — fine-tuning and benchmarking modern open-source ASR (Whisper family, Wav2Vec2) on Kazakh data, with public evaluation reports.
123
- * **Kazakh TTS** — voice synthesis for Kazakh including text normalization, G2P handling, and voice cloning experiments.
124
- * **Real-time voice agents** — end-to-end speech pipelines for Kazakh and Russian, built on LiveKit and self-hosted models.
125
- * **OCR** — recognition of printed and handwritten Kazakh text, adapted for legal, educational, and government documents.
126
- * **Computer Vision** — detection, classification, and segmentation models adapted for Central Asian context.
127
  * **Text / NLP** — LLM fine-tuning, embeddings, classification, and generation for Kazakh/Russian text, with a focus on legal and technical terminology.
 
 
 
 
128
 
129
- Most work is published as open models and benchmarks on Hugging Face. Production-specific components stay closed.
130
 
131
- ### Technical focus
132
 
133
- * **Speech**: Whisper fine-tuning, Faster-Whisper / CTranslate2 inference, VITS-family TTS, VAD-based streaming, LiveKit voice agents.
134
- * **OCR**: classical and transformer-based OCR pipelines, support for Cyrillic and Latin variants of the Kazakh alphabet.
135
- * **Computer Vision**: YOLO family for detection, ViT-family for classification, fine-tuned on Central Asian data.
136
  * **Inference**: vLLM serving, quantization (AWQ, GGUF), latency optimization for production deployment.
137
- * **LLM adaptation**: LoRA/QLoRA fine-tuning on Kazakh/Russian data, domain-specific embeddings, RAG and GraphRAG pipelines.
138
- * **Evaluation**: WER/CER for ASR, CER for OCR, RAGAS and LLM-as-judge for RAG, honest reporting of where models fail.
139
 
140
- ### Why Kazakh
141
 
142
  Kazakh is the native language of over 20 million people, the state language of Kazakhstan, and the language of a growing digital economy. In AI research, it is consistently treated as an afterthought.
143
 
144
- Whisper-large can transcribe Kazakh but with WER noticeably worse than English or Russian. TTS quality falls even further behind. OCR systems regularly confuse Kazakh Cyrillic with Russian. CV models underperform in local context. General-purpose LLMs either slip into Russian when prompted in Kazakh, or produce degraded output.
145
 
146
  This is not a niche academic gap. It's a practical failure affecting real users, real products, and a language that deserves better infrastructure. Darmm exists to close that gap — not through scattered experiments, but through systematic benchmarking, open models, and honest reporting of where the current state of the art actually stands.
147
 
148
- ### Coming soon
149
 
150
- * Multimodal models (vision + language)
151
  * Kazakh ↔ Russian / Kazakh ↔ English translation
152
- * Streaming STT pipelines
153
  * Domain-specific verticals — legal, medical, education
 
154
 
155
- ### Status
156
 
157
  Darmm is an early-stage R&D effort, not a finished product line. Models and writeups are published as they're ready, with honest baselines and known limitations. Reach out via [github.com/R3iwan](https://github.com/R3iwan).
 
9
 
10
  # Darmm AI
11
 
12
+ **Darmm** is an independent R&D effort focused on language and document AI for Kazakh and the broader Central Asian context. Maintained by [R3iwan](https://github.com/R3iwan).
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
13
 
14
+ The focus is the underserved part of the AI landscape: languages and domains where global open-source models drop in quality, and where local context, script, and terminology matter.
15
 
16
  Website: [darmm.kz](https://darmm.kz) — currently AI tutoring, gradually becoming a project showcase.
17
 
18
+ ## What I'm working on
19
 
 
 
 
 
 
20
  * **Text / NLP** — LLM fine-tuning, embeddings, classification, and generation for Kazakh/Russian text, with a focus on legal and technical terminology.
21
+ * **Kazakh-aware tokenization & adaptation** — measuring and closing the gap between how global models handle Kazakh versus how they should: tokenizer efficiency, vocabulary extension, continued pretraining on Kazakh data.
22
+ * **OCR & document AI** — recognition of printed and handwritten Kazakh text, adapted for legal, educational, and government documents; extraction and validation pipelines on top of it.
23
+ * **Retrieval & RAG** — embedding models, hybrid search, and RAG/GraphRAG pipelines tuned for Kazakh/Russian corpora, evaluated against curated golden sets.
24
+ * **Benchmarks & datasets** — open Kazakh-language datasets and honest, reproducible evaluation reports of where current models actually stand.
25
 
26
+ Most work is published as open models, datasets, and benchmarks on Hugging Face. Production-specific components stay closed.
27
 
28
+ ## Technical focus
29
 
30
+ * **LLM adaptation**: LoRA/QLoRA fine-tuning on Kazakh/Russian data, vocabulary extension, domain-specific embeddings, instruction tuning.
31
+ * **OCR**: classical and transformer-based OCR pipelines, support for Cyrillic and Latin variants of the Kazakh alphabet, document layout and field extraction.
32
+ * **Retrieval**: embedding benchmarking, hybrid scoring (BM25 + dense), rerankers, RAG and GraphRAG pipelines.
33
  * **Inference**: vLLM serving, quantization (AWQ, GGUF), latency optimization for production deployment.
34
+ * **Evaluation**: CER for OCR, retrieval and generation metrics for RAG (including LLM-as-judge calibrated against human labels), honest reporting of where models fail.
 
35
 
36
+ ## Why Kazakh
37
 
38
  Kazakh is the native language of over 20 million people, the state language of Kazakhstan, and the language of a growing digital economy. In AI research, it is consistently treated as an afterthought.
39
 
40
+ Tokenizers of major open models fragment Kazakh text far more than English or Russian, degrading both quality and cost. General-purpose LLMs either slip into Russian when prompted in Kazakh, or produce degraded output. OCR systems regularly confuse Kazakh Cyrillic with Russian. Domain terminology legal, governmental, technical is where the drop is sharpest.
41
 
42
  This is not a niche academic gap. It's a practical failure affecting real users, real products, and a language that deserves better infrastructure. Darmm exists to close that gap — not through scattered experiments, but through systematic benchmarking, open models, and honest reporting of where the current state of the art actually stands.
43
 
44
+ ## Coming later
45
 
 
46
  * Kazakh ↔ Russian / Kazakh ↔ English translation
47
+ * Multimodal document understanding (vision + language)
48
  * Domain-specific verticals — legal, medical, education
49
+ * Speech (ASR/TTS) — deliberately parked until the text and document stack is solid
50
 
51
+ ## Status
52
 
53
  Darmm is an early-stage R&D effort, not a finished product line. Models and writeups are published as they're ready, with honest baselines and known limitations. Reach out via [github.com/R3iwan](https://github.com/R3iwan).