Update README.md
Browse files
README.md
CHANGED
|
@@ -13,7 +13,7 @@ pinned: false
|
|
| 13 |
|
| 14 |
## 🇰🇿 Қазақша
|
| 15 |
|
| 16 |
-
**Darmm** — қазақ тілі мен Орталық Азия контексіне арналған сөйлеу және тіл AI саласындағы тәуелсіз R&D жоба. Жетекшісі: [R3iwan](https://github.com/R3iwan).
|
| 17 |
|
| 18 |
Бізің назарымыздағы — жаһандық open-source модельдері сапасы төмендейтін, жергілікті контекст, фонетика және терминология маңызды болатын тілдер мен домендер.
|
| 19 |
|
|
@@ -24,25 +24,36 @@ pinned: false
|
|
| 24 |
* **Қазақ ASR** — Whisper family, Wav2Vec2 модельдерін қазақ деректерінде fine-tune жасау және бенчмарктеу, ашық есептер жариялау.
|
| 25 |
* **Қазақ TTS** — мәтін нормализациясы, G2P өңдеу және дауыс клондау эксперименттерін қоса алғанда дауыс синтезі.
|
| 26 |
* **Real-time дауыс агенттері** — LiveKit және self-hosted модельдерге негізделген қазақ және орыс тілдеріне арналған end-to-end сөйлеу пайплайндары.
|
| 27 |
-
* **
|
|
|
|
|
|
|
| 28 |
|
| 29 |
Жұмыстардың көпшілігі Hugging Face-те ашық модельдер мен бенчмарктер ретінде жарияланады. Өндірістік компоненттер жабық күйде қалады.
|
| 30 |
|
| 31 |
### Техникалық фокус
|
| 32 |
|
| 33 |
* **Сөйлеу**: Whisper fine-tuning, Faster-Whisper / CTranslate2 inference, VITS-family TTS, VAD-based streaming, LiveKit voice agents.
|
|
|
|
|
|
|
| 34 |
* **Inference**: vLLM serving, квантизация (AWQ, GGUF), өндірістік деплоймент үшін latency оптимизациясы.
|
| 35 |
* **LLM адаптациясы**: қазақ/орыс деректерінде LoRA/QLoRA fine-tuning, домен-спецификалық эмбеддингтер, RAG және GraphRAG пайплайндары.
|
| 36 |
-
* **Бағалау**: ASR үшін WER/CER, RAG үшін RAGAS және LLM-as-judge, модельдер қайда жіберетінін адал есептеу.
|
| 37 |
|
| 38 |
### Неліктен қазақ тілі
|
| 39 |
|
| 40 |
Қазақ тілі — 20 миллионнан астам адамның ана тілі, мемлекеттік тіл, өскелең цифрлық экономиканың тілі. AI зерттеулерінде ол үнемі ескерусіз қалады.
|
| 41 |
|
| 42 |
-
Whisper-large қазақ тілін транскрибациялай алады — бірақ WER-і ағылшын немесе орыс тілімен салыстырғанда айтарлықтай жоғары. TTS сапасы одан да артта.
|
| 43 |
|
| 44 |
Бұл академиялық олқылық емес — нақты пайдаланушыларға, нақты өнімдерге және жақсы инфрақұрылымға лайықты тілге әсер ететін практикалық сәтсіздік. Darmm осы олқылықты жабу үшін жұмыс жасайды: шашыраңқы эксперименттер емес, жүйелі бенчмарктеу, ашық модельдер және ағымдағы жай-күйдің адал есебі.
|
| 45 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 46 |
### Мәртебе
|
| 47 |
|
| 48 |
Darmm — ерте кезеңдегі R&D жоба, аяқталған өнім желісі емес. Модельдер мен жазбалар дайын болған сайын жарияланады — адал бастапқы деңгейлермен және белгілі шектеулермен. [github.com/R3iwan](https://github.com/R3iwan) арқылы хабарласыңыз.
|
|
@@ -51,7 +62,7 @@ Darmm — ерте кезеңдегі R&D жоба, аяқталған өнім
|
|
| 51 |
|
| 52 |
## 🇷🇺 Русский
|
| 53 |
|
| 54 |
-
**Darmm** — независимый R&D проект в области речевого и языкового AI для казахского языка и Центральноазиатского контекста. Поддерживается [R3iwan](https://github.com/R3iwan).
|
| 55 |
|
| 56 |
Фокус — недостаточно охваченная часть AI-ландшафта: языки и домены, где качество глобальных open-source моделей падает, а локальный контекст, фонетика и терминология имеют решающее значение.
|
| 57 |
|
|
@@ -62,25 +73,36 @@ Darmm — ерте кезеңдегі R&D жоба, аяқталған өнім
|
|
| 62 |
* **Казахский ASR** — файн-тюнинг и бенчмаркинг современных open-source ASR (семейство Whisper, Wav2Vec2) на казахских данных, с публичными отчётами об оценке.
|
| 63 |
* **Казахский TTS** — синтез голоса для казахского языка, включая нормализацию текста, обработку G2P и эксперименты с клонированием голоса.
|
| 64 |
* **Real-time голосовые агенты** — сквозные речевые пайплайны для казахского и русского языков на базе LiveKit и self-hosted моделей.
|
| 65 |
-
* **
|
|
|
|
|
|
|
| 66 |
|
| 67 |
Большинство работ публикуются как открытые модели и бенчмарки на Hugging Face. Производственные компоненты остаются закрытыми.
|
| 68 |
|
| 69 |
### Технический фокус
|
| 70 |
|
| 71 |
* **Речь**: Whisper fine-tuning, Faster-Whisper / CTranslate2 inference, VITS-family TTS, VAD-based streaming, LiveKit voice agents.
|
|
|
|
|
|
|
| 72 |
* **Inference**: vLLM serving, квантизация (AWQ, GGUF), оптимизация задержки для production-деплоя.
|
| 73 |
* **Адаптация LLM**: LoRA/QLoRA fine-tuning на казахских/русских данных, доменно-специфические эмбеддинги, RAG и GraphRAG пайплайны.
|
| 74 |
-
* **Оценка**: WER/CER для ASR, RAGAS и LLM-as-judge для RAG, честная отчётность о том, где модели дают сбой.
|
| 75 |
|
| 76 |
### Почему казахский
|
| 77 |
|
| 78 |
Казахский — родной язык для более чем 20 миллионов человек, государственный язык Казахстана, язык растущей цифровой экономики. В AI-исследованиях он систематически остаётся на обочине.
|
| 79 |
|
| 80 |
-
Whisper-large транскрибирует казахский — но с WER заметно хуже, чем для английского или русского. TTS отстаёт ещё сильнее.
|
| 81 |
|
| 82 |
Это не академический пробел — это практический сбой, затрагивающий реальных пользователей, реальные продукты и язык, который заслуживает лучшей инфраструктуры. Darmm работает над устранением этого пробела: не разрозненные эксперименты, а системный бенчмаркинг, открытые модели и честная отчётность о реальном положении дел.
|
| 83 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 84 |
### Статус
|
| 85 |
|
| 86 |
Darmm — R&D проект на ранней стадии, а не готовая продуктовая линейка. Модели и статьи публикуются по мере готовности — с честными базовыми показателями и известными ограничениями. Связаться: [github.com/R3iwan](https://github.com/R3iwan).
|
|
@@ -89,7 +111,7 @@ Darmm — R&D проект на ранней стадии, а не готова
|
|
| 89 |
|
| 90 |
## 🌐 English
|
| 91 |
|
| 92 |
-
**Darmm** is an independent R&D effort focused on speech and language AI for the Kazakh language and the broader Central Asian context. Maintained by [R3iwan](https://github.com/R3iwan).
|
| 93 |
|
| 94 |
The focus is the underserved part of the AI landscape: languages and domains where global open-source models drop in quality, and where local context, phonetics, and terminology matter.
|
| 95 |
|
|
@@ -100,25 +122,36 @@ Website: [darmm.kz](https://darmm.kz) — currently AI tutoring, gradually becom
|
|
| 100 |
* **Kazakh ASR** — fine-tuning and benchmarking modern open-source ASR (Whisper family, Wav2Vec2) on Kazakh data, with public evaluation reports.
|
| 101 |
* **Kazakh TTS** — voice synthesis for Kazakh including text normalization, G2P handling, and voice cloning experiments.
|
| 102 |
* **Real-time voice agents** — end-to-end speech pipelines for Kazakh and Russian, built on LiveKit and self-hosted models.
|
| 103 |
-
* **
|
|
|
|
|
|
|
| 104 |
|
| 105 |
Most work is published as open models and benchmarks on Hugging Face. Production-specific components stay closed.
|
| 106 |
|
| 107 |
### Technical focus
|
| 108 |
|
| 109 |
* **Speech**: Whisper fine-tuning, Faster-Whisper / CTranslate2 inference, VITS-family TTS, VAD-based streaming, LiveKit voice agents.
|
|
|
|
|
|
|
| 110 |
* **Inference**: vLLM serving, quantization (AWQ, GGUF), latency optimization for production deployment.
|
| 111 |
* **LLM adaptation**: LoRA/QLoRA fine-tuning on Kazakh/Russian data, domain-specific embeddings, RAG and GraphRAG pipelines.
|
| 112 |
-
* **Evaluation**: WER/CER for ASR, RAGAS and LLM-as-judge for RAG, honest reporting of where models fail.
|
| 113 |
|
| 114 |
### Why Kazakh
|
| 115 |
|
| 116 |
Kazakh is the native language of over 20 million people, the state language of Kazakhstan, and the language of a growing digital economy. In AI research, it is consistently treated as an afterthought.
|
| 117 |
|
| 118 |
-
Whisper-large can transcribe Kazakh — but with WER noticeably worse than English or Russian. TTS quality falls even further behind.
|
| 119 |
|
| 120 |
This is not a niche academic gap. It's a practical failure affecting real users, real products, and a language that deserves better infrastructure. Darmm exists to close that gap — not through scattered experiments, but through systematic benchmarking, open models, and honest reporting of where the current state of the art actually stands.
|
| 121 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 122 |
### Status
|
| 123 |
|
| 124 |
Darmm is an early-stage R&D effort, not a finished product line. Models and writeups are published as they're ready, with honest baselines and known limitations. Reach out via [github.com/R3iwan](https://github.com/R3iwan).
|
|
|
|
| 13 |
|
| 14 |
## 🇰🇿 Қазақша
|
| 15 |
|
| 16 |
+
**Darmm** — қазақ тілі мен Орталық Азия контексіне арналған сөйлеу, көру және тіл AI саласындағы тәуелсіз R&D жоба. Жетекшісі: [R3iwan](https://github.com/R3iwan).
|
| 17 |
|
| 18 |
Бізің назарымыздағы — жаһандық open-source модельдері сапасы төмендейтін, жергілікті контекст, фонетика және терминология маңызды болатын тілдер мен домендер.
|
| 19 |
|
|
|
|
| 24 |
* **Қазақ ASR** — Whisper family, Wav2Vec2 модельдерін қазақ деректерінде fine-tune жасау және бенчмарктеу, ашық есептер жариялау.
|
| 25 |
* **Қазақ TTS** — мәтін нормализациясы, G2P өңдеу және дауыс клондау эксперименттерін қоса алғанда дауыс синтезі.
|
| 26 |
* **Real-time дауыс агенттері** — LiveKit және self-hosted модельдерге негізделген қазақ және орыс тілдеріне арналған end-to-end сөйлеу пайплайндары.
|
| 27 |
+
* **OCR** — қазақ тіліндегі баспа және қолжазба мәтіндерін тану, заң, білім беру және мемлекеттік құжаттарға бейімдеу.
|
| 28 |
+
* **Computer Vision** — Орталық Азия контексіне арналған детекция, классификация және сегментация модельдері.
|
| 29 |
+
* **Мәтін / NLP** — заң және техникалық терминологияға баса назар аудара отырып, қазақ/орыс мәтіні үшін LLM fine-tuning, эмбеддингтер, классификация және генерация.
|
| 30 |
|
| 31 |
Жұмыстардың көпшілігі Hugging Face-те ашық модельдер мен бенчмарктер ретінде жарияланады. Өндірістік компоненттер жабық күйде қалады.
|
| 32 |
|
| 33 |
### Техникалық фокус
|
| 34 |
|
| 35 |
* **Сөйлеу**: Whisper fine-tuning, Faster-Whisper / CTranslate2 inference, VITS-family TTS, VAD-based streaming, LiveKit voice agents.
|
| 36 |
+
* **OCR**: тұрақты және трансформерге негізделген OCR пайплайндары, қазақ алфавитінің кириллица/латын нұсқаларын қолдау.
|
| 37 |
+
* **Computer Vision**: детекция үшін YOLO family, классификация үшін ViT-family, Орталық Азия деректерінде fine-tuning.
|
| 38 |
* **Inference**: vLLM serving, квантизация (AWQ, GGUF), өндірістік деплоймент үшін latency оптимизациясы.
|
| 39 |
* **LLM адаптациясы**: қазақ/орыс деректерінде LoRA/QLoRA fine-tuning, домен-спецификалық эмбеддингтер, RAG және GraphRAG пайплайндары.
|
| 40 |
+
* **Бағалау**: ASR үшін WER/CER, OCR үшін CER, RAG үшін RAGAS және LLM-as-judge, модельдер қайда жіберетінін адал есептеу.
|
| 41 |
|
| 42 |
### Неліктен қазақ тілі
|
| 43 |
|
| 44 |
Қазақ тілі — 20 миллионнан астам адамның ана тілі, мемлекеттік тіл, өскелең цифрлық экономиканың тілі. AI зерттеулерінде ол үнемі ескерусіз қалады.
|
| 45 |
|
| 46 |
+
Whisper-large қазақ тілін транскрибациялай алады — бірақ WER-і ағылшын немесе орыс тілімен салыстырғанда айтарлықтай жоғары. TTS сапасы одан да артта. OCR жүйелері қазақ кириллицасын жиі орысша деп қателеседі. CV модельдері жергілікті контекстте нашар жұмыс жасайды. Жалпы мақсаттағы LLM-дер қазақша нұсқаулармен жұмыс жасағанда не орысшаға ауысады, не сапасыз нәтиже береді.
|
| 47 |
|
| 48 |
Бұл академиялық олқылық емес — нақты пайдаланушыларға, нақты өнімдерге және жақсы инфрақұрылымға лайықты тілге әсер ететін практикалық сәтсіздік. Darmm осы олқылықты жабу үшін жұмыс жасайды: шашыраңқы эксперименттер емес, жүйелі бенчмарктеу, ашық модельдер және ағымдағы жай-күйдің адал есебі.
|
| 49 |
|
| 50 |
+
### Жақын арада
|
| 51 |
+
|
| 52 |
+
* Көпмодальды модельдер (vision + language)
|
| 53 |
+
* Қазақ/орыс аудармасы
|
| 54 |
+
* Streaming STT пайплайндары
|
| 55 |
+
* Салалық бейімдеу — заң, медицина, білім беру
|
| 56 |
+
|
| 57 |
### Мәртебе
|
| 58 |
|
| 59 |
Darmm — ерте кезеңдегі R&D жоба, аяқталған өнім желісі емес. Модельдер мен жазбалар дайын болған сайын жарияланады — адал бастапқы деңгейлермен және белгілі шектеулермен. [github.com/R3iwan](https://github.com/R3iwan) арқылы хабарласыңыз.
|
|
|
|
| 62 |
|
| 63 |
## 🇷🇺 Русский
|
| 64 |
|
| 65 |
+
**Darmm** — независимый R&D проект в области речевого, визуального и языкового AI для казахского языка и Центральноазиатского контекста. Поддерживается [R3iwan](https://github.com/R3iwan).
|
| 66 |
|
| 67 |
Фокус — недостаточно охваченная часть AI-ландшафта: языки и домены, где качество глобальных open-source моделей падает, а локальный контекст, фонетика и терминология имеют решающее значение.
|
| 68 |
|
|
|
|
| 73 |
* **Казахский ASR** — файн-тюнинг и бенчмаркинг современных open-source ASR (семейство Whisper, Wav2Vec2) на казахских данных, с публичными отчётами об оценке.
|
| 74 |
* **Казахский TTS** — синтез голоса для казахского языка, включая нормализацию текста, обработку G2P и эксперименты с клонированием голоса.
|
| 75 |
* **Real-time голосовые агенты** — сквозные речевые пайплайны для казахского и русского языков на базе LiveKit и self-hosted моделей.
|
| 76 |
+
* **OCR** — распознавание печатного и рукописного текста на казахском языке, адаптация под юридические, образовательные и государственные документы.
|
| 77 |
+
* **Computer Vision** — модели детекции, классификации и сегментации, адаптированные под Центральноазиатский контекст.
|
| 78 |
+
* **Текст / NLP** — LLM fine-tuning, эмбеддинги, классификация и генерация для казахского/русского текста с упором на юридическую и техническую терминологию.
|
| 79 |
|
| 80 |
Большинство работ публикуются как открытые модели и бенчмарки на Hugging Face. Производственные компоненты остаются закрытыми.
|
| 81 |
|
| 82 |
### Технический фокус
|
| 83 |
|
| 84 |
* **Речь**: Whisper fine-tuning, Faster-Whisper / CTranslate2 inference, VITS-family TTS, VAD-based streaming, LiveKit voice agents.
|
| 85 |
+
* **OCR**: классические и трансформерные OCR-пайплайны, поддержка кириллических и латинских вариантов казахского алфавита.
|
| 86 |
+
* **Computer Vision**: YOLO family для детекции, ViT-family для классификации, файн-тюнинг на центральноазиатских данных.
|
| 87 |
* **Inference**: vLLM serving, квантизация (AWQ, GGUF), оптимизация задержки для production-деплоя.
|
| 88 |
* **Адаптация LLM**: LoRA/QLoRA fine-tuning на казахских/русских данных, доменно-специфические эмбеддинги, RAG и GraphRAG пайплайны.
|
| 89 |
+
* **Оценка**: WER/CER для ASR, CER для OCR, RAGAS и LLM-as-judge для RAG, честная отчётность о том, где модели дают сбой.
|
| 90 |
|
| 91 |
### Почему казахский
|
| 92 |
|
| 93 |
Казахский — родной язык для более чем 20 миллионов человек, государственный язык Казахстана, язык растущей цифровой экономики. В AI-исследованиях он систематически остаётся на обочине.
|
| 94 |
|
| 95 |
+
Whisper-large транскрибирует казахский — но с WER заметно хуже, чем для английского или русского. TTS отстаёт ещё сильнее. OCR-системы часто путают казахскую кириллицу с русской. CV-модели плохо работают в локальном контексте. Модели общего назначения при казахских промптах либо переключаются на русский, либо выдают деградированный результат.
|
| 96 |
|
| 97 |
Это не академический пробел — это практический сбой, затрагивающий реальных пользователей, реальные продукты и язык, который заслуживает лучшей инфраструктуры. Darmm работает над устранением этого пробела: не разрозненные эксперименты, а системный бенчмаркинг, открытые модели и честная отчётность о реальном положении дел.
|
| 98 |
|
| 99 |
+
### В планах
|
| 100 |
+
|
| 101 |
+
* Мультимодальные модели (vision + language)
|
| 102 |
+
* Казахско-русский / казахско-английский перевод
|
| 103 |
+
* Streaming STT пайплайны
|
| 104 |
+
* Отраслевая адаптация — юриспруденция, медицина, образование
|
| 105 |
+
|
| 106 |
### Статус
|
| 107 |
|
| 108 |
Darmm — R&D проект на ранней стадии, а не готовая продуктовая линейка. Модели и статьи публикуются по мере готовности — с честными базовыми показателями и известными ограничениями. Связаться: [github.com/R3iwan](https://github.com/R3iwan).
|
|
|
|
| 111 |
|
| 112 |
## 🌐 English
|
| 113 |
|
| 114 |
+
**Darmm** is an independent R&D effort focused on speech, vision, and language AI for the Kazakh language and the broader Central Asian context. Maintained by [R3iwan](https://github.com/R3iwan).
|
| 115 |
|
| 116 |
The focus is the underserved part of the AI landscape: languages and domains where global open-source models drop in quality, and where local context, phonetics, and terminology matter.
|
| 117 |
|
|
|
|
| 122 |
* **Kazakh ASR** — fine-tuning and benchmarking modern open-source ASR (Whisper family, Wav2Vec2) on Kazakh data, with public evaluation reports.
|
| 123 |
* **Kazakh TTS** — voice synthesis for Kazakh including text normalization, G2P handling, and voice cloning experiments.
|
| 124 |
* **Real-time voice agents** — end-to-end speech pipelines for Kazakh and Russian, built on LiveKit and self-hosted models.
|
| 125 |
+
* **OCR** — recognition of printed and handwritten Kazakh text, adapted for legal, educational, and government documents.
|
| 126 |
+
* **Computer Vision** — detection, classification, and segmentation models adapted for Central Asian context.
|
| 127 |
+
* **Text / NLP** — LLM fine-tuning, embeddings, classification, and generation for Kazakh/Russian text, with a focus on legal and technical terminology.
|
| 128 |
|
| 129 |
Most work is published as open models and benchmarks on Hugging Face. Production-specific components stay closed.
|
| 130 |
|
| 131 |
### Technical focus
|
| 132 |
|
| 133 |
* **Speech**: Whisper fine-tuning, Faster-Whisper / CTranslate2 inference, VITS-family TTS, VAD-based streaming, LiveKit voice agents.
|
| 134 |
+
* **OCR**: classical and transformer-based OCR pipelines, support for Cyrillic and Latin variants of the Kazakh alphabet.
|
| 135 |
+
* **Computer Vision**: YOLO family for detection, ViT-family for classification, fine-tuned on Central Asian data.
|
| 136 |
* **Inference**: vLLM serving, quantization (AWQ, GGUF), latency optimization for production deployment.
|
| 137 |
* **LLM adaptation**: LoRA/QLoRA fine-tuning on Kazakh/Russian data, domain-specific embeddings, RAG and GraphRAG pipelines.
|
| 138 |
+
* **Evaluation**: WER/CER for ASR, CER for OCR, RAGAS and LLM-as-judge for RAG, honest reporting of where models fail.
|
| 139 |
|
| 140 |
### Why Kazakh
|
| 141 |
|
| 142 |
Kazakh is the native language of over 20 million people, the state language of Kazakhstan, and the language of a growing digital economy. In AI research, it is consistently treated as an afterthought.
|
| 143 |
|
| 144 |
+
Whisper-large can transcribe Kazakh — but with WER noticeably worse than English or Russian. TTS quality falls even further behind. OCR systems regularly confuse Kazakh Cyrillic with Russian. CV models underperform in local context. General-purpose LLMs either slip into Russian when prompted in Kazakh, or produce degraded output.
|
| 145 |
|
| 146 |
This is not a niche academic gap. It's a practical failure affecting real users, real products, and a language that deserves better infrastructure. Darmm exists to close that gap — not through scattered experiments, but through systematic benchmarking, open models, and honest reporting of where the current state of the art actually stands.
|
| 147 |
|
| 148 |
+
### Coming soon
|
| 149 |
+
|
| 150 |
+
* Multimodal models (vision + language)
|
| 151 |
+
* Kazakh ↔ Russian / Kazakh ↔ English translation
|
| 152 |
+
* Streaming STT pipelines
|
| 153 |
+
* Domain-specific verticals — legal, medical, education
|
| 154 |
+
|
| 155 |
### Status
|
| 156 |
|
| 157 |
Darmm is an early-stage R&D effort, not a finished product line. Models and writeups are published as they're ready, with honest baselines and known limitations. Reach out via [github.com/R3iwan](https://github.com/R3iwan).
|