R3iwan commited on
Commit
36ab7a0
·
verified ·
1 Parent(s): 0f2974a

Update README.md

Browse files
Files changed (1) hide show
  1. README.md +45 -12
README.md CHANGED
@@ -13,7 +13,7 @@ pinned: false
13
 
14
  ## 🇰🇿 Қазақша
15
 
16
- **Darmm** — қазақ тілі мен Орталық Азия контексіне арналған сөйлеу және тіл AI саласындағы тәуелсіз R&D жоба. Жетекшісі: [R3iwan](https://github.com/R3iwan).
17
 
18
  Бізің назарымыздағы — жаһандық open-source модельдері сапасы төмендейтін, жергілікті контекст, фонетика және терминология маңызды болатын тілдер мен домендер.
19
 
@@ -24,25 +24,36 @@ pinned: false
24
  * **Қазақ ASR** — Whisper family, Wav2Vec2 модельдерін қазақ деректерінде fine-tune жасау және бенчмарктеу, ашық есептер жариялау.
25
  * **Қазақ TTS** — мәтін нормализациясы, G2P өңдеу және дауыс клондау эксперименттерін қоса алғанда дауыс синтезі.
26
  * **Real-time дауыс агенттері** — LiveKit және self-hosted модельдерге негізделген қазақ және орыс тілдеріне арналған end-to-end сөйлеу пайплайндары.
27
- * **Локализацияланған LLM fine-tuning** — заң және техникалық терминологияға баса назар аудара отырып, қазақ/орыс мәтіні үшін домен-адаптацияланған модельдер.
 
 
28
 
29
  Жұмыстардың көпшілігі Hugging Face-те ашық модельдер мен бенчмарктер ретінде жарияланады. Өндірістік компоненттер жабық күйде қалады.
30
 
31
  ### Техникалық фокус
32
 
33
  * **Сөйлеу**: Whisper fine-tuning, Faster-Whisper / CTranslate2 inference, VITS-family TTS, VAD-based streaming, LiveKit voice agents.
 
 
34
  * **Inference**: vLLM serving, квантизация (AWQ, GGUF), өндірістік деплоймент үшін latency оптимизациясы.
35
  * **LLM адаптациясы**: қазақ/орыс деректерінде LoRA/QLoRA fine-tuning, домен-спецификалық эмбеддингтер, RAG және GraphRAG пайплайндары.
36
- * **Бағалау**: ASR үшін WER/CER, RAG үшін RAGAS және LLM-as-judge, модельдер қайда жіберетінін адал есептеу.
37
 
38
  ### Неліктен қазақ тілі
39
 
40
  Қазақ тілі — 20 миллионнан астам адамның ана тілі, мемлекеттік тіл, өскелең цифрлық экономиканың тілі. AI зерттеулерінде ол үнемі ескерусіз қалады.
41
 
42
- Whisper-large қазақ тілін транскрибациялай алады — бірақ WER-і ағылшын немесе орыс тілімен салыстырғанда айтарлықтай жоғары. TTS сапасы одан да артта. Кең қолданыста бар ашық қазақ-спецификалық сөйлеу модельдері жоқ. Жалпы мақсаттағы LLM-дер қазақша нұсқаулармен жұмыс жасағанда не орысшаға ауысады, не сапасыз нәтиже береді.
43
 
44
  Бұл академиялық олқылық емес — нақты пайдаланушыларға, нақты өнімдерге және жақсы инфрақұрылымға лайықты тілге әсер ететін практикалық сәтсіздік. Darmm осы олқылықты жабу үшін жұмыс жасайды: шашыраңқы эксперименттер емес, жүйелі бенчмарктеу, ашық модельдер және ағымдағы жай-күйдің адал есебі.
45
 
 
 
 
 
 
 
 
46
  ### Мәртебе
47
 
48
  Darmm — ерте кезеңдегі R&D жоба, аяқталған өнім желісі емес. Модельдер мен жазбалар дайын болған сайын жарияланады — адал бастапқы деңгейлермен және белгілі шектеулермен. [github.com/R3iwan](https://github.com/R3iwan) арқылы хабарласыңыз.
@@ -51,7 +62,7 @@ Darmm — ерте кезеңдегі R&D жоба, аяқталған өнім
51
 
52
  ## 🇷🇺 Русский
53
 
54
- **Darmm** — независимый R&D проект в области речевого и языкового AI для казахского языка и Центральноазиатского контекста. Поддерживается [R3iwan](https://github.com/R3iwan).
55
 
56
  Фокус — недостаточно охваченная часть AI-ландшафта: языки и домены, где качество глобальных open-source моделей падает, а локальный контекст, фонетика и терминология имеют решающее значение.
57
 
@@ -62,25 +73,36 @@ Darmm — ерте кезеңдегі R&D жоба, аяқталған өнім
62
  * **Казахский ASR** — файн-тюнинг и бенчмаркинг современных open-source ASR (семейство Whisper, Wav2Vec2) на казахских данных, с публичными отчётами об оценке.
63
  * **Казахский TTS** — синтез голоса для казахского языка, включая нормализацию текста, обработку G2P и эксперименты с клонированием голоса.
64
  * **Real-time голосовые агенты** — сквозные речевые пайплайны для казахского и русского языков на базе LiveKit и self-hosted моделей.
65
- * **Локализованный файн-тюнинг LLM** — доменно-адаптированные модели для казахского/русского текста с упором на юридическую и техническую терминологию.
 
 
66
 
67
  Большинство работ публикуются как открытые модели и бенчмарки на Hugging Face. Производственные компоненты остаются закрытыми.
68
 
69
  ### Технический фокус
70
 
71
  * **Речь**: Whisper fine-tuning, Faster-Whisper / CTranslate2 inference, VITS-family TTS, VAD-based streaming, LiveKit voice agents.
 
 
72
  * **Inference**: vLLM serving, квантизация (AWQ, GGUF), оптимизация задержки для production-деплоя.
73
  * **Адаптация LLM**: LoRA/QLoRA fine-tuning на казахских/русских данных, доменно-специфические эмбеддинги, RAG и GraphRAG пайплайны.
74
- * **Оценка**: WER/CER для ASR, RAGAS и LLM-as-judge для RAG, честная отчётность о том, где модели дают сбой.
75
 
76
  ### Почему казахский
77
 
78
  Казахский — родной язык для более чем 20 миллионов человек, государственный язык Казахстана, язык растущей цифровой экономики. В AI-исследованиях он систематически остаётся на обочине.
79
 
80
- Whisper-large транскрибирует казахский — но с WER заметно хуже, чем для английского или русского. TTS отстаёт ещё сильнее. Широко используемых открытых казахско-специфических речевых моделей не существует. Модели общего назначения при казахских промптах либо переключаются на русский, либо выдают деградированный результат.
81
 
82
  Это не академический пробел — это практический сбой, затрагивающий реальных пользователей, реальные продукты и язык, который заслуживает лучшей инфраструктуры. Darmm работает над устранением этого пробела: не разрозненные эксперименты, а системный бенчмаркинг, открытые модели и честная отчётность о реальном положении дел.
83
 
 
 
 
 
 
 
 
84
  ### Статус
85
 
86
  Darmm — R&D проект на ранней стадии, а не готовая продуктовая линейка. Модели и статьи публикуются по мере готовности — с честными базовыми показателями и известными ограничениями. Связаться: [github.com/R3iwan](https://github.com/R3iwan).
@@ -89,7 +111,7 @@ Darmm — R&D проект на ранней стадии, а не готова
89
 
90
  ## 🌐 English
91
 
92
- **Darmm** is an independent R&D effort focused on speech and language AI for the Kazakh language and the broader Central Asian context. Maintained by [R3iwan](https://github.com/R3iwan).
93
 
94
  The focus is the underserved part of the AI landscape: languages and domains where global open-source models drop in quality, and where local context, phonetics, and terminology matter.
95
 
@@ -100,25 +122,36 @@ Website: [darmm.kz](https://darmm.kz) — currently AI tutoring, gradually becom
100
  * **Kazakh ASR** — fine-tuning and benchmarking modern open-source ASR (Whisper family, Wav2Vec2) on Kazakh data, with public evaluation reports.
101
  * **Kazakh TTS** — voice synthesis for Kazakh including text normalization, G2P handling, and voice cloning experiments.
102
  * **Real-time voice agents** — end-to-end speech pipelines for Kazakh and Russian, built on LiveKit and self-hosted models.
103
- * **Localized LLM fine-tuning** — domain-adapted models for Kazakh/Russian text, with a focus on legal and technical terminology.
 
 
104
 
105
  Most work is published as open models and benchmarks on Hugging Face. Production-specific components stay closed.
106
 
107
  ### Technical focus
108
 
109
  * **Speech**: Whisper fine-tuning, Faster-Whisper / CTranslate2 inference, VITS-family TTS, VAD-based streaming, LiveKit voice agents.
 
 
110
  * **Inference**: vLLM serving, quantization (AWQ, GGUF), latency optimization for production deployment.
111
  * **LLM adaptation**: LoRA/QLoRA fine-tuning on Kazakh/Russian data, domain-specific embeddings, RAG and GraphRAG pipelines.
112
- * **Evaluation**: WER/CER for ASR, RAGAS and LLM-as-judge for RAG, honest reporting of where models fail.
113
 
114
  ### Why Kazakh
115
 
116
  Kazakh is the native language of over 20 million people, the state language of Kazakhstan, and the language of a growing digital economy. In AI research, it is consistently treated as an afterthought.
117
 
118
- Whisper-large can transcribe Kazakh — but with WER noticeably worse than English or Russian. TTS quality falls even further behind. There are no widely-used open Kazakh-specific speech models. General-purpose LLMs either slip into Russian when prompted in Kazakh, or produce degraded output.
119
 
120
  This is not a niche academic gap. It's a practical failure affecting real users, real products, and a language that deserves better infrastructure. Darmm exists to close that gap — not through scattered experiments, but through systematic benchmarking, open models, and honest reporting of where the current state of the art actually stands.
121
 
 
 
 
 
 
 
 
122
  ### Status
123
 
124
  Darmm is an early-stage R&D effort, not a finished product line. Models and writeups are published as they're ready, with honest baselines and known limitations. Reach out via [github.com/R3iwan](https://github.com/R3iwan).
 
13
 
14
  ## 🇰🇿 Қазақша
15
 
16
+ **Darmm** — қазақ тілі мен Орталық Азия контексіне арналған сөйлеу, көру және тіл AI саласындағы тәуелсіз R&D жоба. Жетекшісі: [R3iwan](https://github.com/R3iwan).
17
 
18
  Бізің назарымыздағы — жаһандық open-source модельдері сапасы төмендейтін, жергілікті контекст, фонетика және терминология маңызды болатын тілдер мен домендер.
19
 
 
24
  * **Қазақ ASR** — Whisper family, Wav2Vec2 модельдерін қазақ деректерінде fine-tune жасау және бенчмарктеу, ашық есептер жариялау.
25
  * **Қазақ TTS** — мәтін нормализациясы, G2P өңдеу және дауыс клондау эксперименттерін қоса алғанда дауыс синтезі.
26
  * **Real-time дауыс агенттері** — LiveKit және self-hosted модельдерге негізделген қазақ және орыс тілдеріне арналған end-to-end сөйлеу пайплайндары.
27
+ * **OCR** — қазақ тіліндегі баспа және қолжазба мәтіндерін тану, заң, білім беру және мемлекеттік құжаттарға бейімдеу.
28
+ * **Computer Vision** — Орталық Азия контексіне арналған детекция, классификация және сегментация модельдері.
29
+ * **Мәтін / NLP** — заң және техникалық терминологияға баса назар аудара отырып, қазақ/орыс мәтіні үшін LLM fine-tuning, эмбеддингтер, классификация және генерация.
30
 
31
  Жұмыстардың көпшілігі Hugging Face-те ашық модельдер мен бенчмарктер ретінде жарияланады. Өндірістік компоненттер жабық күйде қалады.
32
 
33
  ### Техникалық фокус
34
 
35
  * **Сөйлеу**: Whisper fine-tuning, Faster-Whisper / CTranslate2 inference, VITS-family TTS, VAD-based streaming, LiveKit voice agents.
36
+ * **OCR**: тұрақты және трансформерге негізделген OCR пайплайндары, қазақ алфавитінің кириллица/латын нұсқаларын қолдау.
37
+ * **Computer Vision**: детекция үшін YOLO family, классификация үшін ViT-family, Орталық Азия деректерінде fine-tuning.
38
  * **Inference**: vLLM serving, квантизация (AWQ, GGUF), өндірістік деплоймент үшін latency оптимизациясы.
39
  * **LLM адаптациясы**: қазақ/орыс деректерінде LoRA/QLoRA fine-tuning, домен-спецификалық эмбеддингтер, RAG және GraphRAG пайплайндары.
40
+ * **Бағалау**: ASR үшін WER/CER, OCR үшін CER, RAG үшін RAGAS және LLM-as-judge, модельдер қайда жіберетінін адал есептеу.
41
 
42
  ### Неліктен қазақ тілі
43
 
44
  Қазақ тілі — 20 миллионнан астам адамның ана тілі, мемлекеттік тіл, өскелең цифрлық экономиканың тілі. AI зерттеулерінде ол үнемі ескерусіз қалады.
45
 
46
+ Whisper-large қазақ тілін транскрибациялай алады — бірақ WER-і ағылшын немесе орыс тілімен салыстырғанда айтарлықтай жоғары. TTS сапасы одан да артта. OCR жүйелері қазақ кириллицасын жиі орысша деп қателеседі. CV модельдері жергілікті контекстте нашар жұмыс жасайды. Жалпы мақсаттағы LLM-дер қазақша нұсқаулармен жұмыс жасағанда не орысшаға ауысады, не сапасыз нәтиже береді.
47
 
48
  Бұл академиялық олқылық емес — нақты пайдаланушыларға, нақты өнімдерге және жақсы инфрақұрылымға лайықты тілге әсер ететін практикалық сәтсіздік. Darmm осы олқылықты жабу үшін жұмыс жасайды: шашыраңқы эксперименттер емес, жүйелі бенчмарктеу, ашық модельдер және ағымдағы жай-күйдің адал есебі.
49
 
50
+ ### Жақын арада
51
+
52
+ * Көпмодальды модельдер (vision + language)
53
+ * Қазақ/орыс аудармасы
54
+ * Streaming STT пайплайндары
55
+ * Салалық бейімдеу — заң, медицина, білім беру
56
+
57
  ### Мәртебе
58
 
59
  Darmm — ерте кезеңдегі R&D жоба, аяқталған өнім желісі емес. Модельдер мен жазбалар дайын болған сайын жарияланады — адал бастапқы деңгейлермен және белгілі шектеулермен. [github.com/R3iwan](https://github.com/R3iwan) арқылы хабарласыңыз.
 
62
 
63
  ## 🇷🇺 Русский
64
 
65
+ **Darmm** — независимый R&D проект в области речевого, визуального и языкового AI для казахского языка и Центральноазиатского контекста. Поддерживается [R3iwan](https://github.com/R3iwan).
66
 
67
  Фокус — недостаточно охваченная часть AI-ландшафта: языки и домены, где качество глобальных open-source моделей падает, а локальный контекст, фонетика и терминология имеют решающее значение.
68
 
 
73
  * **Казахский ASR** — файн-тюнинг и бенчмаркинг современных open-source ASR (семейство Whisper, Wav2Vec2) на казахских данных, с публичными отчётами об оценке.
74
  * **Казахский TTS** — синтез голоса для казахского языка, включая нормализацию текста, обработку G2P и эксперименты с клонированием голоса.
75
  * **Real-time голосовые агенты** — сквозные речевые пайплайны для казахского и русского языков на базе LiveKit и self-hosted моделей.
76
+ * **OCR** — распознавание печатного и рукописного текста на казахском языке, адаптация под юридические, образовательные и государственные документы.
77
+ * **Computer Vision** — модели детекции, классификации и сегментации, адаптированные под Центральноазиатский контекст.
78
+ * **Текст / NLP** — LLM fine-tuning, эмбеддинги, классификация и генерация для казахского/русского текста с упором на юридическую и техническую терминологию.
79
 
80
  Большинство работ публикуются как открытые модели и бенчмарки на Hugging Face. Производственные компоненты остаются закрытыми.
81
 
82
  ### Технический фокус
83
 
84
  * **Речь**: Whisper fine-tuning, Faster-Whisper / CTranslate2 inference, VITS-family TTS, VAD-based streaming, LiveKit voice agents.
85
+ * **OCR**: классические и трансформерные OCR-пайплайны, поддержка кириллических и латинских вариантов казахского алфавита.
86
+ * **Computer Vision**: YOLO family для детекции, ViT-family для классификации, файн-тюнинг на центральноазиатских данных.
87
  * **Inference**: vLLM serving, квантизация (AWQ, GGUF), оптимизация задержки для production-деплоя.
88
  * **Адаптация LLM**: LoRA/QLoRA fine-tuning на казахских/русских данных, доменно-специфические эмбеддинги, RAG и GraphRAG пайплайны.
89
+ * **Оценка**: WER/CER для ASR, CER для OCR, RAGAS и LLM-as-judge для RAG, честная отчётность о том, где модели дают сбой.
90
 
91
  ### Почему казахский
92
 
93
  Казахский — родной язык для более чем 20 миллионов человек, государственный язык Казахстана, язык растущей цифровой экономики. В AI-исследованиях он систематически остаётся на обочине.
94
 
95
+ Whisper-large транскрибирует казахский — но с WER заметно хуже, чем для английского или русского. TTS отстаёт ещё сильнее. OCR-системы часто путают казахскую кириллицу с русской. CV-модели плохо работают в локальном контексте. Модели общего назначения при казахских промптах либо переключаются на русский, либо выдают деградированный результат.
96
 
97
  Это не академический пробел — это практический сбой, затрагивающий реальных пользователей, реальные продукты и язык, который заслуживает лучшей инфраструктуры. Darmm работает над устранением этого пробела: не разрозненные эксперименты, а системный бенчмаркинг, открытые модели и честная отчётность о реальном положении дел.
98
 
99
+ ### В планах
100
+
101
+ * Мультимодальные модели (vision + language)
102
+ * Казахско-русский / казахско-английский перевод
103
+ * Streaming STT пайплайны
104
+ * Отраслевая адаптация — юриспруденция, медицина, образование
105
+
106
  ### Статус
107
 
108
  Darmm — R&D проект на ранней стадии, а не готовая продуктовая линейка. Модели и статьи публикуются по мере готовности — с честными базовыми показателями и известными ограничениями. Связаться: [github.com/R3iwan](https://github.com/R3iwan).
 
111
 
112
  ## 🌐 English
113
 
114
+ **Darmm** is an independent R&D effort focused on speech, vision, and language AI for the Kazakh language and the broader Central Asian context. Maintained by [R3iwan](https://github.com/R3iwan).
115
 
116
  The focus is the underserved part of the AI landscape: languages and domains where global open-source models drop in quality, and where local context, phonetics, and terminology matter.
117
 
 
122
  * **Kazakh ASR** — fine-tuning and benchmarking modern open-source ASR (Whisper family, Wav2Vec2) on Kazakh data, with public evaluation reports.
123
  * **Kazakh TTS** — voice synthesis for Kazakh including text normalization, G2P handling, and voice cloning experiments.
124
  * **Real-time voice agents** — end-to-end speech pipelines for Kazakh and Russian, built on LiveKit and self-hosted models.
125
+ * **OCR** — recognition of printed and handwritten Kazakh text, adapted for legal, educational, and government documents.
126
+ * **Computer Vision** — detection, classification, and segmentation models adapted for Central Asian context.
127
+ * **Text / NLP** — LLM fine-tuning, embeddings, classification, and generation for Kazakh/Russian text, with a focus on legal and technical terminology.
128
 
129
  Most work is published as open models and benchmarks on Hugging Face. Production-specific components stay closed.
130
 
131
  ### Technical focus
132
 
133
  * **Speech**: Whisper fine-tuning, Faster-Whisper / CTranslate2 inference, VITS-family TTS, VAD-based streaming, LiveKit voice agents.
134
+ * **OCR**: classical and transformer-based OCR pipelines, support for Cyrillic and Latin variants of the Kazakh alphabet.
135
+ * **Computer Vision**: YOLO family for detection, ViT-family for classification, fine-tuned on Central Asian data.
136
  * **Inference**: vLLM serving, quantization (AWQ, GGUF), latency optimization for production deployment.
137
  * **LLM adaptation**: LoRA/QLoRA fine-tuning on Kazakh/Russian data, domain-specific embeddings, RAG and GraphRAG pipelines.
138
+ * **Evaluation**: WER/CER for ASR, CER for OCR, RAGAS and LLM-as-judge for RAG, honest reporting of where models fail.
139
 
140
  ### Why Kazakh
141
 
142
  Kazakh is the native language of over 20 million people, the state language of Kazakhstan, and the language of a growing digital economy. In AI research, it is consistently treated as an afterthought.
143
 
144
+ Whisper-large can transcribe Kazakh — but with WER noticeably worse than English or Russian. TTS quality falls even further behind. OCR systems regularly confuse Kazakh Cyrillic with Russian. CV models underperform in local context. General-purpose LLMs either slip into Russian when prompted in Kazakh, or produce degraded output.
145
 
146
  This is not a niche academic gap. It's a practical failure affecting real users, real products, and a language that deserves better infrastructure. Darmm exists to close that gap — not through scattered experiments, but through systematic benchmarking, open models, and honest reporting of where the current state of the art actually stands.
147
 
148
+ ### Coming soon
149
+
150
+ * Multimodal models (vision + language)
151
+ * Kazakh ↔ Russian / Kazakh ↔ English translation
152
+ * Streaming STT pipelines
153
+ * Domain-specific verticals — legal, medical, education
154
+
155
  ### Status
156
 
157
  Darmm is an early-stage R&D effort, not a finished product line. Models and writeups are published as they're ready, with honest baselines and known limitations. Reach out via [github.com/R3iwan](https://github.com/R3iwan).