Instructions to use CYP777/thai-elderly-nemo-3models with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- NeMo
How to use CYP777/thai-elderly-nemo-3models with NeMo:
# tag did not correspond to a valid NeMo domain.
- Notebooks
- Google Colab
- Kaggle
| # การประเมินและเปรียบเทียบโมเดลจดจำเสียงพูดภาษาไทยสำหรับผู้สูงอายุ (Thai Elderly ASR Evaluation) | |
| เอกสารสรุปผลการประเมินประสิทธิภาพและแจกแจงสเกลความแม่นยำ (Accuracy Distribution) ของโมเดล ASR รวมถึงเปรียบเทียบระหว่าง **NeMo Pre-trained (ก่อน Fine-tune)** และโมเดลที่ผ่านการ Fine-tune ด้วยชุดข้อมูลฝึกสอนเกณฑ์ต่างๆ | |
| --- | |
| ## 1. ตารางสรุปภาพรวมประสิทธิภาพโมเดล (Overall Performance) | |
| | สถาปัตยกรรม (Architecture) | ชุดข้อมูลที่ใช้ฝึกสอน (Training Data Criteria) | ชุดข้อมูลประเมิน | **ความแม่นยำคำ %** <br>*(Thai Word Acc)* | **ความแม่นยำอักษร %** <br>*(Char Acc)* | **WER** <br>*(คำผิด)* | **CER** <br>*(อักษรผิด)* | **RTF** <br>*(ความเร็ว/วินาที)* | | |
| | :--- | :--- | :---: | :---: | :---: | :---: | :---: | :---: | | |
| | **NeMo Pre-trained** <br>*(115M Params)* | **Pre-trained Only** *(ก่อน Fine-tune)* | Evaluation Set (19,200) | **93.61%** | **97.81%** | 0.0639 | 0.0219 | - | | |
| | --- | --- | --- | --- | --- | --- | --- | --- | | |
| | **NeMo Fine-tuned** <br>*(115M Params)* | **Acc 100% Only** *(ข้อมูลถอดถูกต้อง 100%)* | Test Only (3,840) | 95.78% | 98.27% | 0.0422 | 0.0173 | **0.0259s** | | |
| | | | Train + Test (19,200) | 95.88% | 98.34% | 0.0412 | 0.0166 | **0.0242s** | | |
| | | **Acc 50–99% Only** *(ข้อมูลถอดถูกต้อง 50–99%)* | Test Only (3,840) | 97.79% | 99.16% | 0.0221 | 0.0084 | **0.0254s** | | |
| | | | Train + Test (19,200) | 98.20% | 99.31% | 0.0180 | 0.0069 | **0.0244s** | | |
| | | **All Data** *(ข้อมูลทั้งหมดรวมทุกเกณฑ์)* | Test Only (3,840) | 99.04% | 99.59% | 0.0096 | 0.0041 | **0.0238s** | | |
| | | | Train + Test (19,200) | **99.56%** | **99.80%** | **0.0044** | **0.0020** | **0.0235s** | | |
| | --- | --- | --- | --- | --- | --- | --- | --- | | |
| | **Whisper (CT2)** <br>*(809M Params)* | **Acc 100% Only** *(ข้อมูลถอดถูกต้อง 100%)* | Test Only (3,840) | 97.34% | 99.14% | 0.0266 | 0.0086 | 0.1570s | | |
| | | | Train + Test (19,200) | 97.46% | 99.19% | 0.0254 | 0.0081 | 0.1547s | | |
| | | **Acc 50–99% Only** *(ข้อมูลถอดถูกต้อง 50–99%)* | Test Only (3,840) | 98.28% | 99.51% | 0.0172 | 0.0049 | 0.1561s | | |
| | | | Train + Test (19,200) | 98.68% | 99.61% | 0.0132 | 0.0039 | 0.1555s | | |
| | | **All Data** *(ข้อมูลทั้งหมดรวมทุกเกณฑ์)* | Test Only (3,840) | 98.61% | 99.59% | 0.0139 | 0.0041 | 0.1567s | | |
| | | | Train + Test (19,200) | 99.13% | 99.72% | 0.0087 | 0.0028 | 0.1455s | | |
| --- | |
| ## 2. การแจกแจงระดับสเกลความแม่นยำทุกๆ 5% (Accuracy Scale Distribution) | |
| ตารางแสดง **จำนวนไฟล์เสียง** ที่ตกลงในแต่ละช่วงความแม่นยำ (สเกลละ 5%) | |
| ### 2.1 เปรียบเทียบรวมทุกโมเดล (ชุดข้อมูล 19,200 ไฟล์เท่ากัน) | |
| | ช่วงสเกลความแม่นยำ (%) | NeMo Pre-trained | NeMo (Acc 100%) | NeMo (Acc 50–99%) | **NeMo (All Data)** | Whisper (Acc 100%) | Whisper (Acc 50–99%) | Whisper (All Data) | | |
| | :---: | :---: | :---: | :---: | :---: | :---: | :---: | :---: | | |
| | **0 – 5%** | 63 | 102 | 51 | **7** | 90 | 38 | 27 | | |
| | **5 – 10%** | 0 | 0 | 0 | 0 | 0 | 0 | 0 | | |
| | **10 – 15%** | 4 | 5 | 0 | 0 | 1 | 0 | 0 | | |
| | **15 – 20%** | 3 | 5 | 6 | 1 | 2 | 0 | 0 | | |
| | **20 – 25%** | 9 | 12 | 3 | 2 | 4 | 0 | 0 | | |
| | **25 – 30%** | 25 | 48 | 20 | 4 | 24 | 16 | 11 | | |
| | **30 – 35%** | 65 | 86 | 44 | 10 | 59 | 40 | 20 | | |
| | **35 – 40%** | 8 | 5 | 2 | 0 | 2 | 1 | 0 | | |
| | **40 – 45%** | 40 | 54 | 21 | 5 | 21 | 20 | 11 | | |
| | **45 – 50%** | 2 | 1 | 0 | 0 | 0 | 0 | 0 | | |
| | **50 – 55%** | 98 | 197 | 77 | 16 | 81 | 51 | 32 | | |
| | **55 – 60%** | 52 | 48 | 10 | 1 | 33 | 4 | 7 | | |
| | **60 – 65%** | 175 | 142 | 50 | 7 | 89 | 43 | 22 | | |
| | **65 – 70%** | 228 | 215 | 109 | 36 | 149 | 109 | 59 | | |
| | **70 – 75%** | 155 | 135 | 52 | 11 | 79 | 39 | 24 | | |
| | **75 – 80%** | 304 | 298 | 126 | 33 | 205 | 81 | 72 | | |
| | **80 – 85%** | 594 | 512 | 252 | 75 | 305 | 159 | 116 | | |
| | **85 – 90%** | 700 | 530 | 214 | 79 | 278 | 124 | 101 | | |
| | **90 – 95%** | 377 | 268 | 125 | 35 | 187 | 80 | 55 | | |
| | **95 – 100%** | 16,288 | 16,537 | 18,038 | **18,878** | 17,591 | 18,395 | 18,643 | | |
| | **รวมทั้งสิ้น (ไฟล์)** | **19,200** | **19,200** | **19,200** | **19,200** | **19,200** | **19,200** | **19,200** | | |
| --- | |
| ### 2.2 ชุดข้อมูล Test Only (รวมทั้งหมด 3,840 ไฟล์) | |
| | ช่วงสเกลความแม่นยำ (%) | NeMo (Acc 100%) | NeMo (Acc 50–99%) | **NeMo (All Data)** | Whisper (Acc 100%) | Whisper (Acc 50–99%) | Whisper (All Data) | | |
| | :---: | :---: | :---: | :---: | :---: | :---: | :---: | | |
| | **0 – 5%** | 19 | 14 | **4** | 20 | 9 | 11 | | |
| | **5 – 10%** | 0 | 0 | 0 | 0 | 0 | 0 | | |
| | **10 – 15%** | 0 | 0 | 0 | 0 | 0 | 0 | | |
| | **15 – 20%** | 1 | 0 | 0 | 0 | 0 | 0 | | |
| | **20 – 25%** | 3 | 1 | 1 | 2 | 0 | 0 | | |
| | **25 – 30%** | 8 | 2 | 0 | 1 | 1 | 0 | | |
| | **30 – 35%** | 18 | 13 | 4 | 12 | 11 | 7 | | |
| | **35 – 40%** | 1 | 0 | 0 | 0 | 0 | 0 | | |
| | **40 – 45%** | 12 | 7 | 3 | 8 | 7 | 4 | | |
| | **45 – 50%** | 0 | 0 | 0 | 0 | 0 | 0 | | |
| | **50 – 55%** | 38 | 13 | 6 | 16 | 13 | 11 | | |
| | **55 – 60%** | 7 | 4 | 0 | 5 | 2 | 3 | | |
| | **60 – 65%** | 30 | 10 | 4 | 12 | 8 | 5 | | |
| | **65 – 70%** | 48 | 31 | 16 | 38 | 27 | 14 | | |
| | **70 – 75%** | 31 | 14 | 6 | 15 | 14 | 7 | | |
| | **75 – 80%** | 73 | 40 | 19 | 57 | 27 | 29 | | |
| | **80 – 85%** | 99 | 54 | 27 | 64 | 43 | 35 | | |
| | **85 – 90%** | 119 | 52 | 41 | 53 | 38 | 37 | | |
| | **90 – 95%** | 49 | 33 | 14 | 34 | 23 | 16 | | |
| | **95 – 100%** | 3,284 | 3,552 | **3,695** | 3,503 | 3,617 | 3,661 | | |
| | **รวมทั้งสิ้น (ไฟล์)** | **3,840** | **3,840** | **3,840** | **3,840** | **3,840** | **3,840** | | |
| --- | |
| ## 3. สรุปข้อสังเกตและผลกระทบของการ Fine-tune | |
| 1. **เปรียบเทียบ NeMo Pre-trained (ก่อน Fine-tune) vs NeMo Fine-tuned:** | |
| - **NeMo Pre-trained (รวม 19,200 ไฟล์):** ความแม่นยำคำอยู่ที่ **93.61%** (Char Acc 97.81%) | |
| - **หลัง Fine-tune ด้วย All Data (NeMo M3):** ความแม่นยำเพิ่มขึ้นเป็น **99.56%** (เพิ่มขึ้นก้าวกระโดดถึง **+5.95%**) | |
| 2. **การกระจุกตัวในกลุ่ม 95-100%:** | |
| - กระบวนการ Fine-tune ดึงจำนวนไฟล์ที่ทายแม่นยำสูง (95-100%) จาก 16,288 ไฟล์ เพิ่มขึ้นเป็น **18,878 ไฟล์** (คิดเป็น **98.32%** ของไฟล์เสียงทั้งหมด) | |
| 3. **สรุปความเร็วและความแม่นยำ:** | |
| - **NeMo (All Data)** เป็นโมเดลที่สมบูรณ์แบบที่สุด มีความแม่นยำสูงสุด **99.56%** และมีความเร็วการประมวลผลสูงสุด **RTF 0.0235 วินาที/ไฟล์** | |