# การประเมินและเปรียบเทียบโมเดลจดจำเสียงพูดภาษาไทยสำหรับผู้สูงอายุ (Thai Elderly ASR Evaluation)
เอกสารสรุปผลการประเมินประสิทธิภาพและแจกแจงสเกลความแม่นยำ (Accuracy Distribution) ของโมเดล ASR รวมถึงเปรียบเทียบระหว่าง **NeMo Pre-trained (ก่อน Fine-tune)** และโมเดลที่ผ่านการ Fine-tune ด้วยชุดข้อมูลฝึกสอนเกณฑ์ต่างๆ
---
## 1. ตารางสรุปภาพรวมประสิทธิภาพโมเดล (Overall Performance)
| สถาปัตยกรรม (Architecture) | ชุดข้อมูลที่ใช้ฝึกสอน (Training Data Criteria) | ชุดข้อมูลประเมิน | **ความแม่นยำคำ %**
*(Thai Word Acc)* | **ความแม่นยำอักษร %**
*(Char Acc)* | **WER**
*(คำผิด)* | **CER**
*(อักษรผิด)* | **RTF**
*(ความเร็ว/วินาที)* |
| :--- | :--- | :---: | :---: | :---: | :---: | :---: | :---: |
| **NeMo Pre-trained**
*(115M Params)* | **Pre-trained Only** *(ก่อน Fine-tune)* | Evaluation Set (19,200) | **93.61%** | **97.81%** | 0.0639 | 0.0219 | - |
| --- | --- | --- | --- | --- | --- | --- | --- |
| **NeMo Fine-tuned**
*(115M Params)* | **Acc 100% Only** *(ข้อมูลถอดถูกต้อง 100%)* | Test Only (3,840) | 95.78% | 98.27% | 0.0422 | 0.0173 | **0.0259s** |
| | | Train + Test (19,200) | 95.88% | 98.34% | 0.0412 | 0.0166 | **0.0242s** |
| | **Acc 50–99% Only** *(ข้อมูลถอดถูกต้อง 50–99%)* | Test Only (3,840) | 97.79% | 99.16% | 0.0221 | 0.0084 | **0.0254s** |
| | | Train + Test (19,200) | 98.20% | 99.31% | 0.0180 | 0.0069 | **0.0244s** |
| | **All Data** *(ข้อมูลทั้งหมดรวมทุกเกณฑ์)* | Test Only (3,840) | 99.04% | 99.59% | 0.0096 | 0.0041 | **0.0238s** |
| | | Train + Test (19,200) | **99.56%** | **99.80%** | **0.0044** | **0.0020** | **0.0235s** |
| --- | --- | --- | --- | --- | --- | --- | --- |
| **Whisper (CT2)**
*(809M Params)* | **Acc 100% Only** *(ข้อมูลถอดถูกต้อง 100%)* | Test Only (3,840) | 97.34% | 99.14% | 0.0266 | 0.0086 | 0.1570s |
| | | Train + Test (19,200) | 97.46% | 99.19% | 0.0254 | 0.0081 | 0.1547s |
| | **Acc 50–99% Only** *(ข้อมูลถอดถูกต้อง 50–99%)* | Test Only (3,840) | 98.28% | 99.51% | 0.0172 | 0.0049 | 0.1561s |
| | | Train + Test (19,200) | 98.68% | 99.61% | 0.0132 | 0.0039 | 0.1555s |
| | **All Data** *(ข้อมูลทั้งหมดรวมทุกเกณฑ์)* | Test Only (3,840) | 98.61% | 99.59% | 0.0139 | 0.0041 | 0.1567s |
| | | Train + Test (19,200) | 99.13% | 99.72% | 0.0087 | 0.0028 | 0.1455s |
---
## 2. การแจกแจงระดับสเกลความแม่นยำทุกๆ 5% (Accuracy Scale Distribution)
ตารางแสดง **จำนวนไฟล์เสียง** ที่ตกลงในแต่ละช่วงความแม่นยำ (สเกลละ 5%)
### 2.1 เปรียบเทียบรวมทุกโมเดล (ชุดข้อมูล 19,200 ไฟล์เท่ากัน)
| ช่วงสเกลความแม่นยำ (%) | NeMo Pre-trained | NeMo (Acc 100%) | NeMo (Acc 50–99%) | **NeMo (All Data)** | Whisper (Acc 100%) | Whisper (Acc 50–99%) | Whisper (All Data) |
| :---: | :---: | :---: | :---: | :---: | :---: | :---: | :---: |
| **0 – 5%** | 63 | 102 | 51 | **7** | 90 | 38 | 27 |
| **5 – 10%** | 0 | 0 | 0 | 0 | 0 | 0 | 0 |
| **10 – 15%** | 4 | 5 | 0 | 0 | 1 | 0 | 0 |
| **15 – 20%** | 3 | 5 | 6 | 1 | 2 | 0 | 0 |
| **20 – 25%** | 9 | 12 | 3 | 2 | 4 | 0 | 0 |
| **25 – 30%** | 25 | 48 | 20 | 4 | 24 | 16 | 11 |
| **30 – 35%** | 65 | 86 | 44 | 10 | 59 | 40 | 20 |
| **35 – 40%** | 8 | 5 | 2 | 0 | 2 | 1 | 0 |
| **40 – 45%** | 40 | 54 | 21 | 5 | 21 | 20 | 11 |
| **45 – 50%** | 2 | 1 | 0 | 0 | 0 | 0 | 0 |
| **50 – 55%** | 98 | 197 | 77 | 16 | 81 | 51 | 32 |
| **55 – 60%** | 52 | 48 | 10 | 1 | 33 | 4 | 7 |
| **60 – 65%** | 175 | 142 | 50 | 7 | 89 | 43 | 22 |
| **65 – 70%** | 228 | 215 | 109 | 36 | 149 | 109 | 59 |
| **70 – 75%** | 155 | 135 | 52 | 11 | 79 | 39 | 24 |
| **75 – 80%** | 304 | 298 | 126 | 33 | 205 | 81 | 72 |
| **80 – 85%** | 594 | 512 | 252 | 75 | 305 | 159 | 116 |
| **85 – 90%** | 700 | 530 | 214 | 79 | 278 | 124 | 101 |
| **90 – 95%** | 377 | 268 | 125 | 35 | 187 | 80 | 55 |
| **95 – 100%** | 16,288 | 16,537 | 18,038 | **18,878** | 17,591 | 18,395 | 18,643 |
| **รวมทั้งสิ้น (ไฟล์)** | **19,200** | **19,200** | **19,200** | **19,200** | **19,200** | **19,200** | **19,200** |
---
### 2.2 ชุดข้อมูล Test Only (รวมทั้งหมด 3,840 ไฟล์)
| ช่วงสเกลความแม่นยำ (%) | NeMo (Acc 100%) | NeMo (Acc 50–99%) | **NeMo (All Data)** | Whisper (Acc 100%) | Whisper (Acc 50–99%) | Whisper (All Data) |
| :---: | :---: | :---: | :---: | :---: | :---: | :---: |
| **0 – 5%** | 19 | 14 | **4** | 20 | 9 | 11 |
| **5 – 10%** | 0 | 0 | 0 | 0 | 0 | 0 |
| **10 – 15%** | 0 | 0 | 0 | 0 | 0 | 0 |
| **15 – 20%** | 1 | 0 | 0 | 0 | 0 | 0 |
| **20 – 25%** | 3 | 1 | 1 | 2 | 0 | 0 |
| **25 – 30%** | 8 | 2 | 0 | 1 | 1 | 0 |
| **30 – 35%** | 18 | 13 | 4 | 12 | 11 | 7 |
| **35 – 40%** | 1 | 0 | 0 | 0 | 0 | 0 |
| **40 – 45%** | 12 | 7 | 3 | 8 | 7 | 4 |
| **45 – 50%** | 0 | 0 | 0 | 0 | 0 | 0 |
| **50 – 55%** | 38 | 13 | 6 | 16 | 13 | 11 |
| **55 – 60%** | 7 | 4 | 0 | 5 | 2 | 3 |
| **60 – 65%** | 30 | 10 | 4 | 12 | 8 | 5 |
| **65 – 70%** | 48 | 31 | 16 | 38 | 27 | 14 |
| **70 – 75%** | 31 | 14 | 6 | 15 | 14 | 7 |
| **75 – 80%** | 73 | 40 | 19 | 57 | 27 | 29 |
| **80 – 85%** | 99 | 54 | 27 | 64 | 43 | 35 |
| **85 – 90%** | 119 | 52 | 41 | 53 | 38 | 37 |
| **90 – 95%** | 49 | 33 | 14 | 34 | 23 | 16 |
| **95 – 100%** | 3,284 | 3,552 | **3,695** | 3,503 | 3,617 | 3,661 |
| **รวมทั้งสิ้น (ไฟล์)** | **3,840** | **3,840** | **3,840** | **3,840** | **3,840** | **3,840** |
---
## 3. สรุปข้อสังเกตและผลกระทบของการ Fine-tune
1. **เปรียบเทียบ NeMo Pre-trained (ก่อน Fine-tune) vs NeMo Fine-tuned:**
- **NeMo Pre-trained (รวม 19,200 ไฟล์):** ความแม่นยำคำอยู่ที่ **93.61%** (Char Acc 97.81%)
- **หลัง Fine-tune ด้วย All Data (NeMo M3):** ความแม่นยำเพิ่มขึ้นเป็น **99.56%** (เพิ่มขึ้นก้าวกระโดดถึง **+5.95%**)
2. **การกระจุกตัวในกลุ่ม 95-100%:**
- กระบวนการ Fine-tune ดึงจำนวนไฟล์ที่ทายแม่นยำสูง (95-100%) จาก 16,288 ไฟล์ เพิ่มขึ้นเป็น **18,878 ไฟล์** (คิดเป็น **98.32%** ของไฟล์เสียงทั้งหมด)
3. **สรุปความเร็วและความแม่นยำ:**
- **NeMo (All Data)** เป็นโมเดลที่สมบูรณ์แบบที่สุด มีความแม่นยำสูงสุด **99.56%** และมีความเร็วการประมวลผลสูงสุด **RTF 0.0235 วินาที/ไฟล์**