Upload README.md with huggingface_hub
Browse files
README.md
CHANGED
|
@@ -1,6 +1,40 @@
|
|
| 1 |
-
#
|
|
|
|
| 2 |
|
| 3 |
-
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 4 |
|
| 5 |
## 🚀 วิธีดาวน์โหลดและติดตั้ง (Installation)
|
| 6 |
|
|
|
|
| 1 |
+
# Thai IndexTTS2
|
| 2 |
+
> **indextts2 thai** โมเดล TTS state of the art (sota) ปรับอารมณ์เสียงได้ (พอประมาณ)
|
| 3 |
|
| 4 |
+
อธิบายโมเดลนี้สั้นๆ มันคือ minimax speech เวอร์ชันที่ไม่มีใส่เสียงหัวเราะ เสียงร้องไห้ แค่นั้นแหละ เพราะนี่คือโมเดลที่ finetune จาก indextts2 ตัวต้นฉบับจาก billibilli
|
| 5 |
+
|
| 6 |
+
### 🌟 ความสามารถ
|
| 7 |
+
- โคลนเสียงได้ ซึ่งโคลนมาทั้งสำเนียงและอารมณ์
|
| 8 |
+
- ปรับ duration ได้ (แต่ไม่ค่อยแม่นยำ มี parameter ให้ปรับ แนะนำไปปรับแบบช้าหรือเร็วก็พอ)
|
| 9 |
+
- emo vector จุดสำคัญของโมเดลนี้ ที่โมเดลอื่นๆไม่มี สามารถ scale อารมณ์ได้ (ภาษาไทยตอนนี้ ทำได้ดีระดับนึง มีเพิ่ม thai emo vec ให้ปรับด้วย แต่ไม่ค่อยดีนัก)
|
| 10 |
+
- เพิ่มระบบตัดเสียงตัดคำอื่นๆ สำหรับภาษาไทยโดยเฉพาะ
|
| 11 |
+
|
| 12 |
+
### 🆚 เทียบกับ opensource โมเดลอื่นๆ ที่พูดไทยได้
|
| 13 |
+
- **vits:** ไวกว่ามาก แต่ซัดทิ้งได้เลย เสียงโคลนไม่ได้ และเสียงยาวไปก็พัง
|
| 14 |
+
- **f5tts thai:** ไว โคลนเสียงได้ แต่เสียงออกแนวค่อนข้างโรโบติก และ ไร้ชีวิตชีวา ปรับไรมากไม่ค่อยได้
|
| 15 |
+
- **vibevoice:** ดีและแม่นยำ เจนเสียงยาวเกือบครึ่งชั่วโมงได้ แต่เจนช้า แบบ ช้าโคตรๆ เอาไปใช้ทำไรมากไม่ได้สำหรับภาษาไทย error rate สำหรับ speaker 2 คนสูงมาก
|
| 16 |
+
- **omnivoice:** ดีที่สุดในปัจจุบัน โคลนเสียงตามสำเนียงและอารมณ์ได้ แต่ไม่มีโมเดลที่ "finetune เพิ่มเติมกับ dataset ภาษาไทย" ทำให้บางเสียงยังไม่ค่อยโอเค และ บางอารมณ์ก็แสดงออกมาไม่ค่อยชัด แต่ความเร็ว กับ ความแม่นยำ ถือว่าดีที่สุด
|
| 17 |
+
- **ของเรา indextts2:** แม้นจะช้ากว่า + แม่นยำต่ำกว่า แต่ด้วยการ finetune ผ่าน "dataset ที่ curated มาดี" ทำให้บางเสียงที่ gen ผมรู้สึกว่าดีกว่าตัว omnivoice มาก
|
| 18 |
+
|
| 19 |
+
### ✅ indextts2 เหมาะกับ
|
| 20 |
+
- คนที่อยากเทสต์ระบบ เผื่อเอาไป finetune เพิ่มเติมต่อ
|
| 21 |
+
- คนที่อยากทำเสียง dub ภาษาไทย ทำพากย์ไทยประโยคสั้นๆต่อครั้ง คุณภาพพอๆกับ vibevoice แต่เร็วกว่า vibevoice มาก
|
| 22 |
+
- ต้องการเสียงที่มีอารมณ์ (โหมด emo vec ไม่ค่อยแม่นยำ error rate ยังสูงอยู่ แต่โหมดอื่นถือว่าโอเค)
|
| 23 |
+
- ต้องการเสียงพากย์ เสียงสารคดี เสียงที่ "คุ้นเคย"
|
| 24 |
+
|
| 25 |
+
### ❌ ไม่เหมาะกับ
|
| 26 |
+
- สตรีมยาวๆ (error rate ยังสูง)
|
| 27 |
+
- ต้องการความเร็ว
|
| 28 |
+
- ไม่อยากเจนซ้ำบ่อยๆ
|
| 29 |
+
- ใช้ศัพท์ไทยผสมอังกฤษบ่อยๆ
|
| 30 |
+
|
| 31 |
+
### 🛠️ เกี่ยวกับการเทรน
|
| 32 |
+
- โปรเจกต์นี้ใช้เวลาประมาณ 2 เดือนหลังจากเทรนรอบแรก กินเวลา 99% ไปกับการหา dataset ผมหมายถึง.......ผม prompt ให้ claude หรือ gemini ไปหา dataset ให้ แล้วมันก็บอกว่า yessirrie แค่นั้นแหละ.....จากนั้นมันก็ลบ dataset ทิ้งไปหมดแล้ว lol
|
| 33 |
+
*(dataset ที่ใช้เทรนประมาณ 800 ชั่วโมงรวมการทำ pairing แล้ว)*
|
| 34 |
+
- อย่างไรก็ตามโมเดลยังสามารถ finetune เพิ่มเติมได้อยู่ ลองดูได้
|
| 35 |
+
- ตอนนี้มีโมเดลที่ค่อนข้างดีกว่าอย่าง omnivoice ในแง่ความเร็วและความแม่นยำ ขาดอีกนิดคือแค่อารมณ์เสียง + ข้อความอธิบาย speech ตอนนี้มีโปรเจกต์ opensource หลายโปรเจกต์ที่น่าเอามา finetune ต่อให้คุณภาพพอๆกับ gemini tts
|
| 36 |
+
|
| 37 |
+
---
|
| 38 |
|
| 39 |
## 🚀 วิธีดาวน์โหลดและติดตั้ง (Installation)
|
| 40 |
|