williampike commited on
Commit
b5c3f82
·
verified ·
1 Parent(s): 031a0cb

Upload README.md with huggingface_hub

Browse files
Files changed (1) hide show
  1. README.md +36 -2
README.md CHANGED
@@ -1,6 +1,40 @@
1
- # Index TTS Project
 
2
 
3
- (เพิ่มคำอธิบายโปรจกต์ที่นี่)
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
4
 
5
  ## 🚀 วิธีดาวน์โหลดและติดตั้ง (Installation)
6
 
 
1
+ # Thai IndexTTS2
2
+ > **indextts2 thai** โมเดล TTS state of the art (sota) ปรับอารมณ์เสียงได้ (พอประมาณ)
3
 
4
+ อธิบายโดลนี้สั้นๆ มันคือ minimax speech เวอรชันที่ไม่มีใส่เสียงหัวเราะ เสียงร้องไห้ แค่ั้นแหละ เพราะนี่คือโมเดลที่ finetune จาก indextts2 ตัวต้นฉบับจาก billibilli
5
+
6
+ ### 🌟 ความสามารถ
7
+ - โคลนเสียงได้ ซึ่งโคลนมาทั้งสำเนียงและอารมณ์
8
+ - ปรับ duration ได้ (แต่ไม่ค่อยแม่นยำ มี parameter ให้ปรับ แนะนำไปปรับแบบช้าหรือเร็วก็พอ)
9
+ - emo vector จุดสำคัญของโมเดลนี้ ที่โมเดลอื่นๆไม่มี สามารถ scale อารมณ์ได้ (ภาษาไทยตอนนี้ ทำได้ดีระดับนึง มีเพิ่ม thai emo vec ให้ปรับด้วย แต่ไม่ค่อยดีนัก)
10
+ - เพิ่มระบบตัดเสียงตัดคำอื่นๆ สำหรับภาษาไทยโดยเฉพาะ
11
+
12
+ ### 🆚 เทียบกับ opensource โมเดลอื่นๆ ที่พูดไทยได้
13
+ - **vits:** ไวกว่ามาก แต่ซัดทิ้งได้เลย เสียงโคลนไม่ได้ และเสียงยาวไปก็พัง
14
+ - **f5tts thai:** ไว โคลนเสียงได้ แต่เสียงออกแนวค่อนข้างโรโบติก และ ไร้ชีวิตชีวา ปรับไรมากไม่ค่อยได้
15
+ - **vibevoice:** ดีและแม่นยำ เจนเสียงยาวเกือบครึ่งชั่วโมงได้ แต่เจนช้า แบบ ช้าโคตรๆ เอาไปใช้ทำไรมากไม่ได้สำหรับภาษาไทย error rate สำหรับ speaker 2 คนสูงมาก
16
+ - **omnivoice:** ดีที่สุดในปัจจุบัน โคลนเสียงตามสำเนียงและอารมณ์ได้ แต่ไม่มีโมเดลที่ "finetune เพิ่มเติมกับ dataset ภาษาไทย" ทำให้บางเสียงยังไม่ค่อยโอเค และ บางอารมณ์ก็แสดงออกมาไม่ค่อยชัด แต่ความเร็ว กับ ความแม่นยำ ถือว่าดีที่สุด
17
+ - **ของเรา indextts2:** แม้นจะช้ากว่า + แม่นยำต่ำกว่า แต่ด้วยการ finetune ผ่าน "dataset ที่ curated มาดี" ทำให้บางเสียงที่ gen ผมรู้สึกว่าดีกว่าตัว omnivoice มาก
18
+
19
+ ### ✅ indextts2 เหมาะกับ
20
+ - คนที่อยากเทสต์ระบบ เผื่อเอาไป finetune เพิ่มเติมต่อ
21
+ - คนที่อยากทำเสียง dub ภาษาไทย ทำพากย์ไทยประโยคสั้นๆต่อครั้ง คุณภาพพอๆกับ vibevoice แต่เร็วกว่า vibevoice มาก
22
+ - ต้องการเสียงที่มีอารมณ์ (โหมด emo vec ไม่ค่อยแม่นยำ error rate ยังสูงอยู่ แต่โหมดอื่นถือว่าโอเค)
23
+ - ต้องการเสียงพากย์ เสียงสารคดี เสียงที่ "คุ้นเคย"
24
+
25
+ ### ❌ ไม่เหมาะกับ
26
+ - สตรีมยาวๆ (error rate ยังสูง)
27
+ - ต้องการความเร็ว
28
+ - ไม่อยากเจนซ้ำบ่อยๆ
29
+ - ใช้ศัพท์ไทยผสมอังกฤษบ่อยๆ
30
+
31
+ ### 🛠️ เกี่ยวกับการเทรน
32
+ - โปรเจกต์นี้ใช้เวลาประมาณ 2 เดือนหลังจากเทรนรอบแรก กินเวลา 99% ไปกับการหา dataset ผมหมายถึง.......ผม prompt ให้ claude หรือ gemini ไปหา dataset ให้ แล้วมันก็บอกว่า yessirrie แค่นั้นแหละ.....จากนั้นมันก็ลบ dataset ทิ้งไปหมดแล้ว lol
33
+ *(dataset ที่ใช้เทรนประมาณ 800 ชั่วโมงรวมการทำ pairing แล้ว)*
34
+ - อย่างไรก็ตามโมเดลยังสามารถ finetune เพิ่มเติมได้อยู่ ลองดูได้
35
+ - ตอนนี้มีโมเดลที่ค่อนข้างดีกว่าอย่าง omnivoice ในแง่ความเร็วและความแม่นยำ ขาดอีกนิดคือแค่อารมณ์เสียง + ข้อความอธิบาย speech ตอนนี้มีโปรเจกต์ opensource หลายโปรเจกต์ที่น่าเอามา finetune ต่อให้คุณภาพพอๆกับ gemini tts
36
+
37
+ ---
38
 
39
  ## 🚀 วิธีดาวน์โหลดและติดตั้ง (Installation)
40