Text-to-Speech
Safetensors
cutetts
voice-cloning
CuteTTS / README_zh.md
MinMinLiang's picture
Upload 16 files
5104922 verified
|
Raw
History Blame Contribute Delete
3.81 kB

EN | 中文

CuteTTS:基于连续潜变量自回归建模的高效高质量语音合成

GitHub paper

CuteTTS logo

  • 轻量级(约 2.3 亿参数)的连续自回归 TTS 模型,可在 GPU、CPU 和 Apple 芯片上高效运行。
  • 超低延迟:在 NVIDIA RTX 4090 上,首个音频块延迟约 40 ms,生成速度约为实时的 9 倍。
  • 出色的语音质量和音色克隆性能。
  • 提供网页 Demo、Python API 和 CLI。
  • 多语言支持:英语、中文、法语、德语、西班牙语。

CuteTTS 模型架构
CuteTTS performance

零样本音色克隆性能

模型 参数量 LibriSpeech test-clean WER (%) ↓ LibriSpeech test-clean SIM ↑ Seed-TTS EN WER (%) ↓ Seed-TTS EN SIM ↑ Seed-TTS ZH WER (%) ↓ Seed-TTS ZH SIM ↑
MOSS‑TTS 8B 1.98 67.7 1.84 70.9 1.37 77.0
Qwen3‑TTS 1.7B 2.35 70.3 1.66 71.4 0.91 77.0
FireRedTTS‑2 1.5B 4.32 64.2 1.95 66.5 1.14 73.6
MOSS‑TTS‑Nano 0.1B 4.10 48.4 4.62 49.9 3.13 64.3
F5‑TTS 0.3B 2.42 66.0 1.83 67.0 1.56 76.0
ZipVoice 0.1B 2.05 67.4 1.70 69.7 1.40 75.1
IndexTTS2 1.5B 2.47 70.0 2.22 70.6 1.02 76.5
CosyVoice 3 0.5B 1.99 69.7 2.02 71.8 1.16 78.0
VoxCPM2 2B 3.01 74.0 1.84 75.3 0.97 79.5
VibeVoice 1.5B 3.04 68.9 1.16 74.4
DiTAR 0.6B 2.39 67.0 1.69 73.5 1.02 75.3
VibeVoice‑Realtime 0.5B 2.00 69.5 2.05 63.3
Pocket TTS 0.1B 1.59 49.1 1.63 50.7
CuteTTS 0.2B 2.16 78.9 2.04 76.5 1.41 77.8
CuteTTS‑distill 0.2B 2.41 76.8 2.03 74.2 1.47 75.6