[EN](README.md) | [中文](README_zh.md) ## CuteTTS:基于连续潜变量自回归建模的高效高质量语音合成 GitHub paper ![CuteTTS logo](assets/logo.png) - 轻量级(约 2.3 亿参数)的连续自回归 TTS 模型,可在 GPU、CPU 和 Apple 芯片上高效运行。 - 超低延迟:在 NVIDIA RTX 4090 上,首个音频块延迟约 40 ms,生成速度约为实时的 9 倍。 - 出色的语音质量和音色克隆性能。 - 提供网页 Demo、Python API 和 CLI。 - 多语言支持:英语、中文、法语、德语、西班牙语。
CuteTTS 模型架构
CuteTTS performance ## 零样本音色克隆性能 | 模型 | 参数量 | LibriSpeech test-clean WER (%) ↓ | LibriSpeech test-clean SIM ↑ | Seed-TTS EN WER (%) ↓ | Seed-TTS EN SIM ↑ | Seed-TTS ZH WER (%) ↓ | Seed-TTS ZH SIM ↑ | |:--|--:|--:|--:|--:|--:|--:|--:| | MOSS‑TTS | 8B | 1.98 | 67.7 | 1.84 | 70.9 | 1.37 | 77.0 | | Qwen3‑TTS | 1.7B | 2.35 | 70.3 | 1.66 | 71.4 | 0.91 | 77.0 | | FireRedTTS‑2 | 1.5B | 4.32 | 64.2 | 1.95 | 66.5 | 1.14 | 73.6 | | MOSS‑TTS‑Nano | 0.1B | 4.10 | 48.4 | 4.62 | 49.9 | 3.13 | 64.3 | | F5‑TTS | 0.3B | 2.42 | 66.0 | 1.83 | 67.0 | 1.56 | 76.0 | | ZipVoice | 0.1B | 2.05 | 67.4 | 1.70 | 69.7 | 1.40 | 75.1 | | IndexTTS2 | 1.5B | 2.47 | 70.0 | 2.22 | 70.6 | 1.02 | 76.5 | | CosyVoice 3 | 0.5B | 1.99 | 69.7 | 2.02 | 71.8 | 1.16 | 78.0 | | VoxCPM2 | 2B | 3.01 | 74.0 | 1.84 | 75.3 | 0.97 | 79.5 | | VibeVoice | 1.5B | | | 3.04 | 68.9 | 1.16 | 74.4 | | DiTAR | 0.6B | 2.39 | 67.0 | 1.69 | 73.5 | 1.02 | 75.3 | | VibeVoice‑Realtime | 0.5B | 2.00 | 69.5 | 2.05 | 63.3 | | | | Pocket TTS | 0.1B | 1.59 | 49.1 | 1.63 | 50.7 | | | | | | | | | | | | | CuteTTS | 0.2B | 2.16 | 78.9 | 2.04 | 76.5 | 1.41 | 77.8 | | CuteTTS‑distill | 0.2B | 2.41 | 76.8 | 2.03 | 74.2 | 1.47 | 75.6 |