| --- |
| license: apache-2.0 |
| pipeline_tag: text-to-speech |
| language: |
| - en |
| - zh |
| - fr |
| - de |
| - es |
| tags: |
| - text-to-speech |
| - voice-cloning |
| --- |
| |
| [EN](README.md) | [δΈζ](README_zh.md) |
|
|
| ## CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents |
|
|
| <a href="https://github.com/OPPO-Mente-Lab/CuteTTS"><img src="https://img.shields.io/badge/GitHub-CuteTTS-black?logo=github" alt="GitHub"></a> |
| <a href="https://arxiv.org/abs/2608.08638"><img src="https://img.shields.io/badge/Paper-CuteTTS-red" alt="paper"></a> |
|
|
|  |
|
|
| - A lightweight (~230M-parameter) continuous autoregressive TTS model that runs efficiently on GPUs, CPUs, and Apple silicon. |
| - Ultra-low latency: ~40 ms to the first audio chunk and a throughput of ~9Γ real time on an NVIDIA RTX 4090. |
| - Excellent speech quality and voice cloning performance. |
| - Web demo, Python API, and CLI. |
| - Multilingual support: English, Chinese, French, German, and Spanish. |
|
|
| <br> |
|
|
| <img src="assets/cute_backbone.png" alt="CuteTTS architecture" width="100%"> |
|
|
| <br> |
|
|
| <img src="assets/performance.svg" alt="CuteTTS performance" width="85%"> |
|
|
|
|
| ## Zero-shot voice-cloning performance |
|
|
| | <sub>Model</sub> | <sub>Params.</sub> | <sub>LibriSpeech test-clean WER (%) β</sub> | <sub>LibriSpeech test-clean SIM β</sub> | <sub>Seed-TTS EN WER (%) β</sub> | <sub>Seed-TTS EN SIM β</sub> | <sub>Seed-TTS ZH WER (%) β</sub> | <sub>Seed-TTS ZH SIM β</sub> | |
| |:--|--:|--:|--:|--:|--:|--:|--:| |
| | <sub>MOSS‑TTS</sub> | <sub>8B</sub> | <sub>1.98</sub> | <sub>67.7</sub> | <sub>1.84</sub> | <sub>70.9</sub> | <sub>1.37</sub> | <sub>77.0</sub> | |
| | <sub>Qwen3‑TTS</sub> | <sub>1.7B</sub> | <sub>2.35</sub> | <sub>70.3</sub> | <sub>1.66</sub> | <sub>71.4</sub> | <sub><strong>0.91</strong></sub> | <sub>77.0</sub> | |
| | <sub>FireRedTTS‑2</sub> | <sub>1.5B</sub> | <sub>4.32</sub> | <sub>64.2</sub> | <sub>1.95</sub> | <sub>66.5</sub> | <sub>1.14</sub> | <sub>73.6</sub> | |
| | <sub>MOSS‑TTS‑Nano</sub> | <sub>0.1B</sub> | <sub>4.10</sub> | <sub>48.4</sub> | <sub>4.62</sub> | <sub>49.9</sub> | <sub>3.13</sub> | <sub>64.3</sub> | |
| | <sub>F5‑TTS</sub> | <sub>0.3B</sub> | <sub>2.42</sub> | <sub>66.0</sub> | <sub>1.83</sub> | <sub>67.0</sub> | <sub>1.56</sub> | <sub>76.0</sub> | |
| | <sub>ZipVoice</sub> | <sub>0.1B</sub> | <sub>2.05</sub> | <sub>67.4</sub> | <sub>1.70</sub> | <sub>69.7</sub> | <sub>1.40</sub> | <sub>75.1</sub> | |
| | <sub>IndexTTS2</sub> | <sub>1.5B</sub> | <sub>2.47</sub> | <sub>70.0</sub> | <sub>2.22</sub> | <sub>70.6</sub> | <sub>1.02</sub> | <sub>76.5</sub> | |
| | <sub>CosyVoice 3</sub> | <sub>0.5B</sub> | <sub>1.99</sub> | <sub>69.7</sub> | <sub>2.02</sub> | <sub>71.8</sub> | <sub>1.16</sub> | <sub>78.0</sub> | |
| | <sub>VoxCPM2</sub> | <sub>2B</sub> | <sub>3.01</sub> | <sub>74.0</sub> | <sub>1.84</sub> | <sub>75.3</sub> | <sub>0.97</sub> | <sub><strong>79.5</strong></sub> | |
| | <sub>VibeVoice</sub> | <sub>1.5B</sub> | <sub>β</sub> | <sub>β</sub> | <sub>3.04</sub> | <sub>68.9</sub> | <sub>1.16</sub> | <sub>74.4</sub> | |
| | <sub>DiTAR</sub> | <sub>0.6B</sub> | <sub>2.39</sub> | <sub>67.0</sub> | <sub>1.69</sub> | <sub>73.5</sub> | <sub>1.02</sub> | <sub>75.3</sub> | |
| | <sub>VibeVoice‑Realtime</sub> | <sub>0.5B</sub> | <sub>2.00</sub> | <sub>69.5</sub> | <sub>2.05</sub> | <sub>63.3</sub> | <sub>β</sub> | <sub>β</sub> | |
| | <sub>Pocket TTS</sub> | <sub>0.1B</sub> | <sub><strong>1.59</strong></sub> | <sub>49.1</sub> | <sub><strong>1.63</strong></sub> | <sub>50.7</sub> | <sub>β</sub> | <sub>β</sub> | |
| | | | | | | | | | |
| | <sub><strong>CuteTTS</strong></sub> | <sub>0.2B</sub> | <sub>2.16</sub> | <sub><strong>78.9</strong></sub> | <sub>2.04</sub> | <sub><strong>76.5</strong></sub> | <sub>1.41</sub> | <sub>77.8</sub> | |
| | <sub><strong>CuteTTS‑distill</strong></sub> | <sub>0.2B</sub> | <sub>2.41</sub> | <sub>76.8</sub> | <sub>2.03</sub> | <sub>74.2</sub> | <sub>1.47</sub> | <sub>75.6</sub> | |
|
|