๋ผ์ด์ ์ค ๊ณ ์ง ์ด ์ฝ๋๋ฒ ์ด์ค ๋ฐ ๊ด๋ จ ๋ชจ๋ธ ๊ฐ์ค์น๋ FISH AUDIO RESEARCH LICENSE ์ ๋ฐ๋ผ ๋ฐฐํฌ๋ฉ๋๋ค. ์์ธํ ๋ด์ฉ์ LICENSE๋ฅผ ์ฐธ์กฐํ์ญ์์ค.
๋ฒ์ ๋ฉด์ฑ ์กฐํญ ๋น์ฌ๋ ์ฝ๋๋ฒ ์ด์ค์ ๋ถ๋ฒ์ ์ธ ์ฌ์ฉ์ ๋ํด ์ด๋ ํ ์ฑ ์๋ ์ง์ง ์์ต๋๋ค. ํด๋น ์ง์ญ์ DMCA ๋ฐ ๊ธฐํ ๊ด๋ จ ๋ฒ๋ฅ ์ ์ฐธ์กฐํ์ญ์์ค.
๋น ๋ฅธ ์์
๋ฌธ์ ์ ๊ตฌ
Fish Audio S2์ ๊ณต์ ๋ฌธ์์ ๋๋ค. ์ง์นจ์ ๋ฐ๋ผ ์ฝ๊ฒ ์์ํ์ญ์์ค.
SGLang ์๋ฒ๋ฅผ ์ฌ์ฉํ๋ ค๋ฉด SGLang-Omni README๋ฅผ ์ฐธ์กฐํ์ญ์์ค.
vLLM Omni ์๋ฒ๋ฅผ ์ฌ์ฉํ๋ ค๋ฉด vLLM-Omni Fish Speech S2 Pro Recipe์ ์ฌ์ฉ์ ๊ฐ์ด๋๋ฅผ ์ฐธ์กฐํ์ญ์์ค.
LLM Agent ๊ฐ์ด๋
๋จผ์ https://speech.fish.audio/ko/install/ ์ ์ฝ๊ณ ๋ฌธ์์ ๋ฐ๋ผ Fish Audio S2๋ฅผ ์ค์น ๋ฐ ๊ตฌ์ฑํ์ญ์์ค.
Fish Audio S2 Pro
์์ฑ ์์ฑ์ ๊ฒฝ๊ณ๋ฅผ ์ฌ์ ์ํ๋ ์ ๊ณ ์ต๊ณ ์ ๋ค๊ตญ์ด ํ ์คํธ ์์ฑ ๋ณํ(TTS) ์์คํ .
Fish Audio S2 Pro๋ Fish Audio์์ ๊ฐ๋ฐํ ์ต์ฒจ๋จ ๋ฉํฐ๋ชจ๋ฌ ๋ชจ๋ธ์ ๋๋ค. ์ ์ธ๊ณ 80๊ฐ ์ด์์ ์ธ์ด๋ฅผ ์์ฐ๋ฅด๋ 1,000๋ง ์๊ฐ ์ด์์ ๋ฐฉ๋ํ ์ค๋์ค ๋ฐ์ดํฐ๋ก ํ์ต๋์์ต๋๋ค. ํ์ ์ ์ธ ์ด์ค ์๊ธฐํ๊ท(Dual-AR) ์ํคํ ์ฒ์ ๊ฐํ ํ์ต(RL) ์ ๋ ฌ ๊ธฐ์ ์ ํตํด S2 Pro๋ ๊ทน๋๋ก ์์ฐ์ค๋ฝ๊ณ ์ฌ์ค์ ์ด๋ฉฐ ๊ฐ์ ์ด ํ๋ถํ ์์ฑ์ ์์ฑํ๋ฉฐ, ์คํ ์์ค์ ํดใญใผใบ๋ ์์ค ๊ฒฝ์ ๋ชจ๋์์ ์ ๋๋ฅผ ๋ฌ๋ฆฌ๊ณ ์์ต๋๋ค.
S2 Pro์ ํต์ฌ ๊ฐ์ ์ ์์ฐ์ด ํ๊ทธ(์: [whisper], [excited], [angry])๋ฅผ ํตํด ์ด์จ๊ณผ ๊ฐ์ ์ **ํ์ ๋จ์ด ์์ค(Sub-word Level)**์์ ๋งค์ฐ ์ธ๋ฐํ๊ฒ ์ธ๋ผ์ธ ์ ์ดํ ์ ์๋ค๋ ์ ์
๋๋ค. ๋ํ ๋ค์ค ํ์ ์์ฑ ๋ฐ ๊ธด ์ปจํ
์คํธ์ ๋ค์ค ํด ๋ํ ์์ฑ์ ๊ธฐ๋ณธ์ ์ผ๋ก ์ง์ํฉ๋๋ค.
์ง๊ธ ๋ฐ๋ก Fish Audio ๊ณต์ ์น์ฌ์ดํธ์์ ์จ๋ผ์ธ ๋ฐ๋ชจ๋ฅผ ์ฒดํํ๊ฑฐ๋, ๊ธฐ์ ๋ณด๊ณ ์ ๋ฐ ๋ธ๋ก๊ทธ ๊ฒ์๋ฌผ์ ํตํด ์์ธํ ์์๋ณด์ญ์์ค.
๋ชจ๋ธ ๋ณ์ฒด
| ๋ชจ๋ธ | ํฌ๊ธฐ | ๊ฐ์ฉ์ฑ | ์ค๋ช |
|---|---|---|---|
| S2-Pro | 4B ํ๋ผ๋ฏธํฐ | HuggingFace | ์ต๊ณ ์ ํ์ง๊ณผ ์์ ์ฑ์ ๊ฐ์ถ ๋ชจ๋ ๊ธฐ๋ฅ์ ๊ฐ์ถ ํ๋๊ทธ์ญ ๋ชจ๋ธ |
๋ชจ๋ธ์ ๋ํ ์์ธํ ๋ด์ฉ์ ๊ธฐ์ ๋ณด๊ณ ์๋ฅผ ์ฐธ์กฐํ์ญ์์ค.
๋ฒค์น๋งํฌ ๊ฒฐ๊ณผ
| ๋ฒค์น๋งํฌ | Fish Audio S2 |
|---|---|
| Seed-TTS Eval โ WER(์ค๊ตญ์ด) | 0.54% (์ ์ฒด ์ต๊ณ ) |
| Seed-TTS Eval โ WER(์์ด) | 0.99% (์ ์ฒด ์ต๊ณ ) |
| Audio Turing Test (์ง์นจ ํฌํจ) | 0.515 ํํ ํ๊ท |
| EmergentTTS-Eval โ ์น๋ฅ | 81.88% (์ ์ฒด ์ต๊ณ ) |
| Fish Instruction Benchmark โ TAR | 93.3% |
| Fish Instruction Benchmark โ ํ์ง | 4.51 / 5.0 |
| ๋ค๊ตญ์ด (MiniMax Testset) โ ์ต๊ณ WER | 24๊ฐ ์ธ์ด ์ค 11๊ฐ |
| ๋ค๊ตญ์ด (MiniMax Testset) โ ์ต๊ณ SIM | 24๊ฐ ์ธ์ด ์ค 17๊ฐ |
Seed-TTS Eval์์ S2๋ ํดใญใผใบ๋ ์์ค ์์คํ ์ ํฌํจํ ๋ชจ๋ ํ๊ฐ ๋ชจ๋ธ ์ค ๊ฐ์ฅ ๋ฎ์ WER์ ๋ฌ์ฑํ์ต๋๋ค: Qwen3-TTS (0.77/1.24), MiniMax Speech-02 (0.99/1.90), Seed-TTS (1.12/2.25). Audio Turing Test์์ S2์ 0.515๋ Seed-TTS (0.417) ๋๋น 24%, MiniMax-Speech (0.387) ๋๋น 33% ํฅ์๋ ์์น์ ๋๋ค. EmergentTTS-Eval์์ S2๋ ๋ถ์ฐจ ์ธ์ดํ(91.61% ์น๋ฅ ), ์๋ฌธ๋ฌธ(84.41%), ๊ตฌ๋ฌธ ๋ณต์ก์ฑ(83.39%) ๋ฑ์ ์ธก๋ฉด์์ ํนํ ๋๋๋ฌ์ง ์ฑ๊ณผ๋ฅผ ๋ณด์์ต๋๋ค.
ํ์ด๋ผ์ดํธ
์์ฐ์ด๋ฅผ ํตํ ์ด๋ฏธ์ธ ์ธ๋ผ์ธ ์ ์ด
S2 Pro๋ ์์ฑ์ ์ ๋ก ์๋ "์ํผ"์ ๋ถ์ฌํฉ๋๋ค. ๊ฐ๋จํ [tag] ๊ตฌ๋ฌธ์ ์ฌ์ฉํ์ฌ ํ
์คํธ์ ์ด๋ ์์น์๋ ๊ฐ์ ์ง์นจ์ ์ ํํ๊ฒ ์ฝ์
ํ ์ ์์ต๋๋ค.
- 15,000๊ฐ ์ด์์ ๊ณ ์ ํ๊ทธ ์ง์: ๊ณ ์ ๋ ์ฌ์ ์ค์ ์ ๊ตญํ๋์ง ์๊ณ ์์ ํ์์ ํ
์คํธ ์ค๋ช
์ ์ง์ํฉ๋๋ค.
[whisper in small voice](์์ ๋ชฉ์๋ฆฌ๋ก ์์ญ์),[professional broadcast tone](์ ๋ฌธ ๋ฐฉ์ก ํค),[pitch up](์๋์ด ๋์) ๋ฑ์ ์๋ํด ๋ณด์ญ์์ค. - ํ๋ถํ ๊ฐ์ ๋ผ์ด๋ธ๋ฌ๋ฆฌ:
[pause][emphasis][laughing][inhale][chuckle][tsk][singing][excited][laughing tone][interrupting][chuckling][excited tone][volume up][echo][angry][low volume][sigh][low voice][whisper][screaming][shouting][loud][surprised][short pause][exhale][delight][panting][audience laughter][with strong accent][volume down][clearing throat][sad][moaning][shocked]
ํ์ ์ ์ธ ์ด์ค ์๊ธฐํ๊ท (Dual-Autoregressive) ์ํคํ ์ฒ
S2 Pro๋ Decoder-only Transformer์ RVQ ์ค๋์ค ์ฝ๋ฑ(10๊ฐ ์ฝ๋๋ถ, ์ฝ 21Hz ํ๋ ์ ์๋)์ผ๋ก ๊ตฌ์ฑ๋ ๋ง์คํฐ-์ฌ๋ ์ด๋ธ ๋ฐฉ์์ Dual-AR ์ํคํ ์ฒ๋ฅผ ์ฑํํ์ต๋๋ค.
- Slow AR (4B ํ๋ผ๋ฏธํฐ): ์๊ฐ ์ถ์ ๋ฐ๋ผ ์๋ํ๋ฉฐ ํต์ฌ ์๋ฏธ ์ฝ๋๋ถ์ ์์ธกํฉ๋๋ค.
- Fast AR (400M ํ๋ผ๋ฏธํฐ): ๊ฐ ํ์์คํ ์์ ๋๋จธ์ง 9๊ฐ์ ์์ฐจ ์ฝ๋๋ถ์ ์์ฑํ์ฌ ๊ทน๋๋ก ์ ๊ตํ ์ํฅ ์ธ๋ถ ์ฌํญ์ ๋ณต์ํฉ๋๋ค.
์ด๋ฌํ ๋น๋์นญ ์ค๊ณ๋ ์ค๋์ค์ ์ต๊ณ ์ถฉ์ค๋๋ฅผ ๋ณด์ฅํ๋ ๋์์ ์ถ๋ก ์๋๋ฅผ ๋ํญ ํฅ์์ํต๋๋ค.
๊ฐํ ํ์ต (RL) ์ ๋ ฌ
S2 Pro๋ ์ฌํ ํ์ต ์ ๋ ฌ์ ์ํด Group Relative Policy Optimization (GRPO) ๊ธฐ์ ์ ์ฑํํ์ต๋๋ค. ๋ฐ์ดํฐ ์ ์ ๋ฐ ์ฃผ์ ์ฒ๋ฆฌ์ ์ฌ์ฉ๋ ๊ฒ๊ณผ ๋์ผํ ๋ชจ๋ธ ์ธํธ๋ฅผ ๋ณด์ ๋ชจ๋ธ(Reward Model)๋ก ์ง์ ์ฌ์ฉํจ์ผ๋ก์จ ์ฌ์ ํ์ต ๋ฐ์ดํฐ ๋ถํฌ์ ์ฌํ ํ์ต ๋ชฉํ ๊ฐ์ ๋ถ์ผ์น ๋ฌธ์ ๋ฅผ ์๋ฒฝํ๊ฒ ํด๊ฒฐํ์ต๋๋ค.
- ๋ค์ฐจ์ ๋ณด์ ์ ํธ: ์๋ฏธ ์ฒด๊ณ์ ์ ํ์ฑ, ์ง์นจ ์ค์ ๋ฅ๋ ฅ, ์ํฅ ์ ํธ๋ ์ ์ ๋ฐ ์์ ์ ์ฌ์ฑ์ ์ข ํฉ์ ์ผ๋ก ํ๊ฐํ์ฌ ์์ฑ๋ ์์ฑ์ ๋งค์ด๊ฐ ์ธ๊ฐ์ ์ง๊ด์ ๋ถํฉํ๋๋ก ๋ณด์ฅํฉ๋๋ค.
SGLang ๊ธฐ๋ฐ์ ๊ทนํ ์คํธ๋ฆฌ๋ฐ ์ถ๋ก ์ฑ๋ฅ
Dual-AR ์ํคํ ์ฒ๋ ํ์ค LLM ๊ตฌ์กฐ์ ๋ํ์ด๋ฏ๋ก S2 Pro๋ Continuous Batching, Paged KV Cache, CUDA Graph ๋ฐ RadixAttention ๊ธฐ๋ฐ Prefix Caching์ ํฌํจํ SGLang์ ๋ชจ๋ ์ถ๋ก ๊ฐ์ ๊ธฐ๋ฅ์ ๊ธฐ๋ณธ์ ์ผ๋ก ์ง์ํฉ๋๋ค.
๋จ์ผ NVIDIA H200 GPU ์ฑ๋ฅ ์งํ:
- ์ค์๊ฐ ๊ณ์ (RTF): 0.195
- ์ฒซ ์์ฑ ์ง์ฐ (TTFA): ์ฝ 100 ms
- ์ด๊ณ ์ ์ฒ๋ฆฌ๋: RTF < 0.5 ์ ์ง ์ ์ฒ๋ฆฌ๋ 3,000+ acoustic tokens/s ๋ฌ์ฑ
๊ฐ๋ ฅํ ๋ค๊ตญ์ด ์ง์
S2 Pro๋ ์์๋ ํน์ ์ธ์ด ์ฒ๋ฆฌ๊ฐ ํ์ ์๋ ๊ณ ํ์ง ํฉ์ฑ์ 80๊ฐ ์ด์์ ์ธ์ด์์ ์ง์ํฉ๋๋ค.
- 1๊ณ์ธต (Tier 1): ์ผ๋ณธ์ด (ja), ์์ด (en), ์ค๊ตญ์ด (zh)
- 2๊ณ์ธต (Tier 2): ํ๊ตญ์ด (ko), ์คํ์ธ์ด (es), ํฌ๋ฅดํฌ๊ฐ์ด (pt), ์๋์ด (ar), ๋ฌ์์์ด (ru), ํ๋์ค์ด (fr), ๋ ์ผ์ด (de)
- ๊ธ๋ก๋ฒ ์ปค๋ฒ๋ฆฌ์ง: sv, it, tr, no, nl, cy, eu, ca, da, gl, ta, hu, fi, pl, et, hi, la, ur, th, vi, jw, bn, yo, xsl, cs, sw, nn, he, ms, uk, id, kk, bg, lv, my, tl, sk, ne, fa, af, el, bo, hr, ro, sn, mi, yi, am, be, km, is, az, sd, br, sq, ps, mn, ht, ml, sr, sa, te, ka, bs, pa, lt, kn, si, hy, mr, as, gu, fo ๋ฑ.
๋ค์ดํฐ๋ธ ๋ค์ค ํ์ ์์ฑ
Fish Audio S2๋ฅผ ์ฌ์ฉํ๋ฉด ์ฌ์ฉ์๊ฐ ์ฌ๋ฌ ํ์๊ฐ ํฌํจ๋ ์ฐธ์กฐ ์ค๋์ค๋ฅผ ์
๋ก๋ํ ์ ์์ผ๋ฉฐ, ๋ชจ๋ธ์ <|speaker:i|> ํ ํฐ์ ํตํด ๊ฐ ํ์์ ํน์ง์ ์ฒ๋ฆฌํฉ๋๋ค. ์ดํ ํ์ ID ํ ํฐ์ ์ฌ์ฉํ์ฌ ๋ชจ๋ธ์ ํํ์ ์ ์ดํจ์ผ๋ก์จ ํ ๋ฒ์ ์์ฑ์ ์ฌ๋ฌ ํ์๋ฅผ ํฌํจํ ์ ์์ต๋๋ค. ๋ ์ด์ ํ์๋ง๋ค ๋ณ๋์ ์ฐธ์กฐ ์ค๋์ค๋ฅผ ์
๋ก๋ํ๊ณ ์์ฑ์ ์์ฑํ ํ์๊ฐ ์์ต๋๋ค.
๋ค์ค ํด ๋ํ ์์ฑ
๋ชจ๋ธ ์ปจํ ์คํธ ํ์ฅ์ ํ์ ์ด ์ด์ ์ด์ ์ ๋ณด์ ๋์์ ๋ฐ์ ํ์ ์์ฑ ๋ด์ฉ์ ํํ๋ ฅ์ ๋์ด๊ณ ์ฝํ ์ธ ์ ์์ฐ์ค๋ฌ์์ ํฅ์์ํฌ ์ ์์ต๋๋ค.
๊ณ ์ ์์ฑ ๋ณต์
Fish Audio S2๋ ์งง์ ์ฐธ์กฐ ์ํ(๋ณดํต 10-30์ด)์ ์ฌ์ฉํ ์ ํํ ์์ฑ ๋ณต์ ๋ฅผ ์ง์ํฉ๋๋ค. ๋ชจ๋ธ์ ์์, ๋งํ๊ธฐ ์คํ์ผ ๋ฐ ๊ฐ์ ์ ๊ฒฝํฅ์ ํฌ์ฐฉํ์ฌ ์ถ๊ฐ์ ์ธ ๋ฏธ์ธ ์กฐ์ ์์ด๋ ์ฌ์ค์ ์ด๊ณ ์ผ๊ด๋ ๋ณต์ ์์ฑ์ ์์ฑํฉ๋๋ค. SGLang ์๋ฒ ์ฌ์ฉ์ ๋ํด์๋ SGLang-Omni README๋ฅผ ์ฐธ์กฐํ์ญ์์ค.
๊ฐ์ฌ์ ๋ง
๊ธฐ์ ๋ณด๊ณ ์
@misc{fish-speech-v1.4,
title={Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis},
author={Shijia Liao and Yuxuan Wang and Tianyu Li and Yifan Cheng and Ruoyi Zhang and Rongzhi Zhou and Yijin Xing},
year={2024},
eprint={2411.01156},
archivePrefix={arXiv},
primaryClass={cs.SD},
url={https://arxiv.org/abs/2411.01156},
}
@misc{liao2026fishaudios2technical,
title={Fish Audio S2 Technical Report},
author={Shijia Liao and Yuxuan Wang and Songting Liu and Yifan Cheng and Ruoyi Zhang and Tianyu Li and Shidong Li and Yisheng Zheng and Xingwei Liu and Qingzheng Wang and Zhizhuo Zhou and Jiahua Liu and Xin Chen and Dawei Han},
year={2026},
eprint={2603.08823},
archivePrefix={arXiv},
primaryClass={cs.SD},
url={https://arxiv.org/abs/2603.08823},
}