--- language: - zh license: apache-2.0 tags: - text-to-speech - tts - axera - ax650 pipeline_tag: text-to-speech --- # KAN-TTS · AX650 交付包(C++ SDK) 将 [modelscope/KAN-TTS](https://github.com/modelscope/KAN-TTS)(SamBERT + HiFi-GAN,中文 16k,发音人 zhitian_emo)部署到 AX650(NPU3)的 C++ 推理包。 ## 示例音频 | 文本 | 音频 | |------|------| | 北京今天天气怎么样 | [example/out.wav](example/out.wav) | | 八十万对六十万,优势在我! | [example/youshi.wav](example/youshi.wav) | | 满江红(怒发冲冠…) | [example/manjianghong.wav](example/manjianghong.wav) | ## 架构(全 NPU,除 PNCA 解码) | 模块 | 位置 | 说明 | |------|------|------| | 前端(文本→符号) | 主机 x86 | ttsfrd,产出 symbols.txt | | AM 编码器 enc(含 embedding/位置编码) | 板端 NPU | am_enc.axmodel(INT8,输入 ling/emo/spk/len) | | 韵律 pitch/energy | 板端 NPU | pitch_energy.axmodel(INT8) | | 时长 duration | 板端 NPU | duration.axmodel(INT8,非自回归单次前向) | | PNCA 解码 dec | 板端 CPU | 自研 C++(float32,host_weights) | | Postnet | 板端 NPU | postnet.axmodel(INT8) | | 声码器 voc | 板端 NPU | voc.axmodel(INT8) | > 校准集为 104 句真实中文语料(覆盖数字/长句/标点),由 pypinyin+jieba 生成 > ttsfrd 风格符号(`sdk/tools/gen_calib.py`)。 > 关键修复:`ax_engine.cpp` 增加 `AX_SYS_MflushCache / AX_SYS_MinvalidateCache`, > 修复多模型串行推理时缓存一致性问题(此前 NPU 输出逐次漂移,长句/特定文本乱码); > 移除"标点强制停顿"补丁(停顿帧喂解码器会损坏音频)。 > 长句(>22 符号)按标点切分成 ≤22 子段拼接;句末自动拼接 0.3s 静音; > 语速默认 1.4x(`KANTTS_SPEED` 可调)。 ## 目录 ``` kantts-tts-ax650/ model/ am_enc/pitch_energy/duration/postnet/voc .axmodel + host_weights/ + resource/ + am_config.yaml sdk/ C++ 源码 + axrt 库(ax_engine/ax_sys)+ build.sh sdk/tools/ text_to_symbols.py(主机 x86,ttsfrd)+ gen_calib.py(校准语料生成) example/ out.wav / youshi.wav(示例音频) ``` ## 板端编译与运行 1. 拷贝整个包到 AX650 板,进入 `sdk/`: ```bash cd sdk && ./build.sh # 产出 kantts_tts ``` 2. 生成符号文件(在主机 x86 上): ```bash python3 sdk/tools/text_to_symbols.py "北京今天天气怎么样" symbols.txt ``` `symbols.txt` 每行一个 ttsfrd `gen_tacotron_symbols` 输出(含 utt id 前缀亦可,程序自动跳过)。 3. 运行: ```bash LD_LIBRARY_PATH=/soc/lib ./sdk/kantts_tts model model/resource symbols.txt out.wav ``` 示例:`输出 out.wav(2.44s 音频,合成 0.72s,RTF=0.30)`(北京例句) ## 板端依赖 - AX650 / NPU3,`/soc/lib` 提供 ax_engine/ax_sys 运行时(或用包内 `sdk/axrt/lib`) - `sdk/axrt/lib/libonnxruntime.so.1.23.2`(aarch64,来自 onnxruntime 1.23.2 wheel) ## 精度与效果验证(2026-08-14 重建后) | 阶段 | 指标 | |------|------| | ling 编码 | 与官方 ttsfrd 逐项一致(T=22) | | enc text_hid | 板端 NPU vs 浮点 cosine 0.990 | | 重建模型编译校验 | am_enc/pitch_energy/duration/voc 余弦 ≥ 0.9999 | | 最终 wav | 北京句可识别;蒋介石台词 ASR = "80萬對60萬,優勢在我" | ## 已知限制 - 前端(文本→符号)依赖主机 ttsfrd,不在板端运行 - postnet 保留原始编译版本(新导出 ONNX 含 ConstantOfShape/Pad 组合,Pulsar2 无法编译; onnxsim 简化会破坏精度;原始模型精度正常) - dec 为 CPU(PNCA);NPU 解码(`KANTTS_NPU_DEC=1`)为实验性, QAT 导出在 Pulsar2 6.0 下因 per-channel DequantizeLinear 无法编译 - 句末自动拼接 0.3s 静音(16k)