GCRN / reports /performance_report.md
inoryQwQ's picture
Upload folder using huggingface_hub
5e23710 verified
|
Raw
History Blame Contribute Delete
1.37 kB
# GCRN AX650 性能报告
## 模型概况
| 项目 | 数值 |
|------|------|
| 模型 | GCRN 语音增强(4 秒固定输入)|
| 输入/输出 | `[1, 2, 401, 161]` float32 |
| 计算量 | 9.80 GMACs |
| 量化 | U16(LSTM/Pow/Sqrt/Div/conv_bias FP32)|
| ONNX 大小 | 38 MB |
| AXMODEL 大小 | 27.6 MB |
## 精度(ONNX vs AXMODEL,8 个样本)
| 指标 | mean ± std |
|------|-----------|
| cosine_similarity | 0.99922 ± 0.00039(min 0.99850)|
| MAE | 0.00888 ± 0.00066 |
| max_abs_diff | 1.37 ± 0.87 |
| 增强波形 cosine(首样本)| 0.99974 |
## 板端延迟(AX650N,NPU3 三核)
测试音频 9.77 秒(156302 样本,4 个 4 秒分块 + 尾部)。
| 语言 | 处理总耗时 | RTF |
|------|-----------|-----|
| Python(axengine)| 0.28 s | 0.0287 |
| C++(axengine)| ~28 s(含直接 DFT 预处理)| 2.9 |
说明:
- Python RTF 0.029 为完整链路(STFT + NPU + ISTFT + 拼接),NPU 单模型推理约 0.064 s/块;
- C++ 耗时主要花在 320 点直接 DFT(每块 401×161×320 复数乘加),若接入 FFT 库可降到亚秒级;
- 板端内存占用:模型 + 双 SDK 运行峰值 < 512 MB(板总内存 3.4 GB)。
## 编译信息
- Pulsar2 镜像:`pulsar2:7.0-lite`
- 目标:AX650 / NPU3;`highest_mix_precision=false`
- 编译耗时:约 1 小时 51 分(LSTM 展开约 30 万算子)