| # GCRN Python SDK |
|
|
| GCRN 语音增强 Python 推理 SDK。模型输入 16 kHz 单声道噪声语音的 STFT 谱 |
| `[1, 2, 401, 161]`(4 秒分块),输出增强谱,再还原为增强波形。 |
|
|
| ## 安装 |
|
|
| ```bash |
| pip install -r requirements.txt |
| ``` |
|
|
| `axengine` 需要 AX650 板端(或带 AX runtime 的主机);普通电脑可以装 `onnxruntime` |
| 后用 ONNX 模型调试。 |
|
|
| ## 快速使用 |
|
|
| ```bash |
| python3 demo.py --model ../models/model.axmodel --input ../test_audio/mix.wav --output enhanced.wav |
| ``` |
|
|
| ## API |
|
|
| ```python |
| from gcrn_sdk import GCRNDenoiser |
| |
| denoiser = GCRNDenoiser("models/model.axmodel") # .onnx 自动走 onnxruntime |
| report = denoiser.enhance_file("noisy.wav", "enhanced.wav") |
| print(report["real_time_factor"]) |
| |
| # 直接处理 int16 PCM: |
| pcm = ... # np.int16 |
| enhanced = denoiser.enhance(pcm) |
| ``` |
|
|
| ## 预处理说明 |
|
|
| - 输入要求:16 kHz、单声道、16-bit PCM WAV; |
| - 分块:4 秒(64000 样本),不足补零,逐块增强后拼接; |
| - STFT:`n_fft=320, hop=160, win=320`,hamming(sym)窗,与模型训练端一致; |
| - 模型边界:`stft_input [1,2,401,161] float32` -> `stft_output [1,2,401,161] float32` |
| (布局为 batch, real/imag, time, freq)。 |
|
|