File size: 1,214 Bytes
5e23710
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
# GCRN Python SDK

GCRN 语音增强 Python 推理 SDK。模型输入 16 kHz 单声道噪声语音的 STFT 谱
`[1, 2, 401, 161]`(4 秒分块),输出增强谱,再还原为增强波形。

## 安装

```bash
pip install -r requirements.txt
```

`axengine` 需要 AX650 板端(或带 AX runtime 的主机);普通电脑可以装 `onnxruntime`
后用 ONNX 模型调试。

## 快速使用

```bash
python3 demo.py --model ../models/model.axmodel --input ../test_audio/mix.wav --output enhanced.wav
```

## API

```python
from gcrn_sdk import GCRNDenoiser

denoiser = GCRNDenoiser("models/model.axmodel")   # .onnx 自动走 onnxruntime
report = denoiser.enhance_file("noisy.wav", "enhanced.wav")
print(report["real_time_factor"])

# 直接处理 int16 PCM:
pcm = ...  # np.int16
enhanced = denoiser.enhance(pcm)
```

## 预处理说明

- 输入要求:16 kHz、单声道、16-bit PCM WAV;
- 分块:4 秒(64000 样本),不足补零,逐块增强后拼接;
- STFT:`n_fft=320, hop=160, win=320`,hamming(sym)窗,与模型训练端一致;
- 模型边界:`stft_input [1,2,401,161] float32` -> `stft_output [1,2,401,161] float32`
  (布局为 batch, real/imag, time, freq)。