Bufeiyan GPT-SoVITS v2Pro Voice Model
这是一个用于 GPT-SoVITS v2Pro 的中文语音合成模型。模型需要下面两个配套权重同时使用,不能把 GPT 权重和 SoVITS 权重与其他训练检查点混用。
模型文件
- GPT 模型:
GPT_weights_v2Pro/bufeiyan-e15.ckpt - SoVITS 模型:
SoVITS_weights_v2Pro/bufeiyan_e8_s992.pth - 参考音频:
参考音频/[步非烟]其他的福利啊。 加油哦。.wav - 推理配置:
GPT_SoVITS/configs/tts_infer.yaml
当前配置使用 GPT e15 和 SoVITS e8 配对。仓库中没有上传原始训练音频。
使用前提
需要先安装原版 GPT-SoVITS,并下载它所需的基础模型到 GPT_SoVITS/pretrained_models。本仓库包含推理权重、参考音频、配置文件,以及可选的训练断点和预处理数据;不包含完整的 GPT-SoVITS 程序及基础模型。
使用原版 GPT-SoVITS WebUI
在原版 GPT-SoVITS 项目根目录执行:
hf download DudeGuuud/bufeiyan-gpt-sovits-v2pro \
--repo-type model \
--local-dir .
启动原版 WebUI:
conda activate GPTSoVits
python webui.py zh_CN
打开 http://127.0.0.1:9874,在推理页面选择:
- GPT:
GPT_weights_v2Pro/bufeiyan-e15.ckpt - SoVITS:
SoVITS_weights_v2Pro/bufeiyan_e8_s992.pth
然后选择或填写参考音频:参考音频/[步非烟]其他的福利啊。 加油哦。.wav。
使用原版 GPT-SoVITS API
原版 api_v2.py 的标准 /tts 接口即可调用,不需要本仓库之外的 API 修改:
conda activate GPTSoVits
python api_v2.py \
-a 127.0.0.1 \
-p 9880 \
-c GPT_SoVITS/configs/tts_infer.yaml
配置文件默认使用 CPU,适合 macOS Apple Silicon。启动后 API 地址是 http://127.0.0.1:9880。
标准 API 调用示例:
curl -X POST "http://127.0.0.1:9880/tts" \
-H "Content-Type: application/json" \
-d '{
"text": "你好,这是一个测试。",
"text_lang": "zh",
"ref_audio_path": "./参考音频/[步非烟]其他的福利啊。 加油哦。.wav",
"prompt_lang": "zh",
"prompt_text": "其他的福利啊。 加油哦。",
"media_type": "wav"
}' \
--output output.wav
继续训练
仓库中的 training/ 和 logs/bufeiyan/ 文件是可选的续训包。推理用的 e15/e8 文件不含完整优化器状态,不能用于严格断点续训;续训应使用下面的完整训练断点:
- GPT 完整断点:
logs/bufeiyan/logs_s1_v2Pro/ckpt/epoch=14-step=435.ckpt - SoVITS 生成器断点:
logs/bufeiyan/logs_s2_v2Pro/G_233333333333.pth - SoVITS 判别器断点:
logs/bufeiyan/logs_s2_v2Pro/D_233333333333.pth
下载完整仓库后,在项目根目录运行 GPT 续训:
python GPT_SoVITS/s1_train.py \
--config_file training/configs/s1_resume.yaml
运行 SoVITS 续训:
python GPT_SoVITS/s2_train.py \
--config training/configs/s2_resume.json
两个配置默认训练到第 20 轮。需要更多或更少轮数时,修改对应配置中的 train.epochs。logs/bufeiyan/ 下的 2-name2text.txt、3-bert、4-cnhubert、5-wav32k、6-name2semantic.tsv 和 7-sv_cn 是原训练数据的预处理结果,续训时会被自动读取。
续训需要使用兼容的 GPT-SoVITS v2Pro 代码和基础模型。macOS CPU 训练还需要本项目训练时使用的 CPU DataLoader 修改;GPU 环境通常可以使用对应版本的原版训练脚本。
SillyTavern 兼容说明
本地版本的 api_v2.py 额外增加了 CORS、/speakers、根路径 POST / 和分段流式返回,这些改动是为了适配当前 SillyTavern 的 GPT-SoVITS-V2 插件,并不是模型运行所必需的。
如果使用未修改的原版 GPT-SoVITS,应该调用标准的 /tts 接口。当前 SillyTavern 插件的自动声音列表和分段流式播放仍需要本地修改版 API,或者对客户端请求进行适配。
注意事项
- 这是 v2Pro 模型,只应与对应的 v2Pro GPT/SoVITS 权重配套使用。
- 参考音频的清晰度、时长和文本匹配程度会影响合成质量。
- 本模型和训练数据的发布不自动授予任何声音、人物、音频或文本素材的版权和使用权。
- 公开仓库中的文件任何人都可以下载。请仅在获得必要授权的情况下使用,并避免冒充、骚扰或误导他人。