Bufeiyan GPT-SoVITS v2Pro Voice Model

这是一个用于 GPT-SoVITS v2Pro 的中文语音合成模型。模型需要下面两个配套权重同时使用,不能把 GPT 权重和 SoVITS 权重与其他训练检查点混用。

模型文件

  • GPT 模型:GPT_weights_v2Pro/bufeiyan-e15.ckpt
  • SoVITS 模型:SoVITS_weights_v2Pro/bufeiyan_e8_s992.pth
  • 参考音频:参考音频/[步非烟]其他的福利啊。 加油哦。.wav
  • 推理配置:GPT_SoVITS/configs/tts_infer.yaml

当前配置使用 GPT e15 和 SoVITS e8 配对。仓库中没有上传原始训练音频。

使用前提

需要先安装原版 GPT-SoVITS,并下载它所需的基础模型到 GPT_SoVITS/pretrained_models。本仓库包含推理权重、参考音频、配置文件,以及可选的训练断点和预处理数据;不包含完整的 GPT-SoVITS 程序及基础模型。

使用原版 GPT-SoVITS WebUI

在原版 GPT-SoVITS 项目根目录执行:

hf download DudeGuuud/bufeiyan-gpt-sovits-v2pro \
  --repo-type model \
  --local-dir .

启动原版 WebUI:

conda activate GPTSoVits
python webui.py zh_CN

打开 http://127.0.0.1:9874,在推理页面选择:

  • GPT:GPT_weights_v2Pro/bufeiyan-e15.ckpt
  • SoVITS:SoVITS_weights_v2Pro/bufeiyan_e8_s992.pth

然后选择或填写参考音频:参考音频/[步非烟]其他的福利啊。 加油哦。.wav

使用原版 GPT-SoVITS API

原版 api_v2.py 的标准 /tts 接口即可调用,不需要本仓库之外的 API 修改:

conda activate GPTSoVits
python api_v2.py \
  -a 127.0.0.1 \
  -p 9880 \
  -c GPT_SoVITS/configs/tts_infer.yaml

配置文件默认使用 CPU,适合 macOS Apple Silicon。启动后 API 地址是 http://127.0.0.1:9880

标准 API 调用示例:

curl -X POST "http://127.0.0.1:9880/tts" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "你好,这是一个测试。",
    "text_lang": "zh",
    "ref_audio_path": "./参考音频/[步非烟]其他的福利啊。 加油哦。.wav",
    "prompt_lang": "zh",
    "prompt_text": "其他的福利啊。 加油哦。",
    "media_type": "wav"
  }' \
  --output output.wav

继续训练

仓库中的 training/logs/bufeiyan/ 文件是可选的续训包。推理用的 e15/e8 文件不含完整优化器状态,不能用于严格断点续训;续训应使用下面的完整训练断点:

  • GPT 完整断点:logs/bufeiyan/logs_s1_v2Pro/ckpt/epoch=14-step=435.ckpt
  • SoVITS 生成器断点:logs/bufeiyan/logs_s2_v2Pro/G_233333333333.pth
  • SoVITS 判别器断点:logs/bufeiyan/logs_s2_v2Pro/D_233333333333.pth

下载完整仓库后,在项目根目录运行 GPT 续训:

python GPT_SoVITS/s1_train.py \
  --config_file training/configs/s1_resume.yaml

运行 SoVITS 续训:

python GPT_SoVITS/s2_train.py \
  --config training/configs/s2_resume.json

两个配置默认训练到第 20 轮。需要更多或更少轮数时,修改对应配置中的 train.epochslogs/bufeiyan/ 下的 2-name2text.txt3-bert4-cnhubert5-wav32k6-name2semantic.tsv7-sv_cn 是原训练数据的预处理结果,续训时会被自动读取。

续训需要使用兼容的 GPT-SoVITS v2Pro 代码和基础模型。macOS CPU 训练还需要本项目训练时使用的 CPU DataLoader 修改;GPU 环境通常可以使用对应版本的原版训练脚本。

SillyTavern 兼容说明

本地版本的 api_v2.py 额外增加了 CORS、/speakers、根路径 POST / 和分段流式返回,这些改动是为了适配当前 SillyTavern 的 GPT-SoVITS-V2 插件,并不是模型运行所必需的。

如果使用未修改的原版 GPT-SoVITS,应该调用标准的 /tts 接口。当前 SillyTavern 插件的自动声音列表和分段流式播放仍需要本地修改版 API,或者对客户端请求进行适配。

注意事项

  • 这是 v2Pro 模型,只应与对应的 v2Pro GPT/SoVITS 权重配套使用。
  • 参考音频的清晰度、时长和文本匹配程度会影响合成质量。
  • 本模型和训练数据的发布不自动授予任何声音、人物、音频或文本素材的版权和使用权。
  • 公开仓库中的文件任何人都可以下载。请仅在获得必要授权的情况下使用,并避免冒充、骚扰或误导他人。
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support