用 GPT-SoVITS 训练自己的声音模型,避坑指南与参数调优心得
数据集质量直接决定了合成出来的声音像不像,千万别为了凑时长去喂那种带背景音乐或环境噪音的素材。我实测过,1分钟纯净的干声效果远好于10分钟带噪音的录音。
避坑指南:推理时的细节
很多人反馈合成的声音像机器人,其实是推理时的参数没调好。在 WebUI 的推理界面,重点调节
数据清洗的硬核操作
不要指望自带的切分工具能完美处理,建议先用 UVR5 把伴奏和噪音彻底剥离。切分时长控制在 2-10 秒之间,太短了AI学不到语调,太长了容易在推理时崩掉。
参数调优的几个关键点
在训练过程中,千万不要盲目追求 Epoch 数量。过拟合会导致声音出现奇怪的电音感或者吞字。
训练配置建议:
- Batch Size: 显存够就开大点,但建议 4-8 即可,过大反而导致收敛慢。
- Learning Rate: 保持默认,除非你发现 Loss 曲线剧烈抖动,才考虑下调。
- Epoch: 建议每 5-10 个 Epoch 保存一次 checkpoint,训练到一半时手动试听,一旦发现语气开始僵硬,立刻回滚到上一个版本。
避坑指南:推理时的细节
很多人反馈合成的声音像机器人,其实是推理时的参数没调好。在 WebUI 的推理界面,重点调节
Softmax 和 Temperature。# 伪代码逻辑:调节推理参数
# 想要声音更自然、随机性强一点 -> 适当调高 Temperature (例如 0.8 - 1.2)
# 想要声音更稳定、不乱跑调 -> 调低 Temperature (例如 0.5 - 0.7)一个提升真实感的 Prompt 技巧
在输入文本时,适当加入标点符号(如逗号、省略号)来强行制造停顿,比在设置里调参数有效得多。
部署环境的坑
如果你是在 Windows 下用 conda 安装,经常会遇到 torch 和 cuda 版本不匹配导致显存溢出。建议直接用官方提供的整合包,或者严格执行以下安装顺序:
# 建议先安装对应版本的 CUDA Toolkit,再执行
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118最容易被忽略的是:参考音频(Reference Audio)的选择。推理时,参考音频的情绪必须和你想合成的文本情绪一致。如果你用一段愤怒的参考音频去合成一段温柔的文字,出来的效果会非常诡异,像是在强行压抑情绪。
免费 AI 工具箱 · 全部完全免费
全部回复 (0)
还没有回复,来发第一条吧!
