guides15 分钟阅读 read · Updated 2026-05-28

如何训练你自己的 RVC 语音模型

创建自定义 AI 语音所需的一切——从原始音频到可用的实时语音模型。涵盖数据集准备、训练工具、参数调整和故障排除。

什么是 RVC 训练?

RVC(基于检索的语音转换)训练是教神经网络重现特定声音的过程。你提供目标声音的干净音频样本,模型会学习该声音的特征——音色、共鸣、共振峰结构、气息——以便能将任何输入语音实时转换为该声音。训练好的模型不会记住训练音频。它学习的是声音的身份,然后将该身份应用于新的语音,同时保留原始说话者的用词、语速、情感和语调。

训练前你需要什么

训练需要三样东西:干净的音频数据、一个训练环境和耐心。数据集的质量是模型质量的唯一最大因素——一个简短、干净的数据集总是胜过一个冗长、嘈杂的数据集。

  • ●10-30 分钟的干净、独立的声乐音频——没有背景音乐、没有噪音、没有混响、没有回声。超过 40 分钟的多样化音频可以进一步提高自然度,但最好不要超过 60 分钟,以避免收益递减。
  • ●音频必须是单一说话者,录制条件相当一致。
  • ●首选无损格式:WAV 或 FLAC,44.1kHz 或 48kHz 采样率,单声道。避免低比特率的 MP3——压缩伪影会被烘焙到模型中。
  • ●一个至少有 6 GB VRAM 的 GPU(推荐 NVIDIA 以支持 CUDA)。8 GB+ VRAM 是舒适批处理大小的理想选择。
  • ●训练软件:Applio (applio.org——推荐,开发最活跃,UI 最好)、Mangio-RVC 或原始的 RVC WebUI。
  • ●没有 GPU?使用云服务:Google Colab (colab.research.google.com——带 T4 GPU 的免费层)、Kaggle、Paperspace 或 RunPod。

第一步——准备你的数据集

数据集准备是大多数人失败的地方。在嘈杂、混响或不一致的音频上训练的模型听起来也会嘈杂、混响和不一致。社区标准的清理流程使用 Ultimate Vocal Remover (UVR5——github.com/Anjok07/ultimatevocalremovergui),这是一个使用 AI 分离人声和乐器并去除混响的免费工具。

  • ●获取你的音频:最好的来源是独立的人声轨道(使用人声分离器从歌曲中提取人声)、播客录音、有声书旁白、采访片段或在安静房间里的直接麦克风录音。
  • ●清理流程:去除乐器(使用 Kim Vocal 2 或 MDX-NET 模型的 UVR5)→ 去除混响和回声(UVR5 VR-DeEchoDeReverb)→ 提取主唱 → 去除残留噪音。不要过度处理——每次处理都会略微降低质量。
  • ●确保只有单一说话者:去除任何有重叠声音、背景杂音或其他说话者的片段。
  • ●包含多样性:不同的音高、情感、语速和音域有助于模型泛化。单调的数据集产生单调的模型。
  • ●修剪静音和非语音部分:去除长停顿、咳嗽和非声乐声音。保留自然的呼吸——去除所有呼吸会使模型听起来像机器人。
  • ●不要在单词中间剪切:保持短语完整,以保留自然的语调模式。
  • ●文件路径:确保你的数据集文件夹路径不含空格或特殊字符——这是所有 RVC 工具中训练失败的常见原因。

第二步——选择你的训练工具

有三个主要的开源工具可以处理 RVC 训练。每个工具都使用相同的数据集并生成相同的 .pth 模型格式——区别在于用户体验。

  • ●Applio——最受欢迎且开发最活跃的 RVC 训练工具。界面干净,自动化的数据集预处理,集成了 TensorBoard 用于监控损失曲线,并支持所有主要的 f0 提取方法。推荐给大多数用户。
  • ●Mangio-RVC / RVC-WebUI——原始 RVC 项目的社区分支。通过浏览器中的 Gradio Web 界面运行。需要更多手动配置,但文档齐全。如果 Applio 在你的系统上无法工作,这是一个很好的替代品。
  • ●Google Colab 笔记本——使用免费云 GPU 进行基于浏览器的训练。无需本地 GPU。搜索“RVC training Colab”以获取社区笔记本。最适合没有独立 GPU 的用户。

第三步——配置训练参数

理解这些参数有助于你获得更好的结果。从推荐的默认值开始,并根据你听到的效果进行调整。

  • ●轮数 (Epochs, 200-500):一个轮数是对你的训练数据进行一次完整的遍历。从 200-300 轮开始并进行评估。更多的轮数可以提高质量,但过拟合会导致机器人般的伪影。没有神奇的数字——你的耳朵是裁判。
  • ●批处理大小 (Batch Size, 取决于 VRAM):6 GB VRAM → 批处理大小 4-6。8 GB VRAM → 批处理大小 6-8。12 GB+ VRAM → 批处理大小 8-12。更高的批处理大小训练更快,但使用更多内存。如果出现 CUDA 内存不足错误,请减小批处理大小。
  • ●采样率 (Sample Rate):40kHz 是社区标准,对大多数声音都适用。48kHz 能捕捉到稍微更多的高频细节,但需要更多计算资源。除非有特殊原因,否则使用 40kHz。
  • ●保存频率 (Save Frequency):每 10-50 轮保存一次检查点,以便你可以测试中间版本。这对于在过拟合之前找到最佳点至关重要。
  • ●RVC 版本 (RVC Version):对于新模型,请始终使用 v2。v2 使用 768 维特征向量(v1 为 256),产生更准确、更自然的声音转换。

F0 提取方法解析

f0(基频)提取方法决定了如何从你的训练音频中检测音高。这个选择会显著影响模型质量。

  • ●RMVPE (推荐)——基于鲁棒多尺度波形的音高估计。当前的社区标准。速度快,能很好地处理嘈杂的音频,并在所有声音类型上产生可靠的音高跟踪。除非有特殊原因,否则使用这个。
  • ●Crepe——音高精度高于 RMVPE,尤其适用于歌声和干净的录音。处理速度较慢。最适合需要最高保真度的高质量录音室录音。
  • ●FCPE——快速、现代的算法,具有高音高精度。在速度很重要时,是 RMVPE 的一个很好的替代品。对嘈杂音频的鲁棒性稍差。
  • ●混合 (RMVPE + FCPE)——一些训练工具提供组合方法。可以在边缘情况下改善结果,但会增加处理时间。先尝试单一方法。

第四步——训练和监控

启动训练并使用 TensorBoard(集成在 Applio 中)或通过测试保存的检查点来监控进度。在现代 GPU 上,训练通常需要 1-4 小时,具体取决于数据集大小和轮数。观察损失曲线——它应该稳定下降然后趋于平缓。当它趋于平缓时,模型已经从数据中学到了它能学到的一切。继续训练可能会导致过拟合。定期保存检查点,并通过在样本音频文件上运行推理来测试它们。听其自然度、清晰度以及输出是否真的像目标声音。最好的检查点很少是最后一个——大多数有经验的训练者发现最佳点在 200 到 400 轮之间。

第五步——生成索引文件

训练完成后,生成 FAISS 索引文件。这一步经常被忽视,但它能显著提高输出质量。索引文件包含一个可搜索的训练音频特征向量数据库。在推理过程中,模型使用此索引来检索目标声音的真实声学模式,从而减少原始说话者声音泄露的“音色泄漏”。在 Applio 中,索引生成是训练后的一个一键式步骤。在分享或导入时,请始终将 .index 文件与 .pth 模型一起提供。

第六步——使用你的模型

你训练好的模型会产生两个关键文件:.pth 模型文件(50-100 MB)和 .index 文件。要在实时中使用它们,请将它们导入到变声器应用程序中。Echo Live 接受 .onnx 格式的模型——使用 voicechanger.live/tools/model-converter 上的免费转换器(基于浏览器,无需上传)转换你的 .pth 文件。为了在训练期间进行测试,大多数训练工具都包含一个内置的推理选项卡,你可以在其中直接测试 .pth 模型而无需转换。

常见问题故障排除

如果你的模型听起来不对,原因几乎总是以下问题之一:

  • ●模型听起来像机器人或有金属感——过拟合。回滚到早期的检查点(尝试 150-250 轮)。如果所有检查点听起来都像机器人,那么你的数据集可能含有需要清理的混响或噪音。
  • ●模型听起来像原始说话者,而不是目标——数据集太短或太单一。增加更多多样性(不同的音高、情感),并确保至少有 15 分钟的干净音频。
  • ●模型听起来沉闷或质量低——源音频比特率低或被过度压缩。始终使用无损的 WAV 或 FLAC。同时检查你是否用太多 UVR5 处理过度了。
  • ●训练因 CUDA 内存不足而崩溃——减小批处理大小。如果已经是最小值,则降低采样率或关闭其他占用 GPU 的应用程序。
  • ●训练损失没有下降——检查你的数据集是否充满了静音或非语音音频。验证文件格式是否正确(WAV/FLAC,单声道,正确的采样率)。
  • ●模型对某些声音效果好,对另一些则不然——RVC 转换质量取决于输入和目标声音之间的音高范围相似性。男声转男声和女声转女声的转换通常效果最好。

FAQ

训练一个好的 RVC 模型需要多少音频?
10-30 分钟的干净、独立的声乐音频是标准建议。少于 5 分钟通常效果不佳。超过 40 分钟的多样化音频可以进一步提高自然度,但质量比数量更重要——15 分钟的干净音频胜过 60 分钟的嘈杂音频。
我可以在没有 GPU 的情况下训练 RVC 模型吗?
在 CPU 上训练技术上是可能的,但不切实际——在 GPU 上需要 1 小时的 200 轮训练,在 CPU 上可能需要 24 小时以上。如果你没有本地 NVIDIA GPU,请使用像 Google Colab 或 Kaggle 这样的免费云 GPU 服务。
我应该使用哪个训练工具?
Applio 是 2026 年最推荐的 RVC 训练工具。它拥有最活跃的开发、最干净的界面,并内置 TensorBoard 支持来监控训练进度。Mangio-RVC 和原始的 RVC WebUI 是可靠的替代品。
我应该训练多少轮?
从 200-300 轮开始并测试输出。没有通用的最佳数字——这取决于你的数据集大小和质量。每 10-50 轮保存一次检查点并听一下。当声音听起来自然时就停止;继续训练可能会导致过拟合和机器人般的伪影。
过拟合听起来是什么样的?
一个过拟合的模型听起来像机器人、有金属感或失真——尤其是在元音和持续音上。声音失去了其自然的质量,开始听起来不自然。如果发生这种情况,请回滚到早期的检查点。这表明模型对训练数据学习得过于具体,失去了泛化能力。
在别人的声音上训练 RVC 模型合法吗?
为个人、非商业用途训练模型通常被认为是可接受的。使用克隆声音冒充他人、实施欺诈或创建误导性内容在大多数司法管辖区都是非法的。一些地区已经颁布了专门针对 AI 语音冒充的深度伪造法律。请始终负责任地使用语音模型。
我可以分享我训练的模型吗?
是的——.pth 和 .index 文件可以自由分享。RVC 社区在 Hugging Face 和 Discord 服务器上有数千个共享模型。请注意源音频:如果你在未经同意的情况下在受版权保护的材料或真人的声音上进行训练,分享模型可能会有道德或法律问题。
我训练的模型中 .pth 和 .onnx 有什么区别?
.pth 文件是训练产生的原生 PyTorch 模型。.onnx 文件是一个优化版本,无需 Python 即可运行——推理更快、内存使用更少,并与像 Echo Live 这样的原生应用兼容。声音质量是相同的。当你准备在实时应用中使用模型时,使用免费的转换工具将 .pth 转换为 .onnx。

Ready to try it?

Download Echo and experience AI-powered voice conversion for yourself.

下载 Echo