guides15 分钟阅读 read · Updated 2026-05-31

如何查找、转换和导入 RVC 语音模型

从零开始在 Echo 中使用 AI 语音所需的一切——在哪里寻找模型、如何挑选好的模型、转换格式、导入以及故障排除。

完整流程——从零到 AI 语音

在 Echo 中使用社区 AI 语音需要五个步骤。下面将详细介绍每一步,但这里先给出一个概述,让你在开始前心中有数。

  • ●第一步——在 Hugging Face 或 AI Hub Discord 上找到一个语音模型。社区模型可免费下载。
  • ●第二步——下载 .pth 文件(如果可用,也下载 .index 文件)。这是 RVC 社区使用的原始模型格式。
  • ●第三步——使用 voicechanger.live/tools/model-converter 上的免费浏览器转换器将 .pth 文件转换为 .onnx 格式。这只需几秒钟,并且绝不会上传你的文件。
  • ●第四步——将 .onnx 文件导入 Echo。打开 Echo → 语音库 → 导入 → 选择你的 .onnx 文件。
  • ●第五步——选择声音,点击“开始”,然后说话。你的声音会通过任何使用你麦克风的应用进行实时转换。

理解文件类型

RVC 语音模型涉及三种文件类型。在此过程中你都会遇到,所以了解每种文件的作用可以避免混淆。

  • ●.pth (PyTorch 模型)——RVC 社区使用的标准格式。这是你从 Hugging Face 下载的文件。一个 .pth 文件通常为 50–100 MB,包含定义目标声音的已训练神经网络。你不能直接在 Echo 中使用 .pth 文件——它们需要先转换为 .onnx。
  • ●.index (FAISS 索引)——一个可选的配套文件,通过引用原始训练音频中的真实声学样本来提高声音质量。对于 Echo 中的实时变声,.index 文件不是必需的——Echo 的 ONNX 流程无需它即可处理转换。但是,如果你使用其他 RVC 工具进行离线转换(如歌曲翻唱、配音),.index 文件会带来明显的质量差异。如果可用,请务必下载。
  • ●.onnx (开放神经网络交换)——Echo 使用的优化格式。将 .pth 转换为 .onnx 会产生相同的声音,但格式无需 Python 或 PyTorch 即可原生运行——这意味着更快的推理、更低的内存占用和无沉重依赖。转换是免费的,只需几秒钟。

第一步——在哪里寻找语音模型

RVC 社区已经制作了数千个语音模型,涵盖了角色、名人、原创声音和自定义创作。质量差异巨大——在干净音频上训练的模型听起来令人信服,而训练不佳的模型听起来像机器人。以下是主要来源。

  • ●Hugging Face——最大的专用 RVC 模型存储库。每个模型都有评分、下载次数、音频预览和元数据(模型版本、训练轮数、采样率)。从这里开始。按角色名或声音类型搜索。
  • ●Hugging Face——许多高质量的 RVC 模型托管在 Hugging Face 上,特别是来自那些记录了他们训练过程的认真创作者。搜索“[角色名] RVC”或“RVC v2 model”。这里的模型通常同时包含 .pth 和 .index 文件。
  • ●AI Hub Discord——最大的 RVC 社区 Discord 服务器,有活跃的模型分享频道。最适合寻找不在公共平台上的小众或自定义模型,或请求特定声音。通过 discord.gg/aihub 加入。
  • ●Reddit (r/RVC)——模型推荐、质量评论和社区审查的建议。适合发现哪些模型被认为是特定角色的最佳选择。

第二步——如何挑选一个好模型

并非所有模型都值得下载。训练良好和训练不佳的模型之间的差异是巨大的。以下是如何识别好模型的方法。

  • ●听音频预览——在 Hugging Face 上,许多模型都有音频演示。一个 5 秒的预览比任何描述都更能说明问题。如果预览听起来不错,那么在 Echo 中听起来也会不错。
  • ●检查训练数据时长——在 15–40 分钟的干净音频上训练的模型通常听起来最好。少于 5 分钟的往往听起来单薄或通用。
  • ●寻找 v2 模型——RVC v2 模型使用 768 维特征向量,听起来比 v1(256 维)更自然。始终优先选择 v2。
  • ●阅读描述——好的创作者会记录他们的参数。一个描述为“在 25 分钟干净人声上训练,300 轮,RMVPE,40kHz”的模型比没有描述的更值得信赖。
  • ●检查下载次数和评分——在 Hugging Face 上,评分高、受欢迎的模型已经过社区验证。在 Discord 上,可以在模型分享频道中寻求推荐。
  • ●检查是否包含 .index 文件——带有 .index 文件的模型通常质量更好,尤其是在离线使用时。即使你在 Echo 中不使用该文件,它也是一个很好的质量信号。

第三步——将 .pth 转换为 .onnx

Echo 使用 .onnx 格式的语音模型——它更快、更轻,并且不需要 Python。从社区下载 .pth 模型后,你需要转换一次。这是免费的,只需几秒钟。

  • ●在浏览器中访问 voicechanger.live/tools/model-converter
  • ●选择你下载的 .pth 文件。文件永远不会离开你的电脑——转换完全在你的浏览器中进行。
  • ●选择模型版本(v1 或 v2)。如果你不确定,先尝试 v2——大多数现代模型都是 v2。
  • ●点击“转换”并下载生成的 .onnx 文件。
  • ●输出的声音质量与原始 .pth 完全相同——只有格式改变了。

第四步——导入到 Echo

准备好 .onnx 文件后,导入到 Echo 大约需要 10 秒钟。

  • ●打开 Echo 并转到语音库(侧边栏中的声音选项卡)。
  • ●点击库顶部的“导入”按钮。
  • ●从你保存的位置选择你的 .onnx 文件。
  • ●声音会立即出现在你的库中——无需重启。
  • ●你可以导入的模型数量没有限制。想导入多少就导入多少。

第五步——开始使用你的声音

导入后,从你的库中选择声音并点击“开始”。Echo 会捕获你的麦克风输入,通过 AI 模型进行实时处理,并通过虚拟音频线缆输出转换后的声音。任何使用麦克风的应用程序——Discord、游戏、OBS、Zoom——都可以通过选择虚拟线缆作为其输入设备来使用转换后的声音。

  • ●音高偏移——如果声音听起来太高或太低,请在 Echo 中调整音高偏移。对于男声转女声,尝试 +12。对于女声转男声,尝试 -12。然后根据听起来自然的效果进行微调。
  • ●GPU 加速——启用 GPU 模式以获得最低延迟。Echo 支持 NVIDIA (CUDA)、AMD/Intel (DirectML) 和 Apple Silicon (CoreML)。
  • ●虚拟音频线缆——确保已安装 VB-Cable (Windows) 或 BlackHole (macOS) 并将其选为 Echo 中的输出设备。然后在 Discord、OBS 或你的游戏中将其选为麦克风。

关于 .index 文件

你会看到许多 .pth 下载旁边都有 .index 文件。以下是它们何时重要以及何时可以忽略它们的具体说明。

  • ●对于 Echo 中的实时变声——不需要 .index 文件。Echo 的 ONNX 流程无需 FAISS 索引即可完成完整的语音转换。没有它,你的声音听起来也会很棒。
  • ●对于离线语音转换(歌曲翻唱、配音)——.index 文件很有用。像 w-okada 和 Applio 这样的工具在推理过程中使用索引来从训练数据中检索真实的声学细节,这可以减少瑕疵并提高长音频的保真度。
  • ●对于模型质量评估——附带 .index 文件的模型通常质量更高。这意味着创作者多花了一步来生成索引,这与更好的整体训练实践相关。
  • ●存储——.index 文件通常为 10–50 MB。如果可用,请下载它们并与你的 .pth 文件一起保存,以备将来使用离线工具。

故障排除

如果导入后声音听起来不对,问题几乎总是以下之一。大多数问题无需寻找新模型即可解决。

  • ●声音听起来像机器人或有金属感——模型可能过拟合了。尝试回退到早期的检查点,或者找同一个角色的不同模型,或者找一个训练轮数较少的模型。
  • ●音高听起来不对——在 Echo 中调整音高偏移。男声转女声通常需要 +12,女声转男声需要 -12。在这个范围内进行实验。
  • ●声音听起来完全不像目标——你可能在 v2 流程中使用了 v1 模型,反之亦然。在模型转换器中选择正确的版本重新转换。
  • ●输出声音沉闷——模型可能是在低质量音频上训练的。找一个在更干净的源材料上训练的不同模型。
  • ●噼啪声或爆音——这通常是音频流程问题,而不是模型问题。在 Echo 设置中增加区块大小,或检查你的 GPU 是否过载。
  • ●转换听起来很普通——对于离线工具,这通常意味着缺少 .index 文件。对于 Echo,尝试一个不同的模型——有些模型就是比其他模型转换效果好。

想创建自己的语音模型吗?

如果你在社区存储库中找不到想要的声音,你可以从头开始训练一个自定义 RVC 模型。这是一个更高级的过程,需要一个 GPU 和一些耐心,但工具是免费的,社区也非常乐于助人。你需要 10–30 分钟来自目标声音的干净、独立的声乐音频。推荐的训练工具是 Applio (applio.org)——它有最好的界面和最活跃的开发。对于没有本地 GPU 的用户,Google Colab 笔记本提供免费的云 GPU 访问权限用于训练。我们有一个完整的分步训练指南,涵盖了使用 UVR5 进行数据集准备、训练参数、f0 提取方法、评估检查点和常见问题故障排除。

语音模型的道德使用

RVC 语音模型是强大的技术,应负责任地使用。不要在未经他人知情或同意的情况下创建真人的模型。不要使用语音模型冒充他人进行欺骗、欺诈或骚扰。如果你创建 AI 生成的语音内容,请明确标注。一些司法管辖区已经颁布了针对 AI 语音冒充的立法——使用克隆声音误导他人正日益成为一种刑事犯罪。RVC 社区的繁荣建立在创作者、模型训练者和用户之间的相互尊重之上。

FAQ

Echo 使用什么文件格式的语音模型?
Echo 使用 .onnx 格式。社区模型以 .pth 文件分发,因此你需要先使用 voicechanger.live/tools/model-converter 上的免费浏览器转换器进行转换。转换只需几秒钟,完全在你的浏览器中运行,并产生相同的声音质量。
我可以导入多少个语音模型?
没有限制。只要你的磁盘空间允许,可以导入任意数量的模型。它们存储在本地,你可以在对话中即时切换。
RVC 语音模型是免费的吗?
绝大多数是免费的。社区在 Hugging Face 和 Discord 服务器上公开分享模型。数千个高质量的角色、名人和原创语音模型都是免费的。
我需要 .index 文件吗?
对于 Echo 中的实时变声不需要。Echo 的 ONNX 流程无需它即可工作。.index 文件对于离线转换工具(w-okada、Applio)很有用,它可以提高像歌曲翻唱这样的长音频的质量。如果可用,请下载以备将来使用离线工具。
我应该使用什么音高偏移?
对于男声转女声,从 +12 开始调整。对于女声转男声,从 -12 开始。同性别的转换通常需要 0 或小幅调整。通过耳朵微调,直到声音听起来自然。
v1 和 v2 模型有什么区别?
RVC v2 模型使用更高维度的特征向量(768 vs 256),听起来更自然。始终优先选择 v2 模型。在模型转换器中转换时,请确保选择正确的版本——v1 和 v2 不可互换。
我可以训练自己的语音模型吗?
是的。你需要 10–30 分钟的干净声乐音频和一个 GPU。推荐的工具是 Applio (applio.org)。请参阅我们的完整训练指南以获取完整步骤。
语音模型合法吗?
在大多数司法管辖区,创建和使用语音模型是合法的。使用模型冒充真人进行欺诈或骚扰是非法的,并且越来越多地受到起诉。请负责任地使用语音模型。

Ready to try it?

Download Echo and experience AI-powered voice conversion for yourself.

下载 Echo