教程··阅读时长 10 分钟

如何使用 AI 克隆你的声音

什么是 AI 声音克隆?

AI 声音克隆能创建一个你声音的数字模型,它可以将任何语音重构成听起来像你的声音。与文本转语音(从文本生成机械的音频)不同,使用 RVC(基于检索的语音转换)的声音克隆技术是语音到语音的——你自然地说话,AI 会实时将输出的声音转换为目标声音。

这项技术通过分析你声音的录音,提取音色、共鸣和声音质感等特征,并建立一个可以再现这些特征的神经网络模型。一旦训练完成,该模型就能实时处理现场音频——你对着麦克风说话,出来的声音听起来就像是克隆的声音。

开始前需要准备什么

录音设备:任何不错的麦克风都可以。在安静的房间里使用一个 USB 电容麦克风(30-50 美元)就能产生极佳的效果。避免使用笔记本电脑的内置麦克风——它们会引入太多噪音。你需要 3-10 分钟的清晰语音录音。

训练软件:Applio (免费开源) 是训练 RVC 模型的标准工具。它在你的 PC 上本地运行,需要一块至少有 4GB 显存的 GPU(NVIDIA GTX 1650 或更高配置)。根据数据集大小和 GPU 性能,训练需要 15-45 分钟。

变声器:Echo (voicechanger.live/download) 可以加载你训练好的模型并实时运行。它接受 .onnx 模型文件,并且所有处理都在本地进行——你的声音数据绝对不会离开你的电脑。

第一步:录制你的声音数据集

录制 3-10 分钟你自然说话的声音。可以朗读一本书、一篇文章或新闻稿——任何能覆盖各种单词和发音的内容都行。尽量保持音量和与麦克风的距离一致(6-12 英寸,约 15-30 厘米)。避免耳语、大喊或夸张的声调变化,除非你想让模型也复现这些极端情况。

将录音保存为单个 WAV 或 MP3 文件。如果你有多个文件,请将它们合并。训练软件会自动将它们分割成片段。更高质量的录音能产生效果显著更好的模型——30 秒的干净音频每次都胜过 5 分钟的嘈杂音频。

第二步:训练你的 RVC 模型

打开 Applio 并创建一个新的实验。上传你的音频文件,将训练轮数 (epoch) 设置为 200-400(越高越准确但越慢),并选择 f0 音高提取方法(目前 RMVPE 是最佳选择)。点击“训练”然后等待——一个典型的 5 分钟数据集在 GTX 3060 上大约需要 20 分钟训练时间。

训练完成后,你将得到一个 .pth 模型文件。这就是你的声音模型。你可以使用 Echo 模型转换工具 (voicechanger.live/tools/model-converter) 将其转换为 .onnx 格式以供实时使用。

第三步:实时使用你的克隆声音

将 .onnx 文件拖拽到 Echo 应用窗口中即可导入。该模型会出现在你的声音库中,与内置预设并列。选择它,启用语音转换,然后开始说话——你的麦克风输出现在就是你的克隆声音了。

Echo Live 通过虚拟音频线(Windows 上的 VB-Cable,macOS 上的 BlackHole)路由处理后的音频,因此任何应用程序(Discord、Zoom、OBS、游戏)都可以像使用普通麦克风一样使用你的克隆声音。处理过程完全在你的本地 GPU 上进行,延迟极低。

获得最佳声音克隆质量的技巧

数据集质量比数量更重要。3 分钟录音棚质量的音频比 10 分钟嘈杂的录音能产生更好的模型。在安静的房间录音,使用防喷罩,并保持与麦克风的距离一致。

训练轮数:从 200 轮开始。听一下输出效果——如果听起来不错,就停止。如果声音听起来沉闷或像机器人,就增加到 400 轮。超过 600 轮很少能提升质量,还可能导致过拟合(模型记住了你的确切录音,而不是学习通用的声音特征)。

音高匹配:当源声音和目标声音的音高范围相似时,声音克隆效果最好。男声转男声和女声转女声的克隆能产生最自然的效果。跨性别克隆是可能的,但可能需要在 DSP 效果链中进行音高调整。

隐私与道德

Echo 在你的设备上本地处理所有数据。你的录音和训练好的模型永远不会离开你的电脑——没有云端上传,没有服务器处理,也没有数据收集。这与那些将你的声音数据存储在其服务器上的云端克隆服务有着根本的不同。

只克隆你有权使用的声音。未经他人同意克隆其声音会引发严重的道德和法律问题。AI 声音克隆技术功能强大——请负责任地将其用于创意项目、内容创作和个人实验。

常见问题

克隆我的声音需要多长的音频?+
3-10 分钟的清晰语音录音是理想的。高质量的录音比更长但嘈杂的录音能产生更好的效果。在安静的房间里使用 USB 电容麦克风效果就很好。
AI 声音克隆是免费的吗?+
是的。训练软件 (Applio) 和实时变声器 (Echo) 都是免费的。没有订阅,没有云服务费。一切都在你的 PC 上本地运行。
我的声音数据会被上传到云端吗?+
不会。Echo 在你的设备上本地处理所有数据。你的录音和训练好的模型永远不会离开你的电脑。这是与云端服务的关键区别。
我可以在 Discord 和游戏中使用我的克隆声音吗?+
可以。Echo 通过一个虚拟音频线路由你的克隆声音,该虚拟音频线在任何应用程序中都可以作为标准的麦克风输入——包括 Discord、Zoom、OBS、Fortnite、Valorant 等等。

Try Echo

Free AI voice conversion. Download and start in under 60 seconds.

下载 Echo