从你的目标声音中收集 10-30 分钟的干净人声音频。使用我们的人声分离器从歌曲中提取人声。
将音频输入 RVC 训练软件(如 Applio、Mangio-RVC)。在现代 GPU 上训练需要 1-4 小时。
将你训练好的 .pth 模型文件拖入 Echo。应用会自动检测模型参数。
你的声音通过训练好的模型进行实时转换。在 Discord、游戏、OBS 或任何语音聊天中使用。
为 D&D 战役、VTuber 形象或角色扮演创建独特的角色语音。一次训练,永久使用。
克隆你自己的声音,并使用该模型在视频中保持一致的音频质量,即使你真实的声音疲惫或沙哑。
在 Discord 中听起来像你最喜欢的游戏角色。克隆标志性的声音并在竞技游戏的语音聊天中使用。
AI 翻唱——训练一个歌手声音的模型,并生成歌曲的翻唱版本。在 YouTube 和 TikTok 上很受欢迎。
为你自己或亲人的声音创建一个数字备份。为未来保存某个人的声音。
跨语言克隆说话者的声音。在为配音说不同语言时保持相同的声音特征。
声音克隆的质量几乎完全取决于训练数据。干净、独立的人声音频,没有背景音乐、混响或噪音,会产生比嘈杂录音好得多的效果。 Vocal Remover / Noise Remover
训练数据的多样性也很重要。包括不同的音高、情感、语速和声音风格。一个只用平静叙述训练的模型将难以处理喊叫或耳语。最好的模型能捕捉到目标声音的全部表达范围。
有关数据集准备、训练参数和评估的详细演练,请阅读我们完整的 RVC 训练教程。
AI 声音克隆使用深度学习来分析目标声音的音频样本,并学习其独特的特征——音色、音高模式、共振峰结构和发音习惯。训练好的模型然后可以将任何输入语音实时转换为听起来像目标声音。Echo 使用 RVC(基于检索的语音转换)技术,只需 10 分钟的训练音频即可产生自然的声音效果。
10-30 分钟的干净、独立的人声音频是理想的。音频应为单一说话者,没有背景音乐或噪音。音高、情感和说话风格的多样性会产生更好的结果。少于 5 分钟通常质量较差,而超过 30 分钟很少能改善结果,只会增加训练时间。