教程··阅读时长 8 分钟

如何从任何歌曲中移除人声

为什么以前移除人声那么难

直到最近,从歌曲中移除人声还需要专业的音频软件,如 iZotope RX(售价 399 美元)、Adobe Audition(订阅制),或者花费数小时进行手动均衡器雕琢。旧技术——相位抵消和中置声道提取——依赖于人声被平移到正中心的假设。它们产生的结果很浑浊,人声残留会泄露到伴奏中,而乐器声也会泄露到人声音轨里。

AI 改变了一切。现代的人声移除工具使用深度神经网络(特别是像 Open-Unmix、Demucs 和 MDX-Net 这样的架构),这些网络在数十万首歌曲上进行了训练。这些模型学会了以相位抵消技术无法企及的精度来区分人声频率和乐器频率。结果就是:在你的浏览器里,几秒钟内就能免费实现干净的分离。

如何移除人声——分步教程

第 1 步:在 voicechanger.live/tools/vocal-remover 打开 AI 人声移除器。无需账户,无需下载,无需注册。

第 2 步:上传你的音频文件。该工具接受 MP3、WAV、FLAC、OGG 和大多数常见的音频格式。没有文件大小限制——处理过程完全在你的浏览器中使用 WebAssembly 和设备的 GPU 进行。

第 3 步:等待 AI 处理。根据歌曲长度和你的硬件,分离过程需要 10-30 秒。在神经网络分析音频时,你会看到一个进度指示器。

第 4 步:下载你的结果。你会得到两个独立的文件:分离出的伴奏(移除了人声)和分离出的人声(移除了伴奏)。两者都可以下载为 WAV 文件,以获得最佳音质。

重要提示:你的音频文件永远不会离开你的电脑。整个 AI 模型都在你的浏览器本地运行——没有任何内容会上传到任何服务器。这对于有版权敏感性的材料和未发布的音乐来说至关重要。

何时使用人声移除器 vs. 音轨分离器

人声移除器将一首歌曲分成两个音轨:人声和伴奏。这非常适合制作卡拉OK、伴奏带和简单的混音,当你只需要音乐而不需要歌手时。

音轨分离器(voicechanger.live/tools/stem-splitter)更进一步——它将一首歌曲分成四个独立的音轨:人声、鼓、贝斯和其他乐器。这是音乐制作人的工具,他们想要分离一段鼓点进行采样、提取一段贝斯线进行混音,或者扒出一段吉他riff进行翻弹。

当你只需要去掉人声时,使用人声移除器。当你需要对单个乐器进行精细控制时,使用音轨分离器。

AI 人声移除的实际工作原理

传统的人声移除使用相位抵消:如果你反转左声道并将其与右声道混合,任何位于中心的音频(通常是人声)都会被抵消掉。问题是,贝斯、底鼓和主奏乐器也通常位于中心——所以你也会失去它们。结果总是一种妥协。

AI 人声移除器采用了根本不同的方法。它们使用基于频谱图的神经网络来分析音频的时频表示。模型通过学习数千个专业多轨录音,知道了人声在频谱图空间中“长”什么样,而吉他、鼓和合成器又“长”什么样。在推理过程中,它会生成一个软掩码,将人声能量与乐器能量隔离开来——从而产生比任何信号处理技术都干净得多的分离效果。

浏览器工具(包括我们的)中使用的模型通常基于 Open-Unmix 或 Hybrid Demucs 架构,并为 WebAssembly 执行进行了优化。它们在现代硬件上能以接近原生的速度运行。

获得最干净结果的技巧

音源质量最重要。一个 320kbps 的 MP3 或无损的 WAV/FLAC 文件总能比 128kbps 的 MP3 或 YouTube 扒下来的音频产生更好的分离效果。AI 模型只能处理音频中存在的信息——压缩产生的失真会在分离过程中被放大。

录音室录音比现场录音分离得更好。在专业录音室录制的歌曲,其干净、独立的人声音轨是混在伴奏之上的。而现场录音则有房间声学、观众噪音以及乐器间的串音,这些都会干扰 AI。

人声上过重的混响会使分离更加困难。如果原始人声有很长的混响尾音,AI 可能难以区分混响和伴奏。结果可能是在伴奏轨道中留有幽灵般的人声残留。对于混响过重的音轨,音轨分离器有时会比更简单的人声移除器产生更干净的结果。

配器极简的民谣歌曲通常可以完美分离。而电子音乐中经过重度处理的人声(如 autotune、声码器)可能更具挑战性,因为人声处理使得声音与合成乐器更难区分。

人声移除与其他替代方案的对比

LALAL.AI 是最知名的商业人声移除工具。它提供卓越的分离质量,采用基于云的处理模型。免费版限制你只能处理 10 分钟的音频,并且导出质量较低——全质量导出需要订阅(每月 15 美元起)。LALAL.AI 会将你的音频上传到他们的服务器进行处理。

Moises 在音乐人中很受欢迎,用于练习和学习。它可以分离音轨,还可以调整速度和音调。与 LALAL.AI 一样,它在云端处理音频,并采用订阅模式(每月 3.99-9.99 美元)。其分离质量很高,尤其对于常见的歌曲结构。

我们的人声移除器完全在你的浏览器本地处理——无需上传,无需账户,无需订阅,没有文件限制。代价是处理速度取决于你的硬件。在现代的笔记本电脑或台式机上,对于大多数使用场景,其质量和速度可与付费替代方案相媲美。

常见问题

真的完全免费且没有限制吗?+
是的。我们的人声移除器和音轨分离器完全免费,没有文件大小限制,没有水印,也无需注册账户。处理过程在你的浏览器本地进行——你的文件永远不会被上传。
AI 人声移除适用于任何歌曲吗?+
它对大多数商业制作的音乐都效果极佳。人声和伴奏分离干净的录音室作品能产生最好的输出效果。现场录音和人声混响过重的歌曲对任何一款人声移除器来说都更具挑战性。
分离出的伴奏质量足够用于卡拉OK吗?+
对大多数歌曲来说,是的。现代 AI 分离技术能产生干净的伴奏,适用于卡拉OK、翻唱视频和 DJ 表演。对于配器非常稀疏或人声处理过重的歌曲,可能会有轻微的残留音。
我能只分离出人声吗?+
可以。人声移除器会同时输出伴奏(移除人声后)和分离出的人声(清唱音轨)。两者都可以作为单独的文件下载。
人声移除和音轨分离有什么区别?+
人声移除将一首歌分成两个音轨:人声和伴奏。音轨分离则分成四个:人声、鼓、贝斯和其他乐器。对于卡拉OK和简单需求,使用人声移除。对于音乐制作、混音和采样,使用音轨分离。
我的音频会上传到服务器吗?+
不会。整个 AI 模型都在你的浏览器本地使用 WebAssembly 和 GPU 加速运行。你的音频文件永远不会离开你的设备。这对于有版权敏感性的材料和未发布的音乐来说非常重要。

Try Echo

Free AI voice conversion. Download and start in under 60 seconds.

下载 Echo