
Ultimate Vocal Remover,通常称为 UVR5,是一款免费的开源桌面应用,使用 AI 源分离模型将任意歌曲拆分为干净的人声和伴奏音轨。它可以在 Windows、macOS 和 Linux 上运行,支持大多数常见音频格式,并让你使用专业音频工程师在重混、卡拉 OK 制作、清唱提取和转录工作中使用的同类深度学习模型。
问题在于,UVR5 的界面会让你面对一串陌生的模型名称——MDX-Net、VR Arch、Demucs、Ensemble——以及没有默认指导的几十项设置。本文将完整介绍整个流程:准备源文件、安装软件、选择合适的模型、处理音轨,并判断结果是否足以满足你的用途。文章也会说明,什么时候免费的在线人声分离器才是更快、更聪明的选择。
什么是 Ultimate Vocal Remover?
UVR5 是一组由开源音频社区开发的先进源分离模型的 GUI 前端。最新版本 v5.6.0 由 GitHub 维护,并以免费的单键安装程序形式发布。与在远程服务器上运行单一模型的浏览器人声分离器不同,UVR5 允许你在本地下载并运行多个模型系列、调整参数,并将它们串联起来以获得最高质量。
该工具支持 MP3、WAV、FLAC、OGG、M4A 以及 FFmpeg 能解码的任何格式。它可以按你选择的格式输出分离音轨,也能处理单个文件或整批文件。如此强大的代价是复杂度:你需要了解该使用哪个模型、如何配置,以及如何评估结果。本文正是为了降低这条学习曲线。
开始前:准备音频源文件
分离质量在 UVR5 打开之前就已经决定了。源文件质量是结果中最大的单一变量;任何模型设置都无法恢复糟糕输入中已经丢失的信息。最重要的是以下三点。
立体声,而不是单声道。 人声分离模型会利用左右声道之间的差异来区分人声和乐器。单声道源会折叠这类信息。如果文件是单声道,或者人声没有混在立体声中央而是偏离中心,分离质量会明显下降。始终从立体声文件开始。
无损优于压缩。 WAV 和 FLAC 文件保留完整频谱。MP3 尤其是低码率 MP3,会丢弃高频细节并引入压缩伪影,模型可能把这些伪影误判为人声残留。320 kbps MP3 可以使用,但有无损文件时始终应优先选择无损文件。
避免重新编码。 每次有损压缩都会降低音质。如果歌曲来自流媒体抓取,或经过多种格式反复转换,累积的伪影会在分离音轨中表现为浑浊人声或幽灵般的乐器痕迹。应寻找质量最高的原始文件。
| 源文件类型 | 分离难度 | 预期结果质量 |
|---|---|---|
| 干净混音的立体声 WAV 或 FLAC | 低 | 极佳——伪影极少,音轨干净 |
| 干净混音的立体声 320 kbps MP3 | 低至中 | 很好——高频有轻微损失 |
| 低码率 MP3 或重新编码的文件 | 高 | 中等——有明显伪影和人声泄漏 |
| 单声道源 | 很高 | 较差——模型无法利用立体声场 |
| 密集、分层的现代流行混音 | 中至高 | 良好,但副歌可能保留幽灵残留 |
| 编曲稀疏的经典摇滚 | 低 | 极佳——声场宽,分离清晰 |
还有一个实用提醒:密集、层次繁多的制作——带有叠加人声、重混响和宽立体声效果的现代流行音乐——天然比干净混音、主唱清晰位于中央的摇滚音轨更难分离。这不是软件限制,而是音频本身的特性。请据此设定质量预期。
如何安装 Ultimate Vocal Remover
UVR5 通过官方 GitHub 仓库发布。不同操作系统的安装过程略有差异,但步骤并不复杂。
-
下载安装程序。 前往 UVR GitHub 的 Releases 页面,下载适合你平台的最新版本。Windows 用户会获得单键安装程序;macOS 和 Linux 用户按照仓库中的平台说明操作。
-
运行安装程序。 Windows 用户可能会看到杀毒软件警告,这是开源软件常见的误报,可以安全地绕过。在 macOS 上,首次打开未签名应用时,需要右键点击应用并选择“打开”以绕过 Gatekeeper。
-
如果提示则安装 FFmpeg。 某些 UVR5 版本会自动安装它依赖的音频解码库 FFmpeg。如果自动安装失败,可以手动安装 FFmpeg,然后在设置中指向它的位置。
-
检查硬件。 UVR5 可以使用 CPU 运行,但处理速度会很慢,每首音轨可能需要数分钟。NVIDIA GPU(最低 GTX 1060 6GB,推荐 8GB 以上显存)会显著加快速度。Apple Silicon(M1 及更新型号)支持 MDX-Net 和 Demucs 模型的 MPS 加速。没有 GPU 也可以使用,只是需要等待更久。
安装后启动 UVR5,你会看到主界面:输入和输出路径字段、处理方法下拉菜单、模型选择下拉菜单以及设置面板。这就是完整的工作区。
为任务选择合适的模型
这正是大多数初学者卡住的地方。UVR5 的模型列表很长,名称也不透明。关键是按目标选择,而不是按名称选择。

四类模型几乎覆盖所有使用场景:
-
MDX-Net:两轨分离(人声和伴奏)的最佳起点。它在速度和质量之间取得良好平衡,是卡拉 OK 音轨和清唱提取最可靠的选择。推荐起始模型:UVR-MDX-NET Inst HQ 3 或 Kim Vocals 2。
-
Demucs v4(htdemucs):当你需要两条以上音轨时使用。Demucs 会把音轨拆成 4–6 个部分:人声、鼓、贝斯和“其他”,也可以使用扩展的六轨版本。这是需要独立乐器音轨的重混用户和编曲者的选择。它支持 Apple Silicon MPS,也是计算量最大的选项。
-
VR Arch:专门用于后处理的模型系列,尤其适合去混响和去回声。从 MDX 模型中提取人声后,再将人声音轨送入 VR Arch 去混响模型,可以清理混入人声的房间声和混响尾音。
-
Ensemble 模式:它不是独立模型,而是将多个模型串联并合并输出的模式。Ensemble 能产生最高质量的结果,但耗时最长,因为它会依次运行每个模型。当质量比速度更重要时使用它。
| 分离目标 | 推荐模型 | 输出音轨 | 速度 | 质量 |
|---|---|---|---|---|
| 卡拉 OK / 伴奏音轨 | MDX-Net(Inst HQ 3) | 2(人声 + 伴奏) | 快 | 很好 |
| 干净的清唱提取 | MDX-Net(Kim Vocals 2) | 2 | 快 | 很好 |
| 多轨重混(鼓、贝斯、其他) | Demucs v4(htdemucs) | 4–6 | 慢 | 极佳 |
| 对提取的人声去混响 | VR Arch(UVR-De-Echo-Normal) | 1(后处理) | 快 | 专项效果 |
| 最高质量,不考虑时间 | Ensemble(MDX + Demucs + VR) | 2–6 | 很慢 | 最佳 |
对大多数创作者来说,实用流程是:先用 MDX-Net 模型完成初始两轨分离。如果人声仍有混响尾音,再用 VR Arch 的去回声模型处理。如果还需要人声以外的独立乐器,切换到 Demucs。只有在必须尽可能干净、且处理时间不是限制时,才使用 Ensemble。
分步操作:用 UVR5 去除人声
一旦准备好源文件并选定模型,处理流程就很直接。
第 1 步 — 设置输入与输出路径
点击 Select Input 选择音频文件,或将文件拖放到输入字段中。点击 Verify Inputs 确认 UVR5 能识别文件。然后点击 Select Output,选择或创建目标文件夹。在路径下方选择输出格式:需要无损质量时选择 WAV,需要更小文件时选择 MP3。
第 2 步 — 选择处理方式与模型
在 Process Method 下拉菜单中选择模型系列;对大多数用户来说,这应该是 MDX-Net。然后打开 Choose Model 下拉菜单。如果没有看到需要的模型,点击 Download More Models,从可用列表中选择。模型只需下载一次,之后会缓存在本地。
第 3 步 — 配置设置
最重要的是三项设置:
-
采样率。 与源文件保持一致,通常是 44.1 kHz 或 48 kHz。不要升采样,因为它不会增加信息。
-
片段大小。 控制每次处理的音频长度。如果 RAM 达到 16GB 或以上,可以设置为 512,以获得更干净的结果。较低数值占用更少内存,但可能产生更多伪影。
-
GPU conversion。 如果有兼容的 NVIDIA GPU,请启用此选项。与仅使用 CPU 相比,它能将处理时间缩短 5–10 倍。
第 4 步 — 选择音轨输出
选择 Vocal Only、Instrumental Only 或两者。对大多数用途来说,同时导出两条音轨,可以通过对照两个输出评估分离质量。
第 5 步 — 开始处理
点击 Start Processing。进度条会显示完成百分比和预计时间。三分钟的音轨在 GPU 上通常需要 30–60 秒,在 CPU 上则可能需要数分钟。
第 6 步 — 批量处理
如果有多个文件,使用 Batch Processing 标签页。选择多个输入文件,设置一个输出文件夹,只需选择一次模型和设置,UVR5 就会依次处理它们。这适合准备一组卡拉 OK 音轨或分离整张专辑的音轨。
如何评估结果:好的分离是什么样
此时最常见的错误,是只听伴奏开头十秒就宣布分离效果好或坏。这个片段具有误导性:安静主歌、响亮副歌、和声段落和混响很重的过渡都会以不同方式考验模型。你需要在整首歌范围内评估。
先听伴奏。 检查是否有主唱痕迹,即残留在伴奏中的幽灵般人声。它们最容易出现在密集副歌、混响很重的段落,以及人声与相同频段乐器重叠的过渡处。安静段落中几乎听不见的残留,在响亮副歌中可能会变得明显。
再听人声音轨。 检查是否有鼓、贝斯、合成器或从伴奏中泄漏过来的房间声。干净的人声音轨应该听起来是独立的;如果能清楚听见伴奏,说明模型在该段落处理得不好。
理解常见伪影。 Ghosting 是留在伴奏中的人声淡淡阴影。Chirping 是一种听起来像快速高频脉冲的数字伪影,常由激进模型设置或较小的片段大小造成。Bleeding 正好相反,是乐器内容泄漏进人声音轨。Watering 或 shimmering 人声是一种相位伪影,会让人声听起来像经过 flanger,常见于混响很重的源文件。
两条输出可以互相解释。 如果副歌伴奏中有人声残留,人声音轨很可能在同一段落出现伴奏泄漏。找出两条输出共同失败的区域,就能知道歌曲中哪些部分对模型来说含义不明确,以及是否值得使用不同模型或 Ensemble 模式重新处理。
实用的质量检查清单:
-
在安静主歌中听伴奏——人声是否完全消失?
-
在最响的副歌中听伴奏——是否有 ghosting?
-
听人声音轨——能否听见鼓或贝斯泄漏?
-
在过渡或桥段同时听两条音轨——人声和乐器重叠处是否出现伪影?
-
检查句尾的混响尾音——它们是否停留在错误的音轨中?
如果结果通过全部五项检查,对大多数用途来说分离已经足够好。如果只在密集段落失败,尝试 Ensemble 模式或另一组模型组合。如果全程失败,问题很可能出在源文件上。
何时在线人声分离器更合适
UVR5 能提供制作级分离,但这种力量确实有代价:你需要安装软件、下载模型文件、理解模型系列、配置设置并等待处理。对相当一部分使用场景来说,这项投入并不必要。

如果你的目标是个人跟唱的卡拉 OK 伴奏、学习参考用的器乐音轨,或转录用的快速人声预览,那么 UVR5 的最佳输出与优秀在线人声分离器之间的差异,在实际聆听中通常难以察觉。但搭建 UVR5 所需的时间和知识并不会因此消失。
BizMuse AI 人声分离器 是一款免费在线人声分离器,无需安装和注册。上传立体声音频后,AI 会将其分离为人声和伴奏音轨,你可以预览两条输出,再以 WAV 文件下载。它完全在浏览器中运行,适用于任何操作系统,也消除了模型选择、GPU 兼容性和 FFmpeg 设置等让非技术用户难以使用 UVR5 的摩擦。
最终决定取决于你需要什么样的输出:
| 因素 | 桌面 UVR5 | 在线人声分离器(BizMuse) |
|---|---|---|
| 是否需要安装 | 是(软件 + 模型 + FFmpeg) | 不需要——基于浏览器 |
| 技术知识 | 中等至高 | 不需要 |
| 模型选择控制 | 完整(MDX、Demucs、VR、Ensemble) | 自动 |
| 处理速度 | GPU 快,CPU 慢 | 浏览器中数秒 |
| 多轨输出(鼓、贝斯) | 是(Demucs 4–6 轨) | 人声 + 伴奏(2 轨) |
| 最适合 | 重混、多轨提取、制作工作 | 卡拉 OK、快速伴奏、人声参考 |
| 成本 | 免费 | 免费,无需注册 |
框架很简单。如果你需要人声和伴奏之外的独立音轨,或者需要为困难源文件调整模型参数,就使用 UVR5。如果你需要快速、无需设置地完成干净的人声和伴奏分离,就使用 BizMuse AI——它既支持这个免费人声分离工具,也提供完整的 AI 音乐创作功能。
常见问题
Ultimate Vocal Remover 免费吗?
是的。UVR5 100% 免费且开源。软件包中包含的所有模型都可以免费下载和使用。项目在 GitHub 页面接受捐赠,但软件和模型本身不收费。
UVR5 没有 GPU 也能用吗?
可以。UVR5 可以用 CPU 运行,但处理速度会明显更慢:GPU 需要 30 秒的音轨,CPU 可能需要数分钟。实际使用建议至少配备 6GB 显存的 NVIDIA GPU。Apple Silicon(M1 及更新型号)也支持大多数模型的 MPS 加速。
我能分离鼓和贝斯,而不仅是人声吗?
可以。使用 Demucs v4(htdemucs)的 4 轨或 6 轨模式,它可以将歌曲分成人声、鼓、贝斯和其他音轨,扩展的六轨版本还会增加钢琴和吉他。MDX-Net 和 VR Arch 仅限于两轨(人声/伴奏)输出。
处理需要多久?
这取决于硬件、模型和歌曲长度。使用 GPU 时,三分钟歌曲通过 MDX-Net 通常需要 30–60 秒。Demucs 更慢。会串联多个模型的 Ensemble 模式每首歌可能需要数分钟。只使用 CPU 时,耗时可能增加到 5–10 倍。
UVR5 支持哪些音频格式?
UVR5 支持 MP3、WAV、FLAC、OGG、M4A 以及 FFmpeg 能解码的任何格式。默认情况下,它会以输入文件的相同格式输出,但你可以在设置中选择其他格式。
UVR5 可以在 Mac 上使用吗?
可以。UVR5 可以运行在 macOS 上,包括 Intel 和 Apple Silicon(M1 及更新型号)设备。Apple Silicon 支持 MDX-Net 和 Demucs 模型的 MPS GPU 加速。首次启动时,需要右键点击应用并选择“打开”以绕过 macOS Gatekeeper。
快速总结
-
准备源文件。 使用立体声无损文件以获得最佳分离效果。无论选择什么模型,单声道或低码率源文件都会产生较差结果。
-
按目标选择模型。 两轨人声/伴奏使用 MDX-Net,多轨使用 Demucs,去混响使用 VR Arch,最高质量使用 Ensemble。
-
配置三项设置。 让采样率匹配源文件;有足够内存时将片段大小设为 512;可用时启用 GPU conversion。
-
检查整首歌曲。 不要只根据开头判断;检查主歌、副歌、过渡和两条音轨中的混响尾音。
-
选择合适的工具。 需要制作级、多轨工作时使用 UVR5;当设置成本高于质量收益时,卡拉 OK、快速伴奏和人声参考可使用免费在线人声分离器。