返回博客

如何使用 Ultimate Vocal Remover(UVR5)实现干净的人声分离

学习如何使用 Ultimate Vocal Remover 分离人声与伴奏:准备音频、选择模型、配置处理、评估伪影,并判断何时在线工具更快。

2026年7月31日Maya Chen创意技术编辑

Ultimate Vocal Remover 完整指南封面:分离人声与伴奏的概念图

Ultimate Vocal Remover,通常称为 UVR5,是一款免费的开源桌面应用,使用 AI 源分离模型将任意歌曲拆分为干净的人声和伴奏音轨。它可以在 Windows、macOS 和 Linux 上运行,支持大多数常见音频格式,并让你使用专业音频工程师在重混、卡拉 OK 制作、清唱提取和转录工作中使用的同类深度学习模型。

问题在于,UVR5 的界面会让你面对一串陌生的模型名称——MDX-Net、VR Arch、Demucs、Ensemble——以及没有默认指导的几十项设置。本文将完整介绍整个流程:准备源文件、安装软件、选择合适的模型、处理音轨,并判断结果是否足以满足你的用途。文章也会说明,什么时候免费的在线人声分离器才是更快、更聪明的选择。

什么是 Ultimate Vocal Remover?

UVR5 是一组由开源音频社区开发的先进源分离模型的 GUI 前端。最新版本 v5.6.0 由 GitHub 维护,并以免费的单键安装程序形式发布。与在远程服务器上运行单一模型的浏览器人声分离器不同,UVR5 允许你在本地下载并运行多个模型系列、调整参数,并将它们串联起来以获得最高质量。

该工具支持 MP3、WAV、FLAC、OGG、M4A 以及 FFmpeg 能解码的任何格式。它可以按你选择的格式输出分离音轨,也能处理单个文件或整批文件。如此强大的代价是复杂度:你需要了解该使用哪个模型、如何配置,以及如何评估结果。本文正是为了降低这条学习曲线。

开始前:准备音频源文件

分离质量在 UVR5 打开之前就已经决定了。源文件质量是结果中最大的单一变量;任何模型设置都无法恢复糟糕输入中已经丢失的信息。最重要的是以下三点。

立体声,而不是单声道。 人声分离模型会利用左右声道之间的差异来区分人声和乐器。单声道源会折叠这类信息。如果文件是单声道,或者人声没有混在立体声中央而是偏离中心,分离质量会明显下降。始终从立体声文件开始。

无损优于压缩。 WAV 和 FLAC 文件保留完整频谱。MP3 尤其是低码率 MP3,会丢弃高频细节并引入压缩伪影,模型可能把这些伪影误判为人声残留。320 kbps MP3 可以使用,但有无损文件时始终应优先选择无损文件。

避免重新编码。 每次有损压缩都会降低音质。如果歌曲来自流媒体抓取,或经过多种格式反复转换,累积的伪影会在分离音轨中表现为浑浊人声或幽灵般的乐器痕迹。应寻找质量最高的原始文件。

源文件类型分离难度预期结果质量
干净混音的立体声 WAV 或 FLAC极佳——伪影极少,音轨干净
干净混音的立体声 320 kbps MP3低至中很好——高频有轻微损失
低码率 MP3 或重新编码的文件中等——有明显伪影和人声泄漏
单声道源很高较差——模型无法利用立体声场
密集、分层的现代流行混音中至高良好,但副歌可能保留幽灵残留
编曲稀疏的经典摇滚极佳——声场宽,分离清晰

还有一个实用提醒:密集、层次繁多的制作——带有叠加人声、重混响和宽立体声效果的现代流行音乐——天然比干净混音、主唱清晰位于中央的摇滚音轨更难分离。这不是软件限制,而是音频本身的特性。请据此设定质量预期。

如何安装 Ultimate Vocal Remover

UVR5 通过官方 GitHub 仓库发布。不同操作系统的安装过程略有差异,但步骤并不复杂。

  1. 下载安装程序。 前往 UVR GitHub 的 Releases 页面,下载适合你平台的最新版本。Windows 用户会获得单键安装程序;macOS 和 Linux 用户按照仓库中的平台说明操作。

  2. 运行安装程序。 Windows 用户可能会看到杀毒软件警告,这是开源软件常见的误报,可以安全地绕过。在 macOS 上,首次打开未签名应用时,需要右键点击应用并选择“打开”以绕过 Gatekeeper。

  3. 如果提示则安装 FFmpeg。 某些 UVR5 版本会自动安装它依赖的音频解码库 FFmpeg。如果自动安装失败,可以手动安装 FFmpeg,然后在设置中指向它的位置。

  4. 检查硬件。 UVR5 可以使用 CPU 运行,但处理速度会很慢,每首音轨可能需要数分钟。NVIDIA GPU(最低 GTX 1060 6GB,推荐 8GB 以上显存)会显著加快速度。Apple Silicon(M1 及更新型号)支持 MDX-Net 和 Demucs 模型的 MPS 加速。没有 GPU 也可以使用,只是需要等待更久。

安装后启动 UVR5,你会看到主界面:输入和输出路径字段、处理方法下拉菜单、模型选择下拉菜单以及设置面板。这就是完整的工作区。

为任务选择合适的模型

这正是大多数初学者卡住的地方。UVR5 的模型列表很长,名称也不透明。关键是按目标选择,而不是按名称选择。

解释应根据分离目标选择哪类 UVR5 模型的图示

四类模型几乎覆盖所有使用场景:

  • MDX-Net:两轨分离(人声和伴奏)的最佳起点。它在速度和质量之间取得良好平衡,是卡拉 OK 音轨和清唱提取最可靠的选择。推荐起始模型:UVR-MDX-NET Inst HQ 3 或 Kim Vocals 2。

  • Demucs v4(htdemucs):当你需要两条以上音轨时使用。Demucs 会把音轨拆成 4–6 个部分:人声、鼓、贝斯和“其他”,也可以使用扩展的六轨版本。这是需要独立乐器音轨的重混用户和编曲者的选择。它支持 Apple Silicon MPS,也是计算量最大的选项。

  • VR Arch:专门用于后处理的模型系列,尤其适合去混响和去回声。从 MDX 模型中提取人声后,再将人声音轨送入 VR Arch 去混响模型,可以清理混入人声的房间声和混响尾音。

  • Ensemble 模式:它不是独立模型,而是将多个模型串联并合并输出的模式。Ensemble 能产生最高质量的结果,但耗时最长,因为它会依次运行每个模型。当质量比速度更重要时使用它。

分离目标推荐模型输出音轨速度质量
卡拉 OK / 伴奏音轨MDX-Net(Inst HQ 3)2(人声 + 伴奏)很好
干净的清唱提取MDX-Net(Kim Vocals 2)2很好
多轨重混(鼓、贝斯、其他)Demucs v4(htdemucs)4–6极佳
对提取的人声去混响VR Arch(UVR-De-Echo-Normal)1(后处理)专项效果
最高质量,不考虑时间Ensemble(MDX + Demucs + VR)2–6很慢最佳

对大多数创作者来说,实用流程是:先用 MDX-Net 模型完成初始两轨分离。如果人声仍有混响尾音,再用 VR Arch 的去回声模型处理。如果还需要人声以外的独立乐器,切换到 Demucs。只有在必须尽可能干净、且处理时间不是限制时,才使用 Ensemble。

分步操作:用 UVR5 去除人声

一旦准备好源文件并选定模型,处理流程就很直接。

第 1 步 — 设置输入与输出路径

点击 Select Input 选择音频文件,或将文件拖放到输入字段中。点击 Verify Inputs 确认 UVR5 能识别文件。然后点击 Select Output,选择或创建目标文件夹。在路径下方选择输出格式:需要无损质量时选择 WAV,需要更小文件时选择 MP3。

第 2 步 — 选择处理方式与模型

Process Method 下拉菜单中选择模型系列;对大多数用户来说,这应该是 MDX-Net。然后打开 Choose Model 下拉菜单。如果没有看到需要的模型,点击 Download More Models,从可用列表中选择。模型只需下载一次,之后会缓存在本地。

第 3 步 — 配置设置

最重要的是三项设置:

  • 采样率。 与源文件保持一致,通常是 44.1 kHz 或 48 kHz。不要升采样,因为它不会增加信息。

  • 片段大小。 控制每次处理的音频长度。如果 RAM 达到 16GB 或以上,可以设置为 512,以获得更干净的结果。较低数值占用更少内存,但可能产生更多伪影。

  • GPU conversion。 如果有兼容的 NVIDIA GPU,请启用此选项。与仅使用 CPU 相比,它能将处理时间缩短 5–10 倍。

第 4 步 — 选择音轨输出

选择 Vocal OnlyInstrumental Only 或两者。对大多数用途来说,同时导出两条音轨,可以通过对照两个输出评估分离质量。

第 5 步 — 开始处理

点击 Start Processing。进度条会显示完成百分比和预计时间。三分钟的音轨在 GPU 上通常需要 30–60 秒,在 CPU 上则可能需要数分钟。

第 6 步 — 批量处理

如果有多个文件,使用 Batch Processing 标签页。选择多个输入文件,设置一个输出文件夹,只需选择一次模型和设置,UVR5 就会依次处理它们。这适合准备一组卡拉 OK 音轨或分离整张专辑的音轨。

如何评估结果:好的分离是什么样

此时最常见的错误,是只听伴奏开头十秒就宣布分离效果好或坏。这个片段具有误导性:安静主歌、响亮副歌、和声段落和混响很重的过渡都会以不同方式考验模型。你需要在整首歌范围内评估。

先听伴奏。 检查是否有主唱痕迹,即残留在伴奏中的幽灵般人声。它们最容易出现在密集副歌、混响很重的段落,以及人声与相同频段乐器重叠的过渡处。安静段落中几乎听不见的残留,在响亮副歌中可能会变得明显。

再听人声音轨。 检查是否有鼓、贝斯、合成器或从伴奏中泄漏过来的房间声。干净的人声音轨应该听起来是独立的;如果能清楚听见伴奏,说明模型在该段落处理得不好。

理解常见伪影。 Ghosting 是留在伴奏中的人声淡淡阴影。Chirping 是一种听起来像快速高频脉冲的数字伪影,常由激进模型设置或较小的片段大小造成。Bleeding 正好相反,是乐器内容泄漏进人声音轨。Watering 或 shimmering 人声是一种相位伪影,会让人声听起来像经过 flanger,常见于混响很重的源文件。

两条输出可以互相解释。 如果副歌伴奏中有人声残留,人声音轨很可能在同一段落出现伴奏泄漏。找出两条输出共同失败的区域,就能知道歌曲中哪些部分对模型来说含义不明确,以及是否值得使用不同模型或 Ensemble 模式重新处理。

实用的质量检查清单:

  1. 在安静主歌中听伴奏——人声是否完全消失?

  2. 在最响的副歌中听伴奏——是否有 ghosting?

  3. 听人声音轨——能否听见鼓或贝斯泄漏?

  4. 在过渡或桥段同时听两条音轨——人声和乐器重叠处是否出现伪影?

  5. 检查句尾的混响尾音——它们是否停留在错误的音轨中?

如果结果通过全部五项检查,对大多数用途来说分离已经足够好。如果只在密集段落失败,尝试 Ensemble 模式或另一组模型组合。如果全程失败,问题很可能出在源文件上。

何时在线人声分离器更合适

UVR5 能提供制作级分离,但这种力量确实有代价:你需要安装软件、下载模型文件、理解模型系列、配置设置并等待处理。对相当一部分使用场景来说,这项投入并不必要。

比较桌面 UVR5 与在线人声分离器的决策框架

如果你的目标是个人跟唱的卡拉 OK 伴奏、学习参考用的器乐音轨,或转录用的快速人声预览,那么 UVR5 的最佳输出与优秀在线人声分离器之间的差异,在实际聆听中通常难以察觉。但搭建 UVR5 所需的时间和知识并不会因此消失。

BizMuse AI 人声分离器 是一款免费在线人声分离器,无需安装和注册。上传立体声音频后,AI 会将其分离为人声和伴奏音轨,你可以预览两条输出,再以 WAV 文件下载。它完全在浏览器中运行,适用于任何操作系统,也消除了模型选择、GPU 兼容性和 FFmpeg 设置等让非技术用户难以使用 UVR5 的摩擦。

最终决定取决于你需要什么样的输出:

因素桌面 UVR5在线人声分离器(BizMuse)
是否需要安装是(软件 + 模型 + FFmpeg)不需要——基于浏览器
技术知识中等至高不需要
模型选择控制完整(MDX、Demucs、VR、Ensemble)自动
处理速度GPU 快,CPU 慢浏览器中数秒
多轨输出(鼓、贝斯)是(Demucs 4–6 轨)人声 + 伴奏(2 轨)
最适合重混、多轨提取、制作工作卡拉 OK、快速伴奏、人声参考
成本免费免费,无需注册

框架很简单。如果你需要人声和伴奏之外的独立音轨,或者需要为困难源文件调整模型参数,就使用 UVR5。如果你需要快速、无需设置地完成干净的人声和伴奏分离,就使用 BizMuse AI——它既支持这个免费人声分离工具,也提供完整的 AI 音乐创作功能。

常见问题

Ultimate Vocal Remover 免费吗?

是的。UVR5 100% 免费且开源。软件包中包含的所有模型都可以免费下载和使用。项目在 GitHub 页面接受捐赠,但软件和模型本身不收费。

UVR5 没有 GPU 也能用吗?

可以。UVR5 可以用 CPU 运行,但处理速度会明显更慢:GPU 需要 30 秒的音轨,CPU 可能需要数分钟。实际使用建议至少配备 6GB 显存的 NVIDIA GPU。Apple Silicon(M1 及更新型号)也支持大多数模型的 MPS 加速。

我能分离鼓和贝斯,而不仅是人声吗?

可以。使用 Demucs v4(htdemucs)的 4 轨或 6 轨模式,它可以将歌曲分成人声、鼓、贝斯和其他音轨,扩展的六轨版本还会增加钢琴和吉他。MDX-Net 和 VR Arch 仅限于两轨(人声/伴奏)输出。

处理需要多久?

这取决于硬件、模型和歌曲长度。使用 GPU 时,三分钟歌曲通过 MDX-Net 通常需要 30–60 秒。Demucs 更慢。会串联多个模型的 Ensemble 模式每首歌可能需要数分钟。只使用 CPU 时,耗时可能增加到 5–10 倍。

UVR5 支持哪些音频格式?

UVR5 支持 MP3、WAV、FLAC、OGG、M4A 以及 FFmpeg 能解码的任何格式。默认情况下,它会以输入文件的相同格式输出,但你可以在设置中选择其他格式。

UVR5 可以在 Mac 上使用吗?

可以。UVR5 可以运行在 macOS 上,包括 Intel 和 Apple Silicon(M1 及更新型号)设备。Apple Silicon 支持 MDX-Net 和 Demucs 模型的 MPS GPU 加速。首次启动时,需要右键点击应用并选择“打开”以绕过 macOS Gatekeeper。

快速总结

  • 准备源文件。 使用立体声无损文件以获得最佳分离效果。无论选择什么模型,单声道或低码率源文件都会产生较差结果。

  • 按目标选择模型。 两轨人声/伴奏使用 MDX-Net,多轨使用 Demucs,去混响使用 VR Arch,最高质量使用 Ensemble。

  • 配置三项设置。 让采样率匹配源文件;有足够内存时将片段大小设为 512;可用时启用 GPU conversion。

  • 检查整首歌曲。 不要只根据开头判断;检查主歌、副歌、过渡和两条音轨中的混响尾音。

  • 选择合适的工具。 需要制作级、多轨工作时使用 UVR5;当设置成本高于质量收益时,卡拉 OK、快速伴奏和人声参考可使用免费在线人声分离器。