toolgarden.xyz
EN
音频分轨人声分离伴奏提取HT-Demucs本地处理

在线音频分轨怎么用?本地分离人声、伴奏、鼓、贝斯、吉他和钢琴

了解音频分轨的原理、4 轨与 6 轨模型的区别,并在浏览器本地把歌曲拆分成人声、鼓、贝斯、吉他、钢琴和其他声部。

ToolGarden 推荐的工具优先在浏览器本地运行,文件和文本不必上传到服务器,适合更注重安全隐私的日常处理。

发布于 2026年7月30日约 9 分钟阅读作者 ToolGarden

想从一首歌里提取纯人声、制作伴奏,或者单独听鼓、贝斯、吉他和钢琴,不一定要安装大型音频软件。浏览器中的音乐源分离模型可以直接读取歌曲,估算各个声部,并把结果导出为独立 WAV 文件。

ToolGarden 的音频分轨工具使用开源 HT-Demucs ONNX 模型。音频解码、模型推理、分段拼接和 WAV 编码都在浏览器本地完成;首次使用需要下载模型资源,但选择的歌曲不会作为分轨任务上传到服务器。

什么是音频分轨?

普通歌曲通常已经混合成左右两个声道。人声、鼓、贝斯和其他乐器共享同一段波形,因此不能像解压 ZIP 一样恢复录音棚里的原始多轨。音频分轨模型会根据频谱、节奏、音色和上下文估算每个声部在混音中的贡献,生成新的分离轨道。

分轨结果适合练习、卡拉 OK 伴奏、混音参考、扒谱和内容分析,但不等同于原始工程文件。混响、失真、合唱、叠录和频率重叠都会让不同轨道之间留下少量串音。

4 轨和 6 轨模型应该怎么选?

模型输出轨道更适合主要取舍
4 轨 HT-Demucs人声、鼓、贝斯、其他提取人声、制作伴奏、节奏练习人声和“其他”通常更集中,但没有独立吉他和钢琴
6 轨 HT-Demucs人声、鼓、贝斯、其他、吉他、钢琴吉他或钢琴练习、六声部分析多两条独立轨道,但“其他”会被进一步拆分,可能显得更弱

只需要消除人声或提取伴奏时,优先选择 4 轨模型。只有确实需要单独拿到吉他或钢琴时,再选择 6 轨模型。输出轨道越多并不代表总体音质一定更好,它只是把同一段混音划分得更细。

如何在浏览器里完成一次音频分轨

  1. 打开音频分轨工具,点击上传区域或把歌曲拖入页面。
  2. 在 4 轨和 6 轨模型之间选择。只做伴奏或人声时建议使用 4 轨。
  3. 勾选需要导出的轨道。减少不需要的长音频输出可以降低结果占用的内存。
  4. 点击“开始分轨”,保持页面打开,等待解码、模型下载、模型加载、分轨和 WAV 编码完成。
  5. 试听结果,分别下载需要的轨道,或把全部结果打包为 ZIP 下载。

为什么第一次使用会比较慢?

分轨页面本身很小,但神经网络模型较大:当前 4 轨模型约 158 MiB,6 轨模型约 130 MiB。模型只在实际开始分轨时下载,校验后存入浏览器缓存;同一浏览器后续使用通常可以复用缓存。

下载完成后,浏览器还要创建 ONNX Runtime 会话并加载模型参数,这一步可能需要 10–15 秒。模型文件采用较小的 FP16 权重存储,但推理时仍需要约 1 GB 以上的运行内存。文件大小较小不等于运行时内存也同样小。

  • 优先使用最新版桌面 Chrome 或 Edge。
  • 处理前关闭占用大量内存的标签页和应用。
  • 长歌曲可以先用音频剪辑工具截取需要的部分。
  • 不要在模型加载或分轨过程中刷新、休眠或关闭页面。
  • 移动端浏览器通常有更严格的内存限制,不适合运行这类模型。

“本地处理”是否意味着完全不联网?

不是。第一次使用需要联网下载页面代码、ONNX Runtime 和模型文件。这里的隐私边界是:网站从公开资源地址下载运行程序和模型,但用户选择的音频文件留在浏览器中,不会被发送给远程分轨 API。

在浏览器 Network 面板中看到模型、WASM 或 Worker 请求是正常的。验证隐私时,应检查请求体里是否出现所选歌曲,而不能把所有网络请求都理解为音频上传。模型准备好并缓存后,后续使用所需的网络流量通常会明显减少。

如何判断分轨结果是否可用?

不要只试听单独一条轨道。把人声、鼓、贝斯和其他轨道重新叠加,检查它们是否能大致还原原曲;再分别关注最重要的目标轨道。轻微金属感或残留通常无法完全避免,真正需要判断的是这些瑕疵会不会影响你的使用目的。

  • 制作卡拉 OK:重点检查伴奏里是否残留明显主唱,以及人声移除后是否出现空洞。
  • 乐器练习:重点检查节拍、主旋律和目标乐器是否连续,不必追求录音棚级隔离。
  • 混音或采样:在耳机和音箱上试听,并检查相位、低频和瞬态伪影。
  • 转写或分析:优先选择包含目标语音或乐器且串音最少的轨道。

常见失败原因与处理方法

现象常见原因建议
模型下载失败网络无法访问模型资源、连接中断或缓存不完整检查网络后重试;必要时清除已缓存模型
模型长时间加载浏览器正在校验模型并创建本地推理会话等待 10–15 秒,避免重复点击或刷新
模型加载失败浏览器或设备可用内存不足关闭其他标签页,改用桌面 Chrome/Edge 后重试
分轨中途失败音频过长、选择轨道过多或推理阶段内存不足缩短音频,减少输出轨道,再重新处理
轨道有串音原混音中多个声部频率、混响或失真高度重叠尝试另一个模型,并根据最终用途判断是否可接受

版权与使用边界

技术上能够分离歌曲,不代表可以任意发布、出售或重新分发结果。商业发行、公开演出、视频配乐和训练数据等用途可能涉及录音制品、词曲和表演者权利。请只处理自己拥有权利、已获授权或适用法律明确允许使用的音频。

总结

在线音频分轨最重要的选择不是“轨道越多越好”,而是根据目标选对模型:提取人声或伴奏优先 4 轨,需要吉他或钢琴时使用 6 轨。浏览器本地推理可以减少音频上传带来的隐私暴露,但大型模型仍需要下载时间、充足内存和合理的音质预期。

常见问题

Q.音频分轨时歌曲会上传到服务器吗?

不会。歌曲解码、模型推理、分段拼接和 WAV 编码都在浏览器本地完成。首次使用需要下载模型与运行时资源,但模型下载不等于上传用户音频。

Q.提取伴奏应该选择 4 轨还是 6 轨?

通常选择 4 轨。它直接输出人声、鼓、贝斯和其他,适合把人声去掉后重新组合伴奏。只有需要单独提取吉他或钢琴时才选择 6 轨。

Q.为什么 130 MB 的模型需要超过 1 GB 内存?

130 MB 是模型权重的存储体积。浏览器推理时还需要展开权重、创建 ONNX Runtime 会话、保存中间张量和输出缓冲,因此运行时内存会远大于下载文件。

Q.为什么分离后的人声里还有伴奏?

音乐源分离是模型估算,不是恢复录音棚原始多轨。当人声与乐器共享频率、混响、失真或声像位置时,少量串音很难完全避免。

Q.手机可以运行音频分轨吗?

部分高端设备可能可以,但不推荐。移动端浏览器的内存上限、后台回收和发热限制更严格,桌面版 Chrome 或 Edge 通常更稳定。