想从一首歌里提取纯人声、制作伴奏,或者单独听鼓、贝斯、吉他和钢琴,不一定要安装大型音频软件。浏览器中的音乐源分离模型可以直接读取歌曲,估算各个声部,并把结果导出为独立 WAV 文件。
ToolGarden 的音频分轨工具使用开源 HT-Demucs ONNX 模型。音频解码、模型推理、分段拼接和 WAV 编码都在浏览器本地完成;首次使用需要下载模型资源,但选择的歌曲不会作为分轨任务上传到服务器。
什么是音频分轨?
普通歌曲通常已经混合成左右两个声道。人声、鼓、贝斯和其他乐器共享同一段波形,因此不能像解压 ZIP 一样恢复录音棚里的原始多轨。音频分轨模型会根据频谱、节奏、音色和上下文估算每个声部在混音中的贡献,生成新的分离轨道。
分轨结果适合练习、卡拉 OK 伴奏、混音参考、扒谱和内容分析,但不等同于原始工程文件。混响、失真、合唱、叠录和频率重叠都会让不同轨道之间留下少量串音。
4 轨和 6 轨模型应该怎么选?
| 模型 | 输出轨道 | 更适合 | 主要取舍 |
|---|---|---|---|
| 4 轨 HT-Demucs | 人声、鼓、贝斯、其他 | 提取人声、制作伴奏、节奏练习 | 人声和“其他”通常更集中,但没有独立吉他和钢琴 |
| 6 轨 HT-Demucs | 人声、鼓、贝斯、其他、吉他、钢琴 | 吉他或钢琴练习、六声部分析 | 多两条独立轨道,但“其他”会被进一步拆分,可能显得更弱 |
只需要消除人声或提取伴奏时,优先选择 4 轨模型。只有确实需要单独拿到吉他或钢琴时,再选择 6 轨模型。输出轨道越多并不代表总体音质一定更好,它只是把同一段混音划分得更细。
如何在浏览器里完成一次音频分轨
- 打开音频分轨工具,点击上传区域或把歌曲拖入页面。
- 在 4 轨和 6 轨模型之间选择。只做伴奏或人声时建议使用 4 轨。
- 勾选需要导出的轨道。减少不需要的长音频输出可以降低结果占用的内存。
- 点击“开始分轨”,保持页面打开,等待解码、模型下载、模型加载、分轨和 WAV 编码完成。
- 试听结果,分别下载需要的轨道,或把全部结果打包为 ZIP 下载。
为什么第一次使用会比较慢?
分轨页面本身很小,但神经网络模型较大:当前 4 轨模型约 158 MiB,6 轨模型约 130 MiB。模型只在实际开始分轨时下载,校验后存入浏览器缓存;同一浏览器后续使用通常可以复用缓存。
下载完成后,浏览器还要创建 ONNX Runtime 会话并加载模型参数,这一步可能需要 10–15 秒。模型文件采用较小的 FP16 权重存储,但推理时仍需要约 1 GB 以上的运行内存。文件大小较小不等于运行时内存也同样小。
- 优先使用最新版桌面 Chrome 或 Edge。
- 处理前关闭占用大量内存的标签页和应用。
- 长歌曲可以先用音频剪辑工具截取需要的部分。
- 不要在模型加载或分轨过程中刷新、休眠或关闭页面。
- 移动端浏览器通常有更严格的内存限制,不适合运行这类模型。
“本地处理”是否意味着完全不联网?
不是。第一次使用需要联网下载页面代码、ONNX Runtime 和模型文件。这里的隐私边界是:网站从公开资源地址下载运行程序和模型,但用户选择的音频文件留在浏览器中,不会被发送给远程分轨 API。
在浏览器 Network 面板中看到模型、WASM 或 Worker 请求是正常的。验证隐私时,应检查请求体里是否出现所选歌曲,而不能把所有网络请求都理解为音频上传。模型准备好并缓存后,后续使用所需的网络流量通常会明显减少。
如何判断分轨结果是否可用?
不要只试听单独一条轨道。把人声、鼓、贝斯和其他轨道重新叠加,检查它们是否能大致还原原曲;再分别关注最重要的目标轨道。轻微金属感或残留通常无法完全避免,真正需要判断的是这些瑕疵会不会影响你的使用目的。
- 制作卡拉 OK:重点检查伴奏里是否残留明显主唱,以及人声移除后是否出现空洞。
- 乐器练习:重点检查节拍、主旋律和目标乐器是否连续,不必追求录音棚级隔离。
- 混音或采样:在耳机和音箱上试听,并检查相位、低频和瞬态伪影。
- 转写或分析:优先选择包含目标语音或乐器且串音最少的轨道。
常见失败原因与处理方法
| 现象 | 常见原因 | 建议 |
|---|---|---|
| 模型下载失败 | 网络无法访问模型资源、连接中断或缓存不完整 | 检查网络后重试;必要时清除已缓存模型 |
| 模型长时间加载 | 浏览器正在校验模型并创建本地推理会话 | 等待 10–15 秒,避免重复点击或刷新 |
| 模型加载失败 | 浏览器或设备可用内存不足 | 关闭其他标签页,改用桌面 Chrome/Edge 后重试 |
| 分轨中途失败 | 音频过长、选择轨道过多或推理阶段内存不足 | 缩短音频,减少输出轨道,再重新处理 |
| 轨道有串音 | 原混音中多个声部频率、混响或失真高度重叠 | 尝试另一个模型,并根据最终用途判断是否可接受 |
版权与使用边界
技术上能够分离歌曲,不代表可以任意发布、出售或重新分发结果。商业发行、公开演出、视频配乐和训练数据等用途可能涉及录音制品、词曲和表演者权利。请只处理自己拥有权利、已获授权或适用法律明确允许使用的音频。
总结
在线音频分轨最重要的选择不是“轨道越多越好”,而是根据目标选对模型:提取人声或伴奏优先 4 轨,需要吉他或钢琴时使用 6 轨。浏览器本地推理可以减少音频上传带来的隐私暴露,但大型模型仍需要下载时间、充足内存和合理的音质预期。