一句话定义
音源分离(Source Separation,音乐圈里更常说 Stem Separation,即分轨分离)指的是用算法从一段已经混好的音频里,把不同的乐器或人声还原成各自独立的音轨。
它到底在做什么
混音的本质是"加法":把十几条录音轨按比例叠成一条波形。叠加之后,谁贡献了哪一帧的信号,已经混在一起了,严格来说这一步不可逆。
AI 的做法不是"化学还原",而是靠经验猜。训练时喂给它大量成对的素材——同一首歌的原始分轨,以及由这些分轨混出来的成品——让它反复对比,学会"混音里长这样的能量,多半来自人声"。
具体流程大致是:把音频切成很短的帧,转成频谱图(横轴时间、纵轴频率的一张能量图),神经网络逐点估计每个时频位置属于哪个声部,输出一组"掩码"(mask),比如"这里 80% 是人声、15% 是鼓";再按掩码把能量分回去,逆变换成波形。也有直接在波形上算的时域模型。常见输出是四轨:人声(vocals)、鼓(drums)、贝斯(bass)、其他(other),这也是多数数据集和工具的默认分类,好一些的模型还能分出钢琴、吉他、弦乐。
打个比方:一锅番茄洋葱汤,你没法真的把洋葱捞回原样,但闻一闻、尝一口,大致能判断"这层浮油是橄榄油、这块是番茄"。分离出来的东西总归带点"串味",这一点后面还会说。
和相邻概念的区别
| 任务 | 输入 | 输出 | 目的 |
|---|---|---|---|
| 音源分离 | 混音成品 | 多条独立音轨 | 拿到可再加工的分轨 |
| 语音降噪 | 带噪人声 | 干净人声 | 只要目标,其余丢掉 |
| 语音分离 | 多人对话录音 | 每人一路 | 听清谁在说,通常只针对人声 |
| 去人声 | 完整歌曲 | 只剩伴奏 | 单目标,人声当噪声扔掉 |
最后一行值得单独说:卡拉OK伴奏、短视频常用的"去掉人声",其实是音源分离的退化用法——只关心剩下什么,不关心拆出来的东西干不干净。
谁在用它
- AI 翻唱:换声模型需要干净的干声做训练素材,也需要把目标歌曲的人声抽出来替换掉。
- 采样与编曲:制作人从老唱片里抠出鼓组或贝斯线,重新编排。注意"技术上拆得开"不等于"版权上能用",商业发行仍要看授权。
- 后期与内容生产:做伴奏、给播客去掉背景音乐、把影视里的对白、音效、配乐重新配比、给老录音做重混。
- 日常场景:助听设备用类似思路,把人声从嘈杂环境里拎出来。
它的边界
分离是有损的:人声轨里常残留鼓点或"水声"(artifacts),拆出来的几轨再混回去,一般也不等于原文件。要做正式发行,原始分轨母带仍然不可替代。至于各工具支持哪些音轨类别、效果如何,迭代很快,以官方页面为准。
