跳到主内容
快讯直播
AI智模界
AI 词典

音源分离:把一首歌拆成人声、鼓和伴奏

一句话定义

音源分离(Source Separation,音乐圈里更常说 Stem Separation,即分轨分离)指的是用算法从一段已经混好的音频里,把不同的乐器或人声还原成各自独立的音轨。

它到底在做什么

混音的本质是"加法":把十几条录音轨按比例叠成一条波形。叠加之后,谁贡献了哪一帧的信号,已经混在一起了,严格来说这一步不可逆。

AI 的做法不是"化学还原",而是靠经验猜。训练时喂给它大量成对的素材——同一首歌的原始分轨,以及由这些分轨混出来的成品——让它反复对比,学会"混音里长这样的能量,多半来自人声"。

具体流程大致是:把音频切成很短的帧,转成频谱图(横轴时间、纵轴频率的一张能量图),神经网络逐点估计每个时频位置属于哪个声部,输出一组"掩码"(mask),比如"这里 80% 是人声、15% 是鼓";再按掩码把能量分回去,逆变换成波形。也有直接在波形上算的时域模型。常见输出是四轨:人声(vocals)、鼓(drums)、贝斯(bass)、其他(other),这也是多数数据集和工具的默认分类,好一些的模型还能分出钢琴、吉他、弦乐。

打个比方:一锅番茄洋葱汤,你没法真的把洋葱捞回原样,但闻一闻、尝一口,大致能判断"这层浮油是橄榄油、这块是番茄"。分离出来的东西总归带点"串味",这一点后面还会说。

和相邻概念的区别

任务输入输出目的
音源分离混音成品多条独立音轨拿到可再加工的分轨
语音降噪带噪人声干净人声只要目标,其余丢掉
语音分离多人对话录音每人一路听清谁在说,通常只针对人声
去人声完整歌曲只剩伴奏单目标,人声当噪声扔掉

最后一行值得单独说:卡拉OK伴奏、短视频常用的"去掉人声",其实是音源分离的退化用法——只关心剩下什么,不关心拆出来的东西干不干净。

谁在用它

  • AI 翻唱:换声模型需要干净的干声做训练素材,也需要把目标歌曲的人声抽出来替换掉。
  • 采样与编曲:制作人从老唱片里抠出鼓组或贝斯线,重新编排。注意"技术上拆得开"不等于"版权上能用",商业发行仍要看授权。
  • 后期与内容生产:做伴奏、给播客去掉背景音乐、把影视里的对白、音效、配乐重新配比、给老录音做重混。
  • 日常场景:助听设备用类似思路,把人声从嘈杂环境里拎出来。

它的边界

分离是有损的:人声轨里常残留鼓点或"水声"(artifacts),拆出来的几轨再混回去,一般也不等于原文件。要做正式发行,原始分轨母带仍然不可替代。至于各工具支持哪些音轨类别、效果如何,迭代很快,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。