跳到主内容
快讯直播
AI智模界
AI 词典

说话人分离(Diarization):会议录音里「谁在什么时候说话」是怎么算出来的

开会录音转成文字,最尴尬的一件事往往是:文字出来了,但全挤成一坨,看不出哪句是老板说的,哪句是客户说的。负责判断「谁在什么时候说话」的这项技术,叫说话人分离(Speaker Diarization,也叫说话人日志)。一句话定义:它不关心说了什么,只负责把一段音频按人的身份切成段,回答「谁、从第几秒到第几秒、在说话」。

它到底在算什么

先纠正一个常见误解:这不是语音识别(ASR,Automatic Speech Recognition)干的活。语音识别解决「说了什么字」,说话人分离解决「是谁说的」。两者是独立的模块,通常串起来用:音频先过分离,切成一段段标注了说话人的片段,再分别送进语音识别,最后拼接成「张三:这个方案下周上线」这种带署名的会议纪要。

那它是怎么判断的?核心思路是「先找声纹,再聚类」。

打个比方:你在一个嘈杂的饭局上闭着眼听,虽然看不见人,但你能感觉到「这个声音低沉、语速慢」「那个声音尖、爱笑」——这是音色特征。系统做的事情类似:它把音频切成很短的帧(几十毫秒级别),对每一帧提取一组声学特征,也就是常说的声纹(Voiceprint / Speaker AI 词典:Embedding">Embedding),本质是一个能把「音色」编码成向量的数字指纹。

接着是聚类(Clustering):同一把嗓子说出的话,向量在空间里会挨得很近;不同人的会分成不同的团。系统不需要提前知道有几个人——它通过看向量能自然聚成几堆来判断(这叫无监督聚类),堆的数量就是说话人数量,每堆对应一个代号「说话人 1、说话人 2」。至于谁是张三,那是另一件事,通常靠人工标注或跟已注册声纹做比对。

难点在切换点检测:人说「嗯,对」的时候可能只有 0.3 秒,两个人抢话时声音还会重叠。系统要能定位这些边界,否则整段就会被切错人。此外,麦克风远近、房间混响、咳嗽和笑声,都会干扰判断。

和相邻概念的区别

概念回答的问题输出
语音识别 ASR说了什么字文字稿
说话人分离 Diarization谁在什么时候说时间段 + 说话人编号
说话人识别 / 声纹验证这段声音是不是张三身份判定或相似度
语音增强、降噪怎么让声音更干净处理后的音频

说话人识别(Speaker Recognition)常常和分离配合:分离先告诉你「这里有两拨人」,识别再告诉你「其中一拨是张三」。

对从业者和普通职场人的意义

对普通人的直接价值:会议记录不再是「一锅粥」,而是能按人检索的对话,复盘时可以直接搜「客户提到的顾虑」,也能看清谁在主导、谁在沉默。做访谈、做客服质检、做播客字幕,都是同一套需求。

对从业者,几个现实提醒:一是别把它当成语音识别的一个参数,它是独立模块,可以单独替换和调优;二是标注成本高——要训练或评估,得有人工标出「谁在第几秒说话」,这在真实会议里很费时间;三是准确率高度依赖音频质量,多人共用一支远场麦克风、开免提、房间空旷,效果会明显下降。很多产品会配合「每人一支麦」或耳麦来绕过这个难题。

最后一句实用建议:评估这类功能时,别只看文字转得准不准,一定要自己拿一段真实的多人会议录音试,重点看两点——说话人数量猜得对不对,以及抢话、短插话的地方有没有切错。具体能力边界以各家官方页面和你的实测为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。