跳到主内容
快讯直播
AI智模界
AI 词典

唤醒词:设备一直在听,但大多时候没在算

一句话定义

唤醒词(Wake Word)是一段预设的短口令。设备听到它,才从"挂机监听"状态切换到"完整语音识别"状态,开始真正听你说话。你喊一声"小爱同学""Hey Siri",灯亮了,它才开始工作——之前它其实一直在听,只是没在算。

原理:门口保安和楼里的经理

麦克风是常开的,一直在采集声音。但如果每一秒的音频都传到云端跑大模型,功耗、流量、成本和隐私都受不了。所以设备里实际住着两个人:

第一层是常开的关键词检测(Keyword Spotting,KWS)。它是一个极小的神经网络,小到能塞进耳机、手表、灯泡这类没什么算力的设备里。它逐帧提取声学特征,只做一件事:判断"这一小段声音像不像那个词"。它不认字、不理解语义,只输出一个分数。分数超过阈值,才去叫第二层。

第二层才是完整的语音识别(Automatic Speech Recognition,ASR)加上后面的语言模型,负责转写、理解、回答。这一层耗电多、算力大,所以只在被唤醒后短暂开机。

打个比方:小区门口坐着一个保安,他只干一件事——听暗号。听到暗号,他才给楼里的经理打电话。你在门口聊今天天气怎么样,他听见了,但不处理,也不会记住。

和相邻概念的区别

概念回答的问题输出
语音活动检测(VAD)现在有没有人在说话有 / 无
关键词检测(KWS)有没有出现某个特定词命中 / 未命中
唤醒词设备常开监听的那一个词唤醒 / 不唤醒
语音识别(ASR)到底说了什么文字

VAD 比唤醒词更轻,通常作为前置步骤;唤醒词可以看成 KWS 在消费设备上的一种特定用法;ASR 则完全是另一层的活儿——它不关心你是不是喊了口令,只关心内容。

对从业者的意义

做唤醒词,关键指标不是"识别率"三个字能概括的,而是误唤醒(把不是口令的声音当成口令)和漏唤醒(喊了没反应)之间的取舍。阈值调低,灵敏但容易被电视里的台词触发;调高,安静但用户要喊三遍。真正的难点在远场、噪声、口音和回声环境下的稳定性,以及功耗——模型必须能在低功耗芯片上常年运行,这是硬约束。

另外,唤醒词通常在本地处理,音频不出设备,这既是隐私优势,也是"设备一直听着"这件事能被接受的前提。

对普通人的意义

  • 喊好几遍没反应,往往不是模型"听不懂",而是环境噪声让分数没到阈值。
  • 电视里说一句就唤醒,是典型的误唤醒案例,厂商会不断用负样本数据去压制它。
  • 有些设备需要按一下再说话,就是在用按键替代常开监听,换取更长的续航。

具体某台设备支持哪些唤醒词、能否自定义、是否全程本地处理,各厂商策略不同,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。