一句话定义
唤醒词(Wake Word)是一段预设的短口令。设备听到它,才从"挂机监听"状态切换到"完整语音识别"状态,开始真正听你说话。你喊一声"小爱同学""Hey Siri",灯亮了,它才开始工作——之前它其实一直在听,只是没在算。
原理:门口保安和楼里的经理
麦克风是常开的,一直在采集声音。但如果每一秒的音频都传到云端跑大模型,功耗、流量、成本和隐私都受不了。所以设备里实际住着两个人:
第一层是常开的关键词检测(Keyword Spotting,KWS)。它是一个极小的神经网络,小到能塞进耳机、手表、灯泡这类没什么算力的设备里。它逐帧提取声学特征,只做一件事:判断"这一小段声音像不像那个词"。它不认字、不理解语义,只输出一个分数。分数超过阈值,才去叫第二层。
第二层才是完整的语音识别(Automatic Speech Recognition,ASR)加上后面的语言模型,负责转写、理解、回答。这一层耗电多、算力大,所以只在被唤醒后短暂开机。
打个比方:小区门口坐着一个保安,他只干一件事——听暗号。听到暗号,他才给楼里的经理打电话。你在门口聊今天天气怎么样,他听见了,但不处理,也不会记住。
和相邻概念的区别
| 概念 | 回答的问题 | 输出 |
|---|---|---|
| 语音活动检测(VAD) | 现在有没有人在说话 | 有 / 无 |
| 关键词检测(KWS) | 有没有出现某个特定词 | 命中 / 未命中 |
| 唤醒词 | 设备常开监听的那一个词 | 唤醒 / 不唤醒 |
| 语音识别(ASR) | 到底说了什么 | 文字 |
VAD 比唤醒词更轻,通常作为前置步骤;唤醒词可以看成 KWS 在消费设备上的一种特定用法;ASR 则完全是另一层的活儿——它不关心你是不是喊了口令,只关心内容。
对从业者的意义
做唤醒词,关键指标不是"识别率"三个字能概括的,而是误唤醒(把不是口令的声音当成口令)和漏唤醒(喊了没反应)之间的取舍。阈值调低,灵敏但容易被电视里的台词触发;调高,安静但用户要喊三遍。真正的难点在远场、噪声、口音和回声环境下的稳定性,以及功耗——模型必须能在低功耗芯片上常年运行,这是硬约束。
另外,唤醒词通常在本地处理,音频不出设备,这既是隐私优势,也是"设备一直听着"这件事能被接受的前提。
对普通人的意义
- 喊好几遍没反应,往往不是模型"听不懂",而是环境噪声让分数没到阈值。
- 电视里说一句就唤醒,是典型的误唤醒案例,厂商会不断用负样本数据去压制它。
- 有些设备需要按一下再说话,就是在用按键替代常开监听,换取更长的续航。
具体某台设备支持哪些唤醒词、能否自定义、是否全程本地处理,各厂商策略不同,以官方页面为准。
