一句话定义:WER(Word Error Rate,词错误率)是衡量语音识别(ASR,Automatic Speech Recognition)转写结果与标准答案差多少的指标,数值越低越好。
它怎么算
把识别结果和人工标注的正确答案(reference)按词对齐,数三类错误:
- 替换(Substitution):说“天气”,识别成“田七”
- 删除(Deletion):说“请帮我查一下”,识别成“请帮我查”
- 插入(Insertion):没说“的”,结果里多出一个“的”
公式很简单:
> WER =(替换数 + 删除数 + 插入数)/ 参考文本的总词数
打个比方,这像老师改默写:写错一个、漏写一个、多写一个都算错,最后拿总错误数除以标准答案的词数。要注意分母是“标准答案有几词”,不是识别结果有几词。
中英文的“词”不是一回事。英文按空格切;中文要先分词,按字切还是按词切,算出来的数会不一样。所以比较两个模型的 WER 之前,先确认口径一致,否则是关公战秦琼。
和相邻概念的区别
| 指标 | 看什么 | 局限 |
|---|---|---|
| WER | 词一级的对错 | 错一个关键词和错一个“的”,权重一样 |
| CER(字错误率) | 字一级的对错 | 中文场景更常用,但同样不区分重要性 |
| 句准率 | 整句是否完全正确 | 一句话错一个字,整句就全错,数字往往很难看 |
它什么时候会骗人
第一,文本归一化规则。参考写“2024年”,识别输出“二零二四年”,算不算错?标点、大小写、数字格式怎么处理,口径一变,WER 能差好几个点。
第二,平均值掩盖长尾。WER 是所有词的平均,模型可能整体漂亮,但人名、地名、专业术语错得离谱。做会议记录、医疗听写时,偏偏就是这些词最要命。一个整体 8% 的 WER,可能意味着关键实体错了三成。
第三,测试集偏“干净”。在朗读式新闻语料上 WER 很低,换成嘈杂环境、方言、多人抢话,数字会明显变差。榜单上的成绩通常来自安静、标准发音的测试集,不能直接等同于你的业务场景。
第四,分母小时波动大。只测 20 个词,错 2 个就是 10%,样本太少时这个数字参考价值有限。
对从业者和普通职场人的意义
WER 是入门指标,不是产品指标。真正上线要看下游任务:语音输入法关心用户改不改字,客服质检关心关键词有没有抓到,字幕关心可读性和时间轴对不对得上。做评测时,除了报整体 WER,最好按词频、领域、说话人分层再看一眼,并把文本归一化规则写清楚。指标的具体定义、测试集构成和计算脚本,以官方页面或论文为准。
