跳到主内容
快讯直播
AI智模界
AI 词典

BLEU 与 ROUGE:n-gram 重叠打分的能与不能

一句话定义:BLEU(Bilingual Evaluation Understudy)和 ROUGE(Recall-Oriented Understudy for Gisting Evaluation)都是靠“n-gram 重叠”给机器生成的文本打分的自动评测指标——BLEU 主要用在机器翻译,ROUGE 主要用在摘要。

原理:像老师拿着标准答案数采分点

n-gram 就是“连续的 n 个词(中文里常按字或词切)”。比如“今天天气很好”里,“今天天气”是一个 3-gram,“天气很好”是另一个。切得越细,匹配越宽松;切到 4-gram,一点语序变动就对不上。

BLEU 的算法很直白:把系统译文切成 1-gram 到 4-gram,看这些片段有多少在参考译文里出现过,算出一个精确率,再乘一个“长度惩罚”(brevity penalty)。惩罚的理由很实际:如果译文只写最有把握的三五个词,精确率会虚高,所以要按长度扣回来。

ROUGE 反着来,盯的是召回率:参考译文(或参考摘要)里该有的内容,系统产出覆盖了多少。常见形式有 ROUGE-N(数 n-gram 的召回)和 ROUGE-L(用最长公共子序列衡量句子级的顺序相似度)。

BLEUROUGE
主战场机器翻译摘要(有时也用于翻译)
关注点精确率:你写的有多少是对的召回率:该写的你写了多少
常见形式1–4 gram 匹配 + 长度惩罚ROUGE-N、ROUGE-L
典型粒度多在语料级别统计句级、语料级都可以

局限:它匹配字面,不判断意思

最要命的问题就是“同义不同形”。参考是“他昨天到了北京”,译文是“他于昨日抵达北京”,人看是满分,n-gram 几乎不重叠,分数很难看。反过来,用词碰巧撞上但语序乱、逻辑错的输出,也可能拿到不错的分。所以它是“参考答案匹配器”,不是“理解器”。抽象式摘要(自己组织语言重写)在 ROUGE 下尤其吃亏,抽取式摘要天然占便宜。

这也解释了它和相邻概念的分工:BLEU/ROUGE 属于基于字面重叠的指标,便宜、快、可复现;AI 词典:BERTScore">BERTScore、COMET 这类属于基于语义或模型的指标,更贴近人的判断但更重、也更依赖模型本身。人工评估则是最终的裁判。

对从业者的实际意义

第一,把它当迭代期的体温计:改一版跑一次,看趋势涨跌。它有噪声,别对小数点后两位斤斤计较。

第二,别把它当验收标准,更别拿它对外宣称质量。尤其在翻译和多语言场景,分数差距往往来自分词方式和语言特性,而不是质量。

第三,做对比实验时,参考译文/参考摘要的数量和写法会显著影响分数,最好固定一套并写清楚,同时搭配一个语义型指标和抽样人工检查。

一句话总结:BLEU 和 ROUGE 是“又快又笨”的老朋友——适合快速自查,不适合替你下结论。具体工具的用法和默认参数,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。