跳到主内容
快讯直播
AI智模界
AI 词典

人工评估(Human Eval):为什么还得靠人

一句话说:人工评估就是让真人来看模型的输出,给它打分、排序或挑错,而不是用一段脚本自动算出一个分数。

打个比方。自动指标像用体重秤量健康——快、准、能复现,但一个人体重正常不代表他精神好。人工评估像请几位教练看录像打分:慢、贵、还带主观,但"这人跑起来协调不协调",秤是量不出来的。

自动指标到底漏掉了什么?

  • 偏好。两个回答都通顺、都没事实错误,但一个啰嗦绕圈,一个三句话说到点上。BLEU、ROUGE 这类基于字词重叠的指标看不出哪个更讨喜,因为两句话用词可能差不多。
  • 事实性。模型把"某项技术诞生于 2015 年"写成了 2010 年,句子照样流畅漂亮,表面重叠度甚至可能更高。反过来,一个完全正确但换了说法的答案,可能被自动指标判低分。对错这件事,机器往往是最不会判的。
  • 可用性。要求"用三个要点回答",模型写了三段话每段两句;或者答得对,但语气居高临下、格式没法直接粘进工作流。这些规则很难穷举,人一眼能看出来。

除此之外,还有安全边界、是否真的按指令办事、多轮对话里有没有前后矛盾——都属于"写不出规则"的范畴。

和相邻概念的区别

概念评的是特点
自动指标(Automatic Metrics,如 BLEU、困惑度)输出与参考答案的表面相似度快、便宜、可复现,但与人的判断常脱节
人工评估(Human Eval)输出本身好不好用贴近真实感受,慢、贵、主观
红队测试(AI 词典:Red Teaming">Red Teaming)专门找坏情况目标是打破,不是日常打分
A/B 测试线上真实行为(点击、留存)要上线才能测,反馈周期长

最常见的执行方式不是打 1–10 分,而是成对比较:给评估者两个回答,问哪个更好。绝对分数因人而异,配对结果却稳得多,再用 Elo 这类方法汇总成排名。前提是写清评分准则(rubric),并检查不同评估者之间的一致性。

对从业者和普通人的意义

一是看到"某模型排名第一"时,多问一句:谁评的、评什么、标准写没写清楚。换一批评估者,名次可能就变。二是做产品别只追榜单,自己攒几十条真实业务问题当评估集,价值远大于通用排名。三是普通职场人挑工具,拿自己最常问的五个问题各试一遍,就已经在做人工评估了。具体评测口径以各家官方页面为准。

人工评估不是"因为没别的办法才凑合",它测的是模型有没有真的帮上忙——这件事,目前只有人能回答。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。