跳到主内容
快讯直播
AI智模界
AI 词典

Rubric 评分:把"好不好"拆成一张打分表

一句话定义

Rubric 评分(rubric scoring,也叫量表打分)就是先把"什么算好"写成一张评分细则表——有哪几个维度、每个维度分几档、每档长什么样——再让评分者(人或模型)逐条对照打钩,最后合计出一个总分。

打个比方

体检,和医生一句"你身体还行"的区别。后者是一句整体印象,前者是血压、血脂、肝功能逐项查,每项有参考区间和分级。拿到报告你能指着某一项说"这条超标了",也能就这一项跟医生讨论。Rubric 就是给"这个回答好不好"做一次体检。

一份能用的 rubric 通常包含三样东西:评分维度(criteria)、每个维度各档的行为描述(level descriptors)、以及合计规则(等权求和、加权,还是允许某项一票否决)。

一个具体例子

假设要评估客服机器人的回复:

  • 是否解决用户实际问题:0 = 没解决,1 = 部分解决,2 = 完全解决
  • 引用的订单/政策信息是否正确:0 = 编造或缺失,1 = 有但含糊,2 = 准确具体
  • 语气是否得体:0 = 生硬或过度热情,1 = 尚可,2 = 恰当
  • 是否给出下一步动作:0 = 无,1 = 模糊,2 = 明确可执行

四项各 0–2 分,满分 8 分。但真正有用的不是总分,而是逐项分数:你能看出这版模型是"信息准但不会收尾",还是"话说得漂亮其实没解决问题"。

和几个容易混的概念比一比

概念回答的问题结果形态
Rubric 评分好在哪、有多好多维度分 + 总分
整体打分(holistic scoring)总体感觉几分单个分数
二元判定对还是错通过 / 不通过
偏好对比(pairwise)A 和 B 哪个更好二选一

还有一组关系常被搞混:LLM-as-a-judge(让模型当裁判)说的是"谁来评",rubric 说的是"按什么评"。裁判手里没有量表,就容易每个答案都给个不低的分数,还偏爱更长的回答、更像自己风格的回答。给裁判配一份 rubric,本质上是把评分标准从模型脑子里挪到纸面上。

对从业者和普通人的意义

  • 评测可复现:别人不同意你的结论时,争论点会落到"这条该不该给 2 分",而不是"我感觉这版更好"。
  • 标注更一致:同一份细则发给多个标注员,人和人之间的分歧会明显下降。
  • 能当训练信号:逐条得分可以直接拼成奖励,引导模型往具体细节上靠。
  • 写提示词就能用:把要求列成清单再交给模型,等于临时塞给它一份 rubric,比"写得好一点"有用得多。

别踩的坑

维度之间重叠(比如"准确"和"不编造"可能是同一件事)会导致重复计分;细则写得太窄,模型会学会应试,分高但实际没用;权重和及格线是人为约定,跨团队比较之前先对齐细则本身。另外,rubric 适合开放式、没有唯一答案的任务(写作、摘要、客服回复);有标准答案的场合,直接判对错更省事。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。