一句话定义
Rubric 评分(rubric scoring,也叫量表打分)就是先把"什么算好"写成一张评分细则表——有哪几个维度、每个维度分几档、每档长什么样——再让评分者(人或模型)逐条对照打钩,最后合计出一个总分。
打个比方
体检,和医生一句"你身体还行"的区别。后者是一句整体印象,前者是血压、血脂、肝功能逐项查,每项有参考区间和分级。拿到报告你能指着某一项说"这条超标了",也能就这一项跟医生讨论。Rubric 就是给"这个回答好不好"做一次体检。
一份能用的 rubric 通常包含三样东西:评分维度(criteria)、每个维度各档的行为描述(level descriptors)、以及合计规则(等权求和、加权,还是允许某项一票否决)。
一个具体例子
假设要评估客服机器人的回复:
- 是否解决用户实际问题:0 = 没解决,1 = 部分解决,2 = 完全解决
- 引用的订单/政策信息是否正确:0 = 编造或缺失,1 = 有但含糊,2 = 准确具体
- 语气是否得体:0 = 生硬或过度热情,1 = 尚可,2 = 恰当
- 是否给出下一步动作:0 = 无,1 = 模糊,2 = 明确可执行
四项各 0–2 分,满分 8 分。但真正有用的不是总分,而是逐项分数:你能看出这版模型是"信息准但不会收尾",还是"话说得漂亮其实没解决问题"。
和几个容易混的概念比一比
| 概念 | 回答的问题 | 结果形态 |
|---|---|---|
| Rubric 评分 | 好在哪、有多好 | 多维度分 + 总分 |
| 整体打分(holistic scoring) | 总体感觉几分 | 单个分数 |
| 二元判定 | 对还是错 | 通过 / 不通过 |
| 偏好对比(pairwise) | A 和 B 哪个更好 | 二选一 |
还有一组关系常被搞混:LLM-as-a-judge(让模型当裁判)说的是"谁来评",rubric 说的是"按什么评"。裁判手里没有量表,就容易每个答案都给个不低的分数,还偏爱更长的回答、更像自己风格的回答。给裁判配一份 rubric,本质上是把评分标准从模型脑子里挪到纸面上。
对从业者和普通人的意义
- 评测可复现:别人不同意你的结论时,争论点会落到"这条该不该给 2 分",而不是"我感觉这版更好"。
- 标注更一致:同一份细则发给多个标注员,人和人之间的分歧会明显下降。
- 能当训练信号:逐条得分可以直接拼成奖励,引导模型往具体细节上靠。
- 写提示词就能用:把要求列成清单再交给模型,等于临时塞给它一份 rubric,比"写得好一点"有用得多。
别踩的坑
维度之间重叠(比如"准确"和"不编造"可能是同一件事)会导致重复计分;细则写得太窄,模型会学会应试,分高但实际没用;权重和及格线是人为约定,跨团队比较之前先对齐细则本身。另外,rubric 适合开放式、没有唯一答案的任务(写作、摘要、客服回复);有标准答案的场合,直接判对错更省事。
