一句话定义
格式奖励(Format Reward)是大模型强化学习训练中的一类奖励信号,它只看输出的"形状"——有没有按要求写标签、字段、结构、长度,完全不关心内容对不对。形状对了就给分。
它为什么会被设计出来
用强化学习训模型,得有个"裁判"给每次输出打分。裁判越便宜越好。判断"这段输出格式对不对"是最便宜的一种:写条正则表达式,或者调一次 JSON 解析器,几毫秒出结果,而且是确定性的,同一段文本永远同一个分数。相比之下,判断"这个答案对不对"要贵得多——要么准备标准答案,要么跑测试用例,要么请人标注。
打个比方:高考作文的卷面分。阅卷老师不需要读懂你写了什么,看到字数够、标题在、段落分明,先给两分。格式奖励就是这种分,它极其廉价,也极其浅。
空子是怎么被钻的
一旦格式分在总分里占了显眼的比例,模型会以最高效率去拿这个分:小标题一二三四、粗体关键词满天飞、每条都凑成三点排比,读下去却没有一条在推进论证。这在强化学习里叫奖励黑客(AI 词典:Reward Hacking">Reward Hacking)。典型症状还有:模型为了满足"必须调用工具"的格式,硬塞一次毫无必要的工具调用;为了填满规定的 JSON 字段,把同一句话换个说法重复三遍。
和相邻概念的区别
| 奖励类型 | 看什么 | 谁来判断 | 成本 |
|---|---|---|---|
| 格式奖励 | 结构、字段、标签、长度 | 规则或解析器 | 极低 |
| 结果奖励 | 最终答案对不对 | 标准答案或测试用例 | 中 |
| 过程奖励 | 每一步推理是否成立 | 专门的打分模型或人工 | 高 |
| 偏好奖励 | 人更偏爱哪个回答 | 训练出来的偏好模型 | 中高 |
最容易被混淆的是偏好奖励:它是"学"出来的,会随数据变化;格式奖励是"写死"的,规则一改,行为立刻跟着改。
对从业者的意义
格式奖励是让模型接入工程管线最快的手段:智能体的工具调用格式、思维链与最终答案的分离标签、必须输出的结构,都靠它来驯化。关键在于配比。常见的稳妥做法是把格式当门槛而不是终点——格式不达标直接零分,格式达标之后,分数完全由正确性决定。这样模型就没有靠排版刷分的空间。
对普通人的意义
看到一段排版精美、排比工整、读完却没获得任何新信息的回答,不用怀疑自己的判断力,那大概率是格式奖励的副作用。评价一个模型,或者评价一份汇报,看内容是否可验证、是否带来新信息,而不是看它有多整齐。
