OpenAI 官网发布了一篇题为《Learning to summarize with human feedback》的研究论文,归类为论文。标题指向一个当下受到关注的思路:摘要模型不再只按自动指标优化,而是把人类的偏好判断纳入训练目标。
对摘要任务来说,“好摘要”本就难以用单一规则刻画。同一篇文章存在多种合理的压缩方式,参考摘要只是其中一种写法;模型即便在词重叠类指标上得分很高,也可能漏掉要点、混入原文没有的信息,或写成不连贯的句子堆砌。以人类反馈作为训练信号,意味着把人工比较、排序或评分中体现的偏好,转化为可优化的目标,让输出更贴近人真正想要的摘要。
从研究脉络看,这类工作属于把人类偏好纳入训练闭环的尝试,与偏好建模、奖励模型、强化学习等方向密切相关。它关心的不只是摘要质量,还有一个更普遍的问题:当任务目标难以形式化时,如何用人的判断来定义“好”。
对 AI 从业者而言,摘要任务的目标相对清晰、评测相对成熟,常被当作检验“人类反馈训练”是否有效的试验场;若在这一任务上能稳定获益,相关方法就有机会迁移到更开放、更难的生成任务。论文链接:https://openai.com/index/learning-to-summarize-with-human-feedback
