跳到主内容
快讯直播
AI智模界
AI 词典

SimPO:不需要参考模型的偏好优化

一句话定义:SimPO(Simple Preference Optimization,简单偏好优化)是一种让语言模型学会“更喜欢好回答、更不喜欢差回答”的对齐方法,最大的特点是训练时不需要额外的参考模型(reference model)。

大模型对齐里常见一组偏好数据:同一个问题下,有一个“好回答”(chosen)和一个“差回答”(rejected)。训练目标是让模型给好回答更高分,给差回答更低分。早期 RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)要额外训练奖励模型,再用强化学习调策略,链路长、工程复杂。DPO(Direct Preference Optimization,AI 词典:直接偏好优化">直接偏好优化)省掉了奖励模型,但仍要同时加载一个冻结的参考模型,用“当前模型相对参考模型的概率变化”当隐式奖励。SimPO 则把这个参考模型也去掉了,直接用当前模型自己的序列平均对数似然(length-normalized log-likelihood)当奖励。

具体说,SimPO 会把一个回答里每个 token 的 log 概率取平均,得到“平均每个 token 写得好不好”的分数。然后要求好回答的分数不仅高于差回答,还要高出至少一个间隔 γ(margin)。如果差距不够,损失就会惩罚模型,推着它把好回答的每 token 概率拉高,把差回答压低。长度归一化(length normalization)是关键:如果不按长度取平均,分数容易被回答长短带偏;按平均分比较,更像是在比“单位长度内的质量”,而不是比谁写得更长。

打个比方:老师批改两篇作文。DPO 像拿学生现在的水平跟“入学基线”比进步幅度;SimPO 则是直接看当前作文的平均质量,并规定优秀作文必须比不合格作文高出固定分差。前者要保存一份基线,后者只看当前表现,按平均分评判,避免“字数多就占便宜”。

维度DPOSimPO
参考模型需要不需要
隐式奖励相对参考模型的 log 概率比当前模型的长度归一化 log 概率
长度处理通常不显式归一化序列平均对数似然
额外间隔无显式 margin有目标间隔 γ
工程负担需加载两个模型单模型,显存更省

对从业者来说,SimPO 的价值是“少一份模型、少一层依赖”:不用维护参考模型,显存和实现复杂度都下降,适合算力有限、想快速试偏好对齐的团队。但它仍需要监督微调(Supervised Fine-Tuning,SFT)给出一个不太差的起点,也需要高质量偏好对;β、γ 等超参怎么设,具体以官方实现和论文为准。对普通人来说,这类方法让模型更倾向于按“平均质量”而不是“写更长”来讨好偏好,回答可能更简洁直接;但偏好对齐本身仍取决于数据质量,方法简化不等于问题消失。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。