跳到主内容
快讯直播
AI智模界
AI 词典

SAC:把"探索"写进目标的强化学习算法

一句话定义

SAC(Soft Actor-Critic,软演员-评论家)是一种 off-policy(离策略)深度强化学习算法,它的目标不只是"拿到最高回报",而是"回报高 + 别太早认死理"——在目标函数里额外加一项策略熵(entropy)。

"软"在哪里

普通强化学习只问一句:"哪条路分最高?"SAC 多问一句:"我是不是太早认定只有这一条路了?"于是优化目标变成:

> 累积回报 + α × 策略熵

熵衡量策略的随机程度:熵越大,动作分布越分散,"尝鲜"的意愿越强。这个额外项把原本"取最大"的硬目标变软,所以叫 soft。α 是温度系数,控制探索占多大分量,SAC 的一大卖点就是它可以自动调节,不必手调。

打个比方:找午饭馆子。普通算法试了三家,发现某家分最高,之后天天吃那家;SAC 会说"分数差不多的话,我不介意偶尔换一家"。时间一长,它更可能摸到巷子深处那家宝藏小店——因为它的搜索范围一直没有塌缩成一个点。

演员和评论家

  • 演员(Actor):策略网络,输入状态,输出动作的概率分布
  • 评论家(Critic):价值网络,评估某个动作好不好;常见做法是同时学两个 Q 网络、取较小值来抑制高估

因为是 off-policy,旧数据能存进经验回放(replay buffer)反复使用,样本效率明显高于同策略方法。

和邻居比一比

算法策略类型数据探索方式
SAC随机策略离策略,可复用熵项自带
PPO随机策略同策略,用完即弃靠策略分布采样
DDPG / TD3确定性策略离策略,可复用需外部加噪声

PPO 稳,但费样本;DDPG/TD3 省样本,但探索靠外力;SAC 想要两头兼得——样本省,探索还是内生的。

对从业者和普通人的意义

做机器人、机械臂这类连续控制任务时,真机采一次样很贵,SAC 常被当作首选基线;它对超参相对不敏感,调参也省心。

不写算法的人也能借用它的思路:别把探索当成干扰项。稳定重复一件还不错的事很安全,但把"多样性"写进自己的目标函数,往往才是找到更优解的前提。

具体实现细节与超参设置,以官方论文和代码库为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。