跳到主内容
快讯直播
AI智模界
AI 词典

策略梯度:按回报好坏,直接改动作概率

一句话定义

策略梯度(Policy Gradient)是一类强化学习(Reinforcement Learning, RL)方法:把"什么状态下做什么动作"写成一个带参数的概率分布,再用回报(Reward)的好坏直接对这份分布的参数求梯度——带来高回报的动作,下次概率调大;带来低回报的,调小。

它是怎么工作的

设策略为 π_θ(a|s):θ 是参数,输入状态 s,输出每个动作 a 的概率。智能体按这个概率去行动,跑完一轮拿到总回报 R。核心思路可以粗略写成:∇J ≈ R · ∇log π_θ(a|s)。翻译成人话——不管这个动作看起来多离谱,只要它换来了高回报,就朝"提高它概率"的方向走一步;回报低,就反向走。

打个比方:学投篮时,教练不告诉你手肘抬几度、手腕压多少,他只在你投完后喊一声"好球"或"偏了"。你要做的是记住那些被喊"好球"的姿势,下次更可能重复它。这跟监督学习(Supervised Learning)不同——监督学习每题都有标准答案,策略梯度只拿到一个分数。

和相邻概念的区别

维度策略梯度值函数方法(Q-learning、DQN 等)
学什么直接学动作概率学每个动作值多少分,再据此选动作
动作空间天然支持连续动作与随机策略连续动作较绕,通常取最大值
输出特点同一状态下动作带随机性多为确定性选择
代表算法REINFORCE、A2C、PPOQ-learning、DQN、SARSA 等

实践中两类常合起来用,即 Actor-Critic:Actor 是策略,负责出招;Critic 是值函数,负责打分,帮 Actor 降低梯度估计的方差。策略梯度的老毛病正是方差大、一步容易跨太远,于是后来有了基线(Baseline)、优势函数(Advantage)、TRPO、PPO 这类"别走太猛"的约束手段。

对从业者和普通人的意义

大模型对齐常用的 RLHF,以及后来强调可验证奖励的训练流程,往往就落在策略梯度这一类方法上:把"人类更喜欢的回答"或"答案是否正确"变成回报,直接去调模型生成下一个词的概率。所以对做 AI 的人,回报怎么设计、训练稳不稳,往往比选哪个算法名更关键。对普通人,这也解释了为什么同一个问题问两遍,回答会不太一样——模型学到的本来就是概率,不是唯一答案。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。