一句话定义
策略梯度(Policy Gradient)是一类强化学习(Reinforcement Learning, RL)方法:把"什么状态下做什么动作"写成一个带参数的概率分布,再用回报(Reward)的好坏直接对这份分布的参数求梯度——带来高回报的动作,下次概率调大;带来低回报的,调小。
它是怎么工作的
设策略为 π_θ(a|s):θ 是参数,输入状态 s,输出每个动作 a 的概率。智能体按这个概率去行动,跑完一轮拿到总回报 R。核心思路可以粗略写成:∇J ≈ R · ∇log π_θ(a|s)。翻译成人话——不管这个动作看起来多离谱,只要它换来了高回报,就朝"提高它概率"的方向走一步;回报低,就反向走。
打个比方:学投篮时,教练不告诉你手肘抬几度、手腕压多少,他只在你投完后喊一声"好球"或"偏了"。你要做的是记住那些被喊"好球"的姿势,下次更可能重复它。这跟监督学习(Supervised Learning)不同——监督学习每题都有标准答案,策略梯度只拿到一个分数。
和相邻概念的区别
| 维度 | 策略梯度 | 值函数方法(Q-learning、DQN 等) |
|---|---|---|
| 学什么 | 直接学动作概率 | 学每个动作值多少分,再据此选动作 |
| 动作空间 | 天然支持连续动作与随机策略 | 连续动作较绕,通常取最大值 |
| 输出特点 | 同一状态下动作带随机性 | 多为确定性选择 |
| 代表算法 | REINFORCE、A2C、PPO 等 | Q-learning、DQN、SARSA 等 |
实践中两类常合起来用,即 Actor-Critic:Actor 是策略,负责出招;Critic 是值函数,负责打分,帮 Actor 降低梯度估计的方差。策略梯度的老毛病正是方差大、一步容易跨太远,于是后来有了基线(Baseline)、优势函数(Advantage)、TRPO、PPO 这类"别走太猛"的约束手段。
对从业者和普通人的意义
大模型对齐常用的 RLHF,以及后来强调可验证奖励的训练流程,往往就落在策略梯度这一类方法上:把"人类更喜欢的回答"或"答案是否正确"变成回报,直接去调模型生成下一个词的概率。所以对做 AI 的人,回报怎么设计、训练稳不稳,往往比选哪个算法名更关键。对普通人,这也解释了为什么同一个问题问两遍,回答会不太一样——模型学到的本来就是概率,不是唯一答案。
