碰到“下一步会发生什么说不准、但又必须一路做选择”的问题,强化学习通常先把它写成一个马尔可夫决策过程(Markov Decision Process,MDP)。一句话说:MDP 是描述“在不确定环境中反复做决策”的数学框架,核心是把问题拆成状态、动作、奖励、转移、折扣这五样东西。
五元组长这样:
| 元素 | 符号 | 含义 | 打游戏的例子 |
|---|---|---|---|
| 状态 | S | 当前局面 | 角色站在哪、还剩多少血 |
| 动作 | A | 能做的选择 | 跳、跑、攻击 |
| 奖励 | R | 这一步拿到多少分 | 吃金币 +1,掉坑 -100 |
| 转移概率 | P | 做完动作后落到哪个局面 | 跳跃可能踩中敌人,也可能踩空 |
| 折扣因子 | γ | 未来的分打几折 | 眼前的金币,比十分钟后的更值钱 |
把它写成函数就是:给定当前状态 s 和动作 a,环境按某个概率分布给出下一个状态 s′ 和一个即时奖励 r。所谓“马尔可夫”,意思是下一步只跟现在有关,跟你怎么走到今天的无关——就像你此刻堵在路上,关心的是当前路况,而不是你半小时前从哪个门出的。
它和邻近概念的区别可以用一张表说清:
| 概念 | 有状态 | 有动作 | 动作会改变后续局面 |
|---|---|---|---|
| 马尔可夫链 | 有 | 无 | —— |
| 多臂老虎机 | 无 | 有 | 否 |
| MDP | 有 | 有 | 是 |
| POMDP | 有但看不全 | 有 | 是 |
马尔可夫链只能被动观察;多臂老虎机(Multi-armed Bandit)拉一次不影响下一次,所以没有“状态”可言;MDP 则是动作会改写局面;POMDP(部分可观测 MDP)更进一步,状态看不全,只能靠观测去推断,比如只看到雷达光点却要判断敌机在哪。
对从业者的实际意义有两层。第一,写一个强化学习环境,本质就是在回答这五个问题:状态包含哪些信息、动作空间是离散还是连续、每步给多少奖励、转移是确定性还是随机、折扣取多大。第二,奖励设计最危险——奖励写歪了,模型会钻空子刷分而不解决真问题。对普通职场人来说,凡是“要反复试错、结果带随机、收益要看若干步之后”的事,比如调投放预算、排生产计划,都可以先按这五格拆一遍,常常能发现原来只盯着即时反馈的毛病。
具体框架里这些元素的字段名和接口细节,以官方文档为准。
