跳到主内容
快讯直播
AI智模界
AI 词典

马尔可夫决策过程(MDP):强化学习的标准五元组

碰到“下一步会发生什么说不准、但又必须一路做选择”的问题,强化学习通常先把它写成一个马尔可夫决策过程(Markov Decision Process,MDP)。一句话说:MDP 是描述“在不确定环境中反复做决策”的数学框架,核心是把问题拆成状态、动作、奖励、转移、折扣这五样东西。

五元组长这样:

元素符号含义打游戏的例子
状态S当前局面角色站在哪、还剩多少血
动作A能做的选择跳、跑、攻击
奖励R这一步拿到多少分吃金币 +1,掉坑 -100
转移概率P做完动作后落到哪个局面跳跃可能踩中敌人,也可能踩空
折扣因子γ未来的分打几折眼前的金币,比十分钟后的更值钱

把它写成函数就是:给定当前状态 s 和动作 a,环境按某个概率分布给出下一个状态 s′ 和一个即时奖励 r。所谓“马尔可夫”,意思是下一步只跟现在有关,跟你怎么走到今天的无关——就像你此刻堵在路上,关心的是当前路况,而不是你半小时前从哪个门出的。

它和邻近概念的区别可以用一张表说清:

概念有状态有动作动作会改变后续局面
马尔可夫链有无——
多臂老虎机无有否
MDP有有是
POMDP有但看不全有是

马尔可夫链只能被动观察;多臂老虎机(Multi-armed Bandit)拉一次不影响下一次,所以没有“状态”可言;MDP 则是动作会改写局面;POMDP(部分可观测 MDP)更进一步,状态看不全,只能靠观测去推断,比如只看到雷达光点却要判断敌机在哪。

对从业者的实际意义有两层。第一,写一个强化学习环境,本质就是在回答这五个问题:状态包含哪些信息、动作空间是离散还是连续、每步给多少奖励、转移是确定性还是随机、折扣取多大。第二,奖励设计最危险——奖励写歪了,模型会钻空子刷分而不解决真问题。对普通职场人来说,凡是“要反复试错、结果带随机、收益要看若干步之后”的事,比如调投放预算、排生产计划,都可以先按这五格拆一遍,常常能发现原来只盯着即时反馈的毛病。

具体框架里这些元素的字段名和接口细节,以官方文档为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。