一句话定义:离线强化学习(Offline Reinforcement Learning,简称 Offline RL)是指智能体(agent)完全不与环境交互,只拿一份已经固定下来的历史数据集来学习决策策略。
它和普通强化学习差在哪
普通强化学习像学开车:你坐进车里,打方向盘、踩油门,车给你反馈,撞了护栏就知道下次别这么干。试错本身就是学习的一部分。
离线强化学习则像只看别人的行车记录仪学开车。数据是死的——你没法问“如果我当时猛打一把方向会怎样”,因为那一把方向从没被拍下来过。数据集里只有“当时有人这么开了,结果是那样”。
核心难点:别高估没见过的动作
几乎所有强化学习算法都依赖同一个套路:先估计每个动作值多少分(价值函数),再挑分最高的。问题在于,估计是基于数据算出来的。如果一个动作在数据集里从没出现过,模型对它的分数基本是猜的,而且往往猜得偏高。
更糟的是,这个高估会被反复放大。算法更新时会想“既然那个没见过的动作分高,那我下一步就从它出发继续算”,于是一个纯属虚构的高分被当成事实,一路传下去。业界管这叫分布偏移(distributional shift)带来的外推误差。打个比方:招聘只看简历、不做实操考核,很容易把某个没见过的背景估得过高,然后基于这个错误判断做出一连串决定。
主要应对思路(不涉及具体跑分,以官方论文和文档为准)
- 约束策略别跑太远:让学到的策略尽量贴近数据集里出现过的行为。
- 悲观估值:对数据支撑不足的动作,主动把它的分数往下压。
- 用模型的不确定性做惩罚:越没见过的区域,越不信任。
BCQ、CQL、IQL 等属于这一路线的代表性方法。
和相邻概念的区别
| 在线强化学习 | 离线强化学习 | 行为克隆 | |
|---|---|---|---|
| 数据来源 | 边试边收集 | 固定历史数据集 | 固定专家演示 |
| 能否探索 | 能 | 不能 | 不能 |
| 目标 | 逼近最优策略 | 不差于数据、尽量更好 | 复刻数据里的行为 |
| 主要风险 | 试错成本高、可能危险 | 高估没见过的动作 | 天花板就是数据水平 |
行为克隆(Behavior Cloning)可以看作离线 RL 的邻居:它只学“数据里怎么做我就怎么做”,不评估好坏;离线 RL 想在数据基础上做得更好,代价就是要处理价值估计的可靠性问题。另外还有离线策略评估(Off-Policy Evaluation),专门判断一个策略在不上线的情况下大概能拿多少分,这本身也是个难题。
对从业者意味着什么
医疗、自动驾驶、金融风控、工业控制、推荐广告,这些场景要么试错代价太高,要么根本不允许试。但它们通常攒了大量历史日志,离线 RL 正好对得上。
实际落地时,数据质量和覆盖面往往比算法选择更关键:日志是由旧策略产生的,只覆盖了旧策略走过的区域,模型在区域外的判断天然不可信。上线前多留一步小流量验证,比迷信离线指标稳妥得多。
