跳到主内容
快讯直播
AI智模界
AI 词典

DQN:用深度网络学 Q 值的强化学习算法

一句话:DQN(Deep Q-Network,深度 Q 网络)是用深度神经网络近似 Q 函数,并靠经验回放和目标网络把训练稳住的强化学习算法。

展开:Q 函数回答“在状态 s 下做动作 a,之后一路走下去,总共能拿多少回报”。传统 Q-learning 像一张大表,每个“状态-动作”格子记一个分数。但下围棋、打游戏时状态多到天文数字,表根本列不完。DQN 换成神经网络:输入状态,输出每个可选动作的 Q 值,选分数最高的动作。

比方:老司机不可能背下每个路口该怎么打方向盘,而是看路况凭直觉判断“直行、左转、刹车”哪个长期最划算。DQN 训练的就是这种直觉。

但把神经网络直接塞进 Q-learning 会“抖”:相邻样本高度相关,目标值又由网络自己算,等于追自己尾巴。DQN 用两招稳住。经验回放(experience replay)把经历 (s,a,r,s') 存进记忆池,随机抽样学习,像复盘笔记打乱顺序翻,减少相关性。目标网络(target network)另存一份更新更慢的网络来算目标值,像考试标准答案先冻结一阵,避免边改答案边对答案。

它和 Q-learning 的区别:Q-learning 是思想,表格版适合小状态;DQN 是深度版工程实现,适合状态复杂但动作离散的场景。和策略梯度比,DQN 先学“每个动作值多少”再选最大,策略梯度直接学动作概率。

对从业者:做游戏 AI、推荐、调度等离散决策,DQN 是经典基线,但要注意探索、样本效率和训练稳定性。对普通人:它把“试错、复盘、慢更新目标”变成可训练系统,是深度强化学习入门绕不开的一站。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。