外观
Atari 与电子游戏
一句话定位:这一页讲清楚 DQN 为什么能在一个又一个像素点上把 Atari 游戏玩过人类——它是深度强化学习的第一个里程碑,本文拆解其问题设定、两大工程技巧、从 DQN 到 Rainbow 的进化,以及游戏 RL 教给我们的边界与启示。
一、问题设定:从像素到动作
1. 为什么是 Atari
1977 年雅达利(Atari)2600 游戏主机发布,到 2013 年已经成为计算机视觉与强化学习社区的标准"玩具"。2013 年,Bellemare 等人在论文 The Arcade Learning Environment(ALE)中把 57 个 Atari 2600 游戏打包成一个公开的评估环境(后来扩展到 61 个游戏),一个统一的接口:观察是 210×160 像素、128 色的屏幕画面,动作是摇杆与按钮的组合,奖励是游戏得分。
Atari 之所以成为深度 RL 的完美试金石,有四个原因:
| 特性 | 含义 | 对 RL 的挑战 |
|---|---|---|
| 视觉输入 | 只有原始像素,没有特征工程 | 必须端到端学习特征 |
| 动作离散 | 每游戏约 4–18 个动作 | 适合 Q-learning 类输出层 |
| 奖励稀疏/延迟 | 得分往往发生在击杀、进球等事件后 | 信用分配(credit assignment)困难 |
| 部分可观测 | 单帧看不出速度与方向 | 需要帧堆叠或 RNN 记忆 |
在 DQN 之前,Atari 上表现最好的 agent(如 BASS、Hmm-based 方法)高度依赖手工设计的特征与人工规则,每个游戏都要单独调。DQN 的意义不在于打败了这些 agent,而在于用一个通用的 CNN+Q-learning 流程端到端打 49 个游戏而不改一行代码。
2. 智能体-环境循环
观察 o_t (210×160 画面, 128 色)
┌──────────────────────────────────────┐
│ ▼
┌───┴────┐ 动作 a_t ┌─────────────────────┐
│ DQN │ ───────────────► │ Atari 2600 模拟器 │
│ agent │ ◄─────────────── │ (ALE 环境) │
└────────┘ 奖励 r_t + 新画面 │ │
└─────────────────────┘
(a_t 会重复 4 帧,即 frame-skip=4)DQN 用 frame-skip=4:每 4 帧取一个动作。这样既降低了时间上的动作频率,又默认做了动作的平滑。每个训练片段(episode)在游戏结束时终止,或者在有"生命"机制的游戏里可以用生命数做天然的短片段切分。
3. 奖励稀疏到底意味着什么
以 Breakout(打砖块)为例:一个回合开始时只有小球和砖墙,agent 必须移动挡板接球。大部分帧的奖励都是 0,得分集中在击碎砖块、一次消砖或打穿墙的瞬间。这正是"探索与利用"矛盾的最典型现场:一个随机的 agent 可能几十分钟都打不到砖块,因此没有信号告诉它"往左还是往右"是对的。有关这一矛盾的通用解法,见探索与利用页。
TIP
Atari 的"像素→动作"任务给深度 RL 提供了天然的问题,但要注意:游戏得分是密集且对齐良好的奖励(每做对一件事就得分),现实中绝大多数问题没有这么干净的奖励信号。别把游戏里的成功经验直接搬到业务场景,先读奖励工程。
二、DQN 架构与预处理
1. 从 2013 NIPS 到 2015 Nature
DQN 的发展分两个版本:
| 版本 | 时间 | 主要改进 | 结果 |
|---|---|---|---|
| DQN 初版(NIPS Deep Learning Workshop) | 2013 年 12 月 | CNN+经验回放 | 7 个游戏中的 3 个超越最优现有方法 |
| DQN Nature 版 | 2015 年 2 月 | 目标网络、Huber loss、架构加深 | 49 个游戏中 29 个超越人类专家 |
2013 版已经证明了"CNN 能从像素直接学到好策略",但 2015 版的两个工程改进——目标网络与误差截断——才是它稳定收敛、横扫 49 个游戏的关键。
2. 预处理流水线
原始画面不能直接进网络,DQN 的预处理如下:
210×160×128色 ──► 灰度化(210×160×1) ──► 下采样+裁剪(84×84×1)
──► 帧堆叠(84×84×4,取最近4帧) ──► CNN- 灰度化:颜色信息在大多数游戏中不是决定策略的信号,砍掉能减少 3/4 计算量。
- 帧堆叠 4 帧:单帧画面看不出物体运动速度与方向(部分可观测问题),把最近 4 帧叠成 4 通道输入,相当于给网络一个"短时记忆"。这是"状态表示即部分可观测问题的解法"的最小实例。
- 奖励截断:把每个游戏的原始得分
clip到[-1, +1]。这防止了某些游戏里得分量级巨大(如 Centipede)导致梯度爆炸,也统一了不同游戏的奖励量纲。
WARNING
奖励截断是一个"信号失真"操作:它让 agent 区分不了"得 100 分"和"得 10000 分"。DQN 能这么做是因为它只关心最大化回报的相对比较,而截断后梯度更稳。这背后的权衡是:截断的副作用在高分差极重要的场景(如金融)可能是灾难性的,详见金融交易中的 RL的陷阱讨论。
3. 网络结构
Nature DQN 的网络是"卷积层做感知、全连接层做价值计算":
text
输入: 84×84×4 帧堆叠
└─► Conv 32@8×8, stride 4, ReLU
└─► Conv 64@4×4, stride 2, ReLU
└─► Conv 64@3×3, stride 1, ReLU
└─► Flatten → 512 全连接, ReLU
└─► 输出层: 每个动作一个 Q 值 (动作数 N 个节点)与监督式 CNN 的关键区别:输出层没有 softmax,而是每个动作对应一个 Q 值节点。损失是 TD 误差的平方(或 Huber):
L(θ) = E[(r + γ·max_{a'} Q(s', a'; θ⁻) − Q(s, a; θ))²]其中 θ⁻ 是目标网络参数,每 C 步(论文取 C=10000)从 θ 复制一次。这个式子就是价值学习页里的 Q-learning 更新公式,只不过 Q 函数换成了神经网络。
4. DQN 训练循环:最小伪代码
把上面所有机制串成一个可读的训练循环(伪代码,与Gymnasium 教程里可运行的实现对应):
python
# DQN 训练循环(伪代码,含中文注释)
replay_buffer = ReplayBuffer(capacity=1_000_000) # 经验回放池,容量 100 万条
online_net = DQN(input=84*84*4, output=num_actions) # 当前 Q 网络
target_net = copy(online_net) # 目标网络:每 C 步同步一次
C = 10_000 # 目标网络同步间隔(Nature 论文取值)
gamma = 0.99 # 折扣因子
state = env.reset()
for frame in range(50_000_000): # Nature 论文训练约 5000 万帧
action = epsilon_greedy(online_net, state, eps)
next_state, reward, done, _ = env.step(action) # frame-skip=4 已被环境封装
reward = clip(reward, -1.0, 1.0) # 奖励截断
replay_buffer.add(state, action, reward, next_state, done)
if len(replay_buffer) >= 10_000: # 回放池足够大才开始学
batch = replay_buffer.sample(32) # 均匀随机抽样:破时间相关
y = r + gamma * max_a target_net(s', a) * (1 - done) # TD 目标(目标网络)
loss = huber_loss(online_net(s, a), y) # Huber loss:对大误差更鲁棒
gradient_update(online_net, loss)
if frame % C == 0:
target_net = copy(online_net) # 定期冻结更新目标
if done:
state = env.reset()两个容易被忽略的实现细节:
- Huber loss(误差截断):Nature 版用 Huber loss 而非 MSE。TD 误差大的样本(通常是早期探索遇到的极端情况)会产生超大梯度,Huber 把误差截断在线性段,防止单个样本破坏参数。这和奖励截断是"双保险"。
done的处理:TD 目标在终止状态下必须取r而不是r + γ·maxQ——否则会把"游戏结束后的虚拟价值"回传进去。这个 bug 极小却极常见,是常见陷阱与反模式页"复现论文失败诊断清单"里的高频条目。
三、两大工程技巧为什么必要
1. 经验回放(Experience Replay):破相关性
强化学习是**非独立同分布(non-i.i.d.)**的数据流:相邻帧高度相关、同一个 episode 里的数据不满足独立抽样。直接按时间顺序做梯度更新会导致:
- 梯度方向被近期经验主导,剧烈震荡甚至发散;
- 一个罕见但重要的早期经验被冲掉,sample efficiency 极差。
经验回放的做法是把 (s, a, r, s', done) 存进一个固定容量(1M 条)的回放池,训练时均匀随机抽样小批量来更新。这相当于强行把时序数据洗牌成近似独立同分布的批次。
| 问题 | 无回放时 | 有回放时 |
|---|---|---|
| 时间相关性 | 相邻样本高度相关,更新方向偏斜 | 随机抽样破掉时间相关 |
| 数据利用 | 每条经验只学一次 | 一条经验被重复学习多次 |
| 样本效率 | 低(需更多环境交互) | 高(一个经验多处受益) |
| 稳定性 | 容易发散 | 显著更稳 |
2. 目标网络(Target Network):稳住自举
Q-learning 的更新是"自举"(bootstrap)的:用 Q(s', a') 的值来更新 Q(s, a)。当 Q 是同一个网络时,这就成了追着自己尾巴跑的循环——每一步都在移动"目标",会导致价值估计振荡甚至发散。
text
没有目标网络: 有目标网络:
用 θ 算目标 用 θ⁻(每10000步才更新) 算目标
y = r + γ max Q(s',a';θ) y = r + γ max Q(s',a';θ⁻)
θ 每步更新 → 目标每步动 θ 每步更新, θ⁻ 不动
──► 目标漂移、发散 ──► 目标固定、稳定学习直觉类比:这就像学生在考试(θ⁻)和学生自己复习(θ)分离——如果出题人每做一道题就改一次答案,学生永远考不好。目标网络让"标准答案"冻结一段时间,学习才可能收敛。
3. 两个技巧缺一个会怎样
社区后来的消融实验与复现(如 2018 年 Zhang 等人的 A Dissection of Overfitting、Hessel 等人的 Rainbow 消融)一致表明:去掉经验回放,DQN 在多数游戏上根本学不进去;去掉目标网络,学习曲线剧烈振荡,在很多游戏上发散。这两个技巧是 DQN 能工作的"地基",而不是锦上添花。
四、结果与意义
1. Nature 2015 的惊人数字
2015 年 2 月,Mnih 等人的论文 Human-level control through deep reinforcement learning 登上 Nature 封面。结论被媒体广泛报道:
| 统计项 | 数值 |
|---|---|
| 测试游戏数 | 49 个 |
| 超过人类专家的游戏数 | 29 个(约 60%) |
| 超过现有最优方法(prior best)的游戏数 | 43 个 |
| 显著低于人类专家的游戏数 | 3 个(Montezuma's Revenge、Private Eye、Venture 等探索困难型) |
几个标志性单游戏成绩(Nature 论文报告):
- Breakout(打砖块):DQN 约 401 分,人类专家约 30 分——靠学会"从侧面打穿砖墙"这种人类常用但 agent 自发学会的技巧。
- Enduro(赛车):DQN 约 861 分,人类专家约 368 分。
- Pong(乒乓):DQN 达到 21:−3(完美碾压级),人类约 9.3 分。
- Montezuma's Revenge:DQN 约 0 分——这个"最难的探索游戏"后来整整两年是深度 RL 探索研究的主战场(见探索与利用)。
2. 为什么这是"人类水平"的标志
在此之前,"AI 玩 Atari"依赖逐游戏的规则工程;在此之后,一个未针对任何游戏定制的通用学习算法,仅凭原始像素和得分,就在多数游戏上达到或超过人类。这验证了一个判断:深度神经网络 + 足够多的试错,可以从高维感官输入中自发学到复杂策略。它对后续 DQN 家族(Double、Dueling、Rainbow)、以及 2016 年 AlphaGo 都提供了直接的方法论铺垫。
INFO
严格说,"Nature 封面"的说法需要精确:2015 年 2 月 26 日的 Nature 封面论文就是 DQN。这与强化学习演进简史里"深度 RL 三巨头(DQN / PPO / AlphaGo)"的说法衔接——DQN 是第一个。
五、从 DQN 到 Rainbow:七项改进
2015 年后,学界在 DQN 上做出一系列"单独验证有效"的改进。2018 年 Hessel 等人把它们组合进一个 agent,命名为 Rainbow,在 Atari 上取得当时的最优平均成绩。七个组件如下:
| # | 改进 | 提出论文 | 一句话机制 |
|---|---|---|---|
| 1 | Double DQN | van Hasselt et al., 2015 | 用当前网络选动作、目标网络算值,缓解价值高估 |
| 2 | Prioritized Experience Replay | Schaul et al., 2015 | 按 TD 误差大小加权采样,让"值得学的经验"被多学 |
| 3 | Dueling Network | Wang et al., 2015 | 把 Q 拆成状态价值 V + 优势 A,动作少时学得更快 |
| 4 | Multi-step Learning | 经典 TD(λ) 思想 | 用 n 步回报替代 1 步回报,加速信用的传播 |
| 5 | Distributional RL(C51) | Bellemare et al., 2017 | 学回报的分布而非期望,保留不确定性信息 |
| 6 | NoisyNet | Fortunato et al., 2017 | 在权重上注入学习得到的噪声,替代 ε-greedy 探索 |
| 7 | 组合本身 | Hessel et al., 2018 | 六项改进共享一个网络,相互正交互补 |
Rainbow 在 Atari 上的平均得分(按 ALE 规范化分数)比当时的 best agent(C51)提升了约 2 倍以上,且中位数远超人类水平。更有意思的是消融实验:每一项改进单独拿掉都会掉分,说明它们是"各补各的短板":
- 去掉 Double:价值高估回归,分数下降;
- 去掉 Prioritized Replay:样本效率下降;
- 去掉 Multi-step:信用分配变慢,Assault 等游戏大幅退步;
- 去掉 Distributional:Ms. Pac-Man 等游戏明显退步。
C51 的一句话理解
Distributional RL(C51)不学 Q(s,a)=E[回报],而是学回报的完整分布(用 51 个固定分位点表示)。直觉:"平均 10 分"掩盖了"50% 概率得 0 分、50% 概率得 20 分"和"100% 得 10 分"的本质区别;分布信息让 agent 在做风险敏感决策时更有依据。它也是后来世界模型与离线 RL 里"不确定性感知"思想的源头。
TIP
Rainbow 的教训值得带到工程里:单点改进很难,组合式改进才是主流。如果你在自己的任务里想"加一个新技巧",最好的做法是先建一个基线,再逐项加并做消融——这正是评估实践页强调的协议。
Rainbow 之后:规模化与分布式的两条腿
Rainbow 确立了"组合改进"的路线,2018 年后 Atari 研究转向两个方向,理解它们有助于看清游戏 RL 的后续形态:
| 方向 | 代表工作 | 思想 | 遗留影响 |
|---|---|---|---|
| 分布式训练 | Ape-X(2018) | 上千 worker 并行采样,优先级回放集中在 learner | 样本吞吐量提升一两个量级 |
| 分布式价值 | IMPALA(2018) | 大规模 actor 异步 + V-trace 校正 | 成为多智能体训练的常用基座 |
| 数据效率 | 训练预算从 5 亿帧压缩到 2000 万帧(如 Some RL 环境工作) | 更关注"少样本变强" | 铺垫了后来 Offline RL 的评估 |
同时 2018 年 Zhang 等人的 A Dissection of Overfitting in Continuous RL 等复现研究揭示了一个更尖锐的问题:DQN 在 Atari 上的"好结果"依赖固定的 5 亿帧预算与固定 seed,很多论文的改进在多个 seed 下并不显著——这直接推动了评估与基准页"多次运行、IQR、样本效率/最终性能双维度"的评估规范成型。
六、游戏 RL 的边界与启示
1. DQN 的代价:样本效率与计算
DQN 在 Atari 上训练需要 约 5000 万帧(Nature 论文是 5000 万,即 5×10⁷),后期复现约需 10^8 帧。以每帧 4ms 的模拟速度算,单游戏训练要数天 GPU 时间。这意味着:
- 游戏环境的成本极低(模拟器毫秒级),RL 的"试错学费"可以随便烧;
- 一旦换到真实世界(机器人、交易、医疗),同样的样本量根本不可行——这是机器人 Sim2Real与离线强化学习页反复出现的话题。
2. 评估陷阱:49 个游戏的平均分不说明一切
- 分数规范化:不同游戏分值量纲差异巨大(从几分到几百万分),直接平均没有意义。Machado 等人 2018 年的 ALE 复审视论文提出用
(agent−随机) / (人类−随机)做规范化,这一规范化分数被后来几乎所有论文采用。 - 随机种子敏感:Atari 的随机性来自模拟器与 ε-greedy,同一算法不同 seed 可能差出 20% 以上。单 seed 结果不可信——评估与基准页有完整论述。
- "超越人类"的测量本身有争议:人类基准来自玩过该游戏的少数玩家短时成绩,并不能代表"人类极限"。
3. 探索仍是瓶颈
DQN 家族在 Montezuma's Revenge 这类"需要长链条探索"的游戏上长期得分接近 0,直到 Go-Explore(2019)、RND(2018)等探索方法出现才有突破。这告诉我们:
当奖励稀疏到"随机行为几乎永远得不到奖励"时,任何价值/策略方法都学不动。探索不是价值学习的附属品,而是独立的工程问题。
4. 从单智能体到双人游戏
ALE 里的双人游戏(如 Pong 的对战模式)开启了另一个话题:两个 agent 同时学习,环境不再平稳,Q-learning 的收敛理论失效。这一方向在多智能体强化学习页展开。
5. 探索难题的深度案例:Montezuma's Revenge 与 Go-Explore
Montezuma's Revenge 为什么难到让 DQN 得 0 分?它的关卡里,agent 必须完成一个长链条探索:下楼梯→拿钥匙→上楼梯→过门→(多次重复)→拿宝物得分。链条上任何一步随机行为做不对,就永远得不到第一次得分信号——没有信号,Q 值全为零,梯度为零,学习停滞。
2018 年后两条路线攻破了它:
- 内在奖励(intrinsic reward):RND(Burda et al., 2018)训练一个"预测器"衡量"这个状态有多新",新状态给额外奖励,驱动 agent 去"没去过的地方"。RND 在 Montezuma 上把 DQN 的 0 分提升到数千分。
- 回放记忆与挑战:Go-Explore(Ecoffet et al., 2021)更彻底——先探索后强化:存档所有见过的状态,从"存档点"重启探索,先解决"探索"再解决"利用",在 Montezuma 上达到人类水平。
这两条路线的完整机制(count-based、RND、ICM、Go-Explore)见探索与利用页。它们的共同教训:"探索"不是 DQN 的一个超参,而是一个需要独立设计的工程问题——这与把探索当 ε 的刻板印象截然不同。
七、游戏 RL 留下的技术遗产
把 Atari 十年的研究串起来,它留给整个深度 RL 四笔遗产:
- 评估协议:"多游戏、多 seed、规范化分数"成了深度 RL 的事实标准,直接催生了评估与基准页的方法论。
- 工程技巧库:回放、目标网络、双 Q、优先级回放、分布价值、噪声探索——每一项都先在 Atari 上被验证,再被移植到机器人、推荐、大模型。
- "游戏作为探针"的方法论:游戏是可复现、可重置、奖励明确的模拟器,是 RL 算法的"风洞"。直到今天,新算法(如 MuZero、EfficientZero、DreamerV3)仍然用 Atari 做第一道检验,因为它的成本收益比无可替代。
- 诚实的边界教育:Montezuma 证明"奖励稀疏时价值学习失效",这让 2018 年后的探索研究爆发;同时"在游戏上强 ≠ 在真实环境强"也提醒所有 RL 工程师:游戏里的成功只是起点,不是终点。
与真实世界的对比表
| 维度 | Atari | 真实业务(机器人/推荐/金融) |
|---|---|---|
| 重置成本 | 毫秒级、免费 | 昂贵甚至不可重置 |
| 奖励 | 密集、对齐良好 | 稀疏、延迟、有噪声 |
| 环境保真度 | 完美模拟(就是环境本身) | 模型误差、分布漂移 |
| 评估 | 分数可精确复现 | 指标受成本、样本、非平稳干扰 |
| 单任务还是多任务 | 单游戏单任务 | 多目标、多约束 |
这张表也解释了为什么 Atari 上的算法改进往往"换环境就掉链子"——不是算法没用,而是真实环境的奖励与数据条件比 Atari 苛刻得多。
附录:想复现 DQN 先回答这七个问题
2018 年后社区对 DQN 复现进行了系统反思(如 Castro 等人的 Dopamine 框架、以及多篇"reproduction study"),发现"论文里的 DQN 和我跑的 DQN 常常不是一回事"。复现或自研 DQN 时先过这七问:
| # | 问题 | 常见分歧 |
|---|---|---|
| 1 | 奖励是否 clip 到 [-1,1]? | 不 clip 数字会差很多 |
| 2 | 用的是 Nature 还是 2013 版网络? | 层数、卷积核不同 |
| 3 | 目标网络同步间隔 C 是多少? | 10000 vs 1000 结果不同 |
| 4 | ε-greedy 的衰减策略? | 线性衰减的起点/终点/时长 |
| 5 | frame-skip 与生命切分? | 是否用"life loss"切 episode |
| 6 | 训练预算多少帧? | 5 亿 vs 1 亿差距巨大 |
| 7 | 报告的是哪个 seed、哪次运行? | 单一 seed 不可比 |
为什么这些细节重要:DQN 的超参敏感度远高于监督学习,改一个细节可能让"超越人类"变成"不如随机"。这也是调参与超参数优化页"RL 超参数敏感度比监督学习高一个量级"的 Atari 佐证。想少踩坑,先抄一个官方复现(如 Dopamine、Rainbow 官方实现),再动你的改动。
时间线:Atari 十年的关键节点
用一张时间线把 Atari 案例放进整个深度 RL 史(与强化学习演进简史页互为印证):
| 时间 | 事件 | 意义 |
|---|---|---|
| 2013 | ALE 基准论文(Bellemare);DQN 初版(NIPS) | 统一评估 + 首次像素级学习 |
| 2015 | DQN Nature 版(目标网络、Huber) | 49 游戏中 29 个超越人类 |
| 2015–16 | Double DQN、PER、Dueling | DQN 家族第一波改进 |
| 2016 | A3C、C51 分布 RL | 异步训练与分布价值 |
| 2017 | Rainbow 组合改进 | 平均分翻倍,消融方法论成型 |
| 2018 | Ape-X、NoisyNet;复现研究兴起 | 规模化 + 对"复现"的反思 |
| 2019–20 | Go-Explore、RND 突破 Montezuma | 稀疏奖励探索的解法 |
| 2020 | MuZero 在 Atari 上 SOTA | 学模型的规划也能打 Atari |
读这张表的启示:Atari 研究十年,主线不是"更大的网络",而是"更好的工程技巧与更严的评估"——这对所有深度 RL 项目都是最有迁移价值的部分。
八、链接概念与论文页
Atari 案例是理解整条"价值学习→深度 RL"主线的最佳入口:
- 机制侧:DQN 的 TD 更新、回放、目标网络全部建立在价值学习的 Q-learning 之上;它如何工作、为什么需要那些技巧,读那一页。
- 论文侧:Mnih 2013/2015、Hessel 2018 是经典论文精读页的必读篇目,该页有"面试可能怎么问"。
- 历史侧:DQN 是 2013–2015 深度 RL 爆发的起点,整个时间线在强化学习演进简史页。
- 评估侧:Atari 基准的江湖地位与批评、规范化分数,见评估与基准。
- 工具侧:想亲手跑 DQN/PPO on Atari,Gymnasium 教程与数据集与工具档案里的环境库清单是起点。
延伸阅读
- 价值学习:从动态规划到 DQN —— DQN 的全部机制基础,含 DQN 家族完整谱系。
- 经典论文精读 —— Mnih DQN 的逐段精读与面试答题框架。
- 评估与基准 —— Atari 基准的规范化分数、seed 敏感性与报告规范。
- 强化学习演进简史 —— DQN 在 2013–2017 深度 RL 爆发中的位置。
- 探索与利用 —— Montezuma's Revenge 这类探索难题的完整解法谱系。
- 数据集与工具档案 —— 环境库与基准套件的选型表。
参考资料
- Mnih, V., et al. (2013). Playing Atari with Deep Reinforcement Learning. arXiv:1312.5602.
- Mnih, V., et al. (2015). Human-level control through deep reinforcement learning. Nature, 518(7540), 529–533.
- Bellemare, M. G., et al. (2013). The Arcade Learning Environment: An Empirical Evaluation of Reinforcement Learning Agents. Journal of Artificial Intelligence Research, 47, 253–279.
- van Hasselt, H., Guez, A., & Silver, D. (2016). Deep Reinforcement Learning with Double Q-learning. arXiv:1509.06461.
- Schaul, T., et al. (2016). Prioritized Experience Replay. arXiv:1511.05952.
- Wang, Z., et al. (2016). Dueling Network Architectures for Deep Reinforcement Learning. arXiv:1511.06581.
- Bellemare, M. G., et al. (2017). A Distributional Perspective on Reinforcement Learning. arXiv:1707.06887.
- Fortunato, M., et al. (2018). Noisy Networks for Exploration. arXiv:1706.10295.
- Hessel, M., et al. (2018). Rainbow: Combining Improvements in Deep Reinforcement Learning. arXiv:1710.02298.
- Machado, M. C., et al. (2018). Revisiting the Arcade Learning Environment: Evaluation Protocols and Open Problems for General Agents. arXiv:1709.06009.
- Sutton, R. S., & Barto, A. G. (2018). Reinforcement Learning: An Introduction (2nd ed.). MIT Press.(免费在线版见 Sutton 主页)