外观
阅读路径
一句话定位:这一页按"你的目标"而不是"论文清单"来组织读论文——它回答"我该读哪些论文、按什么顺序、每篇读到什么程度、花多少时间",适合时间有限、想要路线图而不是书目的人,读完后你能直接照着清单开读,并知道什么时候该停下、什么时候该深挖。
读论文最怕的不是难,而是没有终点。没有路线的读者往往会陷入两种极端:要么在综述里打转,永远"准备再读";要么一头扎进一篇最新 arXiv,被数学术语击穿信心。这一页先把从这里开始里提过的三条路线展开成可执行的论文清单,每篇都标注了"读到什么程度"和"预计时间"。
一、三条路线总览
text
路线一:两小时快速入门(建立"论文直觉")
DQN → PPO → AlphaGo(综述向)→ 可选:一篇综述
目标:面试聊得起来、看得懂博客里的论文引用
路线二:工程落地线(能选算法、能复现、能诊断)
经典精读 6 篇 → RLHF(InstructGPT + DPO)→ 离线 RL(CQL/IQL)
→ 世界模型(DreamerV3/TD-MPC2)→ 挑一篇复现
目标:项目里遇到问题时知道去哪篇论文找答案
路线三:做研究线(能找到 gap、能写相关工作)
论文地图全量 → 复现 2~3 篇经典 → 最新 arXiv 每周跟
→ 按主题做文献矩阵 → 找到可攻击的点
目标:形成自己的研究方向| 维度 | 路线一 | 路线二 | 路线三 |
|---|---|---|---|
| 目标 | 建立直觉 | 支撑工程决策 | 支撑研究 |
| 时长 | 约 2 小时 | 1~2 周(边做边读) | 1~3 个月 |
| 论文数量 | 3~5 篇 | 12~15 篇 | 50+ 篇 |
| 阅读深度 | 摘要 + 方法图 + 结论 | 方法细节 + 公式 + 复现 | 全量 + 消融 + 复现 |
| 需要先修 | 基础概念 | 路线一 + 一个项目 | 路线一 + 路线二 |
| 检验标准 | 能回答"为什么" | 能独立复现一篇 | 能写出一页相关工作 |
三条路线不是互斥的,是递进关系:路线二是路线一加了"工程复现",路线三是路线二加了"广度 + 批判"。工程与研究中途都可以回到路线一补直觉。
二、路线一:两小时快速入门
这条线只读 3 篇经典 + 1 篇可选综述,目标是在 2 小时内建立起"论文长什么样"的直觉。顺序经过设计:先读最简单的(DQN),再读最实用的(PPO),最后读最壮观的(AlphaGo),最后用一篇综述收尾把三篇串起来。
1. DQN:Mnih et al., Playing Atari with Deep Reinforcement Learning, 2013
- 链接:arXiv:1312.5602(NIPS 2013 Deep Learning Workshop 版本,可免费获取;Nature 2015 长版是它的工程化迭代)
- 读到什么程度:摘要 + 方法图 + 两大工程技巧的直觉
- 这篇在讲什么:用深度网络逼近 Q 函数,从像素直接学打游戏。两处机制必须带走——经验回放(把转移存进缓冲池随机采样,打破样本时间相关性)和目标网络(冻结一个旧的 Q 网络来计算目标,稳定训练)。
- 为什么放第一:它是"深度 RL"的起点,语言最朴素,且其两大技巧是后续一切深度 RL 算法的地基。必读章节:经验回放与目标网络那两段。数学部分(CNN 结构、损失函数)扫一眼即可。
2. PPO:Schulman et al., Proximal Policy Optimization Algorithms, 2017
- 链接:arXiv:1707.06347
- 读到什么程度:第 4 节(算法)+ clip 目标的公式直觉
- 这篇在讲什么:一种"既稳又不复杂"的策略优化算法,用裁剪(clip)限制每次更新的步幅。核心公式是
L^CLIP(θ) = E_t[min(r_t(θ) Â_t, clip(r_t(θ), 1-ε, 1+ε) Â_t)],其中r_t(θ)=π_θ(a_t|s_t)/π_θold(a_t|s_t)是新旧策略的概率比。 - 为什么放第二:它是今天最常用的算法(包括 RLHF 微调语言模型),也是经典论文精读里精读的一篇。必读章节:clip 目标如何近似"信任域"那段——它为什么能替代复杂的 TRPO,是这篇论文的灵魂。
3. AlphaGo:Silver et al., Mastering the Game of Go with Deep Neural Networks and Tree Search, 2016
- 链接:Nature 原文(无免费 arXiv 版;AlphaZero 有 arXiv:1712.01815 可作替代)
- 读到什么程度:方法图 + 三段训练(SL 策略网络 → RL 策略网络 → 价值网络)+ 结论
- 这篇在讲什么:把监督学习、强化学习、蒙特卡洛树搜索(MCTS)合成一个系统击败职业棋手。三段训练是必带走的机制:先在 3000 万个人类棋局上监督学策略网络(预测高手落子,准确率约 57%);再让策略网络与自己对弈强化(能以约 80% 胜率击败监督版);最后用强化版自对弈的局面训练价值网络(预测胜负,误差显著低于快速 rollout)。
- 为什么放最后:它是最"宏大"的一篇,信息密度高,适合在前两篇建立算法直觉后阅读。必读章节:图 2 的系统架构 + 三段训练的文字描述。
4.(可选)综述收尾:Li, Deep Reinforcement Learning: An Overview, 2017
- 链接:arXiv:1701.07274
- 读到什么程度:目录 + 每章第一段
- 作用:把 DQN、策略梯度、Actor-Critic 的谱系串成一张图,顺便告诉你"还有哪些论文属于这个家族"。
两小时的时间分配
DQN 40 分钟、PPO 50 分钟、AlphaGo 30 分钟、综述 20 分钟,共约 140 分钟。每篇的"必读章节"加起来不足 30 页,时间完全够。不要逐字读全文——路线一的纪律是"只读该读的"。
三、路线二:工程落地线
这条线给"要拿 RL 做项目"的人。它把经典论文精读的 6 篇作为地基,再补 4 个工程相关方向的代表论文,最后要求你亲手复现一篇。总时长 1~2 周,每天 1~2 小时,边读边在项目里验证。
1. 地基:经典精读 6 篇(第 1~3 天)
经典论文精读 页逐篇精读了 6 篇:Bellman 1957(动态规划)、Watkins 1989/1992(Q-learning)、Mnih 2015(DQN)、Silver 2016(AlphaGo)、Schulman 2017(PPO)、Ouyang 2022(InstructGPT)。路线二的前三天把它们按顺序读完,重点不是背结论,而是把每个算法放在"它解决前一个算法的什么问题"这条线上理解:
text
Bellman(MDP 与价值方程,理论地基)
└─> Q-learning(表格法,off-policy 革命)
└─> DQN(表格 → 神经网络,解决状态爆炸)
└─> PPO(价值法 → 策略法合流,解决稳定性)
└─> AlphaGo(算法合流 + 搜索,工程集大成)
└─> InstructGPT(RL 迁移到语言模型)每篇的"面试怎么答"要点都在这页里,读完顺手自测。
2. RLHF:InstructGPT 与 DPO(第 4 天)
- InstructGPT:Ouyang et al., Training Language Models to Follow Instructions with Human Feedback, 2022,arXiv:2203.02155。三阶段:SFT → 奖励模型(人类偏好对)→ PPO 微调(带 KL 惩罚)。做 LLM 相关工程必读,RLHF 概念页 有消化版。
- DPO:Rafailov et al., Direct Preference Optimization, 2023,arXiv:2305.18290。用偏好对直接优化策略,省掉奖励模型和 PPO。工程上"训练简单"是巨大优势,但前沿进展里会讲它的局限。
3. 离线 RL:CQL 或 IQL 二选一(第 5 天)
- CQL:Kumar et al., Conservative Q-Learning for Offline Reinforcement Learning, 2020,arXiv:2006.04779。在 Q 学习目标上惩罚分布外(OOD)动作的价值估计。
- IQL:Kostrikov et al., Offline Reinforcement Learning with Implicit Q-Learning, 2022,arXiv:2110.06169。用 expectile 回归只学价值函数的支撑,从不 query 分布外动作。
- 怎么选:你的项目是"有历史日志、想学策略"(如推荐、风控)→ 读 IQL 或 CQL;纯在线训练 → 跳过此节。背景见离线 RL 概念页。
4. 世界模型:DreamerV3 或 TD-MPC2 二选一(第 6 天)
- DreamerV3:Hafner et al., Mastering Diverse Domains through World Models, 2023,arXiv:2301.04104。一套超参打遍 150+ 任务,潜空间世界模型 + 固定超参的工程哲学。
- TD-MPC2:Hansen et al., Scalable, Robust World Models for Continuous Control, 2023,arXiv:2310.16828。连续控制的单模型多任务世界模型。
- 怎么选:偏视觉/离散任务读 DreamerV3,偏机器人连续控制读 TD-MPC2。背景见基于模型 RL 概念页。
5. 必修动作:亲手复现一篇(第 7~14 天)
路线二最关键的检验标准是复现。挑一篇与你工作最相关的:
| 项目场景 | 推荐复现 |
|---|---|
| 游戏/Atari | DQN(用 Gymnasium 教程 的骨架改) |
| 连续控制/机器人 | PPO 或 SAC(SB3 有参考实现) |
| 大模型对齐 | DPO(llm-alignment 案例有实战路径) |
| 离线决策 | IQL(D4RL 数据上跑) |
复现的纪律见阅读纪律与 FAQ:先跑官方实现确认复现成功,再自己从零写。不要一上来就闭门造车。
四、路线三:做研究线
这条线给有论文压力的人(读研、发 paper、找研究方向)。它不追求"读完",追求**"读完能看出别人没看到的问题"**。
1. 阶段一:论文地图全量(第 1~2 周)
把论文地图的六条支流从头到尾过一遍:动态规划支流、表格法支流、策略梯度支流、深度 RL 支流、RLHF 支流、多智能体支流。每条支流的关键论文都读摘要 + 方法图,经典几篇读全文。这一步的目标不是记住细节,而是建立"这个领域已被什么人从什么角度攻过"的坐标系——你不知道坐标系,就看不出 gap。
2. 阶段二:复现 2~3 篇经典(第 3~4 周)
精读 + 复现组合拳:选 2~3 篇与你潜在方向最相关的经典论文,先跑官方实现,再从零写一遍并做消融(去掉某个技巧看效果)。这会产生两个研究资产:可复用的代码库、对"哪个机制真正起作用"的亲身直觉。后者是写 related work 和设计消融实验时的底气。
3. 阶段三:每周跟踪 arXiv(持续)
建立每周固定节奏:用 arXiv 的订阅(按关键词如 reinforcement learning、RLHF、world models)或 Papers with Code 的 Trending 页,每周挑 3~5 篇新论文读摘要,1 篇读全文。前沿进展列出了 2020 年代的六大前沿方向,可以作为跟踪时的分类框架。
4. 阶段四:文献矩阵与 gap 挖掘(第 5 周起)
用一个表格维护你的"文献矩阵":行是相关论文,列是(问题设定 / 方法家族 / 实验环境 / 局限 / 与我的关系)。当同一行的局限反复出现(例如"所有方法都在 MuJoCo 上验证"),你就找到了一个可以攻击的点。这是研究入门最被低估、但最有产出的动作。
text
文献矩阵示例(节选):
┌────────────┬──────────────┬──────────────┬──────────────────┐
│ 论文 │ 方法家族 │ 局限 │ 与我研究的关系 │
├────────────┼──────────────┼──────────────┼──────────────────┤
│ IQL │ 隐式 Q │ 只测了 D4RL │ 我的场景也是离线 │
│ CQL │ 保守价值 │ 需要调 α │ 可与 IQL 对比 │
│ ... │ │ │ │
└────────────┴──────────────┴──────────────┴──────────────────┘五、每篇论文"读到什么程度"分级表
读任何一篇论文前,先决定读到第几级,避免两个极端(扫一眼就过 / 死磕到底):
| 级别 | 内容 | 花费 | 什么时候够用 |
|---|---|---|---|
| L0 标题与摘要 | 题目 + 摘要 + 结论 | 5 分钟 | 判断"要不要读" |
| L1 一句话定位 | L0 + 方法图 + 贡献列表 | 15 分钟 | 写综述、给同事讲"这篇在干嘛" |
| L2 机制级 | L1 + 核心公式的直觉 + 关键实验 | 40~60 分钟 | 面试、选算法、理解设计动机 |
| L3 细节级 | L2 + 推导 + 全部实验表格 + 消融 | 2~4 小时 | 复现、写相关工作、批判性阅读 |
| L4 复现级 | L3 + 自己从零写出来并跑通 | 数天~数周 | 做研究、进新方向 |
路线一全员 L2,路线二经典篇 L3、前沿篇 L2,路线三相关论文 L3~L4。论文地图与经典精读页中的每篇论文,都默认按 L2 起步。
六、时间预算总表
| 路线 | 总时长 | 阅读 | 复现 | 检验标准 |
|---|---|---|---|---|
| 一、两小时入门 | 2 小时 | 3~5 篇 × L2 | 无 | 能讲清 DQN 两大技巧、PPO clip 直觉、AlphaGo 三段训练 |
| 二、工程落地 | 1~2 周 | 12~15 篇(3 天经典 + 4 天前沿) | 1 篇完整复现 | 项目里遇到问题能定位到论文;独立复现一篇 |
| 三、做研究 | 1~3 个月 | 地图全量 + 每周 3~5 篇 | 2~3 篇 | 能写出相关工作;能找到至少一个 gap |
常见失败模式
路线二最常见的失败是"读了一堆,一篇没复现"——读 15 篇论文给不了你任何工程能力,复现 1 篇能。如果你时间只够做一件事,选复现。反过来,路线三最常见的失败是"只复现不读地图"——在无坐标系的局部重复别人做过的事,浪费几个月才发现文献里早有答案。
延伸阅读
- 从这里开始 —— 栏目总入口,三条路线的定位与"带走机制别带走数字"的原则。
- 经典论文精读 —— 路线二的地基:6 篇里程碑论文逐篇精读 + 面试答题要点。
- 论文地图 —— 路线三的坐标系:六条支流 40+ 篇论文的一句话定位。
- 前沿进展 —— 路线二/三的望远镜:2020 年代六大前沿方向与代表工作。
- 阅读纪律与 FAQ —— 三栏笔记法、复现纪律、读不懂怎么办。
- 术语表 —— 阅读时遇到陌生术语的速查入口。
参考资料
- Mnih, V., et al. (2013). Playing Atari with Deep Reinforcement Learning. arXiv:1312.5602. https://arxiv.org/abs/1312.5602
- Schulman, J., et al. (2017). Proximal Policy Optimization Algorithms. arXiv:1707.06347. https://arxiv.org/abs/1707.06347
- Silver, D., et al. (2016). Mastering the Game of Go with Deep Neural Networks and Tree Search. Nature 529:484–489. https://www.nature.com/articles/nature16961
- Silver, D., et al. (2017). Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm(AlphaZero). arXiv:1712.01815. https://arxiv.org/abs/1712.01815
- Li, Y. (2017). Deep Reinforcement Learning: An Overview. arXiv:1701.07274. https://arxiv.org/abs/1701.07274
- Ouyang, L., et al. (2022). Training Language Models to Follow Instructions with Human Feedback(InstructGPT). arXiv:2203.02155. https://arxiv.org/abs/2203.02155
- Rafailov, R., et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
- Kumar, A., et al. (2020). Conservative Q-Learning for Offline Reinforcement Learning. arXiv:2006.04779. https://arxiv.org/abs/2006.04779
- Kostrikov, I., et al. (2022). Offline Reinforcement Learning with Implicit Q-Learning. arXiv:2110.06169. https://arxiv.org/abs/2110.06169
- Hafner, D., et al. (2023). Mastering Diverse Domains through World Models(DreamerV3). arXiv:2301.04104. https://arxiv.org/abs/2301.04104
- Hansen, N., et al. (2023). TD-MPC2: Scalable, Robust World Models for Continuous Control. arXiv:2310.16828. https://arxiv.org/abs/2310.16828