Skip to content

阅读路径

本页速览 按目标编排的 RL 读论文路线图:两小时快速入门、工程落地、做研究三条路线的具体论文清单与阅读顺序,以及每篇论文该读到什么程度。

阅读路径 ​

一句话定位:这一页按"你的目标"而不是"论文清单"来组织读论文——它回答"我该读哪些论文、按什么顺序、每篇读到什么程度、花多少时间",适合时间有限、想要路线图而不是书目的人,读完后你能直接照着清单开读,并知道什么时候该停下、什么时候该深挖。

读论文最怕的不是难,而是没有终点。没有路线的读者往往会陷入两种极端:要么在综述里打转,永远"准备再读";要么一头扎进一篇最新 arXiv,被数学术语击穿信心。这一页先把从这里开始里提过的三条路线展开成可执行的论文清单,每篇都标注了"读到什么程度"和"预计时间"。

一、三条路线总览 ​

text
路线一:两小时快速入门(建立"论文直觉")
   DQN → PPO → AlphaGo(综述向)→ 可选:一篇综述
   目标:面试聊得起来、看得懂博客里的论文引用

路线二:工程落地线(能选算法、能复现、能诊断)
   经典精读 6 篇 → RLHF(InstructGPT + DPO)→ 离线 RL(CQL/IQL)
   → 世界模型(DreamerV3/TD-MPC2)→ 挑一篇复现
   目标:项目里遇到问题时知道去哪篇论文找答案

路线三:做研究线(能找到 gap、能写相关工作)
   论文地图全量 → 复现 2~3 篇经典 → 最新 arXiv 每周跟
   → 按主题做文献矩阵 → 找到可攻击的点
   目标:形成自己的研究方向
维度路线一路线二路线三
目标建立直觉支撑工程决策支撑研究
时长约 2 小时1~2 周(边做边读)1~3 个月
论文数量3~5 篇12~15 篇50+ 篇
阅读深度摘要 + 方法图 + 结论方法细节 + 公式 + 复现全量 + 消融 + 复现
需要先修基础概念路线一 + 一个项目路线一 + 路线二
检验标准能回答"为什么"能独立复现一篇能写出一页相关工作

三条路线不是互斥的,是递进关系:路线二是路线一加了"工程复现",路线三是路线二加了"广度 + 批判"。工程与研究中途都可以回到路线一补直觉。

二、路线一:两小时快速入门 ​

这条线只读 3 篇经典 + 1 篇可选综述,目标是在 2 小时内建立起"论文长什么样"的直觉。顺序经过设计:先读最简单的(DQN),再读最实用的(PPO),最后读最壮观的(AlphaGo),最后用一篇综述收尾把三篇串起来。

1. DQN:Mnih et al., Playing Atari with Deep Reinforcement Learning, 2013 ​

  • 链接:arXiv:1312.5602(NIPS 2013 Deep Learning Workshop 版本,可免费获取;Nature 2015 长版是它的工程化迭代)
  • 读到什么程度:摘要 + 方法图 + 两大工程技巧的直觉
  • 这篇在讲什么:用深度网络逼近 Q 函数,从像素直接学打游戏。两处机制必须带走——经验回放(把转移存进缓冲池随机采样,打破样本时间相关性)和目标网络(冻结一个旧的 Q 网络来计算目标,稳定训练)。
  • 为什么放第一:它是"深度 RL"的起点,语言最朴素,且其两大技巧是后续一切深度 RL 算法的地基。必读章节:经验回放与目标网络那两段。数学部分(CNN 结构、损失函数)扫一眼即可。

2. PPO:Schulman et al., Proximal Policy Optimization Algorithms, 2017 ​

  • 链接:arXiv:1707.06347
  • 读到什么程度:第 4 节(算法)+ clip 目标的公式直觉
  • 这篇在讲什么:一种"既稳又不复杂"的策略优化算法,用裁剪(clip)限制每次更新的步幅。核心公式是 L^CLIP(θ) = E_t[min(r_t(θ) Â_t, clip(r_t(θ), 1-ε, 1+ε) Â_t)],其中 r_t(θ)=π_θ(a_t|s_t)/π_θold(a_t|s_t) 是新旧策略的概率比。
  • 为什么放第二:它是今天最常用的算法(包括 RLHF 微调语言模型),也是经典论文精读里精读的一篇。必读章节:clip 目标如何近似"信任域"那段——它为什么能替代复杂的 TRPO,是这篇论文的灵魂。

3. AlphaGo:Silver et al., Mastering the Game of Go with Deep Neural Networks and Tree Search, 2016 ​

  • 链接:Nature 原文(无免费 arXiv 版;AlphaZero 有 arXiv:1712.01815 可作替代)
  • 读到什么程度:方法图 + 三段训练(SL 策略网络 → RL 策略网络 → 价值网络)+ 结论
  • 这篇在讲什么:把监督学习、强化学习、蒙特卡洛树搜索(MCTS)合成一个系统击败职业棋手。三段训练是必带走的机制:先在 3000 万个人类棋局上监督学策略网络(预测高手落子,准确率约 57%);再让策略网络与自己对弈强化(能以约 80% 胜率击败监督版);最后用强化版自对弈的局面训练价值网络(预测胜负,误差显著低于快速 rollout)。
  • 为什么放最后:它是最"宏大"的一篇,信息密度高,适合在前两篇建立算法直觉后阅读。必读章节:图 2 的系统架构 + 三段训练的文字描述。

4.(可选)综述收尾:Li, Deep Reinforcement Learning: An Overview, 2017 ​

  • 链接:arXiv:1701.07274
  • 读到什么程度:目录 + 每章第一段
  • 作用:把 DQN、策略梯度、Actor-Critic 的谱系串成一张图,顺便告诉你"还有哪些论文属于这个家族"。

两小时的时间分配

DQN 40 分钟、PPO 50 分钟、AlphaGo 30 分钟、综述 20 分钟,共约 140 分钟。每篇的"必读章节"加起来不足 30 页,时间完全够。不要逐字读全文——路线一的纪律是"只读该读的"。

三、路线二:工程落地线 ​

这条线给"要拿 RL 做项目"的人。它把经典论文精读的 6 篇作为地基,再补 4 个工程相关方向的代表论文,最后要求你亲手复现一篇。总时长 1~2 周,每天 1~2 小时,边读边在项目里验证。

1. 地基:经典精读 6 篇(第 1~3 天) ​

经典论文精读 页逐篇精读了 6 篇:Bellman 1957(动态规划)、Watkins 1989/1992(Q-learning)、Mnih 2015(DQN)、Silver 2016(AlphaGo)、Schulman 2017(PPO)、Ouyang 2022(InstructGPT)。路线二的前三天把它们按顺序读完,重点不是背结论,而是把每个算法放在"它解决前一个算法的什么问题"这条线上理解:

text
Bellman(MDP 与价值方程,理论地基)
  └─> Q-learning(表格法,off-policy 革命)
        └─> DQN(表格 → 神经网络,解决状态爆炸)
              └─> PPO(价值法 → 策略法合流,解决稳定性)
                    └─> AlphaGo(算法合流 + 搜索,工程集大成)
                          └─> InstructGPT(RL 迁移到语言模型)

每篇的"面试怎么答"要点都在这页里,读完顺手自测。

2. RLHF:InstructGPT 与 DPO(第 4 天) ​

  • InstructGPT:Ouyang et al., Training Language Models to Follow Instructions with Human Feedback, 2022,arXiv:2203.02155。三阶段:SFT → 奖励模型(人类偏好对)→ PPO 微调(带 KL 惩罚)。做 LLM 相关工程必读,RLHF 概念页 有消化版。
  • DPO:Rafailov et al., Direct Preference Optimization, 2023,arXiv:2305.18290。用偏好对直接优化策略,省掉奖励模型和 PPO。工程上"训练简单"是巨大优势,但前沿进展里会讲它的局限。

3. 离线 RL:CQL 或 IQL 二选一(第 5 天) ​

  • CQL:Kumar et al., Conservative Q-Learning for Offline Reinforcement Learning, 2020,arXiv:2006.04779。在 Q 学习目标上惩罚分布外(OOD)动作的价值估计。
  • IQL:Kostrikov et al., Offline Reinforcement Learning with Implicit Q-Learning, 2022,arXiv:2110.06169。用 expectile 回归只学价值函数的支撑,从不 query 分布外动作。
  • 怎么选:你的项目是"有历史日志、想学策略"(如推荐、风控)→ 读 IQL 或 CQL;纯在线训练 → 跳过此节。背景见离线 RL 概念页。

4. 世界模型:DreamerV3 或 TD-MPC2 二选一(第 6 天) ​

  • DreamerV3:Hafner et al., Mastering Diverse Domains through World Models, 2023,arXiv:2301.04104。一套超参打遍 150+ 任务,潜空间世界模型 + 固定超参的工程哲学。
  • TD-MPC2:Hansen et al., Scalable, Robust World Models for Continuous Control, 2023,arXiv:2310.16828。连续控制的单模型多任务世界模型。
  • 怎么选:偏视觉/离散任务读 DreamerV3,偏机器人连续控制读 TD-MPC2。背景见基于模型 RL 概念页。

5. 必修动作:亲手复现一篇(第 7~14 天) ​

路线二最关键的检验标准是复现。挑一篇与你工作最相关的:

项目场景推荐复现
游戏/AtariDQN(用 Gymnasium 教程 的骨架改)
连续控制/机器人PPO 或 SAC(SB3 有参考实现)
大模型对齐DPO(llm-alignment 案例有实战路径)
离线决策IQL(D4RL 数据上跑)

复现的纪律见阅读纪律与 FAQ:先跑官方实现确认复现成功,再自己从零写。不要一上来就闭门造车。

四、路线三:做研究线 ​

这条线给有论文压力的人(读研、发 paper、找研究方向)。它不追求"读完",追求**"读完能看出别人没看到的问题"**。

1. 阶段一:论文地图全量(第 1~2 周) ​

把论文地图的六条支流从头到尾过一遍:动态规划支流、表格法支流、策略梯度支流、深度 RL 支流、RLHF 支流、多智能体支流。每条支流的关键论文都读摘要 + 方法图,经典几篇读全文。这一步的目标不是记住细节,而是建立"这个领域已被什么人从什么角度攻过"的坐标系——你不知道坐标系,就看不出 gap。

2. 阶段二:复现 2~3 篇经典(第 3~4 周) ​

精读 + 复现组合拳:选 2~3 篇与你潜在方向最相关的经典论文,先跑官方实现,再从零写一遍并做消融(去掉某个技巧看效果)。这会产生两个研究资产:可复用的代码库、对"哪个机制真正起作用"的亲身直觉。后者是写 related work 和设计消融实验时的底气。

3. 阶段三:每周跟踪 arXiv(持续) ​

建立每周固定节奏:用 arXiv 的订阅(按关键词如 reinforcement learning、RLHF、world models)或 Papers with Code 的 Trending 页,每周挑 3~5 篇新论文读摘要,1 篇读全文。前沿进展列出了 2020 年代的六大前沿方向,可以作为跟踪时的分类框架。

4. 阶段四:文献矩阵与 gap 挖掘(第 5 周起) ​

用一个表格维护你的"文献矩阵":行是相关论文,列是(问题设定 / 方法家族 / 实验环境 / 局限 / 与我的关系)。当同一行的局限反复出现(例如"所有方法都在 MuJoCo 上验证"),你就找到了一个可以攻击的点。这是研究入门最被低估、但最有产出的动作。

text
文献矩阵示例(节选):
┌────────────┬──────────────┬──────────────┬──────────────────┐
│ 论文        │ 方法家族      │ 局限          │ 与我研究的关系      │
├────────────┼──────────────┼──────────────┼──────────────────┤
│ IQL        │ 隐式 Q        │ 只测了 D4RL  │ 我的场景也是离线   │
│ CQL        │ 保守价值      │ 需要调 α     │ 可与 IQL 对比      │
│ ...        │              │              │                   │
└────────────┴──────────────┴──────────────┴──────────────────┘

五、每篇论文"读到什么程度"分级表 ​

读任何一篇论文前,先决定读到第几级,避免两个极端(扫一眼就过 / 死磕到底):

级别内容花费什么时候够用
L0 标题与摘要题目 + 摘要 + 结论5 分钟判断"要不要读"
L1 一句话定位L0 + 方法图 + 贡献列表15 分钟写综述、给同事讲"这篇在干嘛"
L2 机制级L1 + 核心公式的直觉 + 关键实验40~60 分钟面试、选算法、理解设计动机
L3 细节级L2 + 推导 + 全部实验表格 + 消融2~4 小时复现、写相关工作、批判性阅读
L4 复现级L3 + 自己从零写出来并跑通数天~数周做研究、进新方向

路线一全员 L2,路线二经典篇 L3、前沿篇 L2,路线三相关论文 L3~L4。论文地图与经典精读页中的每篇论文,都默认按 L2 起步。

六、时间预算总表 ​

路线总时长阅读复现检验标准
一、两小时入门2 小时3~5 篇 × L2无能讲清 DQN 两大技巧、PPO clip 直觉、AlphaGo 三段训练
二、工程落地1~2 周12~15 篇(3 天经典 + 4 天前沿)1 篇完整复现项目里遇到问题能定位到论文;独立复现一篇
三、做研究1~3 个月地图全量 + 每周 3~5 篇2~3 篇能写出相关工作;能找到至少一个 gap

常见失败模式

路线二最常见的失败是"读了一堆,一篇没复现"——读 15 篇论文给不了你任何工程能力,复现 1 篇能。如果你时间只够做一件事,选复现。反过来,路线三最常见的失败是"只复现不读地图"——在无坐标系的局部重复别人做过的事,浪费几个月才发现文献里早有答案。

延伸阅读 ​

  • 从这里开始 —— 栏目总入口,三条路线的定位与"带走机制别带走数字"的原则。
  • 经典论文精读 —— 路线二的地基:6 篇里程碑论文逐篇精读 + 面试答题要点。
  • 论文地图 —— 路线三的坐标系:六条支流 40+ 篇论文的一句话定位。
  • 前沿进展 —— 路线二/三的望远镜:2020 年代六大前沿方向与代表工作。
  • 阅读纪律与 FAQ —— 三栏笔记法、复现纪律、读不懂怎么办。
  • 术语表 —— 阅读时遇到陌生术语的速查入口。

参考资料 ​