外观
论文地图
一句话定位:这一页是 RL 文献的"世界地图"——它把七十年的关键论文按六条支流(动态规划、表格法、策略梯度、深度 RL、RLHF、多智能体)铺开,每篇一句话定位,适合想建立全局坐标系、写文献综述、或判断"这篇新论文属于哪条谱系"的人,读完后你能在任何一篇 RL 论文面前说出它从哪条支流长出来。
地图和书单的区别在于:书单告诉你"读什么",地图告诉你"它们之间的血缘关系"。掌握了血缘关系,你会发现看似不相关的论文其实是同一思想在不同条件下的变体——比如 PPO 和 DQN 共享同一个谱系(都从贝尔曼方程出发),RLHF 和 Q-learning 也共享同一个谱系(都在优化一个隐式定义的目标)。这正是演进简史页里时间维度的补充:那一页按"年代"讲,这一页按"主题"讲。
一、六条支流总览
text
RL 论文六条支流(按诞生的思想源头分)
┌──────────────────────────────────────────────────────────────┐
│ ① 动态规划支流 1957~ 贝尔曼方程、策略迭代 「一切的地基」│
│ │ │
│ ② 表格法支流 1959~ 试错学习、TD、Q-learning 「离线学习」│
│ │ │
│ ③ 策略梯度支流 1992~ REINFORCE、TRPO、PPO 「直接学策略」│
│ │ │
│ ④ 深度 RL 支流 2013~ DQN 家族、AlphaGo/MuZero 「神经网络化」│
│ │ │
│ ⑤ RLHF 支流 2022~ InstructGPT、DPO 「对齐人类」│
│ │ │
│ ⑥ 多智能体支流 2017~ MADDPG、QMIX、MAPPO 「多个学习者」│
└──────────────────────────────────────────────────────────────┘
阅读提示:②③④是主流,①是理论地基,⑤⑥是 2017 年后新长出的支流| 支流 | 核心问题 | 代表论文 | 对应的概念页 |
|---|---|---|---|
| ① 动态规划 | 模型已知时如何最优决策 | Bellman 1957、Howard 1960 | 价值学习 |
| ② 表格法 | 模型未知时如何试错学习 | Samuel 1959、Sutton 1988、Watkins 1992 | 价值学习 |
| ③ 策略梯度 | 如何直接优化策略 | Williams 1992、TRPO、PPO | 策略梯度 |
| ④ 深度 RL | 函数近似 + 大规模学习 | DQN 家族、AlphaGo、MuZero | 价值学习 与基于模型 |
| ⑤ RLHF | 如何让模型对齐人类 | InstructGPT、DPO | RLHF |
| ⑥ 多智能体 | 多个学习者共存怎么办 | MADDPG、QMIX、MAPPO | 多智能体 |
下面逐支流展开。每篇论文的标注格式:论文名(作者,年份,期刊/会议)——一句话定位。
二、动态规划支流:1957 年起的理论地基
这一支流回答的是最古老的问题:给定完整的世界模型,最优策略是什么? 它的答案——贝尔曼方程——成了后面所有支流的地基,因为一切 RL 算法本质上都在"模型未知"的条件下做同一件事:逼近贝尔曼方程的解。
1. Bellman, A Markovian Decision Process(1957,Indiana University Mathematics Journal)
——一句话定位:把"带延迟回报的序列决策"形式化为马尔可夫决策过程(MDP),并给出最优性的递归方程(贝尔曼方程),从此序列决策有了统一的数学语言。
核心方程(贝尔曼最优性方程):
text
V*(s) = max_a Σ_s' P(s'|s,a) [ R(s,a,s') + γ V*(s') ]这一支的所有算法——值迭代、Q-learning、DQN——都可以理解成"在不同条件下逼近这个方程的解"。详见价值学习概念页对贝尔曼方程的直觉讲解,以及经典论文精读里的精读章节。
2. Howard, Dynamic Programming and Markov Processes(1960,MIT Press 专著)
——一句话定位:把"策略迭代"做成可计算的算法(策略评估 ↔ 策略改进交替),让动态规划从理论方程变成工程方法。
策略迭代的两步交替,至今仍是许多 RL 算法的骨架:
text
策略评估:给定 π,解 V^π 的线性方程组(或迭代逼近)
↓
策略改进:π'(s) = argmax_a Σ P(s'|s,a)[R + γ V^π(s')]
↓
循环直到策略不再变化三、经典表格法支流:从试错学习到 off-policy
这一支流回答:没有模型、只能和环境试错交互,怎么学? 它把"学习"这件事从最优控制理论(需要模型)变成了真正的机器学习(从经验学)。
1. Samuel, Some Studies in Machine Learning Using the Game of Checkers(1959,IBM Journal of Research and Development)
——一句话定位:跳棋程序用自对弈 + 评估函数学习,是"从经验改进自己"的第一次成功演示,比强化学习命名早了几十年。
Samuel 程序的两个思想至今仍在前沿里:自对弈(self-play,后来的 AlphaZero 是它的终极形态)和时间差分式的价值更新(评估函数朝"下一步的评估"方向调整,正是 TD 思想的雏形)。
2. Sutton, Learning to Predict by the Methods of Temporal Differences(1988,Machine Learning 3(1))
——一句话定位:提出时序差分(TD)学习:用"当前估计"来更新"更早的估计"(bootstrap),在随机游走预测任务上证明它比 Monte Carlo 收敛更快。
TD 的更新公式(TD(0) 形式,TD 误差是核心):
text
δ = r + γ V(s') - V(s) # TD 误差:实际回报 vs 当前估计的差
V(s) ← V(s) + α δ # 朝减少 TD 误差的方向更新为什么 TD 能比 MC 快:MC 要等一整条轨迹结束才能更新(高方差、低偏差),TD 每一步都能更新(低方差、有偏差)。这个"偏差-方差"权衡是价值学习页反复出现的主线。
3. Watkins, Learning from Delayed Rewards(1989,剑桥博士论文)+ Watkins & Dayan, Q-learning(1992,Machine Learning 8(3))
——一句话定位:定义动作价值 Q(s,a) 与 Q-learning 更新规则,并证明它在有限 MDP 下收敛到最优 Q*——off-policy 革命的起点。
Q-learning 是 RL 历史上最重要的单篇算法论文之一:
text
Q(s,a) ← Q(s,a) + α [ r + γ max_a' Q(s',a') - Q(s,a) ]off-policy 的含义:更新里用的是 max_a'(目标策略是贪心),而当前行为策略可以是 ε-greedy 等任意探索策略——学习和行动解耦了。这是它和 SARSA(on-policy,1994 年由 Rummery & Niranjan 提出)最本质的区别。收敛证明的直觉:Q 更新是对贝尔曼最优算子的随机近似,而该算子是压缩映射。完整直觉与 SARSA 对比见价值学习。
4. Rummery & Niranjan, On-line Q-learning Using Connectionist Systems(1994,剑桥技术报告 CUED/F-INFENG/TR166)
——一句话定位:提出 SARSA 更新(用"实际执行的下一个动作"代替 max),on-policy 价值学习的代表。
SARSA 更新:
text
Q(s,a) ← Q(s,a) + α [ r + γ Q(s',a') - Q(s,a) ]
# 注意:这里不是 max_a',而是策略实际会执行的 a'on-policy 与 off-policy 的取舍是经典面试题:SARSA 保守(会学到"探索时的后果")、Q-learning 乐观(假设之后全贪心)。场景题见面试题库。
四、策略梯度支流:1992 年起的另一条大动脉
表格法支流学的是"状态/动作的价值",策略梯度支流直接学"策略"。当动作空间连续或状态空间巨大时,价值法的 argmax 变得不可解,直接优化策略成为必然。
1. Williams, Simple Statistical Gradient-Following Algorithms for Connectionist Reinforcement Learning(1992,Machine Learning 8(3))
——一句话定位:提出 REINFORCE:用"完整轨迹的回报 × 该动作对数概率梯度"更新策略网络,首次给出策略梯度的一般公式。
REINFORCE 的更新直觉:回报高 → 提升这次动作的概率;回报低 → 压低。它不 bias(无偏估计),但方差极大——因为用一整条轨迹的蒙特卡洛回报做权重。策略梯度定理的严格陈述与直觉见策略梯度概念页。
2. Sutton, McAllester, Singh, Mansour, Policy Gradient Methods for Reinforcement Learning with Function Approximation(1999,NeurIPS 12)
——一句话定位:给出带函数近似的策略梯度定理(不要求价值函数近似满足兼容条件也能有好的梯度方向),把策略梯度方法推向可扩展。
策略梯度定理(直觉版):策略 π 的目标函数 J 对参数 θ 的梯度,正比于"状态分布下的期望:优势函数 × 对数策略梯度":
text
∇_θ J(θ) = E[ ∇_θ log π_θ(a|s) · A(s,a) ]3. Schulman et al., Trust Region Policy Optimization(TRPO,2015,arXiv:1502.05477)
——一句话定位:用 KL 散度约束每次更新的步幅(信任域),策略梯度第一次变得"可以放心大步更新"。
TRPO 用二阶方法求解约束优化,稳定但复杂。它的价值更多是思想:与其盲目跟梯度走,不如约束新旧策略的距离。这个思想直接催生了 PPO。
4. Schulman et al., Proximal Policy Optimization Algorithms(PPO,2017,arXiv:1707.06347)
——一句话定位:用一阶的 clip 裁剪近似 TRPO 的信任域,稳定、简单、好并行,成为深度 RL 与 RLHF 的通用主力算法。
clip 目标(注意是比值 r_t(θ) 而非参数距离):
text
L^CLIP(θ) = E_t[ min( r_t(θ) Â_t, clip(r_t(θ), 1-ε, 1+ε) Â_t ) ]
其中 r_t(θ) = π_θ(a_t|s_t) / π_θold(a_t|s_t)为何取代 TRPO:实现只需几行、不需要二阶导数和共轭梯度、对超参数更鲁棒。精读见经典论文精读,机制解读见策略梯度。
5. Haarnoja et al., Soft Actor-Critic(SAC,2018,arXiv:1801.01290)
——一句话定位:在 Actor-Critic 框架里显式最大化"回报 + 熵",连续控制中兼顾样本效率与稳定性的事实标准。
SAC 的独特之处是把探索(熵)写进目标函数而不是靠 ε-greedy 或噪声:J = Σ E[ r + α·H(π(·|s)) ],其中 α 是温度系数(自动调节)。它在 MuJoCo 连续控制上全面超越 DDPG/TD3 的样本效率,成为机器人任务的主流选择。详见Actor-Critic 家族。
五、深度 RL 支流:2013 年起的神经网络化
这一支流把表格法/策略梯度与深度学习结合,是大众认知中"RL 爆火"的来源。
1. Mnih et al., Playing Atari with Deep Reinforcement Learning(2013,arXiv:1312.5602)与 Human-level control through deep reinforcement learning(2015,Nature 518)
——一句话定位:DQN 用 CNN 直接从像素学 Q 函数,两大技巧(经验回放 + 目标网络)让深度 Q 学习第一次稳定,Nature 版在 49 个 Atari 游戏中 29 个超过人类平均水平。
2. DQN 家族三件套(2015–2016,arXiv 均为真实链接)
| 论文 | 年份 | 解决的问题 | 一句话定位 |
|---|---|---|---|
| van Hasselt et al., Double DQN(arXiv:1509.06461) | 2016 | Q 值高估 | 用"当前网络选动作、目标网络估值"解耦,缓解 max 算子带来的系统性高估 |
| Schaul et al., Prioritized Experience Replay(arXiv:1511.05952) | 2016 | 回放采样低效 | 按 TD 误差给经验排序抽样,把样本预算花在最"意外"的转移上 |
| Wang et al., Dueling DQN(arXiv:1511.06581) | 2016 | 状态价值与动作优势耦合 | 把 Q 拆成 V(s) 与 A(s,a) 两条流,架构上更高效地学习"哪些状态好" |
这三项 + 分布视角(C51,Bellemare et al. 2017,arXiv:1707.06887)+ 多步回报,被 Hessel et al. 的 Rainbow(2018,arXiv:1710.02298)集成为一项,拿下当时 Atari 上最高的综合得分。Atari 案例的完整背景见Atari 与电子游戏。
3. Silver et al., Mastering the Game of Go with Deep Neural Networks and Tree Search(AlphaGo,2016,Nature 529)
——一句话定位:监督 + 强化 + MCTS 三合一击败人类顶级棋手,证明"搜索 × 学习"的合流威力。
三段训练(SL 策略网络学人类棋谱 → RL 策略网络自对弈强化 → 价值网络评估局面)是这篇论文最常被面试问起的机制。展开见经典论文精读与AlphaGo 案例。
4. Silver et al., Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm(AlphaZero,2017,arXiv:1712.01815)
——一句话定位:去掉人类棋谱与领域技巧,纯自对弈 + MCTS,一个算法同时精通围棋、国际象棋、将棋——通用性的宣言。
AlphaZero 与 AlphaGo 的差别只有一个字:纯。没有 SL 阶段,没有手工特征,策略与价值网络从随机初始化自对弈训练。它把多臂老虎机页讲过的"乐观面对不确定性"(UCB 变体)用到了 MCTS 的选择步骤。
5. Schrittwieser et al., Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model(MuZero,2020,arXiv:1911.08265)
——一句话定位:把 AlphaZero 的规划扩展到"环境未知":在潜空间学习表示、动力学与奖励,用学到的模型做 MCTS——规划不再需要规则引擎。
MuZero 是基于模型的 RL 在"学习式规划"方向的高点,也直接启发了后来的世界模型研究(见前沿进展)。
六、RLHF 支流:2022 年起的新支流
这一支流回答:模型有知识但"不听话",怎么让输出符合人类偏好? 它把"奖励"从环境换成人类反馈,是 2022 年以来论文密度最高、工程影响最大的支流。
1. Ouyang et al., Training Language Models to Follow Instructions with Human Feedback(InstructGPT,2022,arXiv:2203.02155)
——一句话定位:三阶段(SFT → 奖励模型 → PPO 微调)让语言模型学会"按指令干活",1.3B 的 InstructGPT 在人类评估中胜过 175B 的 GPT-3。
三阶段是 RLHF 的标准范式,详读见经典论文精读与LLM 对齐案例。
2. Rafailov et al., Direct Preference Optimization(DPO,2023,arXiv:2305.18290)
——一句话定位:用偏好对的闭式解把"奖励模型 + PPO"两阶段压缩成一步直接优化策略,训练成本骤降,成为开源对齐的主流。
DPO 的洞察:带 KL 约束的 RLHF 目标有解析解,可以把奖励模型"隐式"地嵌进策略里,因此不需要显式训练奖励模型、不需要 PPO,只用偏好对做分类式训练。代价与局限(如不能显式控制奖励、对偏好噪声敏感)见RLHF 概念页与前沿进展。
3. Bai et al., Constitutional AI: Harmlessness from AI Feedback(RLAIF,2022,arXiv:2212.08073)
——一句话定位:让 AI 自己给反馈(用"宪法"原则指导 AI 评估 AI 输出),替代部分人工标注,规模化"无害性"对齐。
RLAIF 是"RL from AI feedback"的缩写。它把 RLHF 的"人类偏好"换成"AI 根据原则的偏好",解决了人工标注的规模瓶颈,是在线 RLHF 与 RLAIF 的前奏。
七、多智能体支流:2017 年起的新支流
这一支流回答:多个智能体同时学习、互相影响,怎么办? 单智能体的"环境稳定"假设失效(每个智能体都把对方当环境,形成非平稳性),需要新的工具。
1. Lowe et al., Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments(MADDPG,2017,arXiv:1706.02275)
——一句话定位:CTDE(集中训练、分布执行)范式的奠基:训练时让 critic 看到所有智能体的观测与动作,执行时每个 actor 只用自己的局部观测。
2. Rashid et al., QMIX: Monotonic Value Function Factorisation for Deep Multi-Agent Reinforcement Learning(2018,arXiv:1803.11485)
——一句话定位:把联合 Q 值分解成各智能体 Q 值的单调组合(保证 argmax 一致性),在 StarCraft 微操(SMAC)上表现优异。
3. Yu et al., The Surprising Effectiveness of PPO in Cooperative Multi-Agent Games(MAPPO,2021,arXiv:2103.01955)
——一句话定位:把 PPO 配上共享观测的集中式 critic,就能在 SMAC、Google 足球、Hanabi 上打赢当时专用的 MARL 算法——"别低估通用算法的力量"。
多智能体为什么难、博弈论视角与落地现实,见多智能体概念页。
八、时间轴与交叉引用
把六条支流压到一条时间轴上:
text
1957 Bellman ── 动态规划 ──────────► 理论地基
1959 Samuel ── 表格法 ──┐
1988 Sutton TD │ ├──► 价值学习主线 ──► DQN(2013) ──► Rainbow(2018)
1989/92 Q-learning │ │
1994 SARSA ──┘ │
1992 REINFORCE ── 策略梯度 ──► TRPO(2015) ──► PPO(2017) ──► RLHF(2022) ──► DPO(2023)
1999 PG 定理 │ └──► SAC(2018)
2013 DQN ── 深度 RL ──► AlphaGo(2016) ──► AlphaZero(2017) ──► MuZero(2020)
2017 MADDPG ── 多智能体 ──► QMIX(2018) ──► MAPPO(2021)与站内其他页的关系:
| 这条支流 | 在站内哪里细看 |
|---|---|
| 时间维度的完整叙述 | 演进简史(按十年划分,与本页互为经纬) |
| 表格法 + 深度 RL 的机制细节 | 价值学习(从 DP 到 DQN 的完整脉络) |
| 策略梯度 + PPO 的机制细节 | 策略梯度(REINFORCE 到 PPO) |
| RLHF 的机制细节 | RLHF 与人类反馈对齐(三阶段、KL、DPO) |
| 逐篇精读与面试要点 | 经典论文精读(本页地图上的 6 个地标) |
| 术语速查 | 术语表 |
使用建议
把本页当作"文献的编目系统":读任何新论文时,先问三个问题——①它属于哪条支流?②它继承了哪个关键机制(贝尔曼、TD、策略梯度、回放、搜索)?③它相对最近的一篇同支流论文改了什么?答不上来,说明你还没真正定位它。
延伸阅读
- 演进简史 —— 与论文地图互为经纬:按年代讲 RL 七十年的关键节点。
- 经典论文精读 —— 地图上最显眼的 6 个地标的逐篇精读。
- 价值学习 —— 动态规划与表格法两条支流的机制详解。
- RLHF 与人类反馈对齐 —— RLHF 支流的机制详解(三阶段、KL、DPO)。
- 术语表 —— 读论文地图时遇到陌生术语的速查手册。
参考资料
- Bellman, R. (1957). A Markovian Decision Process. Indiana University Mathematics Journal 6(4):679–684. https://doi.org/10.1512/iumj.1957.6.56038
- Samuel, A. L. (1959). Some Studies in Machine Learning Using the Game of Checkers. IBM Journal of Research and Development 3(3):210–229. https://doi.org/10.1147/rd.33.0210
- Sutton, R. S. (1988). Learning to Predict by the Methods of Temporal Differences. Machine Learning 3(1):9–44. http://incompleteideas.net/papers/sutton-88-with-erratum.pdf
- Watkins, C. J. C. H., & Dayan, P. (1992). Q-learning. Machine Learning 8(3):279–292. https://link.springer.com/article/10.1007/BF00992698
- Williams, R. J. (1992). Simple Statistical Gradient-Following Algorithms for Connectionist Reinforcement Learning. Machine Learning 8(3):229–256. https://link.springer.com/article/10.1007/BF00992696
- Schulman, J., et al. (2015). Trust Region Policy Optimization. arXiv:1502.05477. https://arxiv.org/abs/1502.05477
- Schulman, J., et al. (2017). Proximal Policy Optimization Algorithms. arXiv:1707.06347. https://arxiv.org/abs/1707.06347
- Haarnoja, T., et al. (2018). Soft Actor-Critic. arXiv:1801.01290. https://arxiv.org/abs/1801.01290
- Mnih, V., et al. (2013). Playing Atari with Deep Reinforcement Learning. arXiv:1312.5602. https://arxiv.org/abs/1312.5602
- Hessel, M., et al. (2018). Rainbow: Combining Improvements in Deep Reinforcement Learning. arXiv:1710.02298. https://arxiv.org/abs/1710.02298
- Silver, D., et al. (2016). Mastering the Game of Go with Deep Neural Networks and Tree Search. Nature 529:484–489. https://www.nature.com/articles/nature16961
- Silver, D., et al. (2017). Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm(AlphaZero). arXiv:1712.01815. https://arxiv.org/abs/1712.01815
- Schrittwieser, J., et al. (2020). Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model(MuZero). arXiv:1911.08265. https://arxiv.org/abs/1911.08265
- Ouyang, L., et al. (2022). Training Language Models to Follow Instructions with Human Feedback(InstructGPT). arXiv:2203.02155. https://arxiv.org/abs/2203.02155
- Rafailov, R., et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
- Bai, Y., et al. (2022). Constitutional AI: Harmlessness from AI Feedback(RLAIF). arXiv:2212.08073. https://arxiv.org/abs/2212.08073
- Lowe, R., et al. (2017). Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments(MADDPG). arXiv:1706.02275. https://arxiv.org/abs/1706.02275
- Rashid, T., et al. (2018). QMIX: Monotonic Value Function Factorisation for Deep Multi-Agent Reinforcement Learning. arXiv:1803.11485. https://arxiv.org/abs/1803.11485
- Yu, C., et al. (2021). The Surprising Effectiveness of PPO in Cooperative Multi-Agent Games(MAPPO). arXiv:2103.01955. https://arxiv.org/abs/2103.01955