外观
强化学习演进简史
一句话定位:这一页把 RL 七十年的演进压缩成一条可追溯的时间线——从贝尔曼的方程到 RLHF 的流水线,你会看到六条支流(动态规划、表格法、策略梯度、深度 RL、多智能体、RLHF)如何各自发源、分岔、最后在今天的深度 RL 里合流。读完后你能说出"每个关键概念是为了回答什么问题而诞生的",这是读懂论文地图的第一步。
一、总览:七十年,三大纪元
把 1950–2025 的 RL 史切成三个纪元,每个纪元解决一个根本问题:
text
纪元一(1950s–1980s) 理论奠基:数学上证明"可以学"
· 贝尔曼方程、MDP 形式化
· TD 思想的萌芽、信用分配问题被提出
纪元二(1980s–2013) 表格法成熟:在有限状态空间上"学得会"
· TD(λ)、Q-learning、TD-Gammon
· 数学收敛性被证明,但规模上不去
纪元三(2013–今) 深度 RL:在高维状态上"学得动"
· DQN/PPO/AlphaGo 三巨头
· 规模化:RLHF、世界模型、可扩展 RL每个纪元之间的桥梁都是"表征能力":表格法卡在状态空间大小上,深度学习的出现一举把 RL 推向了视觉、语言、物理控制。下面按十年展开。
二、1950s:贝尔曼动态规划与 MDP 形式化
一切的起点是两件事:
- 马尔可夫链理论(A. A. Markov,1906 年起):"下一步只依赖当前状态"的随机过程,为后来"状态完全表征过去"的马尔可夫性质打下基础。
- 理查德·贝尔曼(Richard Bellman) 在 1950 年代发明动态规划(Dynamic Programming):把"多步最优决策"拆成"当前一步 + 剩余问题的最优解",得到著名的贝尔曼方程。1957 年他的《Dynamic Programming》成书。1960 年他进一步提出**马尔可夫决策过程(MDP)**这个完整形式化框架——这直接就是今天马尔可夫决策过程页的五元组源头。
text
贝尔曼最优性原理(一句话):
一个策略要整体最优,它在任何时刻之后的部分也必须是最优的。
→ 于是 V*(s) 可以递归定义:V*(s) = max_a [ R(s,a) + γ·E[V*(s')] ]
→ 这个递归式,就是今天所有价值学习算法的起点。为什么这段历史重要
贝尔曼方程不是"教科书公式",它是 1950 年代为了解决"航天控制、库存管理"里的序列决策而发明的通用原理。理解它的诞生背景,你就能理解为什么 RL 与运筹优化、最优控制同源——三者共享同一个方程。论文级叙述见经典论文精读的 Bellman 篇。
三、1960–1980s:试错学习与 TD 思想的萌芽
这个阶段"强化学习"还不叫强化学习,但三个方向已经暗中萌芽:
1. 试错学习进机器
- Arthur Samuel(1959):跳棋程序开创"机器自我对弈学习",是**自博弈(self-play)**的鼻祖——比 AlphaGo 早了 60 年。
- Bernard Widrow 与 Ted Hoff(1960):提出 LMS 学习规则,后来 Widrow 用"加减分"信号做倒立摆控制,已具备"奖励驱动的适应性控制"雏形。
- Marvin Minsky(1961):在《Steps Toward Artificial Intelligence》里明确提出信用分配问题(credit assignment):"当整个行动序列最终失败,究竟该责怪哪一步?"——这个问题支配了之后几十年的算法设计。
2. "试错"概念的正式化
1960–70 年代,心理学实验(布谷鸟的经典条件反射、奖励学习实验)启发了一批"试错学习器"。Harry Klopf(1972) 等提出"享乐主义神经元"(hedonistic neuron)设想;1970 年代末,Barto、Sutton 与 Anderson(1983) 用"关联搜索元素"(ASE/ACE 网络)在倒立摆任务上演示了试错学习——这被公认为现代强化学习算法的直接前身。
这段"萌芽期"的意义
1960–80s 的关键不在算法多强,而在于把三个问题正式摆上了台面:学什么(策略/价值)、怎么反馈(奖励)、什么时候算账(信用分配)。这三个问题的答案在下一个十年才逐步落成算法。
四、1988–1992:时序差分与 Q-learning
这是表格法 RL 的"革命两年",两个里程碑横空出世:
1. Sutton 的时序差分(TD, 1988)
《Learning to Predict by the Methods of Temporal Differences》——Sutton 证明了一种"边预测边修正"的方法:不需要等最终结果,用下一步的预测来更新这一步的预测:
text
TD 更新的直觉:
旧预测 ──加──▶ (现实奖励 + γ·新预测 − 旧预测) × 学习率
↑________ 这一项叫 TD 误差 δ_t ________↑
蒙地卡罗:等整局结束才知道对错(方差大、无偏)
TD:每步都在用"预测修正预测"(有偏、方差小、在线可学)TD 的优雅之处在于它是**在线(incremental)**的:不需要存整条轨迹。这一思想后来撑起价值学习的半壁江山。
2. Watkins 的 Q-learning(1989 论文 / 1992 正式发表)
Chris Watkins 在博士论文中提出 Q-learning:不学状态价值 V,而学状态-动作价值 Q(s,a),并且更新公式里用了"下一步的最优动作的 Q 值"——这让 Q-learning 成为off-policy(学习时用的策略 ≠ 行为策略),也就是"一边随便探索、一边学最优策略"。这个性质是革命性的,后来的 DQN 直接继承它。
同期还有 Williams 的 REINFORCE(1992)——策略梯度的源头:直接让"带来高回报的动作"概率上升。它定义了与价值学习并行的第二条主线策略梯度方法。
为什么 Q-learning 是"革命"
在 Q-learning 之前,主流观点是"策略和值必须一起学习,且必须 on-policy"。Q-learning 证明了:你可以用任意探索策略收集数据,同时学习一个最优策略——这为后来"经验回放""离线 RL"埋下了逻辑种子。收敛性证明由 Watkins & Dayan(1992)完成。
五、1992–2013:TD-Gammon 与经典 RL 的黄金期
1. Tesauro 的 TD-Gammon(1992–1995)
Gerald Tesauro 用 TD 学习训练了一个西洋双陆棋(backgammon)程序:用神经网络做价值函数近似,只用自对弈(self-play)产生的数据。结果震惊棋界:TD-Gammon 达到了人类顶级大师水平,还开发出了人类没见过的残局下法。
TD-Gammon 的历史意义不在"赢",而在证明了两件事:
- "值函数近似 + 自博弈"在没有任何人类知识的情况下可以打败人类;
- 神经网络做函数近似(而不是查表)在 RL 里是可行的。
这是 AlphaGo 的直接思想祖先。TD-Gammon 也是"经典 RL 黄金期"的标志——90 年代后半到 2000 年代,RL 开始在机器人、游戏、资源调度中开花:Kaelbling、Littman 与 Moore(1996) 发表了著名的《Reinforcement Learning: A Survey》,把整个领域梳理成体系。
2. 黄金期的其他主线
| 年份 | 工作 | 贡献 |
|---|---|---|
| 1993–94 | Rummery & Niranjan 的 SARSA | on-policy 的 TD 控制,与 Q-learning 形成互补 |
| 1996 | Bertsekas & Tsitsiklis《Neuro-Dynamic Programming》 | 把神经网络与动态规划在理论上焊起来 |
| 1999 | Sutton, McAllester, Singh 策略梯度定理 | 给策略梯度方法奠定理论 |
| 2000s | 机器人学中的 RL(爬行、倒立摆)、游戏 AI 应用 | RL 从实验室走向工程试探 |
| 2003 | R-Max、E³ 等探索理论 | 探索—利用的样本复杂度理论 |
黄金期的天花板
表格法 + 简单函数近似能解决"低维状态"问题,但面对图像(高维像素)和语言完全无能为力——特征工程成了瓶颈。这个天花板一直等到 2013 年深度学习入场才被打破。
六、2013–2017:深度 RL 革命(DQN、AlphaGo、PPO)
1. DQN:深度学习接管价值学习(2013/2015)
Mnih 等人的 DQN 首次用卷积神经网络直接从像素学 Q 值,在 49 个 Atari 游戏上超越人类。成功的秘诀是两个工程技巧(缺一个都不行):
- 经验回放(Experience Replay):把历史 (s,a,r,s') 存进大缓冲区随机采样,打破数据相关性;
- 目标网络(Target Network):用一份"冻结"的旧网络提供 TD 目标,稳住自举式更新。
DQN 打开了"深度 RL"大门,完整机制见价值学习,论文细节见经典论文精读的 DQN 篇,游戏侧全景见Atari 与电子游戏。
2. AlphaGo:搜索与学习合流(2016)
Silver 等人的 AlphaGo 用"策略网络 + 价值网络 + MCTS 搜索"的组合在围棋上击败世界冠军李世石——一个当时被认为"还要十年才能攻破"的领域。它的三阶段训练(监督学习策略网络 → RL 自对弈优化 → 价值网络)在AlphaGo 与蒙特卡洛树搜索整页展开。随后 AlphaGo Zero(2017)去掉人类棋谱纯自对弈,AlphaZero(2017)把同一套方法泛化到国际象棋与将棋。
3. PPO:让策略梯度"稳定可调"(2017)
Schulman 等人提出 PPO,用**裁剪(clip)**目标函数限制每次更新的步子,一举解决了 TRPO 计算复杂、"更新太大策略崩坏"的问题:
text
PPO 裁剪目标(直觉):
新策略相对旧策略的"赢面" ratio = π_新/π_旧
把这个 ratio 乘以优势 A,然后 clip 到 [1-ε, 1+ε]
→ 奖励好的动作概率上升,但一次不能升太狠
→ 稳定、简单、只需一阶优化 —— 所以成了业界默认算法PPO 与 A2C、DDPG、TD3、SAC 一起构成 Actor-Critic 家族,谱系与选型见Actor-Critic 家族。
深度 RL 三巨头的分工
DQN 证明了"深网络能学价值",AlphaGo 证明了"深网络能配合搜索达到超人类",PPO 证明了"深度策略学习在工程上可稳定复现"。三者各自开创了价值、搜索、策略三条后继路线。
七、2017–2020:规模化与多智能体
深度 RL 进入"大算力 + 多体"时代:
1. 多智能体的兴起
| 年份 | 工作 | 意义 |
|---|---|---|
| 2017 | MADDPG | 集中训练分布执行(CTDE)范式的代表 |
| 2018 | QMIX | 值分解:用联合价值近似但分解到个体 |
| 2019 | OpenAI Five(Dota 2) | 5v5 自博弈登上职业级 |
| 2019 | AlphaStar(星际争霸 2) | 双人不完全信息博弈的里程碑 |
| 2021 | MAPPO | 证明 PPO 化也能在多智能体上很能打 |
多智能体的核心困难(非平稳、跨智能体信用分配、均衡概念)详见多智能体强化学习。
2. 世界模型与算法工程化
- World Models(Ha & Schmidhuber, 2018)、Dreamer(Hafner et al., 2020):把"预测下一帧"的生成模型引入 RL,让智能体在"梦"里学习——model-based 路线复兴,详见基于模型的 RL。
- SAC(2018):最大熵目标让连续控制既稳又高效,成为机器人领域默认算法。
- MuZero(2020):AlphaZero 的世界模型版——连环境模型也学出来,只靠动作与奖励信号在未知规则游戏上达到超人类。
八、2020–今:RLHF、世界模型与可扩展 RL
1. RLHF 与大模型对齐
2020 年 Stiennon 等人的《Learning to Summarize from Human Feedback》把"人类偏好 → 奖励模型 → PPO 优化"的流程确立下来;2022 年 InstructGPT 把它放大到 ChatGPT 级大模型;2023 年 DPO 又证明"不用显式奖励模型也能直接优化偏好"。这条线今天已经发展成对齐(alignment)这个独立领域,完整流水线见RLHF 与人类反馈对齐,实战见LLM 对齐:RLHF 实战。
text
RLHF 三阶段(2020–2022 定型):
SFT(模仿示范)→ 奖励模型(从人类偏好对里学打分)
→ PPO(以奖励模型为信号、以参考模型为锚点微调策略)
→ 产物:会"懂人话"的对话模型
2023 简化版 DPO:跳过奖励模型,直接用偏好对做优化2. 世界模型与可扩展 RL 的合流
- DreamerV3(2023):同一个算法在 150+ 任务上无需调参达到 SOTA,证明"通用世界模型学习器"可行。
- 离线 RL 成熟:CQL、IQL 等让"只用历史数据训练"成为现实,见离线强化学习。
- 可扩展基础设施:Brax/PureJaxRL 让上万并行环境在 GPU 上单卡跑,把"RL 需要大量采样"的成本压了一个量级。
- RL for Reasoning(2025):DeepSeek-R1 用 RL 直接激励大模型长链推理,证明 RL 不只是"对齐工具",也是"能力放大器"——这是当下最热的前沿,见前沿进展。
九、时间轴总表与六条支流
1. 按十年划分的关键节点表
| 年代 | 关键节点 | 一句话意义 |
|---|---|---|
| 1950s | Bellman 动态规划与 MDP 形式化 | 序列决策有了数学语言 |
| 1959–60s | Samuel 跳棋、Widrow 试错、Minsky 提出信用分配 | 问题被正式提出 |
| 1970s–80s | ASE/ACE 试错学习器;TD 思想萌芽 | 算法原型出现 |
| 1988 | Sutton 的 TD(λ) | 在线预测的可行方法 |
| 1989/92 | Watkins 的 Q-learning | off-policy 革命 |
| 1992 | Williams 的 REINFORCE | 策略梯度主线确立 |
| 1992–95 | Tesauro 的 TD-Gammon | 神经网络自博弈打败人类 |
| 1996 | Kaelbling 等人的 RL 综述 | 领域体系化 |
| 2013 | Mnih 的 DQN(NIPS 版) | 深度 RL 诞生 |
| 2015 | DQN(Nature 版);TRPO | 深度价值学习与信任域策略优化 |
| 2016 | AlphaGo 击败李世石 | 搜索×学习攻破围棋 |
| 2017 | PPO;AlphaZero(Rainbow 论文 2017,正式发表于 AAAI 2018) | 稳定策略优化 + 深度 RL 集大成 |
| 2018 | SAC;World Models;QMIX | 连续控制与多智能体并进 |
| 2019 | OpenAI Five;AlphaStar;RND | 规模化与探索新工具 |
| 2020 | MuZero;RLHF 论文 | 世界模型 + 人类反馈双里程碑 |
| 2022 | InstructGPT/ChatGPT | RLHF 进入大模型时代 |
| 2023 | DPO;DreamerV3 | 对齐简化 + 通用世界模型 |
| 2025 | DeepSeek-R1 等 RL for Reasoning | RL 从对齐走向能力训练 |
2. 六条支流各指向哪里
每一条支流在站内都有一条完整的学习线:
| 支流 | 起点 | 站点主线 |
|---|---|---|
| 动态规划支流 | Bellman 1957 | 论文地图 → 马尔可夫决策过程 |
| 表格法支流 | Samuel 1959 → TD/Q-learning | 价值学习 |
| 策略梯度支流 | Williams 1992 → PPO | 策略梯度方法 |
| 深度 RL 支流 | DQN 2013 → Rainbow → MuZero | 经典论文精读 |
| 多智能体支流 | MADDPG 2017 → MAPPO | 多智能体强化学习 |
| RLHF 支流 | Stiennon 2020 → DPO 2023 | RLHF 与人类反馈对齐 |
学历史的正确姿势
不要把历史当故事背,而是当"问题档案"看:每个里程碑都是对上一个里程碑缺陷的回应。TD 回应"MC 要等整局",Q-learning 回应"学习策略必须和行为策略一致",DQN 回应"高维状态没法查表",PPO 回应"TRPO 太复杂",RLHF 回应"预训练模型只会接话不会对话"。抓住这条"问题→解法"链条,你对整个领域的理解会连成网而不是散成点。
延伸阅读
- 论文地图 —— 本文时间轴的论文级细化版,六条支流逐篇一句话定位。
- 经典论文精读 —— 改变 RL 的六篇关键论文逐篇精读(含"面试怎么答")。
- 价值学习 —— 动态规划 → MC/TD → DQN 的完整技术脉络,对应表格法与深度价值支流。
- 策略梯度方法 —— REINFORCE → TRPO → PPO 的逻辑链,对应策略梯度支流。
- RLHF 与人类反馈对齐 —— 2020 年以来最重要支流的完整展开。
- AlphaGo 与蒙特卡洛树搜索 —— 2016 年"深度 RL 三巨头"中最具戏剧性的一位的完整案例。
参考资料
- Bellman, R. (1957). Dynamic Programming. Princeton University Press. —— 动态规划与贝尔曼方程的原始出处。
- Samuel, A. L. (1959). Some Studies in Machine Learning Using the Game of Checkers. IBM Journal of Research and Development, 3(3), 210–229. https://ieeexplore.ieee.org/document/5392560 —— 自博弈学习的开山之作。
- Minsky, M. (1961). Steps Toward Artificial Intelligence. Proceedings of the IRE, 49(1), 8–30. —— 信用分配问题的首次正式提出。
- Sutton, R. S. (1988). Learning to Predict by the Methods of Temporal Differences. Machine Learning, 3(1), 9–44. https://link.springer.com/article/10.1007/BF00115009 —— TD 学习的原始论文。
- Watkins, C. J. C. H. & Dayan, P. (1992). Q-learning. Machine Learning, 8(3–4), 279–292. https://link.springer.com/article/10.1007/BF00992698 —— Q-learning 及其收敛证明。
- Tesauro, G. (1995). Temporal Difference Learning and TD-Gammon. Communications of the ACM, 38(3), 58–68. https://dl.acm.org/doi/10.1145/203330.203343 —— TD-Gammon 原始论文。
- Mnih, V. et al. (2015). Human-level control through deep reinforcement learning. Nature, 518, 529–533. https://www.nature.com/articles/nature14236 —— DQN 的 Nature 版本。
- Silver, D. et al. (2016). Mastering the game of Go with deep neural networks and tree search. Nature, 529, 484–489. https://www.nature.com/articles/nature16961 —— AlphaGo 原始论文。
- Schulman, J. et al. (2017). Proximal Policy Optimization Algorithms. https://arxiv.org/abs/1707.06347 —— PPO 原始论文。
- Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). https://arxiv.org/abs/2203.02155 —— RLHF 规模化到大模型的里程碑。
- Rafailov, R. et al. (2023). Direct Preference Optimization. https://arxiv.org/abs/2305.18290 —— DPO 原始论文。
- Kaelbling, L. P., Littman, M. L. & Moore, A. W. (1996). Reinforcement Learning: A Survey. JAIR, 4, 237–285. https://arxiv.org/abs/cs/9605103 —— 经典综述,黄金期全景。