Skip to content

强化学习演进简史

本页速览 从贝尔曼方程到 RLHF 的七十年:动态规划奠基、时序差分与 Q-learning、TD-Gammon、深度 RL 三巨头(DQN/PPO/AlphaGo)、再到 LLM 对齐。按十年划分的关键节点表。

强化学习演进简史 ​

一句话定位:这一页把 RL 七十年的演进压缩成一条可追溯的时间线——从贝尔曼的方程到 RLHF 的流水线,你会看到六条支流(动态规划、表格法、策略梯度、深度 RL、多智能体、RLHF)如何各自发源、分岔、最后在今天的深度 RL 里合流。读完后你能说出"每个关键概念是为了回答什么问题而诞生的",这是读懂论文地图的第一步。

一、总览:七十年,三大纪元 ​

把 1950–2025 的 RL 史切成三个纪元,每个纪元解决一个根本问题:

text
纪元一(1950s–1980s) 理论奠基:数学上证明"可以学"
  · 贝尔曼方程、MDP 形式化
  · TD 思想的萌芽、信用分配问题被提出

纪元二(1980s–2013)  表格法成熟:在有限状态空间上"学得会"
  · TD(λ)、Q-learning、TD-Gammon
  · 数学收敛性被证明,但规模上不去

纪元三(2013–今)     深度 RL:在高维状态上"学得动"
  · DQN/PPO/AlphaGo 三巨头
  · 规模化:RLHF、世界模型、可扩展 RL

每个纪元之间的桥梁都是"表征能力":表格法卡在状态空间大小上,深度学习的出现一举把 RL 推向了视觉、语言、物理控制。下面按十年展开。

二、1950s:贝尔曼动态规划与 MDP 形式化 ​

一切的起点是两件事:

  • 马尔可夫链理论(A. A. Markov,1906 年起):"下一步只依赖当前状态"的随机过程,为后来"状态完全表征过去"的马尔可夫性质打下基础。
  • 理查德·贝尔曼(Richard Bellman) 在 1950 年代发明动态规划(Dynamic Programming):把"多步最优决策"拆成"当前一步 + 剩余问题的最优解",得到著名的贝尔曼方程。1957 年他的《Dynamic Programming》成书。1960 年他进一步提出**马尔可夫决策过程(MDP)**这个完整形式化框架——这直接就是今天马尔可夫决策过程页的五元组源头。
text
贝尔曼最优性原理(一句话):
  一个策略要整体最优,它在任何时刻之后的部分也必须是最优的。
  → 于是 V*(s) 可以递归定义:V*(s) = max_a [ R(s,a) + γ·E[V*(s')] ]
  → 这个递归式,就是今天所有价值学习算法的起点。

为什么这段历史重要

贝尔曼方程不是"教科书公式",它是 1950 年代为了解决"航天控制、库存管理"里的序列决策而发明的通用原理。理解它的诞生背景,你就能理解为什么 RL 与运筹优化、最优控制同源——三者共享同一个方程。论文级叙述见经典论文精读的 Bellman 篇。

三、1960–1980s:试错学习与 TD 思想的萌芽 ​

这个阶段"强化学习"还不叫强化学习,但三个方向已经暗中萌芽:

1. 试错学习进机器 ​

  • Arthur Samuel(1959):跳棋程序开创"机器自我对弈学习",是**自博弈(self-play)**的鼻祖——比 AlphaGo 早了 60 年。
  • Bernard Widrow 与 Ted Hoff(1960):提出 LMS 学习规则,后来 Widrow 用"加减分"信号做倒立摆控制,已具备"奖励驱动的适应性控制"雏形。
  • Marvin Minsky(1961):在《Steps Toward Artificial Intelligence》里明确提出信用分配问题(credit assignment):"当整个行动序列最终失败,究竟该责怪哪一步?"——这个问题支配了之后几十年的算法设计。

2. "试错"概念的正式化 ​

1960–70 年代,心理学实验(布谷鸟的经典条件反射、奖励学习实验)启发了一批"试错学习器"。Harry Klopf(1972) 等提出"享乐主义神经元"(hedonistic neuron)设想;1970 年代末,Barto、Sutton 与 Anderson(1983) 用"关联搜索元素"(ASE/ACE 网络)在倒立摆任务上演示了试错学习——这被公认为现代强化学习算法的直接前身。

这段"萌芽期"的意义

1960–80s 的关键不在算法多强,而在于把三个问题正式摆上了台面:学什么(策略/价值)、怎么反馈(奖励)、什么时候算账(信用分配)。这三个问题的答案在下一个十年才逐步落成算法。

四、1988–1992:时序差分与 Q-learning ​

这是表格法 RL 的"革命两年",两个里程碑横空出世:

1. Sutton 的时序差分(TD, 1988) ​

《Learning to Predict by the Methods of Temporal Differences》——Sutton 证明了一种"边预测边修正"的方法:不需要等最终结果,用下一步的预测来更新这一步的预测:

text
TD 更新的直觉:
  旧预测 ──加──▶ (现实奖励 + γ·新预测 − 旧预测) × 学习率
              ↑________ 这一项叫 TD 误差 δ_t ________↑

  蒙地卡罗:等整局结束才知道对错(方差大、无偏)
  TD:每步都在用"预测修正预测"(有偏、方差小、在线可学)

TD 的优雅之处在于它是**在线(incremental)**的:不需要存整条轨迹。这一思想后来撑起价值学习的半壁江山。

2. Watkins 的 Q-learning(1989 论文 / 1992 正式发表) ​

Chris Watkins 在博士论文中提出 Q-learning:不学状态价值 V,而学状态-动作价值 Q(s,a),并且更新公式里用了"下一步的最优动作的 Q 值"——这让 Q-learning 成为off-policy(学习时用的策略 ≠ 行为策略),也就是"一边随便探索、一边学最优策略"。这个性质是革命性的,后来的 DQN 直接继承它。

同期还有 Williams 的 REINFORCE(1992)——策略梯度的源头:直接让"带来高回报的动作"概率上升。它定义了与价值学习并行的第二条主线策略梯度方法。

为什么 Q-learning 是"革命"

在 Q-learning 之前,主流观点是"策略和值必须一起学习,且必须 on-policy"。Q-learning 证明了:你可以用任意探索策略收集数据,同时学习一个最优策略——这为后来"经验回放""离线 RL"埋下了逻辑种子。收敛性证明由 Watkins & Dayan(1992)完成。

五、1992–2013:TD-Gammon 与经典 RL 的黄金期 ​

1. Tesauro 的 TD-Gammon(1992–1995) ​

Gerald Tesauro 用 TD 学习训练了一个西洋双陆棋(backgammon)程序:用神经网络做价值函数近似,只用自对弈(self-play)产生的数据。结果震惊棋界:TD-Gammon 达到了人类顶级大师水平,还开发出了人类没见过的残局下法。

TD-Gammon 的历史意义不在"赢",而在证明了两件事:

  1. "值函数近似 + 自博弈"在没有任何人类知识的情况下可以打败人类;
  2. 神经网络做函数近似(而不是查表)在 RL 里是可行的。

这是 AlphaGo 的直接思想祖先。TD-Gammon 也是"经典 RL 黄金期"的标志——90 年代后半到 2000 年代,RL 开始在机器人、游戏、资源调度中开花:Kaelbling、Littman 与 Moore(1996) 发表了著名的《Reinforcement Learning: A Survey》,把整个领域梳理成体系。

2. 黄金期的其他主线 ​

年份工作贡献
1993–94Rummery & Niranjan 的 SARSAon-policy 的 TD 控制,与 Q-learning 形成互补
1996Bertsekas & Tsitsiklis《Neuro-Dynamic Programming》把神经网络与动态规划在理论上焊起来
1999Sutton, McAllester, Singh 策略梯度定理给策略梯度方法奠定理论
2000s机器人学中的 RL(爬行、倒立摆)、游戏 AI 应用RL 从实验室走向工程试探
2003R-Max、E³ 等探索理论探索—利用的样本复杂度理论

黄金期的天花板

表格法 + 简单函数近似能解决"低维状态"问题,但面对图像(高维像素)和语言完全无能为力——特征工程成了瓶颈。这个天花板一直等到 2013 年深度学习入场才被打破。

六、2013–2017:深度 RL 革命(DQN、AlphaGo、PPO) ​

1. DQN:深度学习接管价值学习(2013/2015) ​

Mnih 等人的 DQN 首次用卷积神经网络直接从像素学 Q 值,在 49 个 Atari 游戏上超越人类。成功的秘诀是两个工程技巧(缺一个都不行):

  1. 经验回放(Experience Replay):把历史 (s,a,r,s') 存进大缓冲区随机采样,打破数据相关性;
  2. 目标网络(Target Network):用一份"冻结"的旧网络提供 TD 目标,稳住自举式更新。

DQN 打开了"深度 RL"大门,完整机制见价值学习,论文细节见经典论文精读的 DQN 篇,游戏侧全景见Atari 与电子游戏。

2. AlphaGo:搜索与学习合流(2016) ​

Silver 等人的 AlphaGo 用"策略网络 + 价值网络 + MCTS 搜索"的组合在围棋上击败世界冠军李世石——一个当时被认为"还要十年才能攻破"的领域。它的三阶段训练(监督学习策略网络 → RL 自对弈优化 → 价值网络)在AlphaGo 与蒙特卡洛树搜索整页展开。随后 AlphaGo Zero(2017)去掉人类棋谱纯自对弈,AlphaZero(2017)把同一套方法泛化到国际象棋与将棋。

3. PPO:让策略梯度"稳定可调"(2017) ​

Schulman 等人提出 PPO,用**裁剪(clip)**目标函数限制每次更新的步子,一举解决了 TRPO 计算复杂、"更新太大策略崩坏"的问题:

text
PPO 裁剪目标(直觉):
  新策略相对旧策略的"赢面" ratio = π_新/π_旧
  把这个 ratio 乘以优势 A,然后 clip 到 [1-ε, 1+ε]
  → 奖励好的动作概率上升,但一次不能升太狠
  → 稳定、简单、只需一阶优化 —— 所以成了业界默认算法

PPO 与 A2C、DDPG、TD3、SAC 一起构成 Actor-Critic 家族,谱系与选型见Actor-Critic 家族。

深度 RL 三巨头的分工

DQN 证明了"深网络能学价值",AlphaGo 证明了"深网络能配合搜索达到超人类",PPO 证明了"深度策略学习在工程上可稳定复现"。三者各自开创了价值、搜索、策略三条后继路线。

七、2017–2020:规模化与多智能体 ​

深度 RL 进入"大算力 + 多体"时代:

1. 多智能体的兴起 ​

年份工作意义
2017MADDPG集中训练分布执行(CTDE)范式的代表
2018QMIX值分解:用联合价值近似但分解到个体
2019OpenAI Five(Dota 2)5v5 自博弈登上职业级
2019AlphaStar(星际争霸 2)双人不完全信息博弈的里程碑
2021MAPPO证明 PPO 化也能在多智能体上很能打

多智能体的核心困难(非平稳、跨智能体信用分配、均衡概念)详见多智能体强化学习。

2. 世界模型与算法工程化 ​

  • World Models(Ha & Schmidhuber, 2018)、Dreamer(Hafner et al., 2020):把"预测下一帧"的生成模型引入 RL,让智能体在"梦"里学习——model-based 路线复兴,详见基于模型的 RL。
  • SAC(2018):最大熵目标让连续控制既稳又高效,成为机器人领域默认算法。
  • MuZero(2020):AlphaZero 的世界模型版——连环境模型也学出来,只靠动作与奖励信号在未知规则游戏上达到超人类。

八、2020–今:RLHF、世界模型与可扩展 RL ​

1. RLHF 与大模型对齐 ​

2020 年 Stiennon 等人的《Learning to Summarize from Human Feedback》把"人类偏好 → 奖励模型 → PPO 优化"的流程确立下来;2022 年 InstructGPT 把它放大到 ChatGPT 级大模型;2023 年 DPO 又证明"不用显式奖励模型也能直接优化偏好"。这条线今天已经发展成对齐(alignment)这个独立领域,完整流水线见RLHF 与人类反馈对齐,实战见LLM 对齐:RLHF 实战。

text
RLHF 三阶段(2020–2022 定型):
  SFT(模仿示范)→ 奖励模型(从人类偏好对里学打分)
  → PPO(以奖励模型为信号、以参考模型为锚点微调策略)
  → 产物:会"懂人话"的对话模型
  2023 简化版 DPO:跳过奖励模型,直接用偏好对做优化

2. 世界模型与可扩展 RL 的合流 ​

  • DreamerV3(2023):同一个算法在 150+ 任务上无需调参达到 SOTA,证明"通用世界模型学习器"可行。
  • 离线 RL 成熟:CQL、IQL 等让"只用历史数据训练"成为现实,见离线强化学习。
  • 可扩展基础设施:Brax/PureJaxRL 让上万并行环境在 GPU 上单卡跑,把"RL 需要大量采样"的成本压了一个量级。
  • RL for Reasoning(2025):DeepSeek-R1 用 RL 直接激励大模型长链推理,证明 RL 不只是"对齐工具",也是"能力放大器"——这是当下最热的前沿,见前沿进展。

九、时间轴总表与六条支流 ​

1. 按十年划分的关键节点表 ​

年代关键节点一句话意义
1950sBellman 动态规划与 MDP 形式化序列决策有了数学语言
1959–60sSamuel 跳棋、Widrow 试错、Minsky 提出信用分配问题被正式提出
1970s–80sASE/ACE 试错学习器;TD 思想萌芽算法原型出现
1988Sutton 的 TD(λ)在线预测的可行方法
1989/92Watkins 的 Q-learningoff-policy 革命
1992Williams 的 REINFORCE策略梯度主线确立
1992–95Tesauro 的 TD-Gammon神经网络自博弈打败人类
1996Kaelbling 等人的 RL 综述领域体系化
2013Mnih 的 DQN(NIPS 版)深度 RL 诞生
2015DQN(Nature 版);TRPO深度价值学习与信任域策略优化
2016AlphaGo 击败李世石搜索×学习攻破围棋
2017PPO;AlphaZero(Rainbow 论文 2017,正式发表于 AAAI 2018)稳定策略优化 + 深度 RL 集大成
2018SAC;World Models;QMIX连续控制与多智能体并进
2019OpenAI Five;AlphaStar;RND规模化与探索新工具
2020MuZero;RLHF 论文世界模型 + 人类反馈双里程碑
2022InstructGPT/ChatGPTRLHF 进入大模型时代
2023DPO;DreamerV3对齐简化 + 通用世界模型
2025DeepSeek-R1 等 RL for ReasoningRL 从对齐走向能力训练

2. 六条支流各指向哪里 ​

每一条支流在站内都有一条完整的学习线:

支流起点站点主线
动态规划支流Bellman 1957论文地图 → 马尔可夫决策过程
表格法支流Samuel 1959 → TD/Q-learning价值学习
策略梯度支流Williams 1992 → PPO策略梯度方法
深度 RL 支流DQN 2013 → Rainbow → MuZero经典论文精读
多智能体支流MADDPG 2017 → MAPPO多智能体强化学习
RLHF 支流Stiennon 2020 → DPO 2023RLHF 与人类反馈对齐

学历史的正确姿势

不要把历史当故事背,而是当"问题档案"看:每个里程碑都是对上一个里程碑缺陷的回应。TD 回应"MC 要等整局",Q-learning 回应"学习策略必须和行为策略一致",DQN 回应"高维状态没法查表",PPO 回应"TRPO 太复杂",RLHF 回应"预训练模型只会接话不会对话"。抓住这条"问题→解法"链条,你对整个领域的理解会连成网而不是散成点。

延伸阅读 ​

  • 论文地图 —— 本文时间轴的论文级细化版,六条支流逐篇一句话定位。
  • 经典论文精读 —— 改变 RL 的六篇关键论文逐篇精读(含"面试怎么答")。
  • 价值学习 —— 动态规划 → MC/TD → DQN 的完整技术脉络,对应表格法与深度价值支流。
  • 策略梯度方法 —— REINFORCE → TRPO → PPO 的逻辑链,对应策略梯度支流。
  • RLHF 与人类反馈对齐 —— 2020 年以来最重要支流的完整展开。
  • AlphaGo 与蒙特卡洛树搜索 —— 2016 年"深度 RL 三巨头"中最具戏剧性的一位的完整案例。

参考资料 ​

  • Bellman, R. (1957). Dynamic Programming. Princeton University Press. —— 动态规划与贝尔曼方程的原始出处。
  • Samuel, A. L. (1959). Some Studies in Machine Learning Using the Game of Checkers. IBM Journal of Research and Development, 3(3), 210–229. https://ieeexplore.ieee.org/document/5392560 —— 自博弈学习的开山之作。
  • Minsky, M. (1961). Steps Toward Artificial Intelligence. Proceedings of the IRE, 49(1), 8–30. —— 信用分配问题的首次正式提出。
  • Sutton, R. S. (1988). Learning to Predict by the Methods of Temporal Differences. Machine Learning, 3(1), 9–44. https://link.springer.com/article/10.1007/BF00115009 —— TD 学习的原始论文。
  • Watkins, C. J. C. H. & Dayan, P. (1992). Q-learning. Machine Learning, 8(3–4), 279–292. https://link.springer.com/article/10.1007/BF00992698 —— Q-learning 及其收敛证明。
  • Tesauro, G. (1995). Temporal Difference Learning and TD-Gammon. Communications of the ACM, 38(3), 58–68. https://dl.acm.org/doi/10.1145/203330.203343 —— TD-Gammon 原始论文。
  • Mnih, V. et al. (2015). Human-level control through deep reinforcement learning. Nature, 518, 529–533. https://www.nature.com/articles/nature14236 —— DQN 的 Nature 版本。
  • Silver, D. et al. (2016). Mastering the game of Go with deep neural networks and tree search. Nature, 529, 484–489. https://www.nature.com/articles/nature16961 —— AlphaGo 原始论文。
  • Schulman, J. et al. (2017). Proximal Policy Optimization Algorithms. https://arxiv.org/abs/1707.06347 —— PPO 原始论文。
  • Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). https://arxiv.org/abs/2203.02155 —— RLHF 规模化到大模型的里程碑。
  • Rafailov, R. et al. (2023). Direct Preference Optimization. https://arxiv.org/abs/2305.18290 —— DPO 原始论文。
  • Kaelbling, L. P., Littman, M. L. & Moore, A. W. (1996). Reinforcement Learning: A Survey. JAIR, 4, 237–285. https://arxiv.org/abs/cs/9605103 —— 经典综述,黄金期全景。