强化学习演进简史
从贝尔曼方程到 RLHF 的七十年:动态规划奠基、时序差分与 Q-learning、TD-Gammon、深度 RL 三巨头(DQN/PPO/AlphaGo)、再到 LLM 对齐。按十年划分的关键节点表。
REINFORCEMENT LEARNING HANDBOOK
从试错到决策的系统化知识 —— MDP · 价值学习 · 策略梯度 · Actor-Critic · 离线 RL · 多智能体 · RLHF · 职业路径
50+ 篇内容不是要你通读的图书馆,而是可以按需组合的路线图
只读十篇的话,读这些
强化学习是在试错中学习"该怎么做"的范式:没有标签只有事后奖励。本文给出精确定义、智能体-环境交互框架、奖励假设、与监督/无监督的对照,以及一个最小 RL 例子的完整拆解。
导读本站 50 余页内容不是图书馆而是路线图:为 1–3 个月内要面试的人准备求职冲刺线,为想打牢底子的人准备约 8 周系统精进线,为在职建造者准备「问题 → 页面」的案头速查索引。
导读直接学"该怎么做":策略梯度定理的直觉、REINFORCE 与高方差问题、baseline 与 advantage、TRPO 的动机与 PPO 的裁剪目标、连续动作空间的实现要点。
核心知识价值学习的完整脉络:策略评估与策略改进、值迭代;蒙特卡洛与时序差分 TD(0);SARSA 与 Q-learning 的同异;DQN 家族的工程技巧(回放、目标网络、Double、Dueling、Rainbow)。
核心知识几乎所有 RL 问题的统一语言:五元组、马尔可夫性质、折扣回报、策略、价值函数与贝尔曼方程;从"知道模型"到"不知道模型"的三种求解路线。
核心知识让语言模型"懂人话"的关键技术:行为克隆的局限、奖励模型训练、PPO 微调三阶段;对齐税、奖励过度优化、DPO 与直接偏好优化的简化;RLHF 与经典 RL 的异同。
核心知识围棋为何"不可搜索";MCTS 四步与 UCB1;策略网络+价值网络如何"用学习置换算力";AlphaZero 的纯自对弈与通用性;搜索与学习的互补原理。
经典案例InstructGPT/ChatGPT 的三阶段训练:SFT → 奖励模型 → PPO;开源复刻(LLaMA-2-chat、Zephyr);奖励过优化与对齐税的真实代价;DPO 如何简化;从 RL 工程师视角看大模型训练。
经典案例用 Gymnasium 从零实现三个版本的 CartPole:表格式 Q-learning → 简单策略梯度 → PPO;每一版的完整代码、关键坑位与"跑通标准";附带最小可复现实验模板。
实践指南按模块浏览,或直接搜索
从贝尔曼方程到 RLHF 的七十年:动态规划奠基、时序差分与 Q-learning、TD-Gammon、深度 RL 三巨头(DQN/PPO/AlphaGo)、再到 LLM 对齐。按十年划分的关键节点表。
强化学习是在试错中学习"该怎么做"的范式:没有标签只有事后奖励。本文给出精确定义、智能体-环境交互框架、奖励假设、与监督/无监督的对照,以及一个最小 RL 例子的完整拆解。
本站 50 余页内容不是图书馆而是路线图:为 1–3 个月内要面试的人准备求职冲刺线,为想打牢底子的人准备约 8 周系统精进线,为在职建造者准备「问题 → 页面」的案头速查索引。
一个完整 RL 系统由哪六层组成:环境、经验收集、学习算法、策略、评估器、安全护栏;"环境即产品"——为什么 RL 项目 80% 的成本在环境上。
强化学习与监督学习、无监督学习、最优控制、运筹优化、规划与搜索、行为克隆的边界辨析——"什么时候该用 RL,什么时候不该"的决策框架。
直接学"该怎么做":策略梯度定理的直觉、REINFORCE 与高方差问题、baseline 与 advantage、TRPO 的动机与 PPO 的裁剪目标、连续动作空间的实现要点。
探索与利用的简化实验室:问题形式化与遗憾定义、ε-greedy、UCB1 的推导与直觉、Thompson Sampling 的贝叶斯视角;上下文老虎机与推荐/广告的桥梁。
从单智能体到博弈:非平稳性、纳什均衡、独立学习的振荡;CTDE 范式、MADDPG、QMIX 与值分解;MARL 在游戏、交通、拍卖中的应用与难落地真相。
先学环境动力学、再在"脑中"规划:MPC、Dyna、Dreamer、World Models、TD-MPC;数据效率与模型误差的两难;AlphaGo/AlphaZero 的 model-based 视角。
价值学习的完整脉络:策略评估与策略改进、值迭代;蒙特卡洛与时序差分 TD(0);SARSA 与 Q-learning 的同异;DQN 家族的工程技巧(回放、目标网络、Double、Dueling、Rainbow)。
奖励即产品需求:奖励塑形与势函数、稀疏奖励与课程学习、Reward Hacking 的经典案例集、逆强化学习(IRL)与偏好学习;如何设计"写不歪"的奖励。
只有历史数据、不再与环境交互:分布外(OOD)动作与价值高估、保守主义思想、CQL 与 IQL;与行为克隆/模仿学习的关系;落地现实与"何时不该用离线 RL"。
几乎所有 RL 问题的统一语言:五元组、马尔可夫性质、折扣回报、策略、价值函数与贝尔曼方程;从"知道模型"到"不知道模型"的三种求解路线。
RL 评估为什么难:回报方差、随机种子、样本效率与计算预算;主流基准图谱(Gymnasium、Atari、MuJoCo、DM Control、Procgen、Meta-World、Maze);评估报告规范。
RL 的第一性矛盾:从 ε-greedy 到熵正则、参数空间噪声、内在奖励(curiosity)、count-based 与 RND;深度 RL 里探索的具体形态与前沿(Go-Explore、E3B)。
价值 + 策略的合流:A2C/A3C、DDPG、TD3、SAC、PPO 的谱系图;on-policy 与 off-policy 的统一视角;连续控制为什么是 SAC 的主场。
让语言模型"懂人话"的关键技术:行为克隆的局限、奖励模型训练、PPO 微调三阶段;对齐税、奖励过度优化、DPO 与直接偏好优化的简化;RLHF 与经典 RL 的异同。
库存管理、装箱、机器调度、网络路由:把组合优化写成 MDP;学习式求解器(L2S、GPN);与经典 OR(MILP、启发式)的对比与互补。
真实物理试错太贵,仿真学习成为主流:仿真器生态(MuJoCo、Isaac)、域随机化、Sim2Real 鸿沟与弥合;OpenAI 灵巧手、ANYmal 四足、抓取等案例。
组合优化、订单执行、做市:金融 RL 的诱惑与陷阱;市场非平稳、信噪比极低、样本独立性差;为什么多数金融 RL 论文在实盘中失效的诚实剖析。
AlphaFold 的端到端结构预测与几何约束、分子设计与药物发现(GFlowNet、RL 分子生成)、实验设计(主动学习)、AlphaProof/AlphaGeometry 的数学推理 RL;RL for Science 的图景。
把用户当环境:列表页排序、实时出价、探索与收入的权衡;淘宝/阿里妈妈、字节等公开技术;bandit 到全 RL 的工程演进与离线评估困境。
对话策略学习、Tool-use 与 Web 导航智能体、具身智能体:把 LLM 当策略的 RL 微调;从 ReAct 到 RL 训练 Agent 的最新进展(如 AgentLM、RFT);环境即 API。
感知-预测-规划-控制栈中 RL 的位置:分层决策、模仿学习与 RL 的混合、安全约束(约束 RL、安全护栏);Waymo/Tesla 技术路线与"为什么 RL 还没接管方向盘"。
围棋为何"不可搜索";MCTS 四步与 UCB1;策略网络+价值网络如何"用学习置换算力";AlphaZero 的纯自对弈与通用性;搜索与学习的互补原理。
DQN 如何在 49 个 Atari 游戏上超越人类:从像素到动作的端到端学习、经验回放与目标网络的诞生;Rainbow 的七项改进;游戏 RL 的边界与启示。
InstructGPT/ChatGPT 的三阶段训练:SFT → 奖励模型 → PPO;开源复刻(LLaMA-2-chat、Zephyr);奖励过优化与对齐税的真实代价;DPO 如何简化;从 RL 工程师视角看大模型训练。
为什么 RL 学习者要读论文:读懂原理而非背 API、跟上前沿而非追热点、面试硬加分;三条阅读路线;栏目五页使用地图;"带走机制别带走数字"。
逐篇精读改变 RL 的经典论文:Bellman 动态规划、Watkins Q-learning、Mnih DQN、Schulman PPO、Silver AlphaGo、Ouyang InstructGPT;每篇的背景、方法、实验、局限与"面试怎么答"。
把 RL 七十年关键论文按主题与时间轴排成地图:动态规划支流、经典表格法支流、策略梯度支流、深度 RL 支流、RLHF 支流、多智能体支流;每篇一句话定位。
2020 年代 RL 前沿:世界模型(DreamerV3、TD-MPC2)、离线 RL(IQL/CQL)、RLHF 与 DPO 家族、可扩展 RL(大规模并行、JAX 生态)、RL for LLM Reasoning(R1、RLVR)、通用智能体;趋势判断。
读 RL 论文的方法论:怎么记笔记(三栏法)、读不懂数学怎么办、如何判断论文好坏、哪些论文可以跳过、复现实验的纪律。
按目标编排的 RL 读论文路线图:两小时快速入门、工程落地、做研究三条路线的具体论文清单与阅读顺序,以及每篇论文该读到什么程度。
Reward Hacking、种子过拟合、环境 bug、评估作弊、样本效率错觉、日志缺失、大规模并行的工程坑——十个最常见的 RL 翻车点与检测方法。
评估协议实战:固定 seed 矩阵、多次运行、学习曲线与 IQR、样本效率/最终性能双维度;算法对比的公平性陷阱;离线评估与在线评估。
RL 项目从问题定义到上线的完整流水线:环境选型(自建 vs 现成)、基线先行、训练循环、评估协议、日志与可复现、部署与监控;"先跑通再调优"的节奏。
RL 对超参数极度敏感:学习率、γ、GAE λ、熵系数、clip 范围、网络宽度;从默认值出发的调参顺序;AutoRL 与批量实验;"先诊断后调参"的方法论。
用 Gymnasium 从零实现三个版本的 CartPole:表格式 Q-learning → 简单策略梯度 → PPO;每一版的完整代码、关键坑位与"跑通标准";附带最小可复现实验模板。
Stable-Baselines3、Ray RLlib、Tianshou、CleanRL、JAX 系(Brax、PureJaxRL)、自研:六个选项的适用场景对比表;"先抄 CleanRL 再改"的工程建议。
适合求职展示的 RL 项目类型:复现论文、自定义环境、真实业务问题;如何写 README 讲清楚"环境-算法-评估-可复现"四要素;常见误区。
从失败项目里长出的十条原则:奖励先于算法、环境先行、简单优先、基线先行、可复现、安全护栏、样本效率意识、迭代节奏、文档化失败、与业务对齐。
RL 面试高频题解析:MDP 与贝尔曼、MC vs TD、Q-learning vs SARSA、DQN 工程技巧、PPO 细节、SAC 与连续控制、探索利用、RLHF、奖励设计场景题;答题框架与追问预测。
RL 求职版图全景:算法研究员、RL 工程师、大模型对齐工程师、仿真/机器人工程师等岗位的职责、核心技能与薪资对比;三维决策清单;career 模块四页使用地图。
RL 简历的标准写法:环境-算法-指标-复现性四要素;项目描述 STAR 化;常见错误(堆算法名、无评估协议);示例改写前后对照。
国内外在招 RL 相关岗位 JD 拆解:算法研究员、RL 算法工程师、大模型对齐、机器人学习等;JD 高频要求词频统计、技能组合画像;dataAsOf。
把 JD 技能词映射成"会/不会/半会不会"四象限:RL 理论、深度学习与代码、工程与仿真、业务与数学;生成个人补课清单并链接到本站页面。
教科书(Sutton&Barto)、课程(DeepMind/伯克利/UCL)、教程(Spinning Up、CleanRL)、博客(Lilian Weng)、播客与社区;按学习阶段组织的真实资源清单。
RL 术语速查:MDP、贝尔曼方程、TD、MC、GAE、PPO、SAC、DQN、OOD、CTDE、RLHF、reward hacking 等 60+ 词条,每条一句话定义 + 关联页面。
环境库(Gymnasium、MuJoCo、Brax、Isaac Gym/Lab)、基准(Atari、Procgen、DM Control、Meta-World、Maze)、数据(D4RL、RL Unplugged)、工具链(W&B、TensorBoard、Hydra、Optuna)。
RL 背后的数学:期望与条件期望、马尔可夫链与平稳分布、动态规划原理、随机近似与 Robbins-Monro、凸优化与 KL 散度;每条对应一个 RL 用途。