外观
学习路径:三条路线
一句话定位:这一页是本站的入口——它把 50 余页内容从"图书馆"变成"路线图":为 1–3 个月内要面试的人准备求职冲刺线,为想打牢底子的人准备约 8 周系统精进线,为在职建造者准备「问题 → 页面」的案头速查索引。读完这一页,你应该能回答三个问题:我是谁、我要去哪里、我现在该先打开哪一页。
一、三条路线总览
text
强化学习手册(50+ 页,六大模块)
│
┌───────────────────────┼───────────────────────┐
▼ ▼ ▼
路线一:求职冲刺 路线二:系统精进 路线三:案头速查
(约 2 周) (约 8 周) (长期)
│ │ │
· career 模块为主线 · 导读 → 核心知识 · 问题 → 页面索引
· 高频概念做配菜 · 案例 → 实践 · 按需深读对应页
· 1 个 Gymnasium demo · 论文 → 数学 · 不要求顺序阅读
│ │ │
▼ ▼ ▼
能答面试题、 能独立完成并评估 每次排障都比
能讲清 PPO/RLHF 一个真实 RL 项目 上次更快三条路线回答三类人的三个问题,核心差异在"目标、节奏、阅读方式":
| 路线 | 适合谁 | 目标 | 时间预算 | 阅读方式 |
|---|---|---|---|---|
| 一、求职冲刺 | 1–3 个月内要面试的人 | 面试能答、项目能讲、简历经得起追问 | 约 2 周(每天 3–4 小时) | 以题带读,效率优先,先背框架再补细节 |
| 二、系统精进 | 想真正理解 RL 的初学者、转行者、在读学生 | 能独立完成一个 RL 项目并写清楚评估 | 约 8 周(每周 10–15 小时) | 顺序阅读,概念与动手交替,每周有检验标准 |
| 三、案头速查 | 正在做 RL 项目的工程师 / 研究员 | 遇到问题快速定位到可执行的答案 | 无固定时长,终身复用 | 按需翻阅,从"问题索引表"进入对应页面 |
别做的一件事
不要把本站当小说从头读到尾。50 页全部顺序读完既不现实也无必要——大多数页面彼此独立成章,读哪页取决于你当前的目标。这也是本页存在的意义:先选路线,再开读。
二、路线一:求职冲刺线(约 2 周)
适合人群:已经有 ML / 深度学习基础,目标是在 1–3 个月内拿到 RL 相关岗位(算法研究员、RL 工程师、大模型对齐工程师)的面试机会。你的稀缺资源是时间,不是知识深度——所以这条线的原则是:以面试题为主线,以高频概念为配菜,以动手 demo 为底线。
1. 主线:career 模块四篇
先读求职模块本身,它们会告诉你市场要什么、怎么对标自己:
- 先看模块导读与岗位版图,搞清楚 8–10 种 RL 岗位的职责、技能与薪资区间,选定一个目标岗位。
- 再拆JD 清单,看真实在招岗位的高频要求词(策略梯度、PPO、RLHF、仿真、机器人……),把要求词抄下来当作你的"考点清单"。
- 然后用能力对标检查简历:环境—算法—指标—可复现性四要素是否齐全。
- 边学边对照面试题库,用其中的答题框架检验自己"能不能把概念讲成面试答案"。
2. 配菜:四个高频概念,一个都不能少
面试考点有明确的重复度。以下是出现频率最高、必须能用一句话+一个例子讲清楚的四个概念:
| 概念 | 必须能回答的问题 | 关联页面 |
|---|---|---|
| MDP | 五元组是什么?马尔可夫性质为什么重要?折扣因子 γ 的直觉? | 马尔可夫决策过程 |
| 价值学习 | MC vs TD?Q-learning vs SARSA?DQN 为什么需要回放和目标网络? | 价值学习 |
| 策略梯度 | 策略梯度定理的直觉?REINFORCE 为什么方差大?PPO 的 clip 在干嘛? | 策略梯度方法 |
| RLHF | 三阶段流水线?奖励模型怎么训?KL 惩罚为什么必要?DPO 简化了什么? | RLHF 与人类反馈对齐 |
面试官的"讲给我听"测试
对着镜子(或录音)把每个概念讲 3 分钟:先说定义,再给直觉,再举例子,最后说一个坑。讲得通,才算会。面试官对 RL 候选人的第一刀往往就是"讲一下 PPO 和 TRPO 的关系",讲不顺就凉一半。
3. 动手底线:一个能跑的 demo
简历和面试里没有项目的 RL 候选人是危险的。这条线只需要一个 demo:Gymnasium 渐进式教程(CartPole 三个版本:表格 Q-learning → REINFORCE → PPO)。它解决三个面试高频问题:环境 API 长什么样、一个训练循环怎么写、学习曲线怎么看。
4. 两周日程表
| 天 | 主线任务 | 配菜 / 动手 | 里程碑 |
|---|---|---|---|
| 1–2 | 读模块导读 + JD 清单 | 抄出 15 条高频要求词 | 确定目标岗位,列出考点清单 |
| 3–4 | 面试题库过一遍 | 读什么是强化学习 | 能用一句话定义 RL |
| 5–6 | 概念组 1:MDP + 价值学习 | 跑通 Gymnasium 教程版本一(Q-learning) | 能默写贝尔曼方程 |
| 7–8 | 概念组 2:策略梯度 + PPO | 跑通版本二(REINFORCE)、版本三(PPO) | 能讲清 clip 机制 |
| 9–10 | 概念组 3:RLHF | 读LLM 对齐案例 | 能画出三阶段流水线 |
| 11–12 | 用能力对标改简历 | 把 demo 的评估协议写进 README | 简历满足四要素 |
| 13–14 | 全真模拟:把面试题库当考卷自测 | 补漏 | 每个高频题能答 3 分钟 |
冲刺线最容易踩的坑
背概念但不做 demo。面试官问你"你跑过什么 RL 实验",你答不上来,前面背的所有公式都会被打折。哪怕只跑通一个 CartPole,也要把它当成"项目"认真对待——这也是作品集项目页反复强调的:一个跑通、可复现、评估规范的小项目,胜过十个没跑过的算法名。
三、路线二:系统精进线(约 8 周)
适合人群:没有时间压力的学习者,想建立不依赖背书的真功底。这条线的原则是:导读 → 核心知识 → 案例 → 实践 → 论文,五步走完一遍;每周都有"检验标准"——通过检验再进入下一周,不通过就补课。
1. 总节奏
text
第 1 周 导读与数学 ← guide/ 模块 + math-primer
第 2 周 MDP 与表格世界 ← 概念 + 动手(Q-learning 表格式)
第 3 周 价值学习 ← 概念 + 动手(MC/TD/DQN 思路)
第 4 周 策略梯度与 AC ← 概念 + 动手(PPO)
第 5 周 深度 RL 工程 ← 评估、框架、调参
第 6 周 经典案例 ← case-studies 精选 3 个
第 7 周 进阶范式 ← model-based / offline / multi-agent
第 8 周 RLHF 与论文 ← 对齐 + 论文地图 + 收尾项目2. 每周主题与检验标准
| 周 | 主题 | 必读页面 | 必做之事 | 检验标准(通过才进下一周) |
|---|---|---|---|---|
| 1 | 导读与数学底子 | 什么是强化学习、RL vs 相邻领域、数学基础速查、术语表 | 浏览全站页面地图建立全局感 | 能画智能体—环境循环图;能解释期望、条件期望、方差在 RL 里各出现在哪 |
| 2 | MDP 与表格世界 | 马尔可夫决策过程、多臂老虎机、探索与利用 | 手写网格世界值迭代或策略迭代 | 能默写贝尔曼期望方程与最优方程,并解释 γ<1 的理由 |
| 3 | 价值学习 | 价值学习 | 在Gymnasium 教程上跑通版本一(表格 Q-learning) | 能讲 MC vs TD 的偏差/方差、Q-learning 为什么是 off-policy |
| 4 | 策略梯度与 Actor-Critic | 策略梯度方法、Actor-Critic 家族 | 跑通版本二、版本三;画一次学习曲线 | 能推导式地讲 REINFORCE 高方差 → baseline → PPO clip 的逻辑链 |
| 5 | 深度 RL 工程 | 评估与基准、评估实践、框架与工具、调参实践 | 为自己的实验搭一套评估协议(多 seed) | 能设计一个公平的算法对比实验并写出报告模板 |
| 6 | 经典案例 | AlphaGo 与 MCTS、Atari 与电子游戏、机器人 Sim2Real | 重读对应论文 | 能讲"搜索×学习"互补原理;能讲 DQN 两大工程技巧 |
| 7 | 进阶范式 | 基于模型的 RL、离线强化学习、多智能体、奖励工程 | 读一页前沿论文(论文前沿) | 能对比 model-based vs model-free、offline vs online 的适用条件 |
| 8 | RLHF 与现代对齐 | RLHF、LLM 对齐案例、演进简史 | 精读经典论文中 1–2 篇 | 能讲 SFT → 奖励模型 → PPO 三阶段,并解释对齐税 |
第 8 周之后怎么办
8 周结束你已经具备"做项目"的能力。后续两条路任选:一是去实践模块从零构建一个完整项目(环境选型 → 基线 → 训练 → 评估 → 部署);二是转论文模块做深水区阅读,从阅读路径按目标选线。此时案头速查线(路线三)开始对你生效——你已经有足够的地图,剩下的都是按需查阅。
四、路线三:案头速查线
适合人群:正在做 RL 项目、卡在具体问题上的工程师与研究员。没有阅读顺序,规则只有一条:遇到问题,查下面这张索引表,翻到对应页面,解决,走人。
| 你遇到的问题 | 直接打开 | 这一页能给你什么 |
|---|---|---|
| 这个任务到底该不该用 RL? | RL vs 相邻领域 | 七种范式的边界 + 选型决策表 |
| 不知道怎么把问题写成 RL 形式 | 马尔可夫决策过程 | 五元组定义、状态/动作怎么设计 |
| 环境模拟器怎么选 / 自己造? | 数据集与工具档案 | 环境库、基准、数据集的完整对照 |
| 算法跑不起来 / 学不进去 | 从零构建 RL 项目 + 常见陷阱 | 八步流水线 + 十个翻车点清单 |
| 奖励总是被钻空子 | 奖励工程 | Reward Hacking 案例集 + 十条设计清单 |
| 想换算法,选 PPO 还是 SAC? | Actor-Critic 家族 + 框架对比 | 谱系对比表 + 选型建议 |
| 超参数怎么调? | 调参实践 | 核心超参速查表 + 调参顺序 |
| 实验结果不可复现 | 评估实践 + 评估与基准 | 评估协议、多 seed 规范 |
| 只有历史数据,不能再交互 | 离线强化学习 | OOD 问题、CQL/IQL、决策树 |
| 想让大模型"懂人话" | RLHF + LLM 对齐案例 | 三阶段流水线、DPO、对齐税 |
| 要面试了,怕被问到 | 面试题库 + JD 清单 | 高频题 + 答题框架 + 考点频率 |
| 想看一篇具体论文怎么读 | 经典论文精读 + 论文地图 | 每篇的背景、方法、局限、面试怎么答 |
给案头速查用户的元建议
每次查完一个页面,花 30 秒在浏览器收藏夹或笔记里记一句"问题 → 结论"。三个月后你就有了一本专属排障手册,这是把速查线变成个人资产的唯一方法。想了解更系统的记笔记方法,见论文阅读纪律与 FAQ。
五、三条路线不互斥
三条路线不是三选一,而是同一本手册的三种打开方式,可以随时切换、叠加使用:
- 冲刺线 → 精进线:面试拿到 offer 或暂时不需要面试后,把冲刺时"背下来"的概念回炉成系统理解。冲刺线教你框架,精进线帮你把框架长成骨骼——很多冲刺线用户在第 2 周会回来补数学基础速查。
- 精进线 → 速查线:8 周结束后,精进线自然退化为速查线。你不需要再顺序读,遇到问题翻索引即可。
- 速查线 → 精进线:速查用户如果发现自己反复查同一类问题(比如每次都在查评估协议),说明这里存在系统性缺口——那就把对应主题放回精进线的周计划里补一轮。
三条路线共用同一个底层结构:概念是砖,案例是房,实践是工地,论文是施工图,资源和求职是外挂工具。本站六大模块的关系可以画成一张图:
text
┌─────────────────────────────────────────────┐
│ guide/ 导读:先看这里,选路线 │
├─────────────────────────────────────────────┤
│ concepts/ 核心知识(12 页)── 砖 │
│ case-studies/ 经典案例(10 页)── 房 │
│ practice/ 实践指南(8 页)── 工地 │
│ papers/ 论文精读(6 页)── 施工图 │
├─────────────────────────────────────────────┤
│ resources/ 资源:术语、数学、清单、工具 │
│ career/ 求职:版图、JD、简历、面试 │
└─────────────────────────────────────────────┘无论从哪条路线进入,如果你只想记住一条,那就是:动手优先。RL 是"读 100 页不如跑 100 步"的学科——Gymnasium 教程永远是你最快的起点。
延伸阅读
- 什么是强化学习 —— 进入精进线之前先读这篇,建立整座大楼的地基概念。
- 马尔可夫决策过程 —— 所有 RL 问题的统一语言,路线的必修第一课。
- RL 系统解剖 —— 从"学概念"切换到"造系统"视角时读,理解六层架构。
- 强化学习演进简史 —— 想建立全局时间感时读,配合论文地图使用。
- 经典论文精读 —— 冲刺线与精进线在第 8 周的交汇点。
- 模块导读与岗位版图 —— 冲刺线第一站,先看市场再准备自己。
参考资料
- Sutton, R. S. & Barto, A. G. (2018). Reinforcement Learning: An Introduction (2nd ed.). MIT Press. 在线全文:http://incompleteideas.net/book/the-book-2nd.html —— 本站所有概念的源头教材。
- OpenAI (2018). Spinning Up in Deep RL. https://spinningup.openai.com/en/latest/ —— 面向工程师的深度 RL 速成教程,与本站"路线一"定位高度一致。
- Lilian Weng (2017–2025). Lilian Weng's Blog — Reinforcement Learning 系列. https://lilianweng.github.io/ —— 高质量综述博客,适合每周精进后的延伸阅读。
- Farama Foundation. Gymnasium Documentation. https://gymnasium.farama.org/ —— 动手 demo 的环境 API 官方文档。
- David Silver (2015). UCL Course on Reinforcement Learning. https://www.davidsilver.uk/teaching/ —— 与本站"路线二"第 1–4 周逐周对应的经典课程。