外观
精选资源清单
一句话定位:这一页是 RL 世界的"值得花钱(其实大多免费)清单"——教科书、公开课、深度教程、博客、工具库与论文追踪渠道,全部真实存在、按学习阶段组织,帮你避开"收藏夹吃灰"和"网上随便搜到过时内容"两个大坑。
一、教科书
| 资源 | 作者/年份 | 免费? | 定位 | 怎么读 |
|---|---|---|---|---|
| Reinforcement Learning: An Introduction(第 2 版) | Sutton & Barto, 2018 | ✅ 免费在线 | RL 圣经,理论 + 直觉的权威出处 | 精读第 1–9 章,其余按需 |
| Algorithms for Reinforcement Learning | Csaba Szepesvári, 2010 | ✅ 免费在线 | 更紧凑的数学版(约 100 页) | 看过 Sutton 后做数学补强 |
| Deep Reinforcement Learning | Aske Plaat, 2022 | ✅ 免费在线 | 深度 RL 全景综述(Springer 开源) | 体系化梳理 DQN→前沿 |
- Sutton & Barto 免费版官方地址:http://incompleteideas.net/book/RLbook2020.pdf
- Szepesvári 免费版:https://sites.ualberta.ca/~szepesva/papers/RLAlgsInMDPs.pdf
- Plaat 免费版:https://arxiv.org/abs/2110.14168(*A Brief Survey of Deep Reinforcement Learning* 的扩展成书版)
二、公开课
| 课程 | 提供方 | 免费? | 特点 | 适合 |
|---|---|---|---|---|
| Introduction to Reinforcement Learning(David Silver) | UCL / DeepMind | ✅ | 10 讲表格法经典路线,概念最清晰 | 入门必看,配合他的讲义 |
| Deep RL Course(CS285) | UC Berkeley / Sergey Levine | ✅ | 深度 RL 前沿视角,含离线 RL、meta-RL | 已入门者进阶 |
| DeepMind x UCL RL Lecture Series | DeepMind / UCL(YouTube) | ✅ | 2022 年起的新系列,覆盖深度 RL 与前沿 | Sutton 之后的第二遍 |
| Deep RL Bootcamp | 伯克利/OpenAI 讲师团队(2017) | ✅ | 讲义短平快,偏工程直觉 | 想快速上手训练 |
- David Silver 课程主页(含每讲视频与幻灯片):https://www.davidsilver.uk/teaching/
- CS285 主页(含幻灯片与作业):https://rail.eecs.berkeley.edu/deeprlcourse/
- DeepMind x UCL 系列在 YouTube 搜 "DeepMind x UCL Reinforcement Learning",播放列表官方频道可查。
WARNING
公开课年份很重要:David Silver 2015 年课程只覆盖到 DQN,之后的深度 RL 前沿要去看 CS285 或 DeepMind 新系列。别拿 2015 年的课程断言 2025 年的主流做法。
三、深度教程(动手向)
| 教程 | 提供方 | 特点 | 上手路径 |
|---|---|---|---|
| Spinning Up in Deep RL | OpenAI | 概念 + 公式 + 代码示例一体的权威入门 | 先读"Intro to RL",再逐个算法页 |
| CleanRL | vwxyzjn 等开源维护 | 单文件、单依赖的最小可读实现,专为教学 | 抄一个 PPO 文件改着玩 |
| Hugging Face Deep RL Course | Hugging Face | 交互式单元课程,直接跑在 Colab/Gradio 上 | 按 unit 顺序刷 |
| Ray RLlib / SB3 官方文档 | Ray / Stable-Baselines3 | 生产级工具的 API 与算法教程 | 有项目需求时查 |
- Spinning Up:https://spinningup.openai.com/en/latest/
- CleanRL 仓库:https://github.com/vwxyzjn/cleanrl ;文档:https://docs.cleanrl.dev/
- Hugging Face Deep RL Course:https://huggingface.co/learn/deep-rl-course/unit0/introduction
和本站的关系
本站渐进式教程就是"Spinning Up + CleanRL"风格的国产版:用 Gymnasium 从 Q-learning 一路写到 PPO。把本站教程和 CleanRL 源码对着看,是效率最高的学法。
四、博客与深度长文
| 博客 | 作者 | 特色 | 必读篇章 |
|---|---|---|---|
| Lilian Weng 博客 | Lilian Weng | 综述式长文,覆盖 RLHF、离线 RL、世界模型 | A Survey on RLHF(2023) |
| Distill | Distill 编辑部(已停更但有存档) | 交互式可视化,把机制讲"看得见" | 经典 RL 可视化文章 |
| The Gradient | 开源编辑部 | 立场文与领域综述,适合了解争议 | "The Bitter Lesson" 相关讨论 |
| OpenAI / DeepMind 官方博客 | OpenAI、DeepMind | 发布新成果时的一手解释 | DQN、AlphaGo、ChatGPT 发布帖 |
| RL Weekly | 社区维护 | 每周 RL 论文速览 | 跟前沿用 |
- Lilian Weng:https://lilianweng.github.io/
- Distill(存档):https://distill.pub/
- The Gradient:https://thegradient.pub/
- OpenAI 博客:https://openai.com/blog ;DeepMind 博客:https://deepmind.google/discover/blog/
怎么读博客
博客是"二道贩子",可能过时或有立场。正确姿势:用博客快速建立全景(先看结论),再回到论文地图读一手论文。Lilian Weng 的长文建议用"三栏笔记法"(问题/方法/局限,见论文阅读纪律)做笔记。
五、工具与库
| 工具 | 用途 | 官方地址 | 备注 |
|---|---|---|---|
| Gymnasium | 标准环境接口(reset/step/render) | https://gymnasium.farama.org/ | 事实标准,几乎所有库都兼容 |
| MuJoCo | 物理仿真器 | https://mujoco.org/ | 2015 年后开源免费,连续控制基准 |
| Brax | GPU 加速物理仿真 | https://github.com/google/brax | 训练速度快一两个量级 |
| Stable-Baselines3 | 生产级算法库(PyTorch) | https://stable-baselines3.readthedocs.io/ | 开箱即用,适合产品验证 |
| CleanRL | 教学/研究用最小实现 | https://github.com/vwxyzjn/cleanrl | 研究复现的主力 |
| Ray RLlib | 分布式 RL | https://docs.ray.io/en/latest/rllib/ | 大规模并行 |
| Tianshou | 学术灵活的中等框架 | https://github.com/thu-ml/tianshou | 训练循环可高度定制 |
更完整的对比见本站框架与工具怎么选,环境与数据集的完整清单见数据集与工具档案。
六、论文追踪
| 渠道 | 地址 | 用法 |
|---|---|---|
| arXiv(cs.LG / cs.AI 分类) | https://arxiv.org/ | 设关键词提醒(如 reinforcement learning) |
| Papers with Code | https://paperswithcode.com/ | 看论文 + 官方实现 + SOTA 榜单 |
| Google Scholar | https://scholar.google.com/ | 按引用量过滤经典论文 |
| Semantic Scholar | https://www.semanticscholar.org/ | 语义检索 + 综述推荐 |
| NeurIPS / ICML / ICLR / COLM | 各会议官网 | 每年 12 月 / 7 月的录用列表是前沿风向标 |
TIP
追论文的正确姿势不是"每天刷 arXiv",而是只关注 3–5 个信号源:Papers with Code 的 RL 榜单 + 每届 NeurIPS/ICML 的 Best Paper + 两三位你信任的资深学者(如 Sergey Levine、Pieter Abbeel、Sergey Levine 团队)的引用。见论文地图先把经典读完,再追前沿。
七、中文资源
对中文读者,一些高质量的中文资源值得单独列出(同样按真实存在筛选,标注形态与定位):
| 资源 | 形态 | 定位 | 地址 |
|---|---|---|---|
| 《动手学强化学习》(王琦、杨毅远、江季) | 开源书 + B 站配套视频 | 中文圈最完整的 RL 入门书之一,代码用 PyTorch 实现经典算法 | https://hrl.boyuai.com/ |
| 李宏毅《机器学习》课程 RL 部分 | 视频课 | 把 RL 讲得最"轻松有趣"的入门课,适合第一次建立直觉 | YouTube 搜 "Hung-yi Lee" |
| 《强化学习》(第 2 版)中译本 | 纸质书 | Sutton & Barto 中文版,叶强 译,人民邮电出版社(2019) | 各大书店 |
| 周志华《机器学习》("西瓜书")第 16 章 | 纸质书 | 中文语境下最简洁的 RL 一章,表格法与策略梯度都有 | 各大书店 |
| 知乎/公众号的算法精读专栏 | 长文 | 良莠不齐,只用来"查个概念",别当教材 | 自行搜索 |
中文资源的两条纪律
- 翻译版对不上术语:同一个概念中译名五花八门(如 "on-policy" 译作"同策略/在线策略/策略内"),对照英文原词使用。本站术语表的英文原词可以帮你对齐。
- 中文社区二手知识滞后:前沿话题(RLHF、离线 RL)的搬运文章常晚于英文原版半年以上。中文资源适合入门与查漏,前沿判断请回到英文一手来源。
八、按阶段推荐表
把上面全部资源按"你现在在哪一步"组织成行动清单:
| 阶段 | 必做 | 选做 | 完成后你能 |
|---|---|---|---|
| 入门(0–1 个月) | David Silver 课程前 7 讲 + Spinning Up 的 Intro to RL + 本站学习路径路线一 | Gymnasium 教程(本站或官方) | 讲清 MDP、TD、Q-learning,能跑通 CartPole |
| 进阶(1–3 个月) | Sutton & Barto 第 1–9 章 + CS285 前 8 讲 + CleanRL 抄 PPO | Lilian Weng 的 RLHF Survey、RLHF 相关 | 看懂主流论文公式,能复现 DQN/PPO/SAC |
| 研究 / 工程前沿(3 个月+) | CS285 后半 + 按论文地图精读 10–15 篇经典 + Papers with Code 复现 | RL Weekly 每周跟进 + 会议论文 | 形成独立判断,能批判性地读新论文 |
避坑提醒
网上大量 2016–2018 年的 RL 教程仍能搜到,但内容已过时(例如还在讲"DQN 是 SOTA"、把 Atari 当主战场)。判断标准很简单:教程里提到的 SOTA 算法是否是 2020 年以后的(PPO/SAC/Dreamer/IQL 等)。不是的话只当历史看。
九、社区与持续学习
学了资源之后,还需要"待在其中"——RL 是快速变化的领域,社区是最好的信号源:
| 渠道 | 地址 | 用途 |
|---|---|---|
| Reddit r/reinforcementlearning | https://www.reddit.com/r/reinforcementlearning/ | 业界/学界讨论、资源推荐、问题求助 |
| Awesome RL 清单(aikorea/awesome-rl) | https://github.com/aikorea/awesome-rl | 分类整理的 RL 资源大索引 |
| NeurIPS / ICML / ICLR | https://neurips.cc/ 、https://icml.cc/ | 一年两度的前沿论文集中发布 |
| arXiv cs.LG | https://arxiv.org/list/cs.LG/recent | 每日新论文(配合关键词订阅) |
| 学术 Twitter / 学者主页 | Levine、Schulman、Lilian Weng 等 | 最快的前沿评论与工作进展 |
快速判断"一个资源值不值得看"的清单
在收藏任何教程/博客/仓库之前,花 30 秒过一遍:
- 日期:最后更新是否在 1–2 年内?RL 领域一年算法代际就换。
- 基准:文中对比的 SOTA 是否仍为主流(PPO/SAC/Dreamer/IQL 这一代)?
- 可复现:有代码吗?代码能跑通吗(看 Issues 是否长期无人回应)?
- 出处:作者是否可查(机构、GitHub 主页)?还是营销号?
- 是否抄:与 Spinning Up / CleanRL 的内容结构高度雷同且无新增信息?那是二手转述,回原始出处更省时间。
十、把资源变成能力的行动模板
收藏 ≠ 学会。资源清单的真正价值在于被使用,这里给一个经过验证的四周节奏模板(可直接套在学习路径的系统精进线上使用):
| 周 | 主题 | 资源组合 | 验收标准 |
|---|---|---|---|
| 第 1 周 | MDP 与表格法 | David Silver 第 1–4 讲 + Sutton & Barto 第 3–4 章 + 本站MDP | 能默写贝尔曼方程,能写出 Q-learning 更新公式 |
| 第 2 周 | 价值学习 | Sutton & Barto 第 5–6 章 + Spinning Up 的 Intro to RL | 能说清 MC vs TD 的偏差-方差差异,跑通 CartPole 的 Q-learning |
| 第 3 周 | 策略梯度 | CS285 第 4–5 讲 + CleanRL 的 PPO 实现 | 能逐项解释 PPO clip 目标,跑通 PPO 并画出学习曲线 |
| 第 4 周 | 综合复现 | 从论文地图挑 1 篇经典论文复现 | 提交一个含"环境-算法-评估-复现"四要素的 README |
三条使用纪律:
- 学完立即输出:每个资源只过一遍,学完立刻写笔记 / 跑代码 / 讲给别人听,禁止"只看不练"地囤课。
- 以结果验收:一门课的完成标志不是"视频看完",而是"跑出了自己的结果"。
- 控制并发资源:同时进行的课程不超过 2 门、教科书不超过 1 本。多资源并行通常是拖延的前奏,而不是勤奋。
常见问题(FAQ)
- Q:收藏了很多课程却提不起劲开始? A:从"最小可行动作"开始——今天只看一讲视频、或只跑通一个 CartPole,别规划"一个月计划"再开始。
- Q:资源太多,怎么知道该优先哪个? A:用上面的阶段表对号入座,优先"必做"列;本页第七节的避坑判断清单会帮你筛掉过时内容。
- Q:英文资源吃力怎么办? A:先看第七节中文资源打底,再回到英文原版;术语对照用本站术语表。
与本站的关系
外部资源负责"喂知识",本站页面负责"建结构":每读完一个外部资源,回对应的本站概念页做一次"这个资源和本站说法有什么出入"的核对——这种主动加工是最有效的记忆方式。
十一、维护你自己的资源清单
收藏夹会腐烂——书签会过期、课程会下线、版本会漂移。把"别人的清单"变成"自己的清单",只需要三条纪律:
- 每季度清理一次:删掉三个月没碰过的收藏。如果一项资源三个月都不值得打开,它大概率永远不值得打开。
- 给每项资源标状态:待看 / 在看 / 已吸收 / 已过时。状态变化本身就是进度感。
- 记录"哪里学到的":每学一个新概念,记下你第一次在哪看懂它(某篇博客、某讲课程、本站某页)。将来温习时,优先回你最懂的出处。
一个随手可用的清单模板(Markdown 即可,不必上工具):
markdown
## 正在学
- [课程名](进度 3/10 讲)→ 出自本站[精选资源清单](/resources/awesome)第 X 节
- [书名] 第 5 章
## 已吸收(可随时引用)
- 概念 X:用 [本站术语表](/resources/glossary) 对照,见[页面名](/concepts/value-based)
## 过时/弃用
- [老教程](2021 年,DQN 当 SOTA)资源是手段不是目的:一个月后你记得的、能讲给别人听的、能跑出结果的,才是你真正拥有的。本站其余页面(学习路径、论文地图、框架与工具)会一直在这里,帮你把资源转化为能力。
延伸阅读
- 学习路径:三条路线 —— 本站帮你把这页资源组织成"先学什么、后学什么"。
- 术语表 —— 学习资源里遇到的生词,随手查。
- 数据集与工具档案 —— 本页工具的完整版(含环境库、基准、离线数据集)。
- 框架与工具怎么选 —— 六个框架的详细对比与选型建议。
- 论文地图 —— 想把"读论文"升级成体系时从这里开始。
参考资料
- Sutton, R. S., & Barto, A. G. (2018). Reinforcement Learning: An Introduction, 2nd ed. 免费在线:http://incompleteideas.net/book/RLbook2020.pdf
- David Silver, UCL 课程主页:https://www.davidsilver.uk/teaching/
- UC Berkeley CS285 Deep RL:https://rail.eecs.berkeley.edu/deeprlcourse/
- OpenAI Spinning Up:https://spinningup.openai.com/en/latest/
- CleanRL:https://github.com/vwxyzjn/cleanrl
- Hugging Face Deep RL Course:https://huggingface.co/learn/deep-rl-course/unit0/introduction
- Lilian Weng 博客:https://lilianweng.github.io/
- Gymnasium:https://gymnasium.farama.org/
- Stable-Baselines3:https://stable-baselines3.readthedocs.io/
- Brax:https://github.com/google/brax
- arXiv:https://arxiv.org/ ;Papers with Code:https://paperswithcode.com/