Skip to content

精选资源清单

本页速览 教科书(Sutton&Barto)、课程(DeepMind/伯克利/UCL)、教程(Spinning Up、CleanRL)、博客(Lilian Weng)、播客与社区;按学习阶段组织的真实资源清单。

精选资源清单 ​

一句话定位:这一页是 RL 世界的"值得花钱(其实大多免费)清单"——教科书、公开课、深度教程、博客、工具库与论文追踪渠道,全部真实存在、按学习阶段组织,帮你避开"收藏夹吃灰"和"网上随便搜到过时内容"两个大坑。

一、教科书 ​

资源作者/年份免费?定位怎么读
Reinforcement Learning: An Introduction(第 2 版)Sutton & Barto, 2018✅ 免费在线RL 圣经,理论 + 直觉的权威出处精读第 1–9 章,其余按需
Algorithms for Reinforcement LearningCsaba Szepesvári, 2010✅ 免费在线更紧凑的数学版(约 100 页)看过 Sutton 后做数学补强
Deep Reinforcement LearningAske Plaat, 2022✅ 免费在线深度 RL 全景综述(Springer 开源)体系化梳理 DQN→前沿

TIP

Sutton & Barto 的每一章末尾有"练习题"与"历史背景",前者适合检验、后者适合理解"为什么这么设计"。中文读者可搭配本站术语表与论文地图对照使用。

二、公开课 ​

课程提供方免费?特点适合
Introduction to Reinforcement Learning(David Silver)UCL / DeepMind✅10 讲表格法经典路线,概念最清晰入门必看,配合他的讲义
Deep RL Course(CS285)UC Berkeley / Sergey Levine✅深度 RL 前沿视角,含离线 RL、meta-RL已入门者进阶
DeepMind x UCL RL Lecture SeriesDeepMind / UCL(YouTube)✅2022 年起的新系列,覆盖深度 RL 与前沿Sutton 之后的第二遍
Deep RL Bootcamp伯克利/OpenAI 讲师团队(2017)✅讲义短平快,偏工程直觉想快速上手训练

WARNING

公开课年份很重要:David Silver 2015 年课程只覆盖到 DQN,之后的深度 RL 前沿要去看 CS285 或 DeepMind 新系列。别拿 2015 年的课程断言 2025 年的主流做法。

三、深度教程(动手向) ​

教程提供方特点上手路径
Spinning Up in Deep RLOpenAI概念 + 公式 + 代码示例一体的权威入门先读"Intro to RL",再逐个算法页
CleanRLvwxyzjn 等开源维护单文件、单依赖的最小可读实现,专为教学抄一个 PPO 文件改着玩
Hugging Face Deep RL CourseHugging Face交互式单元课程,直接跑在 Colab/Gradio 上按 unit 顺序刷
Ray RLlib / SB3 官方文档Ray / Stable-Baselines3生产级工具的 API 与算法教程有项目需求时查

和本站的关系

本站渐进式教程就是"Spinning Up + CleanRL"风格的国产版:用 Gymnasium 从 Q-learning 一路写到 PPO。把本站教程和 CleanRL 源码对着看,是效率最高的学法。

四、博客与深度长文 ​

博客作者特色必读篇章
Lilian Weng 博客Lilian Weng综述式长文,覆盖 RLHF、离线 RL、世界模型A Survey on RLHF(2023)
DistillDistill 编辑部(已停更但有存档)交互式可视化,把机制讲"看得见"经典 RL 可视化文章
The Gradient开源编辑部立场文与领域综述,适合了解争议"The Bitter Lesson" 相关讨论
OpenAI / DeepMind 官方博客OpenAI、DeepMind发布新成果时的一手解释DQN、AlphaGo、ChatGPT 发布帖
RL Weekly社区维护每周 RL 论文速览跟前沿用

怎么读博客

博客是"二道贩子",可能过时或有立场。正确姿势:用博客快速建立全景(先看结论),再回到论文地图读一手论文。Lilian Weng 的长文建议用"三栏笔记法"(问题/方法/局限,见论文阅读纪律)做笔记。

五、工具与库 ​

工具用途官方地址备注
Gymnasium标准环境接口(reset/step/render)https://gymnasium.farama.org/事实标准,几乎所有库都兼容
MuJoCo物理仿真器https://mujoco.org/2015 年后开源免费,连续控制基准
BraxGPU 加速物理仿真https://github.com/google/brax训练速度快一两个量级
Stable-Baselines3生产级算法库(PyTorch)https://stable-baselines3.readthedocs.io/开箱即用,适合产品验证
CleanRL教学/研究用最小实现https://github.com/vwxyzjn/cleanrl研究复现的主力
Ray RLlib分布式 RLhttps://docs.ray.io/en/latest/rllib/大规模并行
Tianshou学术灵活的中等框架https://github.com/thu-ml/tianshou训练循环可高度定制

更完整的对比见本站框架与工具怎么选,环境与数据集的完整清单见数据集与工具档案。

六、论文追踪 ​

渠道地址用法
arXiv(cs.LG / cs.AI 分类)https://arxiv.org/设关键词提醒(如 reinforcement learning)
Papers with Codehttps://paperswithcode.com/看论文 + 官方实现 + SOTA 榜单
Google Scholarhttps://scholar.google.com/按引用量过滤经典论文
Semantic Scholarhttps://www.semanticscholar.org/语义检索 + 综述推荐
NeurIPS / ICML / ICLR / COLM各会议官网每年 12 月 / 7 月的录用列表是前沿风向标

TIP

追论文的正确姿势不是"每天刷 arXiv",而是只关注 3–5 个信号源:Papers with Code 的 RL 榜单 + 每届 NeurIPS/ICML 的 Best Paper + 两三位你信任的资深学者(如 Sergey Levine、Pieter Abbeel、Sergey Levine 团队)的引用。见论文地图先把经典读完,再追前沿。

七、中文资源 ​

对中文读者,一些高质量的中文资源值得单独列出(同样按真实存在筛选,标注形态与定位):

资源形态定位地址
《动手学强化学习》(王琦、杨毅远、江季)开源书 + B 站配套视频中文圈最完整的 RL 入门书之一,代码用 PyTorch 实现经典算法https://hrl.boyuai.com/
李宏毅《机器学习》课程 RL 部分视频课把 RL 讲得最"轻松有趣"的入门课,适合第一次建立直觉YouTube 搜 "Hung-yi Lee"
《强化学习》(第 2 版)中译本纸质书Sutton & Barto 中文版,叶强 译,人民邮电出版社(2019)各大书店
周志华《机器学习》("西瓜书")第 16 章纸质书中文语境下最简洁的 RL 一章,表格法与策略梯度都有各大书店
知乎/公众号的算法精读专栏长文良莠不齐,只用来"查个概念",别当教材自行搜索

中文资源的两条纪律

  1. 翻译版对不上术语:同一个概念中译名五花八门(如 "on-policy" 译作"同策略/在线策略/策略内"),对照英文原词使用。本站术语表的英文原词可以帮你对齐。
  2. 中文社区二手知识滞后:前沿话题(RLHF、离线 RL)的搬运文章常晚于英文原版半年以上。中文资源适合入门与查漏,前沿判断请回到英文一手来源。

八、按阶段推荐表 ​

把上面全部资源按"你现在在哪一步"组织成行动清单:

阶段必做选做完成后你能
入门(0–1 个月)David Silver 课程前 7 讲 + Spinning Up 的 Intro to RL + 本站学习路径路线一Gymnasium 教程(本站或官方)讲清 MDP、TD、Q-learning,能跑通 CartPole
进阶(1–3 个月)Sutton & Barto 第 1–9 章 + CS285 前 8 讲 + CleanRL 抄 PPOLilian Weng 的 RLHF Survey、RLHF 相关看懂主流论文公式,能复现 DQN/PPO/SAC
研究 / 工程前沿(3 个月+)CS285 后半 + 按论文地图精读 10–15 篇经典 + Papers with Code 复现RL Weekly 每周跟进 + 会议论文形成独立判断,能批判性地读新论文

避坑提醒

网上大量 2016–2018 年的 RL 教程仍能搜到,但内容已过时(例如还在讲"DQN 是 SOTA"、把 Atari 当主战场)。判断标准很简单:教程里提到的 SOTA 算法是否是 2020 年以后的(PPO/SAC/Dreamer/IQL 等)。不是的话只当历史看。

九、社区与持续学习 ​

学了资源之后,还需要"待在其中"——RL 是快速变化的领域,社区是最好的信号源:

渠道地址用途
Reddit r/reinforcementlearninghttps://www.reddit.com/r/reinforcementlearning/业界/学界讨论、资源推荐、问题求助
Awesome RL 清单(aikorea/awesome-rl)https://github.com/aikorea/awesome-rl分类整理的 RL 资源大索引
NeurIPS / ICML / ICLRhttps://neurips.cc/ 、https://icml.cc/一年两度的前沿论文集中发布
arXiv cs.LGhttps://arxiv.org/list/cs.LG/recent每日新论文(配合关键词订阅)
学术 Twitter / 学者主页Levine、Schulman、Lilian Weng 等最快的前沿评论与工作进展

快速判断"一个资源值不值得看"的清单 ​

在收藏任何教程/博客/仓库之前,花 30 秒过一遍:

  1. 日期:最后更新是否在 1–2 年内?RL 领域一年算法代际就换。
  2. 基准:文中对比的 SOTA 是否仍为主流(PPO/SAC/Dreamer/IQL 这一代)?
  3. 可复现:有代码吗?代码能跑通吗(看 Issues 是否长期无人回应)?
  4. 出处:作者是否可查(机构、GitHub 主页)?还是营销号?
  5. 是否抄:与 Spinning Up / CleanRL 的内容结构高度雷同且无新增信息?那是二手转述,回原始出处更省时间。

本站怎么帮你

本站学习路径把上面这些外部资源编排成了三条主线;论文地图负责帮你从"看资源"升级到"读论文"。外部资源是"材料",本站页面是"地图",配合使用效率最高。

十、把资源变成能力的行动模板 ​

收藏 ≠ 学会。资源清单的真正价值在于被使用,这里给一个经过验证的四周节奏模板(可直接套在学习路径的系统精进线上使用):

周主题资源组合验收标准
第 1 周MDP 与表格法David Silver 第 1–4 讲 + Sutton & Barto 第 3–4 章 + 本站MDP能默写贝尔曼方程,能写出 Q-learning 更新公式
第 2 周价值学习Sutton & Barto 第 5–6 章 + Spinning Up 的 Intro to RL能说清 MC vs TD 的偏差-方差差异,跑通 CartPole 的 Q-learning
第 3 周策略梯度CS285 第 4–5 讲 + CleanRL 的 PPO 实现能逐项解释 PPO clip 目标,跑通 PPO 并画出学习曲线
第 4 周综合复现从论文地图挑 1 篇经典论文复现提交一个含"环境-算法-评估-复现"四要素的 README

三条使用纪律:

  1. 学完立即输出:每个资源只过一遍,学完立刻写笔记 / 跑代码 / 讲给别人听,禁止"只看不练"地囤课。
  2. 以结果验收:一门课的完成标志不是"视频看完",而是"跑出了自己的结果"。
  3. 控制并发资源:同时进行的课程不超过 2 门、教科书不超过 1 本。多资源并行通常是拖延的前奏,而不是勤奋。

常见问题(FAQ) ​

  • Q:收藏了很多课程却提不起劲开始? A:从"最小可行动作"开始——今天只看一讲视频、或只跑通一个 CartPole,别规划"一个月计划"再开始。
  • Q:资源太多,怎么知道该优先哪个? A:用上面的阶段表对号入座,优先"必做"列;本页第七节的避坑判断清单会帮你筛掉过时内容。
  • Q:英文资源吃力怎么办? A:先看第七节中文资源打底,再回到英文原版;术语对照用本站术语表。

与本站的关系

外部资源负责"喂知识",本站页面负责"建结构":每读完一个外部资源,回对应的本站概念页做一次"这个资源和本站说法有什么出入"的核对——这种主动加工是最有效的记忆方式。

十一、维护你自己的资源清单 ​

收藏夹会腐烂——书签会过期、课程会下线、版本会漂移。把"别人的清单"变成"自己的清单",只需要三条纪律:

  1. 每季度清理一次:删掉三个月没碰过的收藏。如果一项资源三个月都不值得打开,它大概率永远不值得打开。
  2. 给每项资源标状态:待看 / 在看 / 已吸收 / 已过时。状态变化本身就是进度感。
  3. 记录"哪里学到的":每学一个新概念,记下你第一次在哪看懂它(某篇博客、某讲课程、本站某页)。将来温习时,优先回你最懂的出处。

一个随手可用的清单模板(Markdown 即可,不必上工具):

markdown
## 正在学
- [课程名](进度 3/10 讲)→ 出自本站[精选资源清单](/resources/awesome)第 X 节
- [书名] 第 5 章

## 已吸收(可随时引用)
- 概念 X:用 [本站术语表](/resources/glossary) 对照,见[页面名](/concepts/value-based)

## 过时/弃用
- [老教程](2021 年,DQN 当 SOTA)

资源是手段不是目的:一个月后你记得的、能讲给别人听的、能跑出结果的,才是你真正拥有的。本站其余页面(学习路径、论文地图、框架与工具)会一直在这里,帮你把资源转化为能力。

延伸阅读 ​

参考资料 ​