外观
经典论文精读
一句话定位:这一页把改变 RL 的六篇里程碑论文逐篇精读——Bellman 1957(动态规划)、Watkins 1989/1992(Q-learning)、Mnih 2015(DQN)、Silver 2016(AlphaGo)、Schulman 2017(PPO)、Ouyang 2022(InstructGPT),每篇按"背景 → 方法 → 实验 → 局限 → 面试怎么答"展开,适合准备面试或想真正吃透算法的人,读完后你能在面试里把这些论文讲出"机制级"细节,而不只是报名字。
这些论文的共同点:每一篇都改变了一个前提。Bellman 让"序列决策"有了数学语言;Watkins 让"模型未知也能学";Mnih 让"高维输入也能学";AlphaGo 让"搜索与学习合流";PPO 让"稳定更新变得简单";InstructGPT 让"RL 走出环境、走进语言模型"。理解了"改了什么前提",你就在论文地图上给自己装了 GPS。
一、精读方法:六篇按什么顺序读、怎么读
建议顺序:Bellman → Q-learning → DQN → PPO → AlphaGo → InstructGPT。这是依赖链顺序:后一篇的机制建立在前一篇的概念上(比如 DQN 需要 Q-learning 的 off-policy,PPO 需要策略梯度)。
每篇建议的读法(对应阅读路径的 L3 细节级):先读摘要与结论锁定"这篇改了什么前提",再读方法部分推导核心公式,最后看实验表格验证"改前提确实带来效果"。数学推导卡住时,用三栏笔记法把"问题/方法/局限"分开记,不要在一个公式上死磕。
二、Bellman, A Markovian Decision Process(1957)
1. 背景:为什么说这篇是"一切的地基"
1950 年代之前,"决策"研究的是单次选择(博弈论)或确定性系统(经典控制)。Bellman 的贡献是把 "带延迟回报的序列决策" 提升为可计算的数学对象:马尔可夫决策过程(MDP)。此后所有 RL 论文——包括 2025 年的 LLM 推理 RL——使用的记号 (S, A, P, R, γ) 都出自这篇。
2. 方法:贝尔曼最优性方程
MDP 五元组与贝尔曼方程的精确定义见MDP 概念页,这里直接给核心:
text
状态价值(策略 π 下):
V^π(s) = Σ_a π(a|s) Σ_s' P(s'|s,a) [ R(s,a,s') + γ V^π(s') ]
最优性(价值迭代的核心):
V*(s) = max_a Σ_s' P(s'|s,a) [ R(s,a,s') + γ V*(s') ]三个关键机制:
- 最优性原理(principle of optimality):最优策略的任意后缀也是最优的。它让问题可以递归求解——这是"动态规划"这个名字的由来。
- 贝尔曼最优算子 T* 是压缩映射:对任意两个价值函数,
‖T*V₁ - T*V₂‖∞ ≤ γ‖V₁ - V₂‖∞。因此反复应用 T* 会收敛到唯一不动点 V*——这就是"价值迭代收敛"的数学本质,也是后面 Q-learning 收敛证明的模板。 - 价值迭代:从任意初始 V 开始反复
V ← T*V,收敛速度由 γ 控制。
3. 局限
需要已知的转移概率 P 与奖励 R;状态空间必须可枚举(表格法)。真实世界几乎不满足这两个条件——所以才有后面的论文。
4. 面试怎么答
问:为什么说所有 RL 算法都在逼近贝尔曼方程的解? 答框架:贝尔曼最优性方程 V* = TV 给出了"最优价值"的定义;环境已知时直接解(DP);环境未知时,蒙特卡洛用采样替代期望(TD 用单步采样 + bootstrap),Q-learning 把 max 应用到 Q 函数上,DQN 用神经网络表示 Q——本质都是在"模型未知"条件下逼近同一个不动点。
高频追问:γ 的作用?→ 折扣;γ<1 时回报有限、压缩映射保证收敛;γ 越小越短视、收敛越快。价值迭代 vs 策略迭代的区别?→ 价值迭代直接逼近 V*;策略迭代交替做策略评估与策略改进。
三、Watkins, Q-learning(1989 博士论文 / 1992 期刊)
1. 背景:去掉"已知模型"这个前提
Bellman 的方程需要 P 和 R。Watkins 的问题:只知道"试了某个动作、拿到了某个奖励"的样本,还能不能学到最优? 答案是可以——前提是引入 Q 函数并把它交给随机近似。
2. 方法:Q 函数与 off-policy 更新
Q-learning 定义的 Q(s,a) 是"在状态 s 执行 a,之后一直最优"的期望回报。更新规则:
text
Q(s,a) ← Q(s,a) + α [ r + γ max_a' Q(s',a') - Q(s,a) ]
└────────── TD 误差 δ ──────────┘off-policy 革命在这一个公式里:max_a' 使用的是"假设下一步最优"的目标值,与当前实际怎么选动作(ε-greedy、随机……)无关。也就是说:
- 行为策略(behavior policy,怎么收集数据)可以是任意的、有探索的;
- 目标策略(target policy,学什么)是贪心策略;
- 两者解耦 → 离线数据也能学(这直接预示了后来的离线 RL)。
对比 on-policy 的 SARSA 用 Q(s',a')(实际会执行的动作),Q-learning 更乐观激进。这个差异在"悬崖行走"这类环境里有质的差别,详见价值学习的 SARSA vs Q-learning 对照。
3. 收敛证明的直觉(Watkins & Dayan 1992 的核心贡献之一)
论文的收敛结果依赖条件:有限 MDP、状态-动作对无限次访问、学习率满足
text
Σ_t α_t = ∞ (保证更新能走到头)
Σ_t α_t² < ∞ (保证噪声被平均掉)证明直觉分两层:
- 把更新式看成"对贝尔曼最优算子 T* 的随机近似":每个样本是
r + γ max_a' Q(s',a'),它是对(T*Q)(s,a)的无偏采样; - T* 是 γ-压缩映射(Bellman 篇的机制),所以"无偏采样 + 压缩映射"的组合在随机近似理论(Robbins-Monro 框架)下收敛到唯一不动点 Q*。
关于证明的一点诚实补充
1992 年论文给出的收敛证明是当时的一版论证,后续学界对"一般条件下 Q-learning 收敛"的严格处理有更完整的讨论(如包含不充分探索时的不收敛反例)。面试中讲"压缩映射 + 随机近似的直觉"通常已足够;若被追问严格性,可以承认:收敛性依赖无限探索与学习率条件,这也是实践中要保证"访问所有状态动作对"的原因。
4. 局限
- 表格:Q 表要存下每个 (s,a),状态一爆炸就崩;
- max 算子引入系统性高估(噪声取 max 会抬高期望)——这是 DQN 之后 Double DQN 要解决的头号问题;
- 需要持续探索(如 ε-greedy),探索不足则不收敛。
5. 面试怎么答
问:Q-learning 为什么是 off-policy?它能用行为克隆数据训练吗? 答框架:off-policy 指目标策略(贪心,来自 max_a')与行为策略(收集数据的 ε-greedy 等)不同;更新只需要 (s,a,r,s') 四元组,所以历史数据、离线数据都可以用,只要状态-动作对覆盖充分。这也是它与 SARSA 的本质区别。
高频追问:Q-learning 会高估价值吗?→ 会,max 算子对噪声取最大值,系统性地抬高估计;Double DQN 解耦"选动作"与"估值"来缓解。为什么 ε 要衰减?→ 前期需要探索,后期需要利用;衰减太快漏访问,太慢收敛慢。
四、Mnih et al., Human-level control through deep reinforcement learning(DQN,2015,Nature)
1. 背景:从表格到神经网络的两个真问题
2013 年,Mnih 等人先发表了 Playing Atari with Deep Reinforcement Learning(arXiv:1312.5602)验证可行性;2015 年 Nature 版把系统做扎实,成为深度 RL 的里程碑。把 Q-learning 从表格搬到神经网络,直接撞上两个 Q-learning 时代不存在的真问题:
- 样本相关性:在线更新时,相邻帧高度相关,梯度更新会来回震荡;
- 自举的不稳定:目标
r + γ max Q本身就依赖正在更新的网络,一步更新同时改变"答案"和"问题",容易发散。
2. 方法:两大工程技巧
技巧一:经验回放(experience replay)。把每个转移 (s,a,r,s') 存进回放缓冲区,训练时随机均匀采样小批量,而不是按时间顺序使用:
text
在线使用(坏):s1→s2→s3→s4... 相邻样本高度相关,且用完即弃
回放(好): 随机抽 {s7,a7,r7,s7'} {s3,a3,r3,s3'} {s9,...} 破相关 + 复用作用:①打断时间相关性,让梯度近似满足 i.i.d. 假设;②一份经验多次使用,数据效率提高;③也缓解"最近经验的主导地位"。
技巧二:目标网络(target network)。维护一个冻结的目标网络 Q⁻,目标值用它计算,每隔 C 步才从在线网络拷贝一次权重(Nature 版 C=10000):
text
在线更新:Q(s,a) ← Q(s,a) + α[ r + γ max_a' Q⁻(s',a') - Q(s,a) ]
└─ 用冻结的目标网络算目标 ─┘
每隔 C 步:Q⁻ ← Q(拷贝权重)作用:目标值在一段时间内稳定,自举不再"追着自己的尾巴跑",训练大幅稳定。
3. 系统细节(Nature 版)
| 组件 | 设置 |
|---|---|
| 输入 | 84×84 灰度帧,最近 4 帧堆叠(提供运动信息) |
| 网络 | 3 层卷积 + 全连接,输出每个动作的 Q 值 |
| 帧跳过 | 每个动作重复 4 帧(降低计算量) |
| 探索 | ε-greedy,ε 从 1.0 线性衰减到 0.1,之后固定 |
| 优化器 | RMSProp |
| 损失 | 对 TD 误差做截断(Huber/clipped),降低离群样本的梯度 |
4. 结果与意义
- Nature 版在 49 个 Atari 游戏上评估,29 个超过人类专业玩家的平均水平;2013 版只在 7 个游戏上验证、其中 6 个超过当时的 SOTA——Nature 版是"从能学到全面超越"的工程化跃迁。
- 意义:端到端(像素 → 动作)的通用玩法第一次成立,深度 RL 时代开启。它是 Atari 案例页(Atari 与电子游戏)的主角。
5. 局限
- 动作空间必须离散(输出层是每个动作一个 Q 值);
- 高估问题依然存在(Double DQN 缓解,但未根除);
- 样本效率仍然低(需要数百万帧);
- 对超参数、网络结构敏感,复现性在当年是一大痛点。
6. 面试怎么答
问:为什么 DQN 需要经验回放和目标网络? 答框架:回放解决"样本时间相关 → 梯度不稳定"和"数据利用不充分";目标网络解决"目标值随自身更新漂移 → 自举发散"。两个技巧把深度 Q 学习从"训练不稳"变成"可训练"。
高频追问:回放缓冲区大小怎么影响训练?→ 太大则样本陈旧(策略变化后旧经验失真),太小则相关性高;经典值是 10^5~10^6 量级。目标网络更新太频繁会怎样?→ 又变回"追尾巴",不稳定。
五、Silver et al., Mastering the Game of Go with Deep Neural Networks and Tree Search(AlphaGo,2016,Nature)
1. 背景:围棋为什么"不可搜索"
围棋状态空间约 10^170,分支因子约 250,暴力搜索在数学上不可行。过去二十年最好的围棋程序(基于规则与人工评估)与职业棋手有不可逾越的差距。AlphaGo 的策略是用学习置换算力:不是搜尽所有走法,而是学会"哪些走法值得搜、搜到的地方价值是多少"。
2. 方法:三段训练 + 推理时搜索
第一段,SL 策略网络 p_σ(a|s):监督学习。在约 3000 万个来自人类高手的棋局(KGS 服务器)上,训练 13 层 CNN 预测"人类高手会下在哪",准确率约 57%。它学到的是人类落子的先验分布。
第二段,RL 策略网络 p_ρ(a|s):策略梯度强化。把 SL 网络作为初始,让它与自己历史版本对弈,用胜率做奖励做策略梯度。结果:对 SL 网络的胜率约 80%。它学到的是**"赢棋"而不是"像人类"**——比 SL 网络强但分布不同("模仿人类" vs "追求胜利"的经典矛盾,见策略梯度)。
第三段,价值网络 v_θ(s):回归网络。用 RL 策略网络自对弈生成约 3000 万个局面,训练网络直接预测"这个局面最终的胜率(以 RL 网络自对弈的角度)",均方误差约 0.23,显著优于快速 rollout 的约 0.48。
text
三段训练流水线:
人类棋谱 ──SL──> p_σ(学"人类会怎么下")──策略梯度──> p_ρ(学"怎么赢")
│ 自对弈生成局面
▼
v_θ(学"局面价值")
推理时:MCTS 中,p_ρ 提供先验概率、v_θ 提供叶节点价值评估,
二者合成搜索的引导信号 —— "搜索×学习"合流推理时:MCTS。蒙特卡洛树搜索的四个步骤(选择/扩展/模拟/回传)与 UCB 变体详见AlphaGo 与 MCTS 案例。AlphaGo 的独特处在于:树中每个节点用策略网络给出先验 P(a|s),搜索的选择分数与先验成正比("值得探索的候选被网络提前筛掉");叶节点用价值网络 + 快速 rollout 混合评估。训练好的系统在比赛时用约 1202 个 CPU 和 176 个 GPU 的分布式版,单机版约 48 个 CPU 和 8 个 GPU。
3. 结果与意义
- 2015 年 10 月以 5:0 击败欧洲冠军樊麾(首位战胜职业棋手的计算机程序);
- 2016 年 3 月以 4:1 击败世界顶尖棋手李世石(第 4 局李世石"神之一手"获胜,也是围棋史上著名的时刻)。
- 意义:不仅是"AI 下棋赢了人",更是把监督学习、强化学习、树搜索三个流派合成一个系统——三个流派各自单独都无法击败顶级棋手,合起来可以。这被公认为深度 RL 与 AI 的标志性事件。
4. 局限
- 训练成本极高(数千 GPU/TPU 算力当量),无法推广到一般任务;
- SL 阶段依赖人类棋谱(AlphaZero 随后用纯自对弈去掉了它);
- 双网络 + 分布式 rollout 的系统工程复杂度极高。
5. 面试怎么答
问:AlphaGo 的三段训练分别解决什么问题? 答框架:SL 网络解决"初始化与先验"(人类高手在哪下,给搜索一个靠谱起点);RL 网络解决"从像人类到能赢"(自对弈强化拉开与 SL 的差距);价值网络解决"评估局面"(自对弈数据上回归胜负,替代昂贵的 rollout)。推理时 MCTS 把"策略先验 × 价值评估"合成搜索信号——学习的产出成为搜索的输入。
高频追问:价值网络为什么不用人类棋谱训练?→ 人类棋谱的胜负样本分布偏离 RL 网络的实际对局分布;用 RL 自对弈数据训练,评估对象与真实使用一致。AlphaZero 相比 AlphaGo 改了哪一段?→ 去掉了 SL 段与领域特征,纯自对弈从零学,见论文地图与基于模型的 RL。
六、Schulman et al., Proximal Policy Optimization Algorithms(PPO,2017)
1. 背景:TRPO 稳定但复杂,工程上不好用
2015 年的 TRPO(arXiv:1502.05477)证明了"限制更新步幅(信任域)"能让策略梯度稳定,但它要求解一个带 KL 约束的二次规划:需要 Fisher 信息矩阵、共轭梯度、线性搜索——实现复杂、调参痛苦、难以大规模并行。PPO 的问题是:能不能用一阶优化近似信任域,既稳定又简单?
2. 方法:clip 目标
记新旧策略的概率比为 r_t(θ) = π_θ(a_t|s_t) / π_θold(a_t|s_t)(θold 是收集数据时用的旧参数)。PPO 的目标:
text
L^CLIP(θ) = E_t[ min( r_t(θ) Â_t, clip(r_t(θ), 1-ε, 1+ε) Â_t ) ], ε=0.2
直觉拆解:
· Â_t 是优势估计(用 GAE 算,"这步比平均好多少")
· 当优势为正(好动作):r_t 超过 1+ε 时,目标被 clip 住 → 不再鼓励"一次更新走太远"
· 当优势为负(坏动作):r_t 低于 1-ε 时,同样被 clip 住 → 不会因为一次坏样本把概率打得太狠
· min() 保证:如果 unclipped 目标更低,就取 unclipped —— 目标不会被人为抬高关键点:clip 限制的是新旧策略的"概率比"(相对变化),而不是参数距离或动作距离。这给了 PPO"信任域"效果,却只需要一阶梯度。
完整算法(每轮迭代):
text
1. 用当前策略 π_θold 收集一批轨迹
2. 用 GAE 计算每个时刻的优势 Â_t(见[策略梯度](/concepts/policy-gradient))
3. 对同批数据做 K 个 epoch、小批量梯度上升,最大化 L^CLIP
4. 用 TD 误差更新 critic 网络;θold ← θ3. 为什么取代 TRPO(论文与后来实践给出的答案)
| 维度 | TRPO | PPO |
|---|---|---|
| 优化方式 | 二阶(Fisher 矩阵 + 共轭梯度) | 一阶(标准梯度上升) |
| 约束形式 | 硬性 KL 约束 | clip 软约束(近似) |
| 实现复杂度 | 高(线性搜索、矩阵运算) | 低(几行代码) |
| 并行/大规模 | 麻烦 | 天然适合(可复用数据做多 epoch) |
| 稳定性 | 强(约束严格) | 强(clip 足够逼近) |
论文在 Atari 与 MuJoCo 上验证:PPO 的样本效率与稳定性达到或超过 TRPO、A2C 等当时主流方法,而实现简单一个量级。它同时成为 OpenAI 等机构做语言模型 RLHF 微调的主力优化器——LLM 对齐案例里 PPO 微调阶段用的就是它。
4. 局限
- 仍然 on-policy(每批数据用完即弃),样本效率低于 off-policy 方法;
- clip 的 ε 要调;ε 太大近似失效、太小步子太碎;
- 对 reward 尺度敏感(RLHF 里靠 KL 惩罚解决,见RLHF)。
5. 面试怎么答
问:PPO 的 clip 到底在限制什么?为什么能替代 TRPO 的硬约束? 答框架:限制"新旧策略概率比 r_t(θ)",即每次更新的步子;当单次样本把概率比推过 [1-ε, 1+ε] 时目标被裁剪,防止一步更新过大。因为概率比小范围的偏差近似等价于信任域内的小 KL 距离,所以 clip 是一阶可实现的近似信任域——稳定性和 TRPO 相当,复杂度却降了一个量级。
高频追问:为什么用 min 和 clip 的组合而不是直接 clip?→ 防止"clip 目标被人为抬高":unclipped 目标更低时按真实值走,避免策略在有利位置被误导。ε 为什么取 0.2?→ 论文经验值;Atari/MuJoCo 上 0.1~0.3 都稳定。PPO 是 on-policy 还是 off-policy?→ on-policy(行为与目标同一策略),但数据可以做多 epoch 小批量复用。
七、Ouyang et al., Training Language Models to Follow Instructions with Human Feedback(InstructGPT,2022,arXiv:2203.02155)
1. 背景:预训练模型"会接话,不会干活"
GPT-3 能续写任何文本,但用户给它一句指令,它不一定照做——可能答非所问、可能编造事实、可能输出有害内容。原因:预训练目标是"预测下一个 token",不是"满足用户意图"。行为克隆(SFT)只能教"格式",教不会"什么叫好回答"——因为"好"是主观的、无法穷举标注。InstructGPT 的答案是:把"人类偏好"变成奖励信号,用 RL 优化。
2. 方法:三阶段流水线
阶段一,SFT(有监督微调):收集约 13k 条提示(来自 OpenAI API 用户的真实提示),让标注员写期望回答,微调 GPT-3。得到 SFT 模型。局限:SFT 模型学到的是"像标注员的回答",不是"用户更喜欢",且只有少量样本。
阶段二,奖励模型(Reward Model):对同一提示让 SFT 模型生成 4~9 个回答,标注员排序(而不是打分——排序更稳定)。用 Bradley-Terry 模型把排序建模成对数几率,训练 RM:
text
loss = -E[ log σ( r_θ(x, y_w) - r_θ(x, y_l) ) ]
# y_w 是被标注更优的回答,y_l 是更差的
# r_θ 给"回答有多好"打一个标量分这个 RM 把"人类直觉"变成了可求导的奖励函数。偏好排序的原理见RLHF 概念页的 Bradley-Terry 部分。
阶段三,PPO 微调:用 RM 的输出做奖励,对 SFT 模型做 PPO。关键工程细节:参考模型与 KL 惩罚——RLHF 优化目标:
text
maximize E[ r_φ(x, y) ] - β · KL( π_θ(y|x) ‖ π_SFT(y|x) )
# 既要讨好奖励模型,又不许偏离 SFT 太远(β=0.02 量级)KL 惩罚防止策略"钻奖励模型的空子"(过度优化,见奖励工程)。此外论文还混入少量预训练梯度(ppo-ptx)防止模型丢失通用语言能力。
3. 结果(人类评估)
- 1.3B 的 InstructGPT 在人类评估中胜过 175B 的 GPT-3——不是"更小更好",而是"对齐的收益大于规模的差距";
- 输出更"有帮助"(更符合指令要求)、更诚实(TruthfulQA 上幻觉明显减少)、在有害性上有所改善;
- 对齐税:在标准学术基准(SQuAD、HellaSwag、WMT 等)上平均小幅下降(约 0.4%)——"取悦人类偏好"与"优化基准分数"并不完全一致。
常被误解的一点
InstructGPT 的"RLHF"里的奖励不是某个游戏得分,而是奖励模型的打分——奖励模型本身是学出来的、有偏差的。所以 RLHF 从第一性上就存在"奖励模型错 → 策略顺着错的奖励走"的风险,这就是奖励过度优化讨论的前沿问题。
4. 局限
- 人类标注昂贵,偏好数据的规模、质量决定上限;
- 奖励模型是代理目标,RLHF 训练对偏好分布敏感;
- 论文自身的评估者也是标注员群体,存在主观性与潜在偏差;
- 三阶段工程复杂(SFT 模型 + RM + 参考模型 + 策略 + critic 五个模型同时在场),见LLM 对齐案例的实战拆解。
5. 面试怎么答
问:InstructGPT 为什么不用纯 SFT 或直接拿奖励做监督学习? 答框架:SFT 教"格式"不教"质量";奖励模型把人类偏好变成可优化目标;PPO 则能在这个非可微奖励上做策略优化——RLHF 三阶段是"人类判断 → 可微奖励 → 策略优化"的完整链路。其中 KL 惩罚是关键护栏:它防止策略偏离 SFT 过远,也是后续"奖励过度优化"研究的出发点。
高频追问:为什么用排序而非打分训练 RM?→ 人对相对好坏更稳定、跨标注员更一致。KL 惩罚的 β 太大会怎样?→ 策略几乎不动,对齐失效;太小 → 过度优化奖励模型,输出退化成模式崩塌。DPO 和 InstructGPT 的区别?→ DPO 用偏好闭式解免去 RM 与 PPO,见RLHF。
八、六篇串成一条线:面试前的 5 分钟回顾
text
Bellman 1957 定义"最优"是什么 V* = max [R + γV*](压缩映射)
↓
Watkins 1992 不知道模型也能学 Q 更新 = 随机近似 + 压缩映射;off-policy
↓
Mnih 2015 高维输入也能学 回放破相关 + 目标网络稳自举
↓
Schulman 2017 稳定更新变得简单 clip 概率比 ≈ 一阶信任域
↓
Silver 2016 学习×搜索合流 三段训练 + MCTS;用学习置换算力
↓
Ouyang 2022 RL 走出环境走进语言 三阶段(SFT→RM→PPO+KL)面试前把这张链讲一遍(每一环都说"上一环留了什么坑、这一环怎么填"),任何"为什么"类问题都接得住。
延伸阅读
- 论文地图 —— 把六篇放进六条支流与七十年时间轴的全局坐标系。
- 价值学习 —— Bellman/Q-learning/DQN 的机制级展开(DP、MC/TD、SARSA、Rainbow)。
- 策略梯度 —— REINFORCE 到 PPO 的机制级展开(GAE、baseline、clip)。
- RLHF 与人类反馈对齐 —— InstructGPT 三阶段的机制级展开(Bradley-Terry、KL、DPO)。
- AlphaGo 与蒙特卡洛树搜索 —— AlphaGo 的完整案例:MCTS 四步、三段训练、AlphaZero/MuZero 演进。
- LLM 对齐:RLHF 实战 —— InstructGPT 的工程视角:三模型同台、对齐税、开源复刻。
参考资料
- Bellman, R. (1957). A Markovian Decision Process. Indiana University Mathematics Journal 6(4):679–684. https://doi.org/10.1512/iumj.1957.6.56038
- Watkins, C. J. C. H. (1989). Learning from Delayed Rewards(博士论文). University of Cambridge. https://www.cs.rhul.ac.uk/~chrisw/new_thesis.pdf —— 可公开获取的原始博士论文。
- Watkins, C. J. C. H., & Dayan, P. (1992). Q-learning. Machine Learning 8(3):279–292. https://link.springer.com/article/10.1007/BF00992698
- Mnih, V., et al. (2013). Playing Atari with Deep Reinforcement Learning. arXiv:1312.5602. https://arxiv.org/abs/1312.5602
- Mnih, V., et al. (2015). Human-level control through deep reinforcement learning. Nature 518:529–533. https://www.nature.com/articles/nature14236
- Silver, D., et al. (2016). Mastering the Game of Go with Deep Neural Networks and Tree Search. Nature 529:484–489. https://www.nature.com/articles/nature16961
- Schulman, J., et al. (2015). Trust Region Policy Optimization. arXiv:1502.05477. https://arxiv.org/abs/1502.05477
- Schulman, J., et al. (2017). Proximal Policy Optimization Algorithms. arXiv:1707.06347. https://arxiv.org/abs/1707.06347
- Ouyang, L., et al. (2022). Training Language Models to Follow Instructions with Human Feedback(InstructGPT). arXiv:2203.02155. https://arxiv.org/abs/2203.02155
- Sutton, R. S., & Barto, A. G. (2018). Reinforcement Learning: An Introduction (2nd ed.). MIT Press. https://incompleteideas.net/book/RLbook2020.pdf