Skip to content

经典论文精读

本页速览 逐篇精读改变 RL 的经典论文:Bellman 动态规划、Watkins Q-learning、Mnih DQN、Schulman PPO、Silver AlphaGo、Ouyang InstructGPT;每篇的背景、方法、实验、局限与"面试怎么答"。

经典论文精读 ​

一句话定位:这一页把改变 RL 的六篇里程碑论文逐篇精读——Bellman 1957(动态规划)、Watkins 1989/1992(Q-learning)、Mnih 2015(DQN)、Silver 2016(AlphaGo)、Schulman 2017(PPO)、Ouyang 2022(InstructGPT),每篇按"背景 → 方法 → 实验 → 局限 → 面试怎么答"展开,适合准备面试或想真正吃透算法的人,读完后你能在面试里把这些论文讲出"机制级"细节,而不只是报名字。

这些论文的共同点:每一篇都改变了一个前提。Bellman 让"序列决策"有了数学语言;Watkins 让"模型未知也能学";Mnih 让"高维输入也能学";AlphaGo 让"搜索与学习合流";PPO 让"稳定更新变得简单";InstructGPT 让"RL 走出环境、走进语言模型"。理解了"改了什么前提",你就在论文地图上给自己装了 GPS。

一、精读方法:六篇按什么顺序读、怎么读 ​

建议顺序:Bellman → Q-learning → DQN → PPO → AlphaGo → InstructGPT。这是依赖链顺序:后一篇的机制建立在前一篇的概念上(比如 DQN 需要 Q-learning 的 off-policy,PPO 需要策略梯度)。

每篇建议的读法(对应阅读路径的 L3 细节级):先读摘要与结论锁定"这篇改了什么前提",再读方法部分推导核心公式,最后看实验表格验证"改前提确实带来效果"。数学推导卡住时,用三栏笔记法把"问题/方法/局限"分开记,不要在一个公式上死磕。

二、Bellman, A Markovian Decision Process(1957) ​

1. 背景:为什么说这篇是"一切的地基" ​

1950 年代之前,"决策"研究的是单次选择(博弈论)或确定性系统(经典控制)。Bellman 的贡献是把 "带延迟回报的序列决策" 提升为可计算的数学对象:马尔可夫决策过程(MDP)。此后所有 RL 论文——包括 2025 年的 LLM 推理 RL——使用的记号 (S, A, P, R, γ) 都出自这篇。

2. 方法:贝尔曼最优性方程 ​

MDP 五元组与贝尔曼方程的精确定义见MDP 概念页,这里直接给核心:

text
状态价值(策略 π 下):
V^π(s) = Σ_a π(a|s) Σ_s' P(s'|s,a) [ R(s,a,s') + γ V^π(s') ]

最优性(价值迭代的核心):
V*(s) = max_a Σ_s' P(s'|s,a) [ R(s,a,s') + γ V*(s') ]

三个关键机制:

  1. 最优性原理(principle of optimality):最优策略的任意后缀也是最优的。它让问题可以递归求解——这是"动态规划"这个名字的由来。
  2. 贝尔曼最优算子 T* 是压缩映射:对任意两个价值函数,‖T*V₁ - T*V₂‖∞ ≤ γ‖V₁ - V₂‖∞。因此反复应用 T* 会收敛到唯一不动点 V*——这就是"价值迭代收敛"的数学本质,也是后面 Q-learning 收敛证明的模板。
  3. 价值迭代:从任意初始 V 开始反复 V ← T*V,收敛速度由 γ 控制。

3. 局限 ​

需要已知的转移概率 P 与奖励 R;状态空间必须可枚举(表格法)。真实世界几乎不满足这两个条件——所以才有后面的论文。

4. 面试怎么答 ​

问:为什么说所有 RL 算法都在逼近贝尔曼方程的解? 答框架:贝尔曼最优性方程 V* = TV 给出了"最优价值"的定义;环境已知时直接解(DP);环境未知时,蒙特卡洛用采样替代期望(TD 用单步采样 + bootstrap),Q-learning 把 max 应用到 Q 函数上,DQN 用神经网络表示 Q——本质都是在"模型未知"条件下逼近同一个不动点。

高频追问:γ 的作用?→ 折扣;γ<1 时回报有限、压缩映射保证收敛;γ 越小越短视、收敛越快。价值迭代 vs 策略迭代的区别?→ 价值迭代直接逼近 V*;策略迭代交替做策略评估与策略改进。

三、Watkins, Q-learning(1989 博士论文 / 1992 期刊) ​

1. 背景:去掉"已知模型"这个前提 ​

Bellman 的方程需要 P 和 R。Watkins 的问题:只知道"试了某个动作、拿到了某个奖励"的样本,还能不能学到最优? 答案是可以——前提是引入 Q 函数并把它交给随机近似。

2. 方法:Q 函数与 off-policy 更新 ​

Q-learning 定义的 Q(s,a) 是"在状态 s 执行 a,之后一直最优"的期望回报。更新规则:

text
Q(s,a) ← Q(s,a) + α [ r + γ max_a' Q(s',a') - Q(s,a) ]
              └────────── TD 误差 δ ──────────┘

off-policy 革命在这一个公式里:max_a' 使用的是"假设下一步最优"的目标值,与当前实际怎么选动作(ε-greedy、随机……)无关。也就是说:

  • 行为策略(behavior policy,怎么收集数据)可以是任意的、有探索的;
  • 目标策略(target policy,学什么)是贪心策略;
  • 两者解耦 → 离线数据也能学(这直接预示了后来的离线 RL)。

对比 on-policy 的 SARSA 用 Q(s',a')(实际会执行的动作),Q-learning 更乐观激进。这个差异在"悬崖行走"这类环境里有质的差别,详见价值学习的 SARSA vs Q-learning 对照。

3. 收敛证明的直觉(Watkins & Dayan 1992 的核心贡献之一) ​

论文的收敛结果依赖条件:有限 MDP、状态-动作对无限次访问、学习率满足

text
Σ_t α_t = ∞     (保证更新能走到头)
Σ_t α_t² < ∞    (保证噪声被平均掉)

证明直觉分两层:

  1. 把更新式看成"对贝尔曼最优算子 T* 的随机近似":每个样本是 r + γ max_a' Q(s',a'),它是对 (T*Q)(s,a) 的无偏采样;
  2. T* 是 γ-压缩映射(Bellman 篇的机制),所以"无偏采样 + 压缩映射"的组合在随机近似理论(Robbins-Monro 框架)下收敛到唯一不动点 Q*。

关于证明的一点诚实补充

1992 年论文给出的收敛证明是当时的一版论证,后续学界对"一般条件下 Q-learning 收敛"的严格处理有更完整的讨论(如包含不充分探索时的不收敛反例)。面试中讲"压缩映射 + 随机近似的直觉"通常已足够;若被追问严格性,可以承认:收敛性依赖无限探索与学习率条件,这也是实践中要保证"访问所有状态动作对"的原因。

4. 局限 ​

  • 表格:Q 表要存下每个 (s,a),状态一爆炸就崩;
  • max 算子引入系统性高估(噪声取 max 会抬高期望)——这是 DQN 之后 Double DQN 要解决的头号问题;
  • 需要持续探索(如 ε-greedy),探索不足则不收敛。

5. 面试怎么答 ​

问:Q-learning 为什么是 off-policy?它能用行为克隆数据训练吗? 答框架:off-policy 指目标策略(贪心,来自 max_a')与行为策略(收集数据的 ε-greedy 等)不同;更新只需要 (s,a,r,s') 四元组,所以历史数据、离线数据都可以用,只要状态-动作对覆盖充分。这也是它与 SARSA 的本质区别。

高频追问:Q-learning 会高估价值吗?→ 会,max 算子对噪声取最大值,系统性地抬高估计;Double DQN 解耦"选动作"与"估值"来缓解。为什么 ε 要衰减?→ 前期需要探索,后期需要利用;衰减太快漏访问,太慢收敛慢。

四、Mnih et al., Human-level control through deep reinforcement learning(DQN,2015,Nature) ​

1. 背景:从表格到神经网络的两个真问题 ​

2013 年,Mnih 等人先发表了 Playing Atari with Deep Reinforcement Learning(arXiv:1312.5602)验证可行性;2015 年 Nature 版把系统做扎实,成为深度 RL 的里程碑。把 Q-learning 从表格搬到神经网络,直接撞上两个 Q-learning 时代不存在的真问题:

  • 样本相关性:在线更新时,相邻帧高度相关,梯度更新会来回震荡;
  • 自举的不稳定:目标 r + γ max Q 本身就依赖正在更新的网络,一步更新同时改变"答案"和"问题",容易发散。

2. 方法:两大工程技巧 ​

技巧一:经验回放(experience replay)。把每个转移 (s,a,r,s') 存进回放缓冲区,训练时随机均匀采样小批量,而不是按时间顺序使用:

text
在线使用(坏):s1→s2→s3→s4...  相邻样本高度相关,且用完即弃
回放(好):   随机抽 {s7,a7,r7,s7'} {s3,a3,r3,s3'} {s9,...}  破相关 + 复用

作用:①打断时间相关性,让梯度近似满足 i.i.d. 假设;②一份经验多次使用,数据效率提高;③也缓解"最近经验的主导地位"。

技巧二:目标网络(target network)。维护一个冻结的目标网络 Q⁻,目标值用它计算,每隔 C 步才从在线网络拷贝一次权重(Nature 版 C=10000):

text
在线更新:Q(s,a) ← Q(s,a) + α[ r + γ max_a' Q⁻(s',a') - Q(s,a) ]
                                        └─ 用冻结的目标网络算目标 ─┘
每隔 C 步:Q⁻ ← Q(拷贝权重)

作用:目标值在一段时间内稳定,自举不再"追着自己的尾巴跑",训练大幅稳定。

3. 系统细节(Nature 版) ​

组件设置
输入84×84 灰度帧,最近 4 帧堆叠(提供运动信息)
网络3 层卷积 + 全连接,输出每个动作的 Q 值
帧跳过每个动作重复 4 帧(降低计算量)
探索ε-greedy,ε 从 1.0 线性衰减到 0.1,之后固定
优化器RMSProp
损失对 TD 误差做截断(Huber/clipped),降低离群样本的梯度

4. 结果与意义 ​

  • Nature 版在 49 个 Atari 游戏上评估,29 个超过人类专业玩家的平均水平;2013 版只在 7 个游戏上验证、其中 6 个超过当时的 SOTA——Nature 版是"从能学到全面超越"的工程化跃迁。
  • 意义:端到端(像素 → 动作)的通用玩法第一次成立,深度 RL 时代开启。它是 Atari 案例页(Atari 与电子游戏)的主角。

5. 局限 ​

  • 动作空间必须离散(输出层是每个动作一个 Q 值);
  • 高估问题依然存在(Double DQN 缓解,但未根除);
  • 样本效率仍然低(需要数百万帧);
  • 对超参数、网络结构敏感,复现性在当年是一大痛点。

6. 面试怎么答 ​

问:为什么 DQN 需要经验回放和目标网络? 答框架:回放解决"样本时间相关 → 梯度不稳定"和"数据利用不充分";目标网络解决"目标值随自身更新漂移 → 自举发散"。两个技巧把深度 Q 学习从"训练不稳"变成"可训练"。

高频追问:回放缓冲区大小怎么影响训练?→ 太大则样本陈旧(策略变化后旧经验失真),太小则相关性高;经典值是 10^5~10^6 量级。目标网络更新太频繁会怎样?→ 又变回"追尾巴",不稳定。

五、Silver et al., Mastering the Game of Go with Deep Neural Networks and Tree Search(AlphaGo,2016,Nature) ​

1. 背景:围棋为什么"不可搜索" ​

围棋状态空间约 10^170,分支因子约 250,暴力搜索在数学上不可行。过去二十年最好的围棋程序(基于规则与人工评估)与职业棋手有不可逾越的差距。AlphaGo 的策略是用学习置换算力:不是搜尽所有走法,而是学会"哪些走法值得搜、搜到的地方价值是多少"。

2. 方法:三段训练 + 推理时搜索 ​

第一段,SL 策略网络 p_σ(a|s):监督学习。在约 3000 万个来自人类高手的棋局(KGS 服务器)上,训练 13 层 CNN 预测"人类高手会下在哪",准确率约 57%。它学到的是人类落子的先验分布。

第二段,RL 策略网络 p_ρ(a|s):策略梯度强化。把 SL 网络作为初始,让它与自己历史版本对弈,用胜率做奖励做策略梯度。结果:对 SL 网络的胜率约 80%。它学到的是**"赢棋"而不是"像人类"**——比 SL 网络强但分布不同("模仿人类" vs "追求胜利"的经典矛盾,见策略梯度)。

第三段,价值网络 v_θ(s):回归网络。用 RL 策略网络自对弈生成约 3000 万个局面,训练网络直接预测"这个局面最终的胜率(以 RL 网络自对弈的角度)",均方误差约 0.23,显著优于快速 rollout 的约 0.48。

text
三段训练流水线:
人类棋谱 ──SL──>  p_σ(学"人类会怎么下")──策略梯度──> p_ρ(学"怎么赢")
                                                      │ 自对弈生成局面
                                                      ▼
                                              v_θ(学"局面价值")

推理时:MCTS 中,p_ρ 提供先验概率、v_θ 提供叶节点价值评估,
        二者合成搜索的引导信号 —— "搜索×学习"合流

推理时:MCTS。蒙特卡洛树搜索的四个步骤(选择/扩展/模拟/回传)与 UCB 变体详见AlphaGo 与 MCTS 案例。AlphaGo 的独特处在于:树中每个节点用策略网络给出先验 P(a|s),搜索的选择分数与先验成正比("值得探索的候选被网络提前筛掉");叶节点用价值网络 + 快速 rollout 混合评估。训练好的系统在比赛时用约 1202 个 CPU 和 176 个 GPU 的分布式版,单机版约 48 个 CPU 和 8 个 GPU。

3. 结果与意义 ​

  • 2015 年 10 月以 5:0 击败欧洲冠军樊麾(首位战胜职业棋手的计算机程序);
  • 2016 年 3 月以 4:1 击败世界顶尖棋手李世石(第 4 局李世石"神之一手"获胜,也是围棋史上著名的时刻)。
  • 意义:不仅是"AI 下棋赢了人",更是把监督学习、强化学习、树搜索三个流派合成一个系统——三个流派各自单独都无法击败顶级棋手,合起来可以。这被公认为深度 RL 与 AI 的标志性事件。

4. 局限 ​

  • 训练成本极高(数千 GPU/TPU 算力当量),无法推广到一般任务;
  • SL 阶段依赖人类棋谱(AlphaZero 随后用纯自对弈去掉了它);
  • 双网络 + 分布式 rollout 的系统工程复杂度极高。

5. 面试怎么答 ​

问:AlphaGo 的三段训练分别解决什么问题? 答框架:SL 网络解决"初始化与先验"(人类高手在哪下,给搜索一个靠谱起点);RL 网络解决"从像人类到能赢"(自对弈强化拉开与 SL 的差距);价值网络解决"评估局面"(自对弈数据上回归胜负,替代昂贵的 rollout)。推理时 MCTS 把"策略先验 × 价值评估"合成搜索信号——学习的产出成为搜索的输入。

高频追问:价值网络为什么不用人类棋谱训练?→ 人类棋谱的胜负样本分布偏离 RL 网络的实际对局分布;用 RL 自对弈数据训练,评估对象与真实使用一致。AlphaZero 相比 AlphaGo 改了哪一段?→ 去掉了 SL 段与领域特征,纯自对弈从零学,见论文地图与基于模型的 RL。

六、Schulman et al., Proximal Policy Optimization Algorithms(PPO,2017) ​

1. 背景:TRPO 稳定但复杂,工程上不好用 ​

2015 年的 TRPO(arXiv:1502.05477)证明了"限制更新步幅(信任域)"能让策略梯度稳定,但它要求解一个带 KL 约束的二次规划:需要 Fisher 信息矩阵、共轭梯度、线性搜索——实现复杂、调参痛苦、难以大规模并行。PPO 的问题是:能不能用一阶优化近似信任域,既稳定又简单?

2. 方法:clip 目标 ​

记新旧策略的概率比为 r_t(θ) = π_θ(a_t|s_t) / π_θold(a_t|s_t)(θold 是收集数据时用的旧参数)。PPO 的目标:

text
L^CLIP(θ) = E_t[ min( r_t(θ) Â_t,  clip(r_t(θ), 1-ε, 1+ε) Â_t ) ],  ε=0.2

直觉拆解:
· Â_t 是优势估计(用 GAE 算,"这步比平均好多少")
· 当优势为正(好动作):r_t 超过 1+ε 时,目标被 clip 住 → 不再鼓励"一次更新走太远"
· 当优势为负(坏动作):r_t 低于 1-ε 时,同样被 clip 住 → 不会因为一次坏样本把概率打得太狠
· min() 保证:如果 unclipped 目标更低,就取 unclipped —— 目标不会被人为抬高

关键点:clip 限制的是新旧策略的"概率比"(相对变化),而不是参数距离或动作距离。这给了 PPO"信任域"效果,却只需要一阶梯度。

完整算法(每轮迭代):

text
1. 用当前策略 π_θold 收集一批轨迹
2. 用 GAE 计算每个时刻的优势 Â_t(见[策略梯度](/concepts/policy-gradient))
3. 对同批数据做 K 个 epoch、小批量梯度上升,最大化 L^CLIP
4. 用 TD 误差更新 critic 网络;θold ← θ

3. 为什么取代 TRPO(论文与后来实践给出的答案) ​

维度TRPOPPO
优化方式二阶(Fisher 矩阵 + 共轭梯度)一阶(标准梯度上升)
约束形式硬性 KL 约束clip 软约束(近似)
实现复杂度高(线性搜索、矩阵运算)低(几行代码)
并行/大规模麻烦天然适合(可复用数据做多 epoch)
稳定性强(约束严格)强(clip 足够逼近)

论文在 Atari 与 MuJoCo 上验证:PPO 的样本效率与稳定性达到或超过 TRPO、A2C 等当时主流方法,而实现简单一个量级。它同时成为 OpenAI 等机构做语言模型 RLHF 微调的主力优化器——LLM 对齐案例里 PPO 微调阶段用的就是它。

4. 局限 ​

  • 仍然 on-policy(每批数据用完即弃),样本效率低于 off-policy 方法;
  • clip 的 ε 要调;ε 太大近似失效、太小步子太碎;
  • 对 reward 尺度敏感(RLHF 里靠 KL 惩罚解决,见RLHF)。

5. 面试怎么答 ​

问:PPO 的 clip 到底在限制什么?为什么能替代 TRPO 的硬约束? 答框架:限制"新旧策略概率比 r_t(θ)",即每次更新的步子;当单次样本把概率比推过 [1-ε, 1+ε] 时目标被裁剪,防止一步更新过大。因为概率比小范围的偏差近似等价于信任域内的小 KL 距离,所以 clip 是一阶可实现的近似信任域——稳定性和 TRPO 相当,复杂度却降了一个量级。

高频追问:为什么用 min 和 clip 的组合而不是直接 clip?→ 防止"clip 目标被人为抬高":unclipped 目标更低时按真实值走,避免策略在有利位置被误导。ε 为什么取 0.2?→ 论文经验值;Atari/MuJoCo 上 0.1~0.3 都稳定。PPO 是 on-policy 还是 off-policy?→ on-policy(行为与目标同一策略),但数据可以做多 epoch 小批量复用。

七、Ouyang et al., Training Language Models to Follow Instructions with Human Feedback(InstructGPT,2022,arXiv:2203.02155) ​

1. 背景:预训练模型"会接话,不会干活" ​

GPT-3 能续写任何文本,但用户给它一句指令,它不一定照做——可能答非所问、可能编造事实、可能输出有害内容。原因:预训练目标是"预测下一个 token",不是"满足用户意图"。行为克隆(SFT)只能教"格式",教不会"什么叫好回答"——因为"好"是主观的、无法穷举标注。InstructGPT 的答案是:把"人类偏好"变成奖励信号,用 RL 优化。

2. 方法:三阶段流水线 ​

阶段一,SFT(有监督微调):收集约 13k 条提示(来自 OpenAI API 用户的真实提示),让标注员写期望回答,微调 GPT-3。得到 SFT 模型。局限:SFT 模型学到的是"像标注员的回答",不是"用户更喜欢",且只有少量样本。

阶段二,奖励模型(Reward Model):对同一提示让 SFT 模型生成 4~9 个回答,标注员排序(而不是打分——排序更稳定)。用 Bradley-Terry 模型把排序建模成对数几率,训练 RM:

text
loss = -E[ log σ( r_θ(x, y_w) - r_θ(x, y_l) ) ]
   # y_w 是被标注更优的回答,y_l 是更差的
   # r_θ 给"回答有多好"打一个标量分

这个 RM 把"人类直觉"变成了可求导的奖励函数。偏好排序的原理见RLHF 概念页的 Bradley-Terry 部分。

阶段三,PPO 微调:用 RM 的输出做奖励,对 SFT 模型做 PPO。关键工程细节:参考模型与 KL 惩罚——RLHF 优化目标:

text
maximize E[ r_φ(x, y) ] - β · KL( π_θ(y|x) ‖ π_SFT(y|x) )
   # 既要讨好奖励模型,又不许偏离 SFT 太远(β=0.02 量级)

KL 惩罚防止策略"钻奖励模型的空子"(过度优化,见奖励工程)。此外论文还混入少量预训练梯度(ppo-ptx)防止模型丢失通用语言能力。

3. 结果(人类评估) ​

  • 1.3B 的 InstructGPT 在人类评估中胜过 175B 的 GPT-3——不是"更小更好",而是"对齐的收益大于规模的差距";
  • 输出更"有帮助"(更符合指令要求)、更诚实(TruthfulQA 上幻觉明显减少)、在有害性上有所改善;
  • 对齐税:在标准学术基准(SQuAD、HellaSwag、WMT 等)上平均小幅下降(约 0.4%)——"取悦人类偏好"与"优化基准分数"并不完全一致。

常被误解的一点

InstructGPT 的"RLHF"里的奖励不是某个游戏得分,而是奖励模型的打分——奖励模型本身是学出来的、有偏差的。所以 RLHF 从第一性上就存在"奖励模型错 → 策略顺着错的奖励走"的风险,这就是奖励过度优化讨论的前沿问题。

4. 局限 ​

  • 人类标注昂贵,偏好数据的规模、质量决定上限;
  • 奖励模型是代理目标,RLHF 训练对偏好分布敏感;
  • 论文自身的评估者也是标注员群体,存在主观性与潜在偏差;
  • 三阶段工程复杂(SFT 模型 + RM + 参考模型 + 策略 + critic 五个模型同时在场),见LLM 对齐案例的实战拆解。

5. 面试怎么答 ​

问:InstructGPT 为什么不用纯 SFT 或直接拿奖励做监督学习? 答框架:SFT 教"格式"不教"质量";奖励模型把人类偏好变成可优化目标;PPO 则能在这个非可微奖励上做策略优化——RLHF 三阶段是"人类判断 → 可微奖励 → 策略优化"的完整链路。其中 KL 惩罚是关键护栏:它防止策略偏离 SFT 过远,也是后续"奖励过度优化"研究的出发点。

高频追问:为什么用排序而非打分训练 RM?→ 人对相对好坏更稳定、跨标注员更一致。KL 惩罚的 β 太大会怎样?→ 策略几乎不动,对齐失效;太小 → 过度优化奖励模型,输出退化成模式崩塌。DPO 和 InstructGPT 的区别?→ DPO 用偏好闭式解免去 RM 与 PPO,见RLHF。

八、六篇串成一条线:面试前的 5 分钟回顾 ​

text
Bellman 1957   定义"最优"是什么          V* = max [R + γV*](压缩映射)
   ↓
Watkins 1992   不知道模型也能学           Q 更新 = 随机近似 + 压缩映射;off-policy
   ↓
Mnih 2015      高维输入也能学             回放破相关 + 目标网络稳自举
   ↓
Schulman 2017  稳定更新变得简单            clip 概率比 ≈ 一阶信任域
   ↓
Silver 2016    学习×搜索合流              三段训练 + MCTS;用学习置换算力
   ↓
Ouyang 2022    RL 走出环境走进语言         三阶段(SFT→RM→PPO+KL)

面试前把这张链讲一遍(每一环都说"上一环留了什么坑、这一环怎么填"),任何"为什么"类问题都接得住。

延伸阅读 ​

  • 论文地图 —— 把六篇放进六条支流与七十年时间轴的全局坐标系。
  • 价值学习 —— Bellman/Q-learning/DQN 的机制级展开(DP、MC/TD、SARSA、Rainbow)。
  • 策略梯度 —— REINFORCE 到 PPO 的机制级展开(GAE、baseline、clip)。
  • RLHF 与人类反馈对齐 —— InstructGPT 三阶段的机制级展开(Bradley-Terry、KL、DPO)。
  • AlphaGo 与蒙特卡洛树搜索 —— AlphaGo 的完整案例:MCTS 四步、三段训练、AlphaZero/MuZero 演进。
  • LLM 对齐:RLHF 实战 —— InstructGPT 的工程视角:三模型同台、对齐税、开源复刻。

参考资料 ​