外观
前沿进展
一句话定位:这一页是 2020 年代 RL 前沿的望远镜与过滤器——它把六个正在爆发或即将爆发的方向(世界模型、离线 RL、对齐家族、可扩展 RL、RL for Reasoning、通用智能体)逐个拆开,告诉你每个方向"核心机制是什么、代表工作是谁、是真突破还是炒作",适合想追前沿、找研究方向或判断"哪些论文值得跟"的人,读完后你能带着批判眼光看 arXiv 的日更。
先说结论再展开:2020 年代 RL 发生了一次"应用场景的板块迁移"——过去十年,RL 的标志性胜利在游戏与机器人(DQN、AlphaGo、PPO on MuJoCo);而 2020 年代,RL 最重要的新战场是语言模型与智能体:RLHF 让大模型"懂人话",DeepSeek-R1 让 RL 教会模型"推理",WebArena 让 RL 训练浏览器智能体。与此同时,"让 RL 更像工程"的可扩展基础设施(JAX 生态、大规模并行)也在快速成熟。这六条线是经典论文精读里那些里程碑论文的续集。
一、前沿总览:六张桌子的地图
| 方向 | 核心问题 | 代表工作(年份) | 关键机制关键词 | 成熟度 |
|---|---|---|---|---|
| 世界模型 | 能不能在"脑中"规划 | DreamerV3(2023)、TD-MPC2(2023)、MuZero(2020) | 潜空间动力学、想象 rollout、固定超参 | 研究成熟,工程渐热 |
| 离线 RL | 只有历史数据能不能学 | IQL(2022)、CQL(2020)、RvS/DT(2021) | OOD 控制、保守主义、隐式 Q | 研究成熟,落地谨慎 |
| 对齐家族 | 让模型服从人类偏好 | InstructGPT(2022)、DPO(2023)、RLAIF(2022) | 偏好优化、KL 约束、AI 反馈 | 生产可用,问题未消 |
| 可扩展 RL | 算力如何变成算法收益 | Brax(2021)、PureJaxRL(2025) | JAX、GPU 并行、算法即纯函数 | 快速成熟 |
| RL for Reasoning | RL 能不能教模型"思考" | DeepSeek-R1(2025)、RLVR | 可验证奖励、组相对优势、长思维链 | 爆发初期 |
| 通用智能体 | RL 能否驱动通用 Agent | WebArena(2023)、VLA(RT-2 等) | 环境即 API、动作执行奖励 | 探索期 |
text
三条主线的内部结构(读法建议):
· 学环境:世界模型 ──► 离线 RL(用历史数据当"环境日志")
· 定目标:对齐家族 ──► RL for Reasoning(把"目标"变成"可验证奖励")
· 造平台:可扩展 RL ──► 通用智能体(需要大规模并行与真实环境 API)二、世界模型:在"脑中"规划,而不是在真实世界里乱撞
1. 从 MuZero 到世界模型
论文地图讲过 MuZero(2020)的核心:把 AlphaZero 的规划扩展到"环境未知"——在潜空间学习表示、动力学与奖励,用学到的模型做 MCTS。世界模型一脉的后续工作把它推向两个方向:任务泛化(一套超参打所有任务)与连续控制(机器人)。
2. DreamerV3(Hafner et al., 2023,arXiv:2301.04104)
- 机制:学习一个潜空间世界模型(RSSM,循环状态空间模型)预测下一步的表示与奖励;然后在"想象"出来的轨迹上训练 actor-critic(不用真实环境交互)。三个工程关键:离散潜表示(symbolic latent,学习更稳)、固定超参数跨域(从 Atari 到 Minecraft 到机器人,同一套超参)、回报归一化(symlog 变换,解决奖励尺度差异)。
- 结果:在 150+ 个任务上超越专门设计的方法,是"一个算法通吃所有环境"哲学的最强证明。
- 怎么读:别只看它"赢了多少环境",要看它怎么处理"奖励尺度差异"和"长时记忆"——这才是工程可迁移的机制。背景见基于模型的 RL。
3. TD-MPC2(Hansen et al., 2023,arXiv:2310.16828)
- 机制:TD-MPC 家族的延续。潜空间里同时做模型预测控制(MPC)与时序差分学习:学一个状态-动作联合表示,用潜在一致性(latent consistency)目标让表示对齐,再配合目标网络与正则化。核心创新是单模型多任务:一个模型同时掌握 80+ 个连续控制任务(从 5 自由度到 84 自由度)。
- 意义:世界模型从"单个环境"走向"共享表示的多任务",也为机器人操作的多任务学习铺路。
- 怎么读:重点看"多任务共享"如何通过潜在一致性实现——这是它区别于单纯"每任务一个模型"的本质。
4. 这波世界模型热的诚实评估
| 声称 | 现实 |
|---|---|
| "世界模型无需真实交互就能规划" | 训练世界模型本身仍需海量真实/仿真交互;想象 rollout 有模型误差累积 |
| "一套超参打天下" | DreamerV3 做到了,但计算成本不低;"通用超参"靠的是归一化与正则化工程的积累 |
| "世界模型将取代 model-free" | 短期不会:model-free(PPO/SAC)仍更简单更稳;世界模型是样本效率与规划能力的另一条路 |
三、离线 RL:只有历史数据,还能不能学
1. 核心困难:OOD 动作的价值幻觉
离线 RL 的设定:只有一批历史交互数据 (s,a,r,s'),不再与环境交互。难点不在"训练",在评估:策略学到的动作可能超出数据分布(OOD),而 Q 函数对没见过的动作会给出虚高的价值估计——因为 max_a' 会挑中"噪声最大的那个幻觉"。这就是离线 RL 概念页讲的"自举幻觉"。三条主流防线:
| 思路 | 代表 | 做法 | 代价 |
|---|---|---|---|
| 约束策略 | BCQ(arXiv:1812.02900) | 只挑与数据分布接近的动作 | 上限被数据分布卡住 |
| 保守价值 | CQL(arXiv:2006.04779) | 在 Q 学习目标里惩罚 OOD 动作的价值 | 多一个超参 α,保守过头则欠优 |
| 隐式 Q | IQL(arXiv:2110.06169) | 用 expectile 回归学价值支撑,从不 query OOD 动作 | 对超参敏感,策略表现依赖价值质量 |
2. IQL 与 CQL 该怎么选
- CQL:价值法家族,适合"数据覆盖还行、想榨干数据的策略优化";调 α 需要离线验证协议(而离线评估本身就难)。
- IQL:不碰 OOD 动作,工程上更"规矩";被 D4RL 基准证明是近两年最稳的通用选择之一,也是许多下游系统(机器人数据训练)的默认起点。
- 简单经验法则:先 IQL 出基线,再上 CQL 对比——两者的性能差异通常远小于"数据质量"的差异。
3. RvsS 之争:离线 RL 到底需不需要"RL"?
2021~2023 年有一场著名的争论:回报条件监督学习(RCSL)vs 标准离线 RL。代表是 Decision Transformer(arXiv:2106.01345,把轨迹当序列建模,条件是"目标回报")与 RvS(Emmons et al., ICLR 2023)——它们的论点是"序列建模 + 监督学习就够了,不需要动态规划式的价值学习";而 IQL/CQL 一方反驳"RCSL 在关键基准上不如标准离线 RL"。
这场争论的工程结论:
- RCSL 类方法(DT、RvS)实现简单、稳定、天然适合 transformer 架构,在"轨迹数据多、环境结构简单"时够用;
- 标准离线 RL 方法(IQL、CQL)在需要超越数据分布表现时更强,但调参与评估更复杂;
- 别把"论文里的输赢"当成"工程里的答案"——先在你的数据上跑两个基线再说。
四、对齐家族:从 RLHF 到 DPO,以及"在线 RLHF"的回归
1. DPO 家族的兴起
InstructGPT 的三阶段(SFT → RM → PPO)成本高、稳定性难控。DPO(arXiv:2305.18290)用带 KL 约束的 RLHF 目标的闭式解,把奖励模型隐式编码进策略,只用偏好对做一步分类式训练。它让开源社区(Zephyr、Llama-2-Chat 的简化复刻)都能做对齐。此后衍生出 KTO、IPO 等变体,但核心洞察都是同一个:偏好优化有解析解,不必显式建模奖励。机制详解见RLHF 概念页。
2. RLAIF:让 AI 替代人类标注
Constitutional AI(arXiv:2212.08073,Bai et al., 2022)用一套"宪法"原则让 AI 评判 AI 的输出并给出修订,再用 AI 反馈训练 RM——RL from AI feedback(RLAIF)。它解决 RLHF 最大的瓶颈:人类偏好标注太贵、太慢、不一致。局限也很明显:AI 评判者继承模型的偏见,反馈质量存在天花板。
3. 在线 RLHF:奖励模型与策略共同进化
2024 年后的趋势是在线 RLHF:不是用固定的 RM 打分,而是让策略在部署中产出新样本、人工/AI 持续标注、RM 与策略交替更新。它与经典在线 RL(策略与环境交互)同构,只是"环境"变成了"人类+RM"。这是LLM 对齐案例里讲的"从离线对齐到在线对齐"路线。
4. 不能回避的问题:奖励过度优化
Gao, Schulman, Hilton(2022)在 Scaling Laws for Reward Model Overoptimization(arXiv:2210.10760)里给出了 RLHF 的 Goodhart 定律经验曲线:KL 距离增加,奖励模型分数先升后降——策略优化奖励模型到一定程度后,真实质量反而下降。这条曲线是所有对齐工作的"达摩克利斯之剑":没有免费的奖励,优化代理奖励必然有代价。面试/写论文时能说出这条曲线,是区分"背了 RLHF"和"理解了 RLHF"的分水岭。
五、可扩展 RL:算力正在变成算法收益
1. JAX 生态:把 RL 算法变成 GPU 上的纯函数
传统的 RL 训练在 CPU 上跑环境、GPU 上跑网络,带宽是瓶颈。JAX 生态的答案是全流程向量化:
- Brax(Google,2021):物理仿真直接在 JAX/GPU 上跑,单张 GPU 每秒可生成数十万个环境步;
- PureJaxRL(2025,arXiv:2502.19643,Reinforcement Learning at Light Speed):把整个 PPO 训练循环写成 JAX 纯函数(环境、策略、更新一体),用 evojax 的并行原语,让"PPO 一分钟训完一个任务"成为常规操作。
text
传统 RL 训练循环(CPU/GPU 分离):
CPU: 环境步进(慢,几百~几千步/秒)
GPU: 策略前向/梯度更新(快,但等数据)
→ 瓶颈:环境与学习之间搬运数据
JAX 全流程向量化:
环境 + 策略 + 更新 全部写在 GPU 内核里
→ 数万并行环境步进 + 即时更新,带宽瓶颈消失2. 大规模并行带来的范式变化
- 并行环境数量成为超参数:上千个并行环境 + 少量更新轮次,是 2020 年代"样本效率"的新定义;
- 算法即纯函数:CleanRL/PureJaxRL 让复现、消融、超参搜索从"脚本管理"变成"函数调用",研究可复现性大幅改善;
- 基础设施红利:RL 的"学习"部分成本持续下降,成本重心回到"环境与奖励"——再次印证RL 系统解剖里的"环境即产品"。
工程启示
如果你要做 RL 方向的研究或产品,2026 年的今天"从零写 RL 训练循环"已经没有必要——JAX 生态的现成骨架(Brax、PureJaxRL)比自研快、比自研稳。框架选型详见框架与工具怎么选。
六、RL for Reasoning:RL 教会大模型"思考"
1. 背景:从"对齐偏好"到"优化可验证的正确性"
RLHF 的奖励是奖励模型的主观打分;但对数学、代码这类任务,存在客观可验证的奖励(答案对不对、测试过不过)。"用 RL 优化可验证奖励"(Reinforcement Learning with Verifiable Rewards,RLVR)成为 2024~2025 年最热的方向:它没有奖励模型的偏差,奖励是硬事实。
2. DeepSeek-R1(DeepSeek-AI, 2025,arXiv:2501.12948)
DeepSeek-R1 是这一方向的标志性工作,两个贡献必须分开记:
贡献一:R1-Zero 证明"纯 RL 足以涌现推理"。不做任何监督微调(SFT),直接从基础模型上用 RL 训练,模型就"自发"学会了在数学推理中延长思考时间、自我反思——论文里著名的 "aha moment"(顿悟时刻)就是指这种涌现。
贡献二:GRPO 解决了大规模 RL 的基础设施问题。标准 PPO 需要 critic 网络估计价值函数,大规模训练时 critic 与策略一样大、双倍内存、双倍不稳。GRPO(Group Relative Policy Optimization)的思路:
text
PPO 的做法: 优势 ≈ r - V(s) # 需要学一个价值网络 V
GRPO 的做法: 每个问题生成一组回答 {y1..yG}
奖励做组内归一化:Â_i = (r_i - mean(r)) / std(r)
→ 不需要 critic,组内相对优势直接当 advantage"相对化"省掉价值网络,训练基础设施简化一个量级——这是 R1 能在有限算力下规模化 RL 训练的关键机制。它的思想脉络与 PPO 用 advantage 替代绝对回报一脉相承(见策略梯度)。
3. 这条线该怎么看
| 声称 | 现实与风险 |
|---|---|
| "RL 让模型学会推理" | 成立,但仅在奖励可验证(数学/代码)的任务上强;开放性问题奖励仍靠模型/LLM 评判,会退化成"RLHF 式的主观对齐" |
| "过程奖励(PRM)比结果奖励更好" | 有争议:过程奖励能提供密集信号,但标注代价高、可能引导走捷径 |
| "推理 RL 将替代所有 RLHF" | 不会:Reasoning RL 优化"正确性",RLHF 优化"偏好",二者解决不同问题;工程上常共存 |
七、通用智能体:RL 遇上 Agent
1. 环境即 API
当"环境"从游戏变成浏览器、API、真实世界,RL 的智能体范式随之改变:智能体的动作是调用工具/点击网页/执行命令,奖励来自"任务是否完成"(可执行性、任务成功率)。智能体与对话系统案例把这个范式的 MDP 化讲透了。
2. WebArena(Zhou et al., 2023,arXiv:2307.13854)
- 是什么:自托管的真实网页环境(电商、论坛、CMS 等),1091 个任务,用功能正确性(网站状态是否达到目标)评估智能体,而不是只看"点没点对"。
- 为什么重要:它是"通用智能体的 Atari"——给 Agent 研究一个可复现、可评估、贴近真实的测试场;它暴露的核心难题是评估(如何判断一个浏览器操作序列"完成了任务")与长程信用分配(几十步操作后才知道成败)。
3. VLA(Vision-Language-Action):具身智能体的 RL 化
VLA 模型把视觉、语言、动作合并成一个模型(代表如 RT-2 系列,Brohan et al., 2023,arXiv:2307.15818),把"网络知识"迁移到机器人控制。RL 在其中的角色仍在探索:目前主流是先大规模预训练模仿,再用 RL 微调把成功率推过瓶颈——这与 AlphaGo "先 SL 后 RL" 的路线在结构上同构。进展与批评见机器人 Sim2Real 案例。
八、批判性视角:什么是真突破,什么是炒作
读前沿论文最需要的技能不是"跟上",而是区分信号与噪声。一套可用的判断框架:
| 判断维度 | 真突破的特征 | 炒作的信号 |
|---|---|---|
| 机制 | 提出可复用的机制(如 GRPO 去掉 critic、TD-MPC2 的潜在一致性) | 只报结果不报机制,"XX 首次超越人类" |
| 评估 | 多个独立任务/多 seed/与强基线对比、公开代码 | 单一任务、单一 seed、只和弱基线比 |
| 可复现 | 官方实现公开、消融完整 | 代码未公开或"即将开源" |
| 上下文 | 明确限定适用条件与失败模式 | 声称通用、"one algorithm to rule them all" |
用这套框架回看本页六条线:
- 真突破:IQL/CQL 的 OOD 处理思想、DPO 的闭式解洞察、GRPO 的基建简化、DreamerV3 的固定超参工程——它们都留下了可迁移的机制。
- 待观察:通用智能体(评估与信用分配未解)、在线 RLHF(成本与稳定性未解)、RL for Reasoning 在开放问题上的泛化。
- 大概率是炒作:任何"横扫所有任务、无需调参"的标题党;任何只在单一私有基准上宣称超越的方法。
最后一句忠告
前沿页会过期,机制不会。2026 年你读这篇时的"前沿",2028 年就是旧闻——但"组内相对优势省掉 critic""OOD 动作的价值幻觉""奖励过度优化的 KL 曲线"这些机制,会像"经验回放""目标网络"一样,成为下一代经典论文的地基。读前沿时,永远问一句:这篇论文留下了什么机制?
延伸阅读
- 基于模型的 RL 与世界模型 —— 世界模型方向的机制详解(MPC、Dyna、Dreamer 家族)。
- 离线强化学习 —— 离线 RL 的核心困难与三类解法(BCQ/CQL/IQL)的机制详解。
- RLHF 与人类反馈对齐 —— 对齐家族的机制详解(Bradley-Terry、KL、DPO、RLAIF)。
- 经典论文精读 —— 前沿的"上一代":六篇里程碑论文,理解前沿必须有坐标系。
- 智能体与对话系统 —— 通用智能体方向:环境即 API、LLM Agent 的 RL 微调。
参考资料
- Hafner, D., et al. (2023). Mastering Diverse Domains through World Models(DreamerV3). arXiv:2301.04104. https://arxiv.org/abs/2301.04104
- Hansen, N., et al. (2023). TD-MPC2: Scalable, Robust World Models for Continuous Control. arXiv:2310.16828. https://arxiv.org/abs/2310.16828
- Kumar, A., et al. (2020). Conservative Q-Learning for Offline Reinforcement Learning(CQL). arXiv:2006.04779. https://arxiv.org/abs/2006.04779
- Kostrikov, I., et al. (2022). Offline Reinforcement Learning with Implicit Q-Learning(IQL). arXiv:2110.06169. https://arxiv.org/abs/2110.06169
- Chen, L., et al. (2021). Decision Transformer: Reinforcement Learning via Sequence Modeling. arXiv:2106.01345. https://arxiv.org/abs/2106.01345
- Fujimoto, S., et al. (2019). Off-Policy Deep Reinforcement Learning without Exploration(BCQ). arXiv:1812.02900. https://arxiv.org/abs/1812.02900
- Rafailov, R., et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
- Bai, Y., et al. (2022). Constitutional AI: Harmlessness from AI Feedback(RLAIF). arXiv:2212.08073. https://arxiv.org/abs/2212.08073
- Gao, L., Schulman, J., & Hilton, J. (2022). Scaling Laws for Reward Model Overoptimization. arXiv:2210.10760. https://arxiv.org/abs/2210.10760
- Lucchetti, F., & Gu, P. (2025). Reinforcement Learning at Light Speed(PureJaxRL). arXiv:2502.19643. https://arxiv.org/abs/2502.19643
- DeepSeek-AI (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948. https://arxiv.org/abs/2501.12948
- Zhou, S., et al. (2023). WebArena: A Realistic Web Environment for Building Autonomous Agents. arXiv:2307.13854. https://arxiv.org/abs/2307.13854
- Brohan, A., et al. (2023). RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. arXiv:2307.15818. https://arxiv.org/abs/2307.15818