外观
RL vs 相邻领域
一句话定位:这一页回答一个务实问题——"我的问题该不该用 RL?" 它把 RL 与六类相邻范式(监督学习、无监督学习、最优控制、运筹优化、规划与搜索、行为克隆)逐一对齐比较,最后给出一张可执行的选型决策表。读完后你能对自己的任务说出"用 RL / 不用 RL / 先用别的再过渡到 RL"中的一句,而不是"试试 RL 吧"。
一、先说结论:六种范式,各差一个"维"
RL 不是孤独的学科,它站在一堆邻居中间。快速总览表先给你一张全景:
| 范式 | 一句话定位 | 与 RL 的关键差别 | 关系 |
|---|---|---|---|
| 监督学习 | 从 (x, y) 学映射 | 数据静止、反馈即时,无序列决策 | 提供函数近似与数据思维 |
| 无监督学习 | 从数据找结构 | 无"决策—后果"概念 | 可用于状态表示学习 |
| 最优控制 | 已知模型,求最优控制序列 | 通常假设模型已知、目标是轨迹优化 | 模型已知时 RL 的"无学习版" |
| 运筹优化 | 静态求最优解 | 通常无时序、无交互学习 | 序列化的 OR 问题就是 MDP |
| 规划与搜索 | 模型已知,靠搜索找路径 | 无"从数据中学习",计算量大 | 可与学习结合(MCTS+网络) |
| 行为克隆 | 抄专家的示范 | 无试错、无探索、受专家水平天花板 | RL 的"冷启动"手段 |
一句话记忆:RL = 序列决策 + 试错学习 + 长期回报最大化;每个邻居都少其中至少一块。下面逐对拆解。
二、与监督/无监督学习
这部分在什么是强化学习已经详细展开过三维对照(数据形式 / 反馈 / 目标),这里只做承上启下,不再重复表格,只补充三个容易被忽略的工程差异:
- 数据不独立同分布:监督学习假设样本独立;RL 里你的下一个状态是你的上一个动作造成的——这直接导致经验回放(Experience Replay)这类"强行打断相关性"的工程技巧的出现,详见价值学习。
- 训练与部署不分家:监督学习先离线训练再上线;RL 的部署(与环境交互)本身就是训练过程的一部分,因此有了离线强化学习这个专门研究"训练时不再交互"的分支。
- 没有固定的"测试集":RL 评估要面对环境随机性、种子敏感性、非平稳性,评估难度高一个量级,见评估与基准。
无监督学习的隐藏角色
无监督学习在 RL 中不是对手,而是组件:世界模型学的是"状态的低维表示"(潜空间),内在奖励里的 count-based 方法用的是密度估计。想看这种合流,去基于模型的 RL 与世界模型。
三、RL vs 最优控制(Optimal Control)
最优控制是 RL 在"已知模型"假设下的近亲,两者都解决连续状态上的序列决策,数学上同源(都通向动态规划与贝尔曼方程)。关键差别在于模型是否已知:
| 维度 | 最优控制 | RL | 备注 |
|---|---|---|---|
| 动力学模型 | 通常已知(或可精确建) | 通常未知,靠采样学习 | 这是最本质的分界线 |
| 目标 | 最小化代价函数 J(u) | 最大化累积奖励 G | 同一个问题的两种符号 |
| 求解工具 | LQR、变分法、PMP、MPC | TD、策略梯度、Q-learning | MPC 是"滚动时域 + 重规划" |
| 对随机性的处理 | 经典方法多假设确定/高斯 | 天生处理随机转移与随机策略 | — |
| 状态维度 | 常为低维连续(机器人、航天) | 可高维离散/连续(图像、文本) | — |
MPC(Model Predictive Control) 特别值得说:它每一小步都用已知模型向前滚动优化几步,执行第一步,再重规划。它和基于模型的 RL 的关系是:
- MPC 不"学习",只"优化"——模型给错了它就失灵;
- model-based RL 把"学模型"这一步补上:先学一个世界模型,再在其上用 MPC 或规划求解,见基于模型的 RL;
- 现代工作如 Dreamer、TD-MPC 正是把两者焊在一起:学习潜空间模型 + MPC 式规划。
工程现实
真实物理系统(机器人、飞行器)往往有精确的解析模型(刚体动力学),此时用最优控制通常比 RL 更稳、更可解释、更省样本。RL 的舞台是模型太难建的场景(软体、流体、接触多变的操作)。这也解释了为什么工业界"LQR/MPC 先上,RL 只解决模型写不出来的部分"。机器人侧的现实分析见机器人控制与 Sim2Real。
四、RL vs 运筹优化(Operations Research, OR)
运筹优化(OR)处理"在约束下找最优解":线性规划、整数规划(MILP)、组合优化(TSP、装箱、调度)。它与 RL 的关系常被误解,值得拆成两个层面:
1. 静态 OR 不是 RL,但"序列化"后就变成了 RL
| 层面 | OR 的经典形态 | 写成 MDP 后 |
|---|---|---|
| 时间 | 单次决策(解一个优化问题) | 逐步决策(每步都在解"子问题") |
| 状态 | 无/静态 | 剩余任务、库存、机器占用 |
| 动作 | 一次性的分配/排程 | 每一步的分配/排程决定 |
| 目标 | 最小化总代价 | 最小化长期折扣代价 |
库存管理是典型例子:静态报童问题(newsvendor)是一次性订货决策,属于 OR;动态库存控制(每个周期决定订多少、下期库存成为状态)就是标准的 MDP,贝尔曼最早就是为此发明的动态规划。调度、装箱、网络路由同理——判断标准是"这次决策会不会改变下一次决策的局面"。想深挖,见调度与运筹优化中的 RL。
2. 学习式求解器:把 RL 当"构造启发式"
经典 OR 求解(MILP、分支定界)在规模变大时指数爆炸,RL 的新用法是训练一个策略直接构造/改进解(learning to search / learning to construct):
text
经典路线:精确求解器(MILP) ──→ 规模一大就超时
启发式路线:人工启发式 ──→ 快但次优
学习路线:RL 训练构造策略 ──→ 快 + 自适应问题分布RL 在这类问题上的价值不是"取代 MILP",而是在"每次决策都要实时给出近似解"的在线场景(路由、调度)里提供速度。评估难点在于泛化:训练用的问题分布是否覆盖真实分布,见评估与基准。
一个历史渊源
OR 和 RL 的祖师爷是同一个人——贝尔曼。动态规划既被 OR 界当优化工具用,也是 RL 的数学地基(马尔可夫决策过程页里的贝尔曼方程就是它)。两界分离主要是研究社群差异,而非数学差异。
五、RL vs 规划与搜索(Planning & Search)
经典 AI 规划(STRIPS、PDDL 一脉)和搜索(A*、MCTS)解决的问题也是"找一串动作达到目标"。与 RL 的分界线依然是:模型是否已知、要不要学习。
| 维度 | 经典规划/搜索 | RL |
|---|---|---|
| 模型 | 显式给出(动作效果、目标) | 默认未知,从交互中学 |
| 靠什么找动作序列 | 搜索/回溯/启发式 | 策略/价值函数的梯度学习 |
| 泛化到新实例 | 差(每次重新搜索) | 好(学出"套路") |
| 计算集中在 | 决策时的搜索 | 训练阶段 |
MCTS(蒙特卡洛树搜索) 是这条边界上最精彩的合流点:它本身是"模型已知时的高效搜索",但 AlphaGo 把它与策略网络、价值网络结合——网络负责给搜索提供"先验"和"估值",搜索负责把算力花在关键分支上。这就是AlphaGo 与蒙特卡洛树搜索的"搜索 × 学习"原理,也是基于模型的 RL里"在脑中规划"的现实形态。
工程判断
如果你的领域有一个精确可调用的模拟器(比如围棋规则、电路仿真),搜索/规划往往能立刻给出强解,不需要 RL;只有当模拟器太贵(不能每步都深度搜索)或模型不精确时,才需要"学习来替代搜索"或"学习 + 浅层搜索"。AlphaGo 的胜利恰恰来自后者:搜索深度有限,就用网络把没搜到的部分"猜"出来。
六、RL vs 行为克隆 / 模仿学习(Imitation Learning)
行为克隆(Behavior Cloning, BC)是模仿学习中最直白的一支:把专家示范当监督学习数据,学 π(a|s)。它是 RL 领域里最容易被混淆的邻居,也最容易被人用错——因为实现太简单了:
python
# 行为克隆:就是多分类/回归!
# 数据:专家轨迹 [(s1,a1), (s2,a2), ...]
# 目标:最小化 π(a|s) 与示范动作的交叉熵
loss = cross_entropy(policy(s), expert_action)1. 行为克隆的三个致命伤
| 局限 | 原因 | 后果 |
|---|---|---|
| 分布漂移(compounding error) | 训练时看到的都是专家状态,测试时一旦偏出专家轨迹,越错越偏 | 长程任务指数级偏离专家 |
| 天花板是专家 | 学到的上限就是示范者的水平 | 无法超越示范(围棋超人类无从谈起) |
| 没有错误反馈 | 永远不知道"这么做会得到负奖励" | 面对示范外情况束手无策 |
2. 模仿学习的三种变体
| 变体 | 思路 | 代表工作 | 与 RL 的关系 |
|---|---|---|---|
| 行为克隆 BC | 直接回归专家动作 | Pomerleau 1989 ALVINN | 无 RL,纯监督学习 |
| 逆强化学习 IRL | 从示范反推奖励函数 | Ng & Russell 2000、MaxEnt IRL | 奖励函数来自示范,之后仍需 RL 求解 |
| 生成式对抗模仿 GAIL | 判别器区分"我的轨迹 vs 专家轨迹",策略骗过判别器 | Ho & Ermon 2016 | 形式上像对抗训练,不需要显式奖励 |
模仿学习在现实中的真实地位是 RL 的冷启动器:先用 BC 训一个差不多的策略,再用 RL 微调超越专家。自动驾驶就是这条路的典型——先抄,再学,见自动驾驶决策。在 LLM 语境下,SFT 就是"行为克隆",而 RLHF 就是"行为克隆之后的 RL 微调"——这个关系在RLHF 与人类反馈对齐里被反复强调。
最常见的误判
把"有大量人类示范"误当成"应该用 RL"。如果你只有示范、没有环境、没有奖励,行为克隆就能给你 80% 的收益,RL 反而难做。正确顺序是:先 BC 打底 → 有环境可试错 → 再上 RL。反过来一上来就 RL,探索空间太大,通常学不动。
七、深度学习在 RL 中的位置(深度 RL)
深度 RL(Deep RL)= 深度学习提供函数近似 + RL 提供学习目标。拆开看:
| 深度学习的角色 | 在 RL 里的具体位置 | 对应页面 |
|---|---|---|
| 价值函数近似 | DQN 用 CNN 从像素估计 Q(s,a) | 价值学习 |
| 策略函数近似 | 策略网络输出动作分布 π(a|s) | 策略梯度方法 |
| 状态表示/压缩 | 世界模型把高维观测编码进潜空间 | 基于模型的 RL |
| 奖励/价值建模 | 奖励模型(Bradley-Terry 打分器) | RLHF |
所以"深度 RL"不是新范式,而是范式不变、表示能力升级。它的代价也清晰:深度学习引入了调参敏感、样本效率低、可解释性差,这些问题的工程应对在调参实践和常见陷阱。
一句话定位深度学习
"深度学习决定智能体能'记住多复杂的模式',RL 决定它'为什么要记住这些'。"前者回答表示能力,后者回答学习目标——缺一不可。
八、选型决策表
把上面六组比较浓缩成一张决策表。问自己四个问题,按顺序回答即可走到结论:
| 问题 | 是 | 否 |
|---|---|---|
| Q1. 这是不是序列决策(动作影响后续局面)? | 进入 Q2 | 用监督/无监督/静态优化即可,不必上 RL |
| Q2. 有没有精确可用的模型/模拟器? | 优先规划/搜索或最优控制;模拟贵才考虑 model-based RL | 进入 Q3 |
| Q3. 有没有大量专家示范? | 先行为克隆打底,再过渡 RL | 进入 Q4 |
| Q4. 能否写出靠谱的奖励 + 承担试错成本? | ✅ 上 RL(先从零构建项目) | ❌ 考虑离线强化学习或干脆不做 |
进一步的精化建议表:
| 具体情形 | 推荐范式 | 理由 |
|---|---|---|
| 机器人轨迹跟踪,模型可精确建模 | 最优控制(MPC/LQR) | 稳、快、可解释,RL 没必要 |
| 游戏 / 没有模型的博弈 | RL(+ MCTS 混合) | 探索是唯一路径 |
| 推荐、广告、A/B 测试(单步选择) | Contextual Bandit | 比全 RL 简单且够用,见多臂老虎机 |
| 库存、调度、装箱(有长期代价) | 序列决策 → RL 或动态规划 | 规模大时学构造启发式 |
| 有大量专家日志、无法在线试错 | 行为克隆 + 离线 RL | 详见离线强化学习 |
| 目标难写标量奖励 | 先 IRL/偏好学习,或评估是否能简化目标 | 见奖励工程 |
| 想加速大模型推理/对齐 | RLHF / 直接偏好优化 | 见RLHF |
最后一条忠告
选型错误的代价不在"选了 RL",而在选了 RL 却没给它配齐环境、奖励、评估三件套。RL 的失败案例里,绝大多数不是"算法不行",而是"问题不合适 + 基础设施没跟上"。建议决策完再读一遍常见陷阱与反模式的陷阱总表,对照检查自己的项目。
延伸阅读
- 什么是强化学习 —— 本文对照表的"基准面":RL 自身的定义、四要素与最小例子。
- 马尔可夫决策过程 —— "什么情况下一个问题能写成 RL"的严格数学判据。
- 基于模型的 RL 与世界模型 —— 与最优控制/MPC 合流的那条线的完整展开。
- 调度与运筹优化中的 RL —— 静态 OR 问题如何被序列化并交给 RL 的真实案例。
- 自动驾驶决策 —— 模仿学习 + RL + 安全约束混合路线的工程现实。
- 机器人控制与 Sim2Real —— 最优控制与 RL 在机器人领域的分工实况。
参考资料
- Sutton, R. S. & Barto, A. G. (2018). Reinforcement Learning: An Introduction (2nd ed.), §1.7 "Relationship to Optimal Control". MIT Press. 在线全文:http://incompleteideas.net/book/the-book-2nd.html —— 教科书对 RL 与最优控制、运筹学边界的权威论述。
- Ho, J. & Ermon, S. (2016). Generative Adversarial Imitation Learning. NeurIPS 2016. https://arxiv.org/abs/1606.03476 —— GAIL 原文,模仿学习与 RL 关系的关键文献。
- Ng, A. Y. & Russell, S. (2000). Algorithms for Inverse Reinforcement Learning. ICML 2000. https://ai.stanford.edu/~ang/papers/icml00-irl.pdf —— 逆强化学习开创性论文。
- Pomerleau, D. A. (1989). ALVINN: An Autonomous Land Vehicle in a Neural Network. NeurIPS 1989. —— 行为克隆的经典源头(自动驾驶原型车)。
- Browne, C. et al. (2012). A Survey of Monte Carlo Tree Search Methods. IEEE Transactions on Computational Intelligence and AI in Games. https://ieeexplore.ieee.org/document/6145622 —— MCTS 综述,规划/搜索与学习结合的背景文献。
- OpenAI (2018). Spinning Up in Deep RL — Key Concepts. https://spinningup.openai.com/en/latest/spinningup/rl_intro.html —— "为什么 RL 与监督/无监督不同"的简明英文对照。