Skip to content

RL vs 相邻领域

本页速览 强化学习与监督学习、无监督学习、最优控制、运筹优化、规划与搜索、行为克隆的边界辨析——"什么时候该用 RL,什么时候不该"的决策框架。

RL vs 相邻领域 ​

一句话定位:这一页回答一个务实问题——"我的问题该不该用 RL?" 它把 RL 与六类相邻范式(监督学习、无监督学习、最优控制、运筹优化、规划与搜索、行为克隆)逐一对齐比较,最后给出一张可执行的选型决策表。读完后你能对自己的任务说出"用 RL / 不用 RL / 先用别的再过渡到 RL"中的一句,而不是"试试 RL 吧"。

一、先说结论:六种范式,各差一个"维" ​

RL 不是孤独的学科,它站在一堆邻居中间。快速总览表先给你一张全景:

范式一句话定位与 RL 的关键差别关系
监督学习从 (x, y) 学映射数据静止、反馈即时,无序列决策提供函数近似与数据思维
无监督学习从数据找结构无"决策—后果"概念可用于状态表示学习
最优控制已知模型,求最优控制序列通常假设模型已知、目标是轨迹优化模型已知时 RL 的"无学习版"
运筹优化静态求最优解通常无时序、无交互学习序列化的 OR 问题就是 MDP
规划与搜索模型已知,靠搜索找路径无"从数据中学习",计算量大可与学习结合(MCTS+网络)
行为克隆抄专家的示范无试错、无探索、受专家水平天花板RL 的"冷启动"手段

一句话记忆:RL = 序列决策 + 试错学习 + 长期回报最大化;每个邻居都少其中至少一块。下面逐对拆解。

二、与监督/无监督学习 ​

这部分在什么是强化学习已经详细展开过三维对照(数据形式 / 反馈 / 目标),这里只做承上启下,不再重复表格,只补充三个容易被忽略的工程差异:

  1. 数据不独立同分布:监督学习假设样本独立;RL 里你的下一个状态是你的上一个动作造成的——这直接导致经验回放(Experience Replay)这类"强行打断相关性"的工程技巧的出现,详见价值学习。
  2. 训练与部署不分家:监督学习先离线训练再上线;RL 的部署(与环境交互)本身就是训练过程的一部分,因此有了离线强化学习这个专门研究"训练时不再交互"的分支。
  3. 没有固定的"测试集":RL 评估要面对环境随机性、种子敏感性、非平稳性,评估难度高一个量级,见评估与基准。

无监督学习的隐藏角色

无监督学习在 RL 中不是对手,而是组件:世界模型学的是"状态的低维表示"(潜空间),内在奖励里的 count-based 方法用的是密度估计。想看这种合流,去基于模型的 RL 与世界模型。

三、RL vs 最优控制(Optimal Control) ​

最优控制是 RL 在"已知模型"假设下的近亲,两者都解决连续状态上的序列决策,数学上同源(都通向动态规划与贝尔曼方程)。关键差别在于模型是否已知:

维度最优控制RL备注
动力学模型通常已知(或可精确建)通常未知,靠采样学习这是最本质的分界线
目标最小化代价函数 J(u)最大化累积奖励 G同一个问题的两种符号
求解工具LQR、变分法、PMP、MPCTD、策略梯度、Q-learningMPC 是"滚动时域 + 重规划"
对随机性的处理经典方法多假设确定/高斯天生处理随机转移与随机策略—
状态维度常为低维连续(机器人、航天)可高维离散/连续(图像、文本)—

MPC(Model Predictive Control) 特别值得说:它每一小步都用已知模型向前滚动优化几步,执行第一步,再重规划。它和基于模型的 RL 的关系是:

  • MPC 不"学习",只"优化"——模型给错了它就失灵;
  • model-based RL 把"学模型"这一步补上:先学一个世界模型,再在其上用 MPC 或规划求解,见基于模型的 RL;
  • 现代工作如 Dreamer、TD-MPC 正是把两者焊在一起:学习潜空间模型 + MPC 式规划。

工程现实

真实物理系统(机器人、飞行器)往往有精确的解析模型(刚体动力学),此时用最优控制通常比 RL 更稳、更可解释、更省样本。RL 的舞台是模型太难建的场景(软体、流体、接触多变的操作)。这也解释了为什么工业界"LQR/MPC 先上,RL 只解决模型写不出来的部分"。机器人侧的现实分析见机器人控制与 Sim2Real。

四、RL vs 运筹优化(Operations Research, OR) ​

运筹优化(OR)处理"在约束下找最优解":线性规划、整数规划(MILP)、组合优化(TSP、装箱、调度)。它与 RL 的关系常被误解,值得拆成两个层面:

1. 静态 OR 不是 RL,但"序列化"后就变成了 RL ​

层面OR 的经典形态写成 MDP 后
时间单次决策(解一个优化问题)逐步决策(每步都在解"子问题")
状态无/静态剩余任务、库存、机器占用
动作一次性的分配/排程每一步的分配/排程决定
目标最小化总代价最小化长期折扣代价

库存管理是典型例子:静态报童问题(newsvendor)是一次性订货决策,属于 OR;动态库存控制(每个周期决定订多少、下期库存成为状态)就是标准的 MDP,贝尔曼最早就是为此发明的动态规划。调度、装箱、网络路由同理——判断标准是"这次决策会不会改变下一次决策的局面"。想深挖,见调度与运筹优化中的 RL。

2. 学习式求解器:把 RL 当"构造启发式" ​

经典 OR 求解(MILP、分支定界)在规模变大时指数爆炸,RL 的新用法是训练一个策略直接构造/改进解(learning to search / learning to construct):

text
经典路线:精确求解器(MILP)  ──→ 规模一大就超时
启发式路线:人工启发式       ──→ 快但次优
学习路线:RL 训练构造策略   ──→ 快 + 自适应问题分布

RL 在这类问题上的价值不是"取代 MILP",而是在"每次决策都要实时给出近似解"的在线场景(路由、调度)里提供速度。评估难点在于泛化:训练用的问题分布是否覆盖真实分布,见评估与基准。

一个历史渊源

OR 和 RL 的祖师爷是同一个人——贝尔曼。动态规划既被 OR 界当优化工具用,也是 RL 的数学地基(马尔可夫决策过程页里的贝尔曼方程就是它)。两界分离主要是研究社群差异,而非数学差异。

经典 AI 规划(STRIPS、PDDL 一脉)和搜索(A*、MCTS)解决的问题也是"找一串动作达到目标"。与 RL 的分界线依然是:模型是否已知、要不要学习。

维度经典规划/搜索RL
模型显式给出(动作效果、目标)默认未知,从交互中学
靠什么找动作序列搜索/回溯/启发式策略/价值函数的梯度学习
泛化到新实例差(每次重新搜索)好(学出"套路")
计算集中在决策时的搜索训练阶段

MCTS(蒙特卡洛树搜索) 是这条边界上最精彩的合流点:它本身是"模型已知时的高效搜索",但 AlphaGo 把它与策略网络、价值网络结合——网络负责给搜索提供"先验"和"估值",搜索负责把算力花在关键分支上。这就是AlphaGo 与蒙特卡洛树搜索的"搜索 × 学习"原理,也是基于模型的 RL里"在脑中规划"的现实形态。

工程判断

如果你的领域有一个精确可调用的模拟器(比如围棋规则、电路仿真),搜索/规划往往能立刻给出强解,不需要 RL;只有当模拟器太贵(不能每步都深度搜索)或模型不精确时,才需要"学习来替代搜索"或"学习 + 浅层搜索"。AlphaGo 的胜利恰恰来自后者:搜索深度有限,就用网络把没搜到的部分"猜"出来。

六、RL vs 行为克隆 / 模仿学习(Imitation Learning) ​

行为克隆(Behavior Cloning, BC)是模仿学习中最直白的一支:把专家示范当监督学习数据,学 π(a|s)。它是 RL 领域里最容易被混淆的邻居,也最容易被人用错——因为实现太简单了:

python
# 行为克隆:就是多分类/回归!
# 数据:专家轨迹 [(s1,a1), (s2,a2), ...]
# 目标:最小化 π(a|s) 与示范动作的交叉熵
loss = cross_entropy(policy(s), expert_action)

1. 行为克隆的三个致命伤 ​

局限原因后果
分布漂移(compounding error)训练时看到的都是专家状态,测试时一旦偏出专家轨迹,越错越偏长程任务指数级偏离专家
天花板是专家学到的上限就是示范者的水平无法超越示范(围棋超人类无从谈起)
没有错误反馈永远不知道"这么做会得到负奖励"面对示范外情况束手无策

2. 模仿学习的三种变体 ​

变体思路代表工作与 RL 的关系
行为克隆 BC直接回归专家动作Pomerleau 1989 ALVINN无 RL,纯监督学习
逆强化学习 IRL从示范反推奖励函数Ng & Russell 2000、MaxEnt IRL奖励函数来自示范,之后仍需 RL 求解
生成式对抗模仿 GAIL判别器区分"我的轨迹 vs 专家轨迹",策略骗过判别器Ho & Ermon 2016形式上像对抗训练,不需要显式奖励

模仿学习在现实中的真实地位是 RL 的冷启动器:先用 BC 训一个差不多的策略,再用 RL 微调超越专家。自动驾驶就是这条路的典型——先抄,再学,见自动驾驶决策。在 LLM 语境下,SFT 就是"行为克隆",而 RLHF 就是"行为克隆之后的 RL 微调"——这个关系在RLHF 与人类反馈对齐里被反复强调。

最常见的误判

把"有大量人类示范"误当成"应该用 RL"。如果你只有示范、没有环境、没有奖励,行为克隆就能给你 80% 的收益,RL 反而难做。正确顺序是:先 BC 打底 → 有环境可试错 → 再上 RL。反过来一上来就 RL,探索空间太大,通常学不动。

七、深度学习在 RL 中的位置(深度 RL) ​

深度 RL(Deep RL)= 深度学习提供函数近似 + RL 提供学习目标。拆开看:

深度学习的角色在 RL 里的具体位置对应页面
价值函数近似DQN 用 CNN 从像素估计 Q(s,a)价值学习
策略函数近似策略网络输出动作分布 π(a|s)策略梯度方法
状态表示/压缩世界模型把高维观测编码进潜空间基于模型的 RL
奖励/价值建模奖励模型(Bradley-Terry 打分器)RLHF

所以"深度 RL"不是新范式,而是范式不变、表示能力升级。它的代价也清晰:深度学习引入了调参敏感、样本效率低、可解释性差,这些问题的工程应对在调参实践和常见陷阱。

一句话定位深度学习

"深度学习决定智能体能'记住多复杂的模式',RL 决定它'为什么要记住这些'。"前者回答表示能力,后者回答学习目标——缺一不可。

八、选型决策表 ​

把上面六组比较浓缩成一张决策表。问自己四个问题,按顺序回答即可走到结论:

问题是否
Q1. 这是不是序列决策(动作影响后续局面)?进入 Q2用监督/无监督/静态优化即可,不必上 RL
Q2. 有没有精确可用的模型/模拟器?优先规划/搜索或最优控制;模拟贵才考虑 model-based RL进入 Q3
Q3. 有没有大量专家示范?先行为克隆打底,再过渡 RL进入 Q4
Q4. 能否写出靠谱的奖励 + 承担试错成本?✅ 上 RL(先从零构建项目)❌ 考虑离线强化学习或干脆不做

进一步的精化建议表:

具体情形推荐范式理由
机器人轨迹跟踪,模型可精确建模最优控制(MPC/LQR)稳、快、可解释,RL 没必要
游戏 / 没有模型的博弈RL(+ MCTS 混合)探索是唯一路径
推荐、广告、A/B 测试(单步选择)Contextual Bandit比全 RL 简单且够用,见多臂老虎机
库存、调度、装箱(有长期代价)序列决策 → RL 或动态规划规模大时学构造启发式
有大量专家日志、无法在线试错行为克隆 + 离线 RL详见离线强化学习
目标难写标量奖励先 IRL/偏好学习,或评估是否能简化目标见奖励工程
想加速大模型推理/对齐RLHF / 直接偏好优化见RLHF

最后一条忠告

选型错误的代价不在"选了 RL",而在选了 RL 却没给它配齐环境、奖励、评估三件套。RL 的失败案例里,绝大多数不是"算法不行",而是"问题不合适 + 基础设施没跟上"。建议决策完再读一遍常见陷阱与反模式的陷阱总表,对照检查自己的项目。

延伸阅读 ​

参考资料 ​

  • Sutton, R. S. & Barto, A. G. (2018). Reinforcement Learning: An Introduction (2nd ed.), §1.7 "Relationship to Optimal Control". MIT Press. 在线全文:http://incompleteideas.net/book/the-book-2nd.html —— 教科书对 RL 与最优控制、运筹学边界的权威论述。
  • Ho, J. & Ermon, S. (2016). Generative Adversarial Imitation Learning. NeurIPS 2016. https://arxiv.org/abs/1606.03476 —— GAIL 原文,模仿学习与 RL 关系的关键文献。
  • Ng, A. Y. & Russell, S. (2000). Algorithms for Inverse Reinforcement Learning. ICML 2000. https://ai.stanford.edu/~ang/papers/icml00-irl.pdf —— 逆强化学习开创性论文。
  • Pomerleau, D. A. (1989). ALVINN: An Autonomous Land Vehicle in a Neural Network. NeurIPS 1989. —— 行为克隆的经典源头(自动驾驶原型车)。
  • Browne, C. et al. (2012). A Survey of Monte Carlo Tree Search Methods. IEEE Transactions on Computational Intelligence and AI in Games. https://ieeexplore.ieee.org/document/6145622 —— MCTS 综述,规划/搜索与学习结合的背景文献。
  • OpenAI (2018). Spinning Up in Deep RL — Key Concepts. https://spinningup.openai.com/en/latest/spinningup/rl_intro.html —— "为什么 RL 与监督/无监督不同"的简明英文对照。