外观
术语表
一句话定位:这一页讲清楚 RL 的全部黑话——读论文、看面试题、跟同事开会时遇到不认识的缩写,翻这一页就够了;每条词条一句话定义,并指向本站讲它的完整页面。
一、使用说明
强化学习的术语密度在机器学习各分支里数一数二:同一个概念有学名、缩写、别名(比如"时序差分"= TD = Temporal Difference,有时又叫"bootstrap 学习")。术语表的用途是快速定位,不是替代正文。
- 怎么读:按类别浏览,或 Ctrl+F 搜缩写。每个词条格式为"术语 | 一句话定义 | 关联页面",关联页面是本站对它的完整讲解。
- 关联页面怎么用:面试追问、概念辨析需要展开时,点链接去读正文;正文里有公式、直觉、例子和"坑"四件套。
- 概念之间的脉络:本站推荐按学习路径的顺序读,术语表更像字典——遇到不会的查一下,然后回到主线。
- 数学定义:本页只给文字定义;涉及公式的(贝尔曼方程、KL 散度、期望等)见数学基础速查。
建议
把本页当作"面试自测清单":随机抽 10 个词条,能不看定义说出每一条吗?说不出的那条就是你的薄弱环节,点进关联页面补课。
二、基础框架术语
这一组是 MDP 语言本身,几乎每个 RL 问题都要用到。
| 术语 | 一句话定义 | 关联页面 |
|---|---|---|
| MDP(马尔可夫决策过程) | 用五元组 (S, A, P, R, γ) 描述序贯决策问题的统一框架,几乎所有 RL 问题都能写成 MDP。 | MDP |
| 马尔可夫性质 | 下一状态只依赖当前状态与动作、与更早历史无关的性质,是 MDP 与贝尔曼方程成立的前提。 | MDP |
| 状态(State) | 智能体观测到的环境状况 s ∈ S,是决策的依据;状态表示是否"够马尔可夫"决定了学习难度。 | MDP |
| 动作(Action) | 智能体在每个状态可采取的选择 a ∈ A;离散(上/下)或连续(力矩值)决定了算法选型。 | MDP |
| 奖励(Reward) | 环境对动作的即时反馈 r,RL 的全部学习目标就是最大化累积奖励。 | 什么是强化学习 |
| 回报(Return) | 从 t 时刻起的折扣累计奖励 G_t = r_t + γr_{t+1} + γ²r_{t+2} + ⋯,价值函数的估计对象。 | MDP |
| 折扣因子(γ) | 0 ≤ γ ≤ 1 的常数,控制未来奖励的权重;γ<1 也让无限时序的回报有界、收敛可证。 | MDP |
| 策略(Policy) | 从状态到动作(分布)的映射 π(a|s),RL 训练的最终产物,部署时直接用它决策。 | MDP |
| 随机策略 / 确定性策略 | 随机策略输出动作概率分布(天然带探索),确定性策略直接输出一个动作(连续控制常用)。 | 策略梯度 |
| 状态价值函数 V(s) | 从状态 s 出发按策略 π 行动所获得的期望回报 V_π(s),回答"这个局面值多少"。 | 价值学习 |
| 动作价值函数 Q(s,a) | 在状态 s 采取动作 a 之后遵循策略 π 的期望回报 Q_π(s,a),DQN 学的就是它。 | 价值学习 |
| 优势函数 A(s,a) | A = Q(s,a) − V(s),度量"这个动作比平均水平好多少",是策略梯度减方差的核心工具。 | 策略梯度 |
| 贝尔曼方程 | 价值函数的自洽方程 V(s) = r + γV(s′),把"长远回报"拆成"即时奖励 + 下一步价值"。 | MDP |
| 贝尔曼最优性 | 最优价值满足 V*(s) = max_a [r + γV*(s′)],是值迭代与 Q-learning 的数学依据。 | 价值学习 |
| 探索与利用(Exploration-Exploitation) | "尝试新动作(探索)"与"使用已知最优(利用)"的权衡,RL 的第一性矛盾。 | 探索与利用 |
| 遗憾(Regret) | 累计收益与"始终选最优动作"的理想收益之差,评估 bandit 算法与在线学习的标准指标。 | 多臂老虎机 |
| 多臂老虎机(Multi-Armed Bandit) | 只有一步决策、没有时序维度的简化 RL,探索-利用研究的理想实验室。 | 多臂老虎机 |
| Contextual Bandit | 带上下文特征的老虎机:每次先看特征再选动作,推荐/广告系统最常用的"RL 前身"。 | 多臂老虎机 |
| 信用分配(Credit Assignment) | 延迟奖励如何回溯到导致它的早期动作的问题,是 RL 比单步监督学习难的核心原因。 | 什么是强化学习 |
| 稀疏奖励(Sparse Reward) | 大多数步骤奖励为零、只在关键事件(如到达终点)有反馈的设定,需要课程学习、内在奖励等对策。 | 奖励工程 |
| 奖励塑形(Reward Shaping) | 通过添加引导性奖励(如"接近目标加分")加速学习;须遵循势能塑形定理,否则可能改变最优策略。 | 奖励工程 |
| Reward Hacking(奖励黑客) | 智能体发现并利用奖励函数漏洞刷分、而非真正完成任务的行为,如绕过目标拿分。 | 奖励工程 |
| POMDP(部分可观测 MDP) | 智能体只能观测状态的投影而非全量状态(如机器人只见局部地图),通常需要记忆或循环网络。 | MDP |
INFO
POMDP 与 MDP 的差别很容易被忽略:工程里几乎都是"状态观测",而算法理论上都假设"状态可知"。观测不完整时,把历史拼接进状态(如帧堆叠)是最朴素的缓解手段。
三、算法家族术语
按"价值学习 → 策略学习 → 两者合流"的谱系排列,方便对照记忆。
| 术语 | 一句话定义 | 关联页面 |
|---|---|---|
| 动态规划(DP) | 在环境模型已知时,通过"策略评估 + 策略改进"迭代求解 MDP 的方法族。 | 价值学习 |
| 策略迭代 | DP 求解法之一:反复"评估当前策略的价值 → 贪心改进策略",直到策略不再变化。 | 价值学习 |
| 值迭代 | 直接迭代贝尔曼最优方程收敛到 V*,最后从 V* 提取贪心策略的 DP 方法。 | 价值学习 |
| 蒙特卡洛方法(MC) | 用完整回合的累计回报样本估计价值,无偏但高方差,只在回合结束时更新。 | 价值学习 |
| 时序差分(TD) | 用"即时奖励 + 下一步价值估计"更新,采用 bootstrap,有偏但方差低、可逐步更新。 | 价值学习 |
| TD 误差 | δ = r + γV(s′) − V(s),TD 学习的更新信号;GAE 本质就是多步 TD 误差的加权组合。 | 价值学习 |
| Q-learning | 经典 off-policy 表格算法,用 max_{a'} Q(s′,a′) 更新 Q,目标策略与行为策略可以不同。 | 价值学习 |
| SARSA | on-policy 的表格 TD 算法,更新时用的是实际采取的下一动作,学的是"行为策略本身"的 Q。 | 价值学习 |
| On-policy / Off-policy | 训练数据是否来自与目标策略相同的策略:on 更稳但样本利用率低,off 可复用历史数据(回放)。 | 价值学习 |
| 经验回放(Experience Replay) | 把历史 (s, a, r, s′) 存进缓冲区、随机抽样更新,打破样本相关性,是 DQN 两大功臣之一。 | 价值学习 |
| 目标网络(Target Network) | 延迟更新的 Q 网络副本,用于生成稳定的自举目标,抑制训练发散,DQN 另一功臣。 | 价值学习 |
| DQN | 神经网络近似 Q + 回放 + 目标网络,2015 年在 49 个 Atari 游戏上超越人类,开启深度 RL 时代。 | 价值学习 |
| Double DQN | 用两个网络解耦"选动作"与"评动作",缓解 Q 值系统性高估。 | 价值学习 |
| Dueling DQN | 把 Q 拆成状态价值 V 与优势 A 两个输出头,让价值估计更稳定、学习更快。 | 价值学习 |
| Prioritized Replay | 按 TD 误差大小加权采样回放样本,让"还没学会"的样本更常被学到。 | 价值学习 |
| Rainbow | 把 Double、Dueling、优先回放、多步回报、分布 Q(C51)、噪声网络等七项改进整合为一。 | 价值学习 |
| 策略梯度(Policy Gradient) | 直接对策略参数求梯度:"提高高回报动作的概率、压低低回报动作",天然支持随机策略。 | 策略梯度 |
| REINFORCE | 最朴素的策略梯度算法,用整回合回报当权重,直觉清晰但方差极大。 | 策略梯度 |
| Baseline | 从回报中减去的量(通常取价值函数 V),不改变梯度期望、只大幅降低方差。 | 策略梯度 |
| Actor-Critic | 策略网络(actor)与价值网络(critic)的组合,critic 给 actor 提供低方差优势信号,当今主流架构。 | Actor-Critic 家族 |
| A2C / A3C | 多环境并行的 Actor-Critic:A3C 是异步版,A2C 是同步版(更常见、更好复现)。 | Actor-Critic 家族 |
| GAE(广义优势估计) | 用参数 λ 把 n 步优势加权组合,在偏差与方差之间连续调节,PPO 的标准配置。 | Actor-Critic 家族 |
| TRPO | 用 KL 散度约束限制每次策略更新的幅度,保证单调改进,但实现复杂、计算重。 | 策略梯度 |
| PPO | 用 clip 裁剪目标近似 TRPO 的约束,简单、稳定、易实现,目前最主流的 on-policy 算法。 | 策略梯度 |
| DDPG | 确定性策略梯度 + Q 学习的 off-policy 连续控制算法,是"深度 Actor-Critic"的早期形态。 | Actor-Critic 家族 |
| TD3 | 对 DDPG 的三项修复:双 Q、延迟更新、目标策略平滑,大幅缓解价值高估与方差。 | Actor-Critic 家族 |
| SAC | 最大熵 off-policy 算法,目标函数额外最大化策略熵,连续控制领域的事实标准之一。 | Actor-Critic 家族 |
| 熵正则(Entropy Regularization) | 在目标函数里加策略熵项鼓励随机性,防止策略过早收敛、兼顾探索。 | 探索与利用 |
| 温度系数(α) | SAC 中控制"熵奖励"权重的系数,可做自动温度调节(自动调整 α)省去手调。 | Actor-Critic 家族 |
高频易错点
SARSA 与 Q-learning 的区别:两者公式只差一步——SARSA 用实际采取的 a′,Q-learning 用 max 选的 a′。这决定了 on/off-policy 属性,是面试和调参中反复出现的考点,详见价值学习。
四、深度 RL 工程术语
算法落地阶段的高频词汇,多为"为什么 DQN/PPO 能work、怎么部署"相关。
| 术语 | 一句话定义 | 关联页面 |
|---|---|---|
| 样本效率 | 达到给定性能所需的环境交互次数;off-policy(SAC、DQN)通常远高于 on-policy(PPO)。 | Actor-Critic 家族 |
| 学习曲线 | 训练中回报随步数/环境交互数的变化曲线,是 RL 调参与评估的第一诊断工具。 | 评估与基准 |
| 种子(Seed) | 随机数种子;固定 seed 可复现实验,但"用同一个 seed 反复调参"会造成隐蔽过拟合。 | 评估与基准 |
| 复现性 | 同一代码与配置能重现相近结果的能力,要求固定 seed、记录全部超参与环境版本。 | 常见陷阱与反模式 |
| 分布偏移 | 训练与部署数据分布不一致(如仿真→真实、离线→在线),RL 策略常因此性能崩塌。 | 离线强化学习 |
| 域随机化(Domain Randomization) | 训练时随机化仿真物理/渲染参数,让策略学到不变性,实现零样本 Sim2Real 的关键手段。 | 机器人 Sim2Real |
| Sim2Real | 仿真训练 → 真实环境部署的迁移过程,核心鸿沟是动力学、观测与接触的建模误差。 | 机器人 Sim2Real |
| 课程学习(Curriculum Learning) | 从简单任务逐步过渡到困难任务的训练安排,应对稀疏奖励与探索困难。 | 奖励工程 |
| HER(Hindsight Experience Replay) | 把"未达成的目标"改写成"已达成"来构造正样本,解决稀疏奖励与多目标问题。 | 奖励工程 |
| 内在奖励 / Curiosity | 以"新颖性、预测误差"等内在信号充当额外奖励,驱动智能体探索未见过的状态。 | 探索与利用 |
| Count-based 探索 | 统计状态访问次数、对未知状态给额外奖励的朴素探索法,表格世界好用、高维失效。 | 探索与利用 |
| RND(随机网络蒸馏) | 用固定随机网络的输出当"新颖性靶子",预测误差大的状态更"新奇"、给更高内在奖励。 | 探索与利用 |
| 向量化环境 | 并行运行多个环境副本收集经验,提升吞吐与训练稳定性,是 A2C/PPO 的工程标配。 | 框架与工具怎么选 |
五、高级范式术语
离线 RL、多智能体、对齐等前沿范式的词汇,读 2020 年代论文必备。
| 术语 | 一句话定义 | 关联页面 |
|---|---|---|
| Model-based RL | 先学习环境模型、再在模型内规划/学习的范式,样本效率高,但模型误差会累积。 | 基于模型的 RL |
| 世界模型(World Model) | 编码状态表示并预测转移与奖励的模型,是 Dreamer、TD-MPC、MuZero 的核心组件。 | 基于模型的 RL |
| Model-free RL | 不学环境模型、直接由交互数据学价值/策略的算法(DQN、PPO、SAC 都是)。 | 价值学习 |
| 离线 RL(Offline RL) | 只使用固定历史数据集训练、不再与环境交互,关键困难是 OOD 动作的价值高估。 | 离线强化学习 |
| OOD(Out-of-Distribution) | 训练数据中不存在或极少覆盖的状态-动作对;离线 RL 中 Q 网络对它外推出的"幻觉高估"是主要病灶。 | 离线强化学习 |
| CQL(保守 Q 学习) | 在 Q 学习目标中加入对 OOD 动作价值的惩罚,用"保守主义"抑制高估的离线 RL 方法。 | 离线强化学习 |
| IQL(隐式 Q 学习) | 只回归数据分布内动作的价值、不做外推的离线 RL 方法,无需额外的行为约束项。 | 离线强化学习 |
| 行为克隆(BC) | 直接从专家示范做监督学习(输入状态、输出动作),简单但无法处理专家外的状态。 | RL vs 相邻领域 |
| 模仿学习(Imitation Learning) | 从示范学习策略的范式家族:行为克隆、逆强化学习、GAIL 等。 | RL vs 相邻领域 |
| 逆强化学习(IRL) | 从专家行为反推奖励函数,是"奖励工程太难写"时的另一条路径。 | 奖励工程 |
| 多智能体 RL(MARL) | 多个智能体同时学习决策,环境动态随他人策略变化而不平稳。 | 多智能体强化学习 |
| CTDE | "集中训练、分布式执行":训练时可用全局信息,部署时只用局部观测,MARL 的主流范式。 | 多智能体强化学习 |
| 纳什均衡 | 一组策略组合使得无人能单方面改进自身收益,是 MARL 的收敛目标也常是困难所在。 | 多智能体强化学习 |
| 非平稳性 | 环境动态因其他智能体同时学习而改变,导致"单智能体 MDP 假设"直接失效。 | 多智能体强化学习 |
| 值分解(Value Decomposition) | 把联合 Q 值分解为个体 Q 值之和/之积(如 QMIX),实现 CTDE 的经典手段。 | 多智能体强化学习 |
| MADDPG | 集中式 critic、分布式 actor 的多智能体扩展,off-policy、连续动作。 | 多智能体强化学习 |
| MAPPO | PPO 的多智能体版本,简单直接,在不少任务上反而刷新 SOTA。 | 多智能体强化学习 |
| RLHF | 用人类偏好训练奖励模型、再用 PPO 微调语言模型的三阶段对齐流水线(SFT → RM → PPO)。 | RLHF 与人类反馈对齐 |
| 奖励模型(Reward Model) | 在人类偏好对上训练、给候选文本打分的模型,充当 RLHF 中"自动化的人工奖励"。 | RLHF 与人类反馈对齐 |
| Bradley-Terry 模型 | 偏好建模的标准假设:P(选 A 而非 B) = σ(r(A) − r(B)),奖励模型训练的基础。 | RLHF 与人类反馈对齐 |
| KL 惩罚 | RLHF 中约束新策略不要偏离参考模型太远的正则项,防止 PPO 把模型"改飞"。 | RLHF 与人类反馈对齐 |
| DPO(直接偏好优化) | 从偏好数据直接构造策略目标、跳过奖励模型与 PPO 的对齐简化路线。 | RLHF 与人类反馈对齐 |
| 对齐(Alignment) | 让模型行为符合人类意图与价值的整体目标,RLHF、DPO、RLAIF 都是其实现手段。 | RLHF 与人类反馈对齐 |
| 对齐税(Alignment Tax) | 对齐训练付出的通用能力下降代价,RLHF 的经典副作用。 | RLHF 与人类反馈对齐 |
| 奖励过度优化 | 奖励模型分数被刷高但真实质量下降的现象(Goodhart 定律),RLHF 训练的典型失败模式。 | RLHF 与人类反馈对齐 |
| RLAIF | 用 AI 反馈替代人类反馈来训练奖励模型,实现对齐的规模化扩展。 | RLHF 与人类反馈对齐 |
六、易混术语辨析
以下五组是面试与论文阅读里最常见的"混淆重灾区",单独拎出来对比。
| 混淆组 | 关键区分 | 一句话记忆法 |
|---|---|---|
| MC vs TD | MC 用完整回合回报(无偏、高方差);TD 用"奖励 + 自举估计"(有偏、低方差) | "MC 等结果,TD 猜一步" |
| On-policy vs Off-policy | 数据来源是否与目标策略一致;off-policy 能复用历史数据 | "SARSA 学自己,Q 学别人" |
| 价值学习 vs 策略梯度 | 价值学习先学 Q 再导出策略;策略梯度直接学策略 | "先估后选 vs 直接选" |
| Model-based vs Model-free | 是否显式学习环境转移/奖励模型 | "要不要先学世界" |
| RLHF vs DPO | RLHF 三阶段(RM+PPO);DPO 一步到位、无 RM 无 PPO | "绕路 vs 直达" |
| TRPO vs PPO | TRPO 用硬 KL 约束;PPO 用软 clip 近似约束 | "约束改成惩罚(近似)" |
| DDPG vs TD3 vs SAC | 三者都是 off-policy 连续控制,TD3 修 DDPG 的高估,SAC 再加最大熵 | "SAC = TD3 的思想 + 熵" |
七、缩写速查(A–Z)
按字母序整理全文所有缩写,记不住出处时直接查表。
| 缩写 | 全称 | 本页位置 |
|---|---|---|
| A2C / A3C | Advantage Actor-Critic / Asynchronous A2C | 算法家族 |
| AC | Actor-Critic | 算法家族 |
| BC | Behavior Cloning 行为克隆 | 高级范式 |
| BT | Bradley-Terry 偏好模型 | 高级范式 |
| CQL | Conservative Q-Learning | 高级范式 |
| CTDE | Centralized Training with Decentralized Execution | 高级范式 |
| DDPG | Deep Deterministic Policy Gradient | 算法家族 |
| DPO | Direct Preference Optimization | 高级范式 |
| DP | Dynamic Programming 动态规划 | 算法家族 |
| DQN | Deep Q-Network | 算法家族 |
| GAE | Generalized Advantage Estimation | 算法家族 |
| HER | Hindsight Experience Replay | 工程术语 |
| IQL | Implicit Q-Learning | 高级范式 |
| IRL | Inverse Reinforcement Learning | 高级范式 |
| KL | Kullback-Leibler 散度 | 数学基础速查 |
| MARL | Multi-Agent RL | 高级范式 |
| MC | Monte Carlo 蒙特卡洛 | 算法家族 |
| MDP | Markov Decision Process | 基础框架 |
| OOD | Out-of-Distribution 分布外 | 高级范式 |
| POMDP | Partially Observable MDP | 基础框架 |
| PPO | Proximal Policy Optimization | 算法家族 |
| RM | Reward Model 奖励模型 | 高级范式 |
| RND | Random Network Distillation | 工程术语 |
| RLHF | RL from Human Feedback | 高级范式 |
| SAC | Soft Actor-Critic | 算法家族 |
| SARSA | State-Action-Reward-State-Action | 算法家族 |
| SFT | Supervised Fine-Tuning 监督微调 | RLHF |
| TD | Temporal Difference 时序差分 | 算法家族 |
| TD3 | Twin Delayed DDPG | 算法家族 |
| TRPO | Trust Region Policy Optimization | 算法家族 |
DANGER
缩写同名异义的情况在论文里很常见:例如 TD 有时指"时序差分",有时指"任务描述";IML 在个别语境是"隐式模仿学习"。遇到缩写务必结合上下文确认含义,面试里被追问时先说全称再展开。
延伸阅读
- 马尔可夫决策过程(MDP) —— 术语表的理论根基,五元组与贝尔曼方程的完整推导。
- 价值学习:从动态规划到 DQN —— DP/MC/TD/Q-learning/DQN 家族的系统讲解。
- 策略梯度方法 —— REINFORCE、advantage、PPO 的直觉与公式。
- RLHF 与人类反馈对齐 —— 对齐范式全部术语(RM、KL、DPO、对齐税)的来龙去脉。
- 数学基础速查 —— 本页词条背后的数学工具与对应算法。
- 精选资源清单 —— 想系统学一遍,从这里挑教科书与课程。
参考资料
- Sutton, R. S., & Barto, A. G. (2018). Reinforcement Learning: An Introduction, 2nd ed., MIT Press. 免费在线版:http://incompleteideas.net/book/RLbook2020.pdf —— 术语的权威出处。
- OpenAI Spinning Up(术语表部分):https://spinningup.openai.com/en/latest/ —— 英文版 RL 术语速查,与本页互补。
- David Silver 的 UCL 强化学习课程:https://www.davidsilver.uk/teaching/ —— 术语对应的完整课程视频与讲义。
- Lilian Weng 博客:https://lilianweng.github.io/ —— 覆盖 RLHF、离线 RL、世界模型等前沿术语的长文讲解。