Skip to content

术语表

本页速览 RL 术语速查:MDP、贝尔曼方程、TD、MC、GAE、PPO、SAC、DQN、OOD、CTDE、RLHF、reward hacking 等 60+ 词条,每条一句话定义 + 关联页面。

术语表 ​

一句话定位:这一页讲清楚 RL 的全部黑话——读论文、看面试题、跟同事开会时遇到不认识的缩写,翻这一页就够了;每条词条一句话定义,并指向本站讲它的完整页面。

一、使用说明 ​

强化学习的术语密度在机器学习各分支里数一数二:同一个概念有学名、缩写、别名(比如"时序差分"= TD = Temporal Difference,有时又叫"bootstrap 学习")。术语表的用途是快速定位,不是替代正文。

  • 怎么读:按类别浏览,或 Ctrl+F 搜缩写。每个词条格式为"术语 | 一句话定义 | 关联页面",关联页面是本站对它的完整讲解。
  • 关联页面怎么用:面试追问、概念辨析需要展开时,点链接去读正文;正文里有公式、直觉、例子和"坑"四件套。
  • 概念之间的脉络:本站推荐按学习路径的顺序读,术语表更像字典——遇到不会的查一下,然后回到主线。
  • 数学定义:本页只给文字定义;涉及公式的(贝尔曼方程、KL 散度、期望等)见数学基础速查。

建议

把本页当作"面试自测清单":随机抽 10 个词条,能不看定义说出每一条吗?说不出的那条就是你的薄弱环节,点进关联页面补课。

二、基础框架术语 ​

这一组是 MDP 语言本身,几乎每个 RL 问题都要用到。

术语一句话定义关联页面
MDP(马尔可夫决策过程)用五元组 (S, A, P, R, γ) 描述序贯决策问题的统一框架,几乎所有 RL 问题都能写成 MDP。MDP
马尔可夫性质下一状态只依赖当前状态与动作、与更早历史无关的性质,是 MDP 与贝尔曼方程成立的前提。MDP
状态(State)智能体观测到的环境状况 s ∈ S,是决策的依据;状态表示是否"够马尔可夫"决定了学习难度。MDP
动作(Action)智能体在每个状态可采取的选择 a ∈ A;离散(上/下)或连续(力矩值)决定了算法选型。MDP
奖励(Reward)环境对动作的即时反馈 r,RL 的全部学习目标就是最大化累积奖励。什么是强化学习
回报(Return)从 t 时刻起的折扣累计奖励 G_t = r_t + γr_{t+1} + γ²r_{t+2} + ⋯,价值函数的估计对象。MDP
折扣因子(γ)0 ≤ γ ≤ 1 的常数,控制未来奖励的权重;γ<1 也让无限时序的回报有界、收敛可证。MDP
策略(Policy)从状态到动作(分布)的映射 π(a|s),RL 训练的最终产物,部署时直接用它决策。MDP
随机策略 / 确定性策略随机策略输出动作概率分布(天然带探索),确定性策略直接输出一个动作(连续控制常用)。策略梯度
状态价值函数 V(s)从状态 s 出发按策略 π 行动所获得的期望回报 V_π(s),回答"这个局面值多少"。价值学习
动作价值函数 Q(s,a)在状态 s 采取动作 a 之后遵循策略 π 的期望回报 Q_π(s,a),DQN 学的就是它。价值学习
优势函数 A(s,a)A = Q(s,a) − V(s),度量"这个动作比平均水平好多少",是策略梯度减方差的核心工具。策略梯度
贝尔曼方程价值函数的自洽方程 V(s) = r + γV(s′),把"长远回报"拆成"即时奖励 + 下一步价值"。MDP
贝尔曼最优性最优价值满足 V*(s) = max_a [r + γV*(s′)],是值迭代与 Q-learning 的数学依据。价值学习
探索与利用(Exploration-Exploitation)"尝试新动作(探索)"与"使用已知最优(利用)"的权衡,RL 的第一性矛盾。探索与利用
遗憾(Regret)累计收益与"始终选最优动作"的理想收益之差,评估 bandit 算法与在线学习的标准指标。多臂老虎机
多臂老虎机(Multi-Armed Bandit)只有一步决策、没有时序维度的简化 RL,探索-利用研究的理想实验室。多臂老虎机
Contextual Bandit带上下文特征的老虎机:每次先看特征再选动作,推荐/广告系统最常用的"RL 前身"。多臂老虎机
信用分配(Credit Assignment)延迟奖励如何回溯到导致它的早期动作的问题,是 RL 比单步监督学习难的核心原因。什么是强化学习
稀疏奖励(Sparse Reward)大多数步骤奖励为零、只在关键事件(如到达终点)有反馈的设定,需要课程学习、内在奖励等对策。奖励工程
奖励塑形(Reward Shaping)通过添加引导性奖励(如"接近目标加分")加速学习;须遵循势能塑形定理,否则可能改变最优策略。奖励工程
Reward Hacking(奖励黑客)智能体发现并利用奖励函数漏洞刷分、而非真正完成任务的行为,如绕过目标拿分。奖励工程
POMDP(部分可观测 MDP)智能体只能观测状态的投影而非全量状态(如机器人只见局部地图),通常需要记忆或循环网络。MDP

INFO

POMDP 与 MDP 的差别很容易被忽略:工程里几乎都是"状态观测",而算法理论上都假设"状态可知"。观测不完整时,把历史拼接进状态(如帧堆叠)是最朴素的缓解手段。

三、算法家族术语 ​

按"价值学习 → 策略学习 → 两者合流"的谱系排列,方便对照记忆。

术语一句话定义关联页面
动态规划(DP)在环境模型已知时,通过"策略评估 + 策略改进"迭代求解 MDP 的方法族。价值学习
策略迭代DP 求解法之一:反复"评估当前策略的价值 → 贪心改进策略",直到策略不再变化。价值学习
值迭代直接迭代贝尔曼最优方程收敛到 V*,最后从 V* 提取贪心策略的 DP 方法。价值学习
蒙特卡洛方法(MC)用完整回合的累计回报样本估计价值,无偏但高方差,只在回合结束时更新。价值学习
时序差分(TD)用"即时奖励 + 下一步价值估计"更新,采用 bootstrap,有偏但方差低、可逐步更新。价值学习
TD 误差δ = r + γV(s′) − V(s),TD 学习的更新信号;GAE 本质就是多步 TD 误差的加权组合。价值学习
Q-learning经典 off-policy 表格算法,用 max_{a'} Q(s′,a′) 更新 Q,目标策略与行为策略可以不同。价值学习
SARSAon-policy 的表格 TD 算法,更新时用的是实际采取的下一动作,学的是"行为策略本身"的 Q。价值学习
On-policy / Off-policy训练数据是否来自与目标策略相同的策略:on 更稳但样本利用率低,off 可复用历史数据(回放)。价值学习
经验回放(Experience Replay)把历史 (s, a, r, s′) 存进缓冲区、随机抽样更新,打破样本相关性,是 DQN 两大功臣之一。价值学习
目标网络(Target Network)延迟更新的 Q 网络副本,用于生成稳定的自举目标,抑制训练发散,DQN 另一功臣。价值学习
DQN神经网络近似 Q + 回放 + 目标网络,2015 年在 49 个 Atari 游戏上超越人类,开启深度 RL 时代。价值学习
Double DQN用两个网络解耦"选动作"与"评动作",缓解 Q 值系统性高估。价值学习
Dueling DQN把 Q 拆成状态价值 V 与优势 A 两个输出头,让价值估计更稳定、学习更快。价值学习
Prioritized Replay按 TD 误差大小加权采样回放样本,让"还没学会"的样本更常被学到。价值学习
Rainbow把 Double、Dueling、优先回放、多步回报、分布 Q(C51)、噪声网络等七项改进整合为一。价值学习
策略梯度(Policy Gradient)直接对策略参数求梯度:"提高高回报动作的概率、压低低回报动作",天然支持随机策略。策略梯度
REINFORCE最朴素的策略梯度算法,用整回合回报当权重,直觉清晰但方差极大。策略梯度
Baseline从回报中减去的量(通常取价值函数 V),不改变梯度期望、只大幅降低方差。策略梯度
Actor-Critic策略网络(actor)与价值网络(critic)的组合,critic 给 actor 提供低方差优势信号,当今主流架构。Actor-Critic 家族
A2C / A3C多环境并行的 Actor-Critic:A3C 是异步版,A2C 是同步版(更常见、更好复现)。Actor-Critic 家族
GAE(广义优势估计)用参数 λ 把 n 步优势加权组合,在偏差与方差之间连续调节,PPO 的标准配置。Actor-Critic 家族
TRPO用 KL 散度约束限制每次策略更新的幅度,保证单调改进,但实现复杂、计算重。策略梯度
PPO用 clip 裁剪目标近似 TRPO 的约束,简单、稳定、易实现,目前最主流的 on-policy 算法。策略梯度
DDPG确定性策略梯度 + Q 学习的 off-policy 连续控制算法,是"深度 Actor-Critic"的早期形态。Actor-Critic 家族
TD3对 DDPG 的三项修复:双 Q、延迟更新、目标策略平滑,大幅缓解价值高估与方差。Actor-Critic 家族
SAC最大熵 off-policy 算法,目标函数额外最大化策略熵,连续控制领域的事实标准之一。Actor-Critic 家族
熵正则(Entropy Regularization)在目标函数里加策略熵项鼓励随机性,防止策略过早收敛、兼顾探索。探索与利用
温度系数(α)SAC 中控制"熵奖励"权重的系数,可做自动温度调节(自动调整 α)省去手调。Actor-Critic 家族

高频易错点

SARSA 与 Q-learning 的区别:两者公式只差一步——SARSA 用实际采取的 a′,Q-learning 用 max 选的 a′。这决定了 on/off-policy 属性,是面试和调参中反复出现的考点,详见价值学习。

四、深度 RL 工程术语 ​

算法落地阶段的高频词汇,多为"为什么 DQN/PPO 能work、怎么部署"相关。

术语一句话定义关联页面
样本效率达到给定性能所需的环境交互次数;off-policy(SAC、DQN)通常远高于 on-policy(PPO)。Actor-Critic 家族
学习曲线训练中回报随步数/环境交互数的变化曲线,是 RL 调参与评估的第一诊断工具。评估与基准
种子(Seed)随机数种子;固定 seed 可复现实验,但"用同一个 seed 反复调参"会造成隐蔽过拟合。评估与基准
复现性同一代码与配置能重现相近结果的能力,要求固定 seed、记录全部超参与环境版本。常见陷阱与反模式
分布偏移训练与部署数据分布不一致(如仿真→真实、离线→在线),RL 策略常因此性能崩塌。离线强化学习
域随机化(Domain Randomization)训练时随机化仿真物理/渲染参数,让策略学到不变性,实现零样本 Sim2Real 的关键手段。机器人 Sim2Real
Sim2Real仿真训练 → 真实环境部署的迁移过程,核心鸿沟是动力学、观测与接触的建模误差。机器人 Sim2Real
课程学习(Curriculum Learning)从简单任务逐步过渡到困难任务的训练安排,应对稀疏奖励与探索困难。奖励工程
HER(Hindsight Experience Replay)把"未达成的目标"改写成"已达成"来构造正样本,解决稀疏奖励与多目标问题。奖励工程
内在奖励 / Curiosity以"新颖性、预测误差"等内在信号充当额外奖励,驱动智能体探索未见过的状态。探索与利用
Count-based 探索统计状态访问次数、对未知状态给额外奖励的朴素探索法,表格世界好用、高维失效。探索与利用
RND(随机网络蒸馏)用固定随机网络的输出当"新颖性靶子",预测误差大的状态更"新奇"、给更高内在奖励。探索与利用
向量化环境并行运行多个环境副本收集经验,提升吞吐与训练稳定性,是 A2C/PPO 的工程标配。框架与工具怎么选

五、高级范式术语 ​

离线 RL、多智能体、对齐等前沿范式的词汇,读 2020 年代论文必备。

术语一句话定义关联页面
Model-based RL先学习环境模型、再在模型内规划/学习的范式,样本效率高,但模型误差会累积。基于模型的 RL
世界模型(World Model)编码状态表示并预测转移与奖励的模型,是 Dreamer、TD-MPC、MuZero 的核心组件。基于模型的 RL
Model-free RL不学环境模型、直接由交互数据学价值/策略的算法(DQN、PPO、SAC 都是)。价值学习
离线 RL(Offline RL)只使用固定历史数据集训练、不再与环境交互,关键困难是 OOD 动作的价值高估。离线强化学习
OOD(Out-of-Distribution)训练数据中不存在或极少覆盖的状态-动作对;离线 RL 中 Q 网络对它外推出的"幻觉高估"是主要病灶。离线强化学习
CQL(保守 Q 学习)在 Q 学习目标中加入对 OOD 动作价值的惩罚,用"保守主义"抑制高估的离线 RL 方法。离线强化学习
IQL(隐式 Q 学习)只回归数据分布内动作的价值、不做外推的离线 RL 方法,无需额外的行为约束项。离线强化学习
行为克隆(BC)直接从专家示范做监督学习(输入状态、输出动作),简单但无法处理专家外的状态。RL vs 相邻领域
模仿学习(Imitation Learning)从示范学习策略的范式家族:行为克隆、逆强化学习、GAIL 等。RL vs 相邻领域
逆强化学习(IRL)从专家行为反推奖励函数,是"奖励工程太难写"时的另一条路径。奖励工程
多智能体 RL(MARL)多个智能体同时学习决策,环境动态随他人策略变化而不平稳。多智能体强化学习
CTDE"集中训练、分布式执行":训练时可用全局信息,部署时只用局部观测,MARL 的主流范式。多智能体强化学习
纳什均衡一组策略组合使得无人能单方面改进自身收益,是 MARL 的收敛目标也常是困难所在。多智能体强化学习
非平稳性环境动态因其他智能体同时学习而改变,导致"单智能体 MDP 假设"直接失效。多智能体强化学习
值分解(Value Decomposition)把联合 Q 值分解为个体 Q 值之和/之积(如 QMIX),实现 CTDE 的经典手段。多智能体强化学习
MADDPG集中式 critic、分布式 actor 的多智能体扩展,off-policy、连续动作。多智能体强化学习
MAPPOPPO 的多智能体版本,简单直接,在不少任务上反而刷新 SOTA。多智能体强化学习
RLHF用人类偏好训练奖励模型、再用 PPO 微调语言模型的三阶段对齐流水线(SFT → RM → PPO)。RLHF 与人类反馈对齐
奖励模型(Reward Model)在人类偏好对上训练、给候选文本打分的模型,充当 RLHF 中"自动化的人工奖励"。RLHF 与人类反馈对齐
Bradley-Terry 模型偏好建模的标准假设:P(选 A 而非 B) = σ(r(A) − r(B)),奖励模型训练的基础。RLHF 与人类反馈对齐
KL 惩罚RLHF 中约束新策略不要偏离参考模型太远的正则项,防止 PPO 把模型"改飞"。RLHF 与人类反馈对齐
DPO(直接偏好优化)从偏好数据直接构造策略目标、跳过奖励模型与 PPO 的对齐简化路线。RLHF 与人类反馈对齐
对齐(Alignment)让模型行为符合人类意图与价值的整体目标,RLHF、DPO、RLAIF 都是其实现手段。RLHF 与人类反馈对齐
对齐税(Alignment Tax)对齐训练付出的通用能力下降代价,RLHF 的经典副作用。RLHF 与人类反馈对齐
奖励过度优化奖励模型分数被刷高但真实质量下降的现象(Goodhart 定律),RLHF 训练的典型失败模式。RLHF 与人类反馈对齐
RLAIF用 AI 反馈替代人类反馈来训练奖励模型,实现对齐的规模化扩展。RLHF 与人类反馈对齐

六、易混术语辨析 ​

以下五组是面试与论文阅读里最常见的"混淆重灾区",单独拎出来对比。

混淆组关键区分一句话记忆法
MC vs TDMC 用完整回合回报(无偏、高方差);TD 用"奖励 + 自举估计"(有偏、低方差)"MC 等结果,TD 猜一步"
On-policy vs Off-policy数据来源是否与目标策略一致;off-policy 能复用历史数据"SARSA 学自己,Q 学别人"
价值学习 vs 策略梯度价值学习先学 Q 再导出策略;策略梯度直接学策略"先估后选 vs 直接选"
Model-based vs Model-free是否显式学习环境转移/奖励模型"要不要先学世界"
RLHF vs DPORLHF 三阶段(RM+PPO);DPO 一步到位、无 RM 无 PPO"绕路 vs 直达"
TRPO vs PPOTRPO 用硬 KL 约束;PPO 用软 clip 近似约束"约束改成惩罚(近似)"
DDPG vs TD3 vs SAC三者都是 off-policy 连续控制,TD3 修 DDPG 的高估,SAC 再加最大熵"SAC = TD3 的思想 + 熵"

七、缩写速查(A–Z) ​

按字母序整理全文所有缩写,记不住出处时直接查表。

缩写全称本页位置
A2C / A3CAdvantage Actor-Critic / Asynchronous A2C算法家族
ACActor-Critic算法家族
BCBehavior Cloning 行为克隆高级范式
BTBradley-Terry 偏好模型高级范式
CQLConservative Q-Learning高级范式
CTDECentralized Training with Decentralized Execution高级范式
DDPGDeep Deterministic Policy Gradient算法家族
DPODirect Preference Optimization高级范式
DPDynamic Programming 动态规划算法家族
DQNDeep Q-Network算法家族
GAEGeneralized Advantage Estimation算法家族
HERHindsight Experience Replay工程术语
IQLImplicit Q-Learning高级范式
IRLInverse Reinforcement Learning高级范式
KLKullback-Leibler 散度数学基础速查
MARLMulti-Agent RL高级范式
MCMonte Carlo 蒙特卡洛算法家族
MDPMarkov Decision Process基础框架
OODOut-of-Distribution 分布外高级范式
POMDPPartially Observable MDP基础框架
PPOProximal Policy Optimization算法家族
RMReward Model 奖励模型高级范式
RNDRandom Network Distillation工程术语
RLHFRL from Human Feedback高级范式
SACSoft Actor-Critic算法家族
SARSAState-Action-Reward-State-Action算法家族
SFTSupervised Fine-Tuning 监督微调RLHF
TDTemporal Difference 时序差分算法家族
TD3Twin Delayed DDPG算法家族
TRPOTrust Region Policy Optimization算法家族

DANGER

缩写同名异义的情况在论文里很常见:例如 TD 有时指"时序差分",有时指"任务描述";IML 在个别语境是"隐式模仿学习"。遇到缩写务必结合上下文确认含义,面试里被追问时先说全称再展开。

延伸阅读 ​

参考资料 ​