外观
JD 知识点拆解
一句话定位:这一页把 JD 里的每个技能词翻译成本站的具体页面和具体考点——30+ 技能词的映射总表、"会/不会/半会不会"四象限自评法、个人补课清单模板,以及高频考点的权重排序。
从 JD 清单 抄下来的技能词,此刻还是一堆名词。本页做三件事:把它们翻译成知识点 → 让你诚实自评 → 产出一张带优先级的补课清单。这张清单就是你接下来两周的学习作战地图,也是 面试题库 的输入。
一、技能词 → 页面映射总表(30+ 词)
下表把 JD 中最高频的 30+ 个技能词归为四大类,每词给出:它到底考什么、对应本站页面(含术语表速查入口)。
A 类:RL 理论(面试必考的主战场)
| JD 技能词 | 具体考什么 | 对应页面 |
|---|---|---|
| MDP / 马尔可夫决策过程 | 五元组、马尔可夫性质、折扣回报、策略与价值函数 | markov-decision-process |
| 贝尔曼方程 | 状态价值/动作价值的递推式、最优性原理 | markov-decision-process |
| Q-learning | off-policy TD 更新、收敛直觉 | value-based |
| SARSA | on-policy TD、与 Q-learning 的差别 | value-based |
| TD / 时序差分 | TD(0) 更新、TD 误差、bootstrap、MC vs TD | value-based |
| DQN 及变体 | 经验回放、目标网络、Double/Dueling/Rainbow | value-based |
| 策略梯度 | 策略梯度定理直觉、REINFORCE、baseline/advantage | policy-gradient |
| PPO | clip 目标、为什么稳、与 TRPO 的关系 | policy-gradient |
| GAE | 广义优势估计、λ 的含义 | policy-gradient |
| Actor-Critic | 两个网络分工、A2C/A3C | actor-critic |
| SAC | 最大熵目标、自动温度、连续控制为何强 | actor-critic |
| TD3 / DDPG | 连续动作、双 Q、延迟更新 | actor-critic |
| 探索与利用 | ε-greedy、UCB、Thompson Sampling、熵正则 | exploration-exploitation |
| 多臂老虎机 / contextual bandit | 遗憾、UCB1、后验采样、推荐落地 | bandits |
| 奖励设计 / reward hacking | 奖励塑形、稀疏奖励、钻空子案例 | reward-engineering |
| 离线 RL | OOD、价值高估、CQL/IQL、何时不该用 | offline-rl |
| 多智能体 | 非平稳性、CTDE、MADDPG/QMIX | multi-agent |
| 世界模型 / model-based | MPC、Dreamer、TD-MPC、模型误差 | model-based |
B 类:RLHF / 大模型对齐(2026 年最热)
| JD 技能词 | 具体考什么 | 对应页面 |
|---|---|---|
| RLHF 三阶段 | SFT→RM→PPO、为什么不能只靠 SFT | rlhf |
| 奖励模型 / Bradley-Terry | 偏好对训练、分数标定 | rlhf |
| KL 惩罚 | 参考模型 KL、为什么必须有 | rlhf |
| 奖励过优化 / Goodhart | 对齐税、分数涨但质量降 | rlhf |
| DPO | 闭式偏好目标、与 PPO 的取舍 | rlhf |
| 对齐评估 | 帮助性/无害性/事实性、评测集 | rlhf 与 evaluation-benchmarks |
| SFT 与偏好数据流水线 | 数据质量、去重、质量分层 | LLM 对齐案例 |
| 推理增强 RL(RLVR、R1) | 可验证奖励、过程奖励 | 前沿论文 |
C 类:深度学习与代码
| JD 技能词 | 具体考什么 | 对应页面 |
|---|---|---|
| PyTorch / JAX | 张量、autograd、模块化实现 | framework-comparison |
| 分布式训练 | DP/PP/TP、DeepSpeed、梯度同步 | build-your-own |
| 反向传播 / 优化器 | 链式法则、Adam、梯度消失 | math-primer |
| Transformer / 注意力 | 自注意力、位置编码(对齐岗必考) | rlhf 相关背景 |
| 实验管理 | 配置(Hydra)、日志、W&B/TensorBoard | evaluation-in-practice |
| 代码规范 | 单元测试、代码评审、CI | build-your-own |
| Gymnasium API | reset/step/obs/action space | gymnasium-tutorial |
D 类:工程与仿真、业务与数学
| JD 技能词 | 具体考什么 | 对应页面 |
|---|---|---|
| MuJoCo / Isaac / 仿真器 | 物理引擎、域随机化、Sim2Real | datasets-tools 与 robotics-sim2real |
| 分布式采样 / 并行训练 | 环境并行、向量化、GPU 采样 | build-your-own |
| 评估协议 | 固定 seed、多运行、学习曲线、IQR | evaluation-in-practice |
| 基准(Atari/MuJoCo/Procgen) | 环境图谱、各自的坑 | evaluation-benchmarks |
| 概率与期望 | 期望、条件期望、方差、KL 散度 | math-primer |
| 优化基础 | 凸优化、随机梯度、拉格朗日 | math-primer |
| 业务建模 | 把业务指标写成 MDP/奖励、离线评估业务收益 | reward-engineering 与各 case 页 |
| 统计与因果(策略岗) | A/B 测试、偏差、置信区间 | bandits 相关落地章节 |
| C++ / ROS(机器人岗) | 真机管线、通信 | robotics-sim2real |
映射表怎么用
这张表是"JD 词 → 本站页"的索引,也是本模块与 概念模块、实践模块、论文模块 三大内容模块的接线板。每当你从 JD 里抄出一个陌生词,先来这里查它归哪类、考什么,再决定投入多少时间。
二、四象限自评法:会 / 半会不会 / 不会 / 不需要
对映射表里每个技能词,做一次诚实的四象限分类。分类的诚实度直接决定补课清单的质量——自评过高是面试翻车的第一大原因。
| 象限 | 判定标准 | 行动 |
|---|---|---|
| 会(精通) | 能被追问三层(是什么→为什么→边界/坑)且能手写核心公式 | 在简历里写进项目细节,展示为主 |
| 半会不会 | 听说过、能说个大概、一追问公式/细节就卡壳 | 补漏主战场:重读对应页面 + 用面试题库自测 |
| 不会但需要 | JD 明确要求或高频出现,但完全没学过 | 系统学:进入学习路径对应模块 |
| 不需要 | 偶现、加分项、且与你目标岗位方向无关 | 暂时忽略,记进"以后再补" |
四象限自评的实操步骤
text
第 1 步 从 [JD 清单](/career/jd-list) 抄出目标岗位全部技能词(约 15-30 个)
第 2 步 逐词打象限标(会/半会不会/不会/不需要),写进下表
第 3 步 对"半会不会"和"不会"的词,去映射表找对应页面
第 4 步 生成补课清单(见下一节模板)
第 5 步 每学完一个,回来复评:半会不会 → 会,才算完成自评的两个坑
- 坑一:把"读过标题"当"会"。判断标准不是"看过这个算法",而是"能被追问三层"。用面试题库的追问列表做体检,比自我感觉可靠。
- 坑二:把"会"和"熟练实现"混为一谈。会推公式不等于能在 PyTorch 里写出来;面试现场常有手写伪代码环节。凡标"会"的,至少要在gymnasium-tutorial里跑通过一个对应实现。
三、补课清单模板
下面是一份可直接复制的补课清单模板。优先级用 P0/P1/P2 标注:P0 是目标岗位必现词且你现在不会或半会不会,P1 是常现词,P2 是加分项。
| # | 技能词 | 象限 | 对应页面 | 优先级 | 现状细节(具体卡在哪) | 计划动作 | 截止日期 | 复评 |
|---|---|---|---|---|---|---|---|---|
| 1 | PPO | 半会不会 | policy-gradient | P0 | 知道 clip,说不清为什么稳 | 重读页面+手写伪代码+跑 SB3 | 本周六 | 待定 |
| 2 | RLHF 三阶段 | 不会但需要 | rlhf | P0 | 完全没学过 | 系统读+看 LLM 对齐案例 | 下周 | 待定 |
| 3 | 奖励设计 | 半会不会 | reward-engineering | P1 | 只知道 reward hacking 名词 | 读案例集+做两个设计练习 | 两周内 | 待定 |
| 4 | SAC | 会 | actor-critic | P1 | 能推熵目标公式 | 写进简历项目,准备追问 | — | 已会 |
模板填写规则:
- 现状细节必须写具体:"半会不会"要写清楚"卡在哪一环"(公式?实现?还是为什么),否则补课时没有靶子。
- 计划动作要落到本站页面:每个"不会"都要有明确的页面/模块入口,而不是"去学习"这种空话。
- 截止日期要服从求职时间线:按学习路径的求职冲刺线,P0 项应在一周内清零。
四、高频考点权重
综合JD 清单的词频统计与面试题出题概率,给考点一个权重排序。这是"时间有限时先学什么"的答案。
| 权重 | 考点 | 出题形态 | 对应页面 |
|---|---|---|---|
| ★★★★★ | MDP 与贝尔曼方程 | 手推、概念追问,几乎必考 | markov-decision-process |
| ★★★★★ | MC vs TD、Q-learning vs SARSA | 对比题常客 | value-based |
| ★★★★★ | PPO(clip 动机、机制、坑) | 高频中的高频 | policy-gradient |
| ★★★★☆ | DQN 工程技巧(回放/目标网络) | 深度 RL 必考 | value-based |
| ★★★★☆ | RLHF 三阶段与 KL 惩罚 | 大模型岗必考 | rlhf |
| ★★★★☆ | 探索与利用 | 应用题+概念题 | exploration-exploitation |
| ★★★☆☆ | SAC 最大熵与连续控制 | 机器人/控制岗必考 | actor-critic |
| ★★★☆☆ | Actor-Critic 架构 | 与 PPO 绑定出现 | actor-critic |
| ★★★☆☆ | 奖励设计场景题 | 业务岗常考 | reward-engineering |
| ★★☆☆☆ | 离线 RL / bandit | 策略岗加分项 | offline-rl、bandits |
| ★★☆☆☆ | 多智能体 / 世界模型 | 研究岗加分项 | multi-agent、model-based |
权重随岗位漂移
以上是"全市场平均权重"。具体到岗位会明显漂移:机器人岗把 SAC/Sim2Real 提到 ★★★★★,大模型岗把 RLHF/DPO 提到 ★★★★★,策略岗把 bandit/因果提到 ★★★★★。自评时按你的目标岗位调整权重,而不是背这张平均表。
五、与面试题库的衔接
补课清单的终点是面试题库。衔接方式是以题带学:
- 每学完一个 P0 考点,去面试题库找到对应题目,按"答题框架 + 追问预测"练一遍;
- 用面试题库的"自测清单"(30 题对勾表)当作补课清单的验收标准:勾满才算"会";
- 面试题库里你答不上的题,反向回到映射表重新标注象限——自评是一个会循环的环:
text
JD 技能词 → 映射表 → 四象限自评 → 补课清单(P0/P1/P2) → 面试题库自测
↑ │
└──────────────── 答不上 → 重新自评 ────────────────────┘这一页产出的那张补课清单,就是你在 模块导读与岗位版图 里定下的目标岗位与你的实际差距之间的唯一桥梁。桥的另一端是简历分析——补完之后,把"会"的项写进简历四要素。
延伸阅读
- JD 清单 —— 技能词的来源:六类岗位 JD 拆解与词频统计。
- 面试题库 —— 补课清单的验收标准:高频题+答题框架+自测清单。
- 马尔可夫决策过程(MDP) —— 几乎所有技能词的共同地基,P0 考点之首。
- 价值学习 —— Q-learning/SARSA/DQN 的完整脉络,对比题主战场。
- 策略梯度 —— PPO 的本体:clip 机制、GAE、REINFORCE。
- RLHF 与人类反馈对齐 —— 大模型对齐岗的全部考点所在。
- 术语表 —— 60+ 词条速查,自评时随手对照。
参考资料
- Sutton, R. S., & Barto, A. G. (2018). Reinforcement Learning: An Introduction, 2nd ed. —— 理论考点的权威出处,免费在线:http://incompleteideas.net/book/the-book-2nd.html
- OpenAI Spinning Up in Deep RL —— 算法速查与代码,PPO/SAC 实现的对照参考:https://spinningup.openai.com
- Hugging Face Deep RL Course —— 概念+代码配套课程:https://huggingface.co/learn/deep-rl-course
- Gymnasium 官方文档 —— 环境 API 与基准环境清单:https://gymnasium.farama.org
- Stable-Baselines3 文档与代码:https://github.com/DLR-RM/stable-baselines3