外观
模块导读与岗位版图
一句话定位:这一页讲清楚"RL 岗位市场长什么样"——哪些岗位在招、每个岗位做什么、要什么、给多少,以及面对这份版图你该从 career 模块(四页使用地图见下文第五节)的哪一页开始。
站在 2026 年回头看,强化学习已经从一个"学术圈自嗨的方向"变成了多个产业条线的硬技能:大模型对齐、具身智能、自动驾驶、推荐广告、运筹调度、量化交易,每一块都在招 RL 背景的人,但每一块要的"RL"都不一样。很多人投简历失败,不是因为不会 RL,而是没搞清市场要的是哪种 RL——这是 career 模块存在的第一理由。
一、模块定位:先看市场,再准备自己
career 模块的逻辑是一句话:先看市场,再准备自己。绝大多数求职者犯的错误是反过来的——先闷头学了一年,再去看招聘,发现学的东西和 JD 对不上。本站的解法是四条流水线:
text
市场在招什么 JD 在要求什么 我该怎么准备 如何被验证
┌────────────┐ ┌──────────────────┐ ┌────────────────┐ ┌────────────┐
│ 岗位版图 │ │ 知识点拆解 │ │ 简历 / 作品集 │ │ 面试题库 │
│ (本页) │──▶│ knowledge-map │──▶│ resume-analysis │──▶│ interview │
│ 市场概览 │ │ 技能词→页面映射 │ │ 四要素+STAR │ │ 高频题+追问 │
└────────────┘ └──────────────────┘ └────────────────┘ └────────────┘
▲ │ │ │
│ ▼ ▼ ▼
[jd-list] 拆解真实 [本站 concepts / [practice] [本站 concepts]
在招岗位的 JD 原文 practice 页面] 作品集与评估 全部知识点和 guide 模块的分工
学习路径 回答"我该按什么顺序学";career 模块回答"市场要什么、我该怎么对齐"。求职冲刺线 就是以 career 四篇为主线、配上高频概念页的一条约 2 周的面试准备路线,两条线互为表里:career 告诉你学什么,guide 告诉你按什么节奏学。
具体到四页,各自回答一个问题:
| 页面 | 回答的问题 | 最佳使用时机 |
|---|---|---|
| 本页(index) | 市场上都有哪些 RL 岗位,我适合哪一类 | 一开始,花 30 分钟读完 |
| JD 清单 | 真实在招岗位的 JD 到底写了什么要求 | 拿到具体目标岗位后逐字对照 |
| 知识点拆解 | JD 里的每个技能词对应本站哪个知识点、我会不会 | 自评阶段,产出个人补课清单 |
| 简历分析 | 简历和作品集该怎么突出 RL 能力 | 投递前 1-2 周 |
| 面试题库 | 面试会问什么、怎么答 | 面试前冲刺 |
一个重要前提
以下所有岗位信息、薪资区间都随市场剧烈波动,且是多来源抽样后的综合概括,不是某个具体职位的官方定薪。任何具体决策(投哪家、要多少钱)请以 JD 清单 里给出的实时招聘平台信息为准。本站提供的是"看市场的框架",不是"市场的最终答案"。
二、岗位版图:十类 RL 相关岗位全景
1. 十类岗位总表
我们把市场上真正在招 RL 背景人才的岗位归成十类。这个归类刻意按"RL 在业务里承担的角色"划分,而不是按公司划分——因为同一家公司可能同时开这十类中的四五类岗位。
| # | 岗位 | 典型雇主 | 核心职责 | 关键技能组合 | 参考薪资(国内/年) | 参考薪资(海外/年, TC) |
|---|---|---|---|---|---|---|
| 1 | RL 算法研究员(Research Scientist) | DeepMind、OpenAI、Meta FAIR、国内大厂研究部、AI 创业公司 | 提出新算法/新范式,跑通关键实验,写论文或产出专利 | 数学功底、论文复现、大规模实验 | 60–150 万 | $25–60 万+ |
| 2 | RL 算法工程师(Applied Scientist / RL Engineer) | 国内大厂、自动驾驶、游戏、量化 | 把 RL 算法落地到具体业务,调优、上线、监控 | 算法 + 工程 + 业务建模 | 40–90 万 | $22–45 万 |
| 3 | 大模型对齐工程师(LLM Alignment / RLHF) | 大模型公司、云厂商、AI Infra | SFT / 奖励模型 / PPO / DPO 全链路,对齐评估 | RLHF、分布式训练、评测 | 50–120 万 | $25–50 万+ |
| 4 | 机器人学习工程师(Robotics / Embodied AI) | 具身智能创业、智元/宇树/大疆、人形机器人 | 仿真训练、Sim2Real、VLA 策略、数据采集 | 连续控制、仿真器、RL+模仿 | 50–120 万 | $22–45 万 |
| 5 | 仿真与训练平台工程师(Simulation / RL Infra) | 大厂 RL 团队、具身智能、自动驾驶 | 环境开发、并行训练框架、数据管道 | 高性能计算、仿真器、分布式 | 45–90 万 | $20–40 万 |
| 6 | 推荐/广告/搜索策略算法(Decision Intelligence) | 字节、阿里、腾讯、美团 | 排序、出价、探索策略、离线评估 | Contextual Bandit、离线 RL、因果 | 40–90 万 | $20–38 万 |
| 7 | 决策优化 / 运筹调度工程师 | 物流、制造、云资源调度、供应链 | 库存、调度、装箱、路由的序列决策 | MDP 建模、OR 算法、RL 混合 | 35–80 万 | $18–35 万 |
| 8 | 自动驾驶决策规划算法 | 华为、百度、小马、毫末、Waymo 类 | 行为决策、运动规划中的模仿+RL 混合 | 规划、仿真测试、安全约束 | 40–100 万 | $22–42 万 |
| 9 | 量化交易 / 执行优化研究员 | 量化私募、券商自营 | 订单执行、做市、组合层面的 RL | 金融 MDP 化、回测、风控 | 60–150 万+ | $25–60 万+ |
| 10 | 游戏 AI 工程师 | 游戏大厂、游戏 AI 创业 | NPC 决策、对战 AI、内容生成 RL | 游戏环境、多智能体、对战 | 30–70 万 | $18–32 万 |
读表须知:薪资为 2026 年市场综合估算,国内含现金+股票,海外为总包(TC,含 base+bonus+equity)。同一岗位头部公司与非头部差距可以到 2 倍以上。具体数字请以 JD 清单 中的招聘平台实时信息为准。
2. 三类"母体岗位"——大多数岗位都是它们的变体
十类岗位看着多,其实都源自三个母体,理解母体就能理解变体:
- 研究型(母体一):目标是"造出别人没造出的方法"。对应 #1 研究员,#3 对齐工程师的"研究岗"变体,#4 机器人的"策略创新"变体。考的是数学与论文。
- 应用型(母体二):目标是"让 RL 在一个具体业务里产生可度量的收益"。对应 #2、#6、#7、#8、#9、#10。考的是建模能力 + 工程落地。
- 平台型(母体三):目标是"让 RL 能大规模地训练起来"。对应 #5,以及 #2/#3 里的 Infra 角色。考的是分布式系统与工程。
为什么这样切
同一个"RL 工程师"头衔,在 A 公司是"把论文里的 SAC 调通到机器人上",在 B 公司是"写分布式采样框架",在 C 公司是"跟运营对齐出价目标"。投简历前先判断这个 JD 属于哪个母体,再决定简历怎么组织——这是 career 模块反复强调的第一件事。
3. 岗位趋势的三个方向(2026 视角)
- RLHF 类岗位从"稀有"走向"主流":对齐已经是大模型训练的标准环节,几乎所有大模型公司都有对齐团队,且需求外溢到云厂商与垂直行业(医疗、金融客服的领域对齐)。这类岗位的 RL 门槛其实不高(PPO 一个算法打天下),但分布式训练与评测能力很关键。
- 具身智能把"机器人学习"推上风口:人形机器人、灵巧手、VLA(vision-language-action)模型的资金与人才需求双高。这类岗位最缺的是能同时写 RL 算法和摆弄仿真器的人。
- 传统 RL 岗位在"决策智能"里换了个名字:推荐、广告、风控、调度岗位的 JD 里出现 bandit、离线 RL、因果推断的词频在上升。很多岗位不叫 RL,但做的事就是 RL——投递时别只搜"强化学习"三个字。
三、技能雷达:RL 岗位的五能力象限
无论哪类岗位,衡量 RL 人才都可以用五个能力象限。这五个象限是我们拆 JD、写简历、准备面试时反复使用的主坐标:
| 象限 | 代表能力 | 面试怎么检验 | 对应本站 |
|---|---|---|---|
| 理论 | MDP、贝尔曼方程、收敛直觉、算法谱系 | 手推公式、对比题、追问"为什么" | 概念模块 全部 |
| 代码 | PyTorch、算法实现、Debug、实验脚本 | 手写伪代码、代码 review、现场调 bug | 实践模块 与 框架选型 |
| 数学 | 概率、期望、KL、凸优化、统计 | 推导 advantage、解释 GAE/熵 | math-primer |
| 工程 | 仿真器、分布式训练、数据管道、评估体系 | 问环境怎么建、实验怎么管、怎么复现 | evaluation-in-practice 与 build-your-own |
| 业务 | 把业务问题建模成 MDP、设计奖励、评估业务收益 | 场景设计题、Case 题 | reward-engineering 与各 case 页 |
用这五个象限给自己打个分(1-5),你会立刻得到一张与岗位错位图:
text
能力自评示例(一位有 2 年工程经验、想转 RL 的候选人):
理论 代码 数学 工程 业务
算法研究员(研究型) 5 4 5 3 1 ← 数学/理论不够
RL 算法工程师(应用型) 3 5 3 4 3 ← 理论/数学是短板
对齐工程师(应用型) 3 4 3 5 3 ← RL 理论可再补
机器人学习(应用型) 4 4 3 4 2 ← 数学/仿真可再补
仿真平台工程师(平台型) 2 5 2 5 2 ← 理论要求低,工程要求高怎么读这张雷达
雷达图不是"平均分越高越好",而是"形状要对上岗位"。研究岗要求"理论/数学凸起",平台岗要求"代码/工程凸起",应用岗要求"工程/业务凸起"。面试挂掉最常见的三类原因,对应三个象限的凹陷:理论岗挂数学、应用岗挂工程落地、所有岗挂业务建模。
四、三维决策清单:选哪个方向
面对十类岗位,别凭感觉挑。按下面三个维度各打一轮分,最后用决策矩阵收口。
1. 维度一:你的背景
| 背景特征 | 更顺的岗位方向 | 原因 |
|---|---|---|
| 硕士/博士,发过 RL 论文 | 研究员、对齐研究岗、机器人研究岗 | 研究岗的第一硬通货是论文 |
| 本科/硕士,工程出身(后端/分布式) | 仿真平台、RL Infra、对齐工程岗 | 平台型岗位重工程 |
| 硕士,做过推荐/搜索/风控 | 决策智能、广告策略 | 业务经验直接迁移,MDP 建模是加分 |
| 博士,运筹/优化背景 | 决策优化、量化、调度 | 数学建模能力是硬通货 |
| 机器人/控制背景 | 机器人学习、自动驾驶决策 | 连续控制与仿真经验直接对口 |
2. 维度二:你的兴趣
- 喜欢"证明一个想法对",享受论文被引用 → 研究型岗位。代价:发不出论文的压力、实验周期长。
- 喜欢"把一个东西真正跑上线,看到指标涨" → 应用型岗位。代价:业务问题不优雅、RL 经常不是最优解。
- 喜欢"造平台、优化训练一万个 GPU" → 平台型岗位。代价:离算法远、长期做 infra 容易失去算法手感。
兴趣与现实常冲突
一个常见悲剧:热爱理论的硕士生进了纯业务团队,天天写 SQL 分析留存;而动手能力强的工程师进了研究组,三个月没跑出一个像样的实验。面试时问清楚团队构成与"你入职前三个月做什么",比看岗位 title 有用得多。
3. 维度三:市场趋势
| 趋势(2026 视角) | 受益岗位 | 风险 |
|---|---|---|
| 大模型对齐常态化 | 对齐工程师、RLHF | 门槛走低、竞争者多、红利期在收窄 |
| 具身智能融资热 | 机器人学习、仿真平台 | 泡沫风险、部分公司存活不确定 |
| 决策智能渗透推荐/风控 | 策略算法、离线 RL | 岗位名字不叫 RL,识别成本高 |
| 自动驾驶收敛到"规控安全" | 决策规划 | 只有头部公司还在大举招人 |
| RL for Reasoning(R1、RLVR) | 研究岗、对齐岗 | 论文驱动的热点,落地要看推理成本 |
4. 三维决策矩阵
把三个维度打过分后,用这个矩阵收口:
text
背景 × 兴趣 × 趋势 综合判断
──────────────────────────────────────────────
背景对研究岗友好 × 喜欢证明想法 × 关注对齐/R1
→ 首选:大模型对齐研究岗 / 研究员(对齐方向)
背景对应用岗友好 × 喜欢上线 × 关注决策智能
→ 首选:策略算法工程师 / 推荐·风控·调度
背景工程强 × 喜欢造平台 × 关注具身智能
→ 首选:仿真平台工程师 / RL Infra
背景数学强 × 喜欢建模 × 关注量化/运筹
→ 首选:量化执行 / 决策优化
──────────────────────────────────────────────
若四个都不突出:从 #2 RL 算法工程师(应用型)切入
是最宽容的入口——它对单一象限的要求不极端。五、四页使用地图
最后给出 career 模块四页(加本页共五页)的完整使用顺序。两种典型用法:
用法 A:求职冲刺(配合 guide/paths 求职冲刺线)
text
第 1 天 读完本页 → 锁定 1-2 个目标岗位
第 2 天 读 [JD 清单](/career/jd-list) → 找到 5 份目标 JD 逐条对照
第 3-5 天 用 [知识点拆解](/career/knowledge-map) 生成补课清单 → 补齐 P0 考点
第 6-7 天 按 [简历分析](/career/resume-analysis) 改简历 + 用作品集补项目
第 8-14 天 用 [面试题库](/career/interview-questions) 自测 → 高频题过三遍用法 B:长期准备(慢线)
text
先读本页建立市场认知 → 按 [学习路径](/guide/paths) 系统精进线走
每学完一个概念模块,回来查 [知识点拆解](/career/knowledge-map)
确认"这个知识点对应哪个 JD 技能词" → 边学边对齐| 页面 | 产出物 | 前置依赖 | 预计耗时 |
|---|---|---|---|
| 本页 | 目标岗位清单(1-2 个) | 无 | 30 分钟 |
| JD 清单 | 5 份目标 JD 的要求摘录 | 本页 | 1-2 小时 |
| 知识点拆解 | 个人补课清单 | JD 清单 | 1-2 小时 |
| 简历分析 | 改好的简历 + 作品集 README | 知识点拆解 | 半天 |
| 面试题库 | 通过自测的高频题清单 | 知识点拆解 | 面试前 1 周 |
延伸阅读
- 学习路径:三条路线 —— 求职冲刺线以 career 模块为主线,这里看整体节奏。
- JD 清单 —— 真实在招岗位的 JD 拆解与词频统计,下一步就进这页。
- 知识点拆解 —— 把 JD 技能词映射成"会/不会/半会不会"并生成补课清单。
- 简历分析 —— 四要素 + STAR,把 RL 能力在简历上讲清楚。
- 面试题库 —— 高频面试题的答题框架与追问预测。
参考资料
- levels.fyi(薪酬数据库,2026):https://www.levels.fyi
- LinkedIn Jobs(全球职位搜索):https://www.linkedin.com/jobs
- Glassdoor(岗位与薪酬评价):https://www.glassdoor.com
- BOSS 直聘(国内职位搜索):https://www.zhipin.com
- 拉勾招聘(互联网职位):https://www.lagou.com
- 猎聘(中高端职位):https://www.liepin.com
- OpenAI Careers(对齐/研究岗位):https://openai.com/careers
- DeepMind Careers(研究/工程岗位):https://deepmind.google/about/careers/
- Anthropic Careers(对齐/研究岗位):https://www.anthropic.com/careers
- 字节跳动招聘:https://jobs.bytedance.com
- 腾讯招聘:https://careers.tencent.com
- 阿里巴巴招聘:https://talent.alibaba.com
- 百度招聘:https://talent.baidu.com