外观
科研与生物医药中的 RL
一句话定位:这一页讲清楚 RL 在科研领域的四个真实落点——蛋白质结构预测里"伪 RL"的思想、分子设计与药物发现的 RL 生成、实验设计的主动学习、以及 AlphaGeometry/AlphaProof 把"搜索×学习"用于数学推理的突破;并讨论"AI 做科学"的评估与伦理。
一、RL for Science 总览:为什么科学问题适合 RL
1. 科学问题的两个幸运属性
大部分真实业务场景里 RL 卡在"没有模拟器、没有奖励"(见金融交易中的 RL),但科学问题往往两个条件都占:
| RL 的必要条件 | 科学场景的对应 |
|---|---|
| 可交互的环境/模拟器 | 物理模拟器(分子动力学、等离子体、流体)、计算实验、数学证明环境 |
| 可定义的目标/奖励 | 结合能、稳定性、准确性、定理可验证 |
| 数据可生成 | 自对弈、随机生成问题、采样分子构象 |
2. RL for Science 的四大谱系
text
RL for Science
├─ 结构预测:AlphaFold(监督学习为主,"伪 RL"思想)
├─ 分子设计:RL/GFlowNet 生成满足性质的分子
├─ 实验设计:主动学习/贝叶斯优化(RL 化决策)
└─ 数学推理:AlphaGeometry / AlphaProof(符号引擎 + RL 搜索)一个贯穿主题:科学的"环境"是计算机模拟器(model),所以这四大谱系都贴着基于模型的 RL在走——先在模型里学会怎么做,再让专家/实验去验证。
二、蛋白质:AlphaFold 与"伪 RL"视角
1. AlphaFold 在做什么
AlphaFold2(Jumper et al., 2021, Nature)从氨基酸序列预测蛋白质三维结构,在 CASP14 上中位精度(GDT)达到约 92,接近实验精度。它不是强化学习系统——主体是监督学习(预测每个残基的位置与置信度)+ 几何约束优化(结构重排)。
2. 为什么要用"伪 RL"视角看它
尽管 AlphaFold 没有显式 RL 组件,它的设计里藏着与 RL 同构的思想:
| AlphaFold 组件 | RL 对应概念 |
|---|---|
| 端到端可微(序列 → 结构坐标) | 从"输入状态"到"输出动作"的可微策略 |
| 循环结构重排(recycling) | 多次迭代改进输出 = 序列决策 |
| 几何约束损失 | 奖励/约束塑形 |
| 置信度预测作为自监督信号 | 类似 value 估计 |
更重要的参照:AlphaFold 的成功路径(大规模数据 + 可微端到端 + 与领域知识(几何)结合)与 AlphaGo 的方法论是"同一家族的两种变体"——AlphaGo 用 RL+搜索,AlphaFold 用 SL+几何优化。两者的共同点是放弃手工规则、让模型自己学表示。这解释了为什么 AI4Science 社区普遍把 AlphaFold 和 AlphaGo 并列看。
3. AlphaFold 的技术细节:Evoformer 与 recycling
把 AlphaFold2 的关键设计拆开看,每个都值得 RL 工程师借鉴:
| 组件 | 作用 | 对 RL 的启示 |
|---|---|---|
| Evoformer 双流 | 氨基酸与共进化信息互相精炼(行/列注意力) | "表示反复精炼"比"一层到位"强 |
| recycling(循环重排) | 同一结构被多次迭代改进 | 与 AlphaGo 的搜索迭代同构 |
| 结构模块 SE(3) 约束 | 只生成"合法的三维几何" | 动作空间约束大幅缩小搜索 |
| 置信度头(pLDDT) | 预测每个残基的置信度 | 模型自带"价值估计"可做主动采样 |
一个关键点:AlphaFold 从序列直接回归结构坐标,本质上把"推理"压缩进了前向传播;而 AlphaGeometry 把"推理"留给了搜索。两条路线说明:当问题可微时用端到端学习,当问题需要精确演绎时用搜索×学习——这是 AI4Science 里反复出现的设计决策。
INFO
把 AlphaFold 与 RL 联系起来还有一个实际价值:结构预测的"奖励信号"(如折叠能量、实验吻合度)可以作为其他科学任务(分子对接、蛋白设计)的奖励函数。AlphaFold 输出的结构可以直接当作下游 RL 任务(如设计一个能结合特定靶点的蛋白)的模拟器——这是"预测模型 → 生成模型"的管道,2023 年后的蛋白设计工作大量采用这条路线。
三、分子设计与药物发现
1. RL 生成分子:MolDQN 与 REINVENT
任务:生成一个满足性质约束的分子(如"预测药效高、毒性低、合成可行")。分子以图/序列表示,生成过程本身是顺序决策:
text
状态 s_t :已生成的分子片段(SMILES 字符串 / 分子图)
动作 a_t :加一个原子 / 一个键 / 一个官能团
奖励 r_t :最终分子的性质打分(对接分数、药效、类药性 QED 等)
终止 :分子完成(满足价键/长度约束)- MolDQN(Zhou et al., 2019):用 DQN 在分子图上逐步添加原子/键,直接优化性质(同时做 QED、logP 等单目标优化)。
- REINVENT(Olivecrona et al., 2017):用策略梯度训练 RNN 生成 SMILES 分子,目标加"性质奖励 + 与预训练先验的 KL 惩罚"——这个"奖励 + KL 到先验"的设计与 RLHF 的 KL 惩罚同构(见LLM 对齐:RLHF 实战)。
2. GFlowNet:从"找到最优分子"到"采样多样好分子"
GFlowNets(Generative Flow Networks,Bengio et al., 2021) 是 2020 年代针对分子设计问题提出的新框架:
text
普通 RL(如 MolDQN) :学一个策略,只找"奖励最高的那一个"分子
GFlowNet :学一个策略,按"奖励的比例"采样分子
P(最终分子 x) ∝ R(x) (奖励高的分子被采到的概率高)为什么这很重要:药物发现中"最高奖励的分子"未必是"最好的候选"——因为性质预测本身有误差、合成可行性需要人判断、候选需要多样性。GFlowNet 保证"奖励高的区域多采样、但也保留多样性",比"argmax 式 RL"更适合科学探索。
| 方法 | 目标 | 多样性 | 适用 |
|---|---|---|---|
| 贝叶斯优化 | 找最优点 | 低 | 小搜索空间 |
| RL 分子生成(MolDQN/REINVENT) | 最大化奖励 | 中 | 单目标、性质可打分 |
| GFlowNet | 按奖励成比例采样 | 高 | 多目标、需多样性、奖励噪声大 |
3. 落地现实与坑
- 分子性质的模拟打分器本身不准(对接分数与实验结合能相关度有限)——"仿真赢、实验输"的 Sim2Real 问题在药物里叫 sim2wet-lab gap(见机器人控制与 Sim2Real的同类讨论);
- RL 生成的分子合成可行性低是最大落地障碍,奖励里必须加合成难度项;
- 用少量真实实验数据做在线微调(贝叶斯优化式的 active learning)比纯离线生成有效得多。
4. 分子 RL 的评估指标速查
做分子生成 RL,几个行业通用指标必须认识:
| 指标 | 全称/含义 | 方向 | 用途 |
|---|---|---|---|
| QED | 类药性(0–1) | 越高越好 | 通用性质 |
| logP | 脂水分配系数 | 适中(约 1–5) | 成药性 |
| SA_score | 合成可及性(1–10) | 越低越易合成 | 落地关键 |
| 对接分数 | 与靶点结合亲和力估计 | 越低(越负)越好 | 活性代理 |
| 有效性/新颖性 | 合法分子比例、与已知分子距离 | 越高越好 | 生成质量 |
坑:单指标最优 ≠ 好分子(QED 高的分子常有合成问题);多指标联合用加权/帕累托更现实——这正是奖励工程页"多目标奖励"的分子版。
5. 一个分子 RL 的训练循环:伪代码
把"RL 生成分子"落到可运行的循环(以策略梯度家族为例):
python
# 分子生成 RL 训练循环(伪代码,含中文注释)
policy = RNN_or_Transformer(smiles_generator) # 生成 SMILES 的序列模型
prior = copy(policy) # 预训练先验(普通分子语言模型)
for step in range(train_steps):
smiles = policy.sample(batch_size) # 生成一批分子
score = scorer(smiles) # 性质打分:QED/logP/对接分数 加权
validity = valid(smiles) # 合法性校验(价键、语法)
r = score * validity # 非法分子直接 0 分
# 关键:奖励 + KL 惩罚(防止生成"骗过打分器"的胡言乱语)
loss = -(r - beta * kl(policy, prior)) * logprob(smiles)
gradient_update(policy, loss)三个工程要点(对应正文的坑):
- 先验 + KL 惩罚是分子 RL 的"护栏"——与 RLHF 的参考模型同一思想,防止模型退化成"乱编 SMILES 骗分数"(见LLM 对齐:RLHF 实战);
- 打分器必须先过"毒理/合成性"门:只优化 QED 会得到"看着像药、做不出来"的分子;
- 探索要多样化:如果需要候选池而非单个最优,用 GFlowNet 路线(按奖励比例采样)而不是纯 argmax。
四、实验设计:主动学习与贝叶斯优化
1. 问题:每一轮实验都贵
科学家做实验(筛选化合物、做材料合成、跑仿真)有预算约束。**实验设计(Experimental Design)**要回答"下一批实验该测什么",让信息/收益最大化。这天然是序列决策:
text
状态 s_t :目前所有已测样本的 (输入 x_i, 结果 y_i)
动作 a_t :选择下一批要测的 x
奖励 r_t :测完后的收益(如模型不确定性降低 / 找到更好的 y)
转移 :真实或模拟实验返回 y(x)2. 主动学习 + RL 化
- 经典做法是贝叶斯优化(BO):用高斯过程等代理模型预测"哪里最值得测"(探索+利用,本质上和 bandit 同一个权衡,见多臂老虎机页);
- RL 化的思路:把"采集函数(acquisition function)"本身学出来——让一个策略学会"该测哪里"而不用手工设计 UCB/EI 公式;
- 多轮预算分配、批量实验设计(一测一批)、以及"测量仪器切换成本"都是 RL 优于静态 BO 的地方。
判断:小规模实验设计用 BO 就够了(简单、样本高效);当问题维度高、实验有动力学(如连续发酵过程)、需要长序列决策时,RL 才值得。别为了用 RL 而 RL。
3. 主动学习 × RL 的融合形态
实验设计与 RL 的融合正在形成几条清晰的路线:
| 路线 | 做法 | 成熟度 |
|---|---|---|
| 策略式采集函数 | 用 RL 学"下一个测哪"的策略(替代 UCB/EI) | 研究早期 |
| 批式设计 + 约束 | 一次选一批实验,满足仪器/预算约束 | 实用中 |
| 闭环实验室(self-driving lab) | 机器人自动做实验 + RL 决策下一轮 | 前沿试点 |
| 分子生成 + BO 混合 | RL 生成候选、BO 排序、实验验证再反馈 | 工业常用 |
给团队的路线:先跑通"生成候选 → 模拟打分 → 少量实验验证 → 反馈重训"的闭环,再谈用 RL 替换闭环里的哪一环。数据闭环比算法先进更重要——这是RL 系统解剖页"环境即产品"在科学场景的复现。
五、数学推理:AlphaGeometry / AlphaProof
1. 从围棋到数学:搜索×学习的复现
AlphaGeometry(Trinh et al., 2024, Nature)用"符号引擎 + 神经网络引导搜索"解决欧氏几何题,在 IMO 2015–2023 的 30 道几何题上解出 25 道(此前最好方法解出约 10 道)。其结构完全是 AlphaGo 方法论的数学版:
text
符号引擎(环境):给定公理/定理,自动推导(= 确定性的"搜索规则")
神经网络(策略/价值):预测"哪一步推导最可能通往证明"
搜索:MCTS 风格,网络引导 + 符号引擎验证
训练数据:计算机随机生成上亿条几何构型 → 符号引擎解出 → 监督训练对比AlphaGo 与蒙特卡洛树搜索页的组件:符号引擎≈围棋规则,随机生成数据≈自对弈,网络引导≈策略/价值先验。"搜索×学习"的公式在完全不同的领域又赢了一次。
2. AlphaProof:把 RL 用于形式化证明
2024 年 7 月,DeepMind 发布 AlphaProof:用Lean 形式化证明环境 + RL 训练模型解 IMO 题。要点:
- 把自然语言题目翻译成 Lean 形式化陈述;
- 模型生成证明步骤,Lean 编译器当"判官"(奖励=证明是否通过)——奖励完全可自动验证,不需要人类打分;
- 与推理 RL(RLVR,见前沿进展页)是同一个范式:可验证奖励驱动大规模 RL。
AlphaProof 在 IMO 2024 上取得银牌水平(42 分满分得 28 分,其中代数和数论题满分)。这证明 RL 不仅能"对齐说话",还能"创造数学知识"。
TIP
AlphaGeometry/AlphaProof 给 RL 工程师的最大启示是环境先行:它们成功的前提是有一个可自动验证、可无限生成样本的环境(符号引擎 / Lean 编译器)。想在科学任务里复制这条路径,第一步不是调 PPO,而是把"任务→可验证环境"建好。这也呼应了RL 系统解剖页"环境即产品"。
3. 形式化证明的工程门槛
"用 RL 做数学"不是调个模型就行的,工程门槛集中在三处:
| 门槛 | 内容 | 现状 |
|---|---|---|
| 形式化翻译 | 把自然语言题目转成 Lean 陈述 | 依赖 LLM+人工校验,瓶颈 |
| 证明环境的可扩展 | 定理库(mathlib)规模与检索 | 大型但仍在快速扩展 |
| 训练算力 | 上亿样本 + 大规模搜索 | 只有头部机构能负担 |
理性看待:AlphaProof 的 IMO 银牌是"算法胜利",但"泛化到真实数学研究"还差很远——因为它解决的问题是"题目已给出、答案可验证",而真实数学是"问题要自己提、证明要自己组织"。这个差距提醒我们:AI4Science 的里程碑要按"任务可验证程度"分级评价,不要把一个里程碑说成全能。
六、核聚变等物理控制案例
1. 核聚变等离子体控制
DeepMind 与瑞士等离子体中心合作(Degrave et al., 2022, Nature)用 RL 控制核聚变装置的等离子体形状与位置。要点:
- 环境是托卡马克的物理模拟器(RAPTOR 等),奖励=达到目标等离子体形态 + 满足约束(避免破裂);
- 训练出的策略能从噪声观测中控制等离子体,且能在 3–4 天内重新配置适应新装置/新目标——相比传统控制需要数月人工调参,这是 RL 最大的工程价值(快速适配);
- 但它仍是在仿真→真机的框架里,且真机实验数量极少,风险由安全护栏兜底。
2. 这类"控制型"科学 RL 的共同配方
| 要素 | 具体做法 |
|---|---|
| 高保真模拟器 | 物理仿真(融合、流体、材料) |
| 明确目标+约束 | 形状、温度、稳定性约束 |
| 域随机化/鲁棒性 | 应对模拟误差(sim gap) |
| 安全护栏 | 真机试验限量、失败保护 |
| 快速重配置 | RL 策略可对新参数快速再训 |
这条"模拟器 + 约束 + 护栏 + 快速重训"的流水线,与机器人控制与 Sim2Real几乎逐条对应——物理世界的 RL 工程模板是通用的。
七、科学发现的评估与伦理
1. 评估的三层问题
| 层次 | 问题 | 现状 |
|---|---|---|
| 任务层 | 模型在基准(CASP、IMO、分子性质预测)上是否达标 | 大多可测、但基准易过拟合 |
| 科学层 | 是否产生可发表、可复现的新知识 | 多数停留在"预测好",未闭环验证 |
| 影响层 | 是否真正加速发现、改变实验范式 | 少数案例(AlphaFold 结构库、ESM 等) |
关键批评:很多"RL for Science"论文只在计算机模拟指标上取胜(对接分数高、预测误差小),离真实实验验证差一步。科学共同体要求"wet-lab 验证"才是硬标准——这再次是 Sim2Real 问题。
2. 伦理与风险
- 药物/材料生成的滥用:AI 设计的分子可能同时被用作有毒物质(dual-use);
- 评估透明度:AI 生成的"发现"需要可追溯(训练数据、验证流程);
- 可复现性:AI4Science 论文常因训练数据/环境不公开而无法复现——与评估与基准页的可复现纪律一脉相承。
WARNING
科研场景的奖励工程有独特的伦理分量:奖励(如"结合能最高")可能诱导模型生成实验上无法合成或实际上有害的分子。奖励函数不只要定义"什么好",还要定义"什么绝不能做"(合成可行性、毒性约束)——这是奖励工程页"奖励即规格"在科学领域最严肃的形态。
八、资源指引
- 概念基础:想理解 AlphaProof 的"可验证奖励",先读基于模型的 RL与奖励工程;
- 方法谱系:AlphaGo→AlphaZero→MuZero→AlphaGeometry 的"搜索×学习"演进,读AlphaGo 与蒙特卡洛树搜索;
- 前沿追踪:GFlowNet、RLVR、AI4Science 的最新工作,读前沿进展;
- 工具与数据:AlphaFold 数据库、分子数据集、仿真器的清单,见数据集与工具档案。
工具链速查表
做 AI4Science RL 项目,常用的开源工具集中在下面几类:
| 类别 | 工具 | 用途 |
|---|---|---|
| 分子表示 | RDKit、Open Babel | SMILES 解析/生成、分子性质计算 |
| 蛋白质结构 | AlphaFold 数据库(AFDB)、ESMFold | 结构获取/预测 |
| 分子生成 | REINVENT、MolDQN、GFlowNet 实现 | RL/生成式分子设计 |
| 化学信息 | PubChem、ChEMBL | 化合物与生物活性数据 |
| 数学证明 | Lean 4 + mathlib、leanprover 社区 | 形式化证明 |
| 物理仿真 | MuJoCo、Isaac、Fusion 模拟器 | 控制类科学任务 |
建议:先跑通一条最小链路(如"RDKit 生成分子 → 打分器打分 → 用一个小 RL 脚本优化 QED"),再谈大规模。这条链路的每一环都有现成开源实现,是进入 AI4Science RL 的最快路径——也最能验证你是否真的需要 RL(很多时候一个贝叶斯优化就够,见第四节判断)。
延伸阅读
- 基于模型的 RL 与世界模型 —— 科学模拟器即环境的统一框架与模型误差陷阱。
- AlphaGo 与蒙特卡洛树搜索 —— AlphaGeometry/AlphaProof 的"搜索×学习"直系祖先。
- 前沿进展 —— GFlowNet、RLVR、可扩展 RL 与 AI4Science 的最新工作。
- 奖励工程 —— 性质打分、约束、合成可行性的奖励设计。
- 机器人控制与 Sim2Real —— 仿真→真机迁移在物理科学中的同构问题。
- 数据集与工具档案 —— 分子、蛋白质、仿真器等数据与工具。
参考资料
- Jumper, J., et al. (2021). Highly accurate protein structure prediction with AlphaFold. Nature, 596(7873), 583–589.
- Trinh, T. H., et al. (2024). Solving olympiad geometry without human demonstrations. Nature, 625(7995), 476–482.(AlphaGeometry)
- DeepMind 官方博客(2024 年 7 月). AI solves IMO problems at silver medal level(AlphaProof 与 AlphaGeometry 2)。
- Zhou, Z., Kearnes, S., Li, L., Zare, R. N., & Riley, P. (2019). Optimization of Molecules via Deep Reinforcement Learning. Scientific Reports, 9, 10752.(MolDQN)
- Olivecrona, M., et al. (2017). Molecular de-novo design through deep reinforcement learning. Journal of Cheminformatics, 9, 48.(REINVENT)
- Bengio, Y., et al. (2021). GFlowNet Foundations. arXiv:2111.09266.
- Degrave, J., et al. (2022). Magnetic control of tokamak plasmas through deep reinforcement learning. Nature, 602(7897), 414–419.
- Sutton, R. S., & Barto, A. G. (2018). Reinforcement Learning: An Introduction (2nd ed.). MIT Press.