Skip to content

科研与生物医药中的 RL

本页速览 AlphaFold 的端到端结构预测与几何约束、分子设计与药物发现(GFlowNet、RL 分子生成)、实验设计(主动学习)、AlphaProof/AlphaGeometry 的数学推理 RL;RL for Science 的图景。

科研与生物医药中的 RL ​

一句话定位:这一页讲清楚 RL 在科研领域的四个真实落点——蛋白质结构预测里"伪 RL"的思想、分子设计与药物发现的 RL 生成、实验设计的主动学习、以及 AlphaGeometry/AlphaProof 把"搜索×学习"用于数学推理的突破;并讨论"AI 做科学"的评估与伦理。

一、RL for Science 总览:为什么科学问题适合 RL ​

1. 科学问题的两个幸运属性 ​

大部分真实业务场景里 RL 卡在"没有模拟器、没有奖励"(见金融交易中的 RL),但科学问题往往两个条件都占:

RL 的必要条件科学场景的对应
可交互的环境/模拟器物理模拟器(分子动力学、等离子体、流体)、计算实验、数学证明环境
可定义的目标/奖励结合能、稳定性、准确性、定理可验证
数据可生成自对弈、随机生成问题、采样分子构象

2. RL for Science 的四大谱系 ​

text
RL for Science
 ├─ 结构预测:AlphaFold(监督学习为主,"伪 RL"思想)
 ├─ 分子设计:RL/GFlowNet 生成满足性质的分子
 ├─ 实验设计:主动学习/贝叶斯优化(RL 化决策)
 └─ 数学推理:AlphaGeometry / AlphaProof(符号引擎 + RL 搜索)

一个贯穿主题:科学的"环境"是计算机模拟器(model),所以这四大谱系都贴着基于模型的 RL在走——先在模型里学会怎么做,再让专家/实验去验证。

二、蛋白质:AlphaFold 与"伪 RL"视角 ​

1. AlphaFold 在做什么 ​

AlphaFold2(Jumper et al., 2021, Nature)从氨基酸序列预测蛋白质三维结构,在 CASP14 上中位精度(GDT)达到约 92,接近实验精度。它不是强化学习系统——主体是监督学习(预测每个残基的位置与置信度)+ 几何约束优化(结构重排)。

2. 为什么要用"伪 RL"视角看它 ​

尽管 AlphaFold 没有显式 RL 组件,它的设计里藏着与 RL 同构的思想:

AlphaFold 组件RL 对应概念
端到端可微(序列 → 结构坐标)从"输入状态"到"输出动作"的可微策略
循环结构重排(recycling)多次迭代改进输出 = 序列决策
几何约束损失奖励/约束塑形
置信度预测作为自监督信号类似 value 估计

更重要的参照:AlphaFold 的成功路径(大规模数据 + 可微端到端 + 与领域知识(几何)结合)与 AlphaGo 的方法论是"同一家族的两种变体"——AlphaGo 用 RL+搜索,AlphaFold 用 SL+几何优化。两者的共同点是放弃手工规则、让模型自己学表示。这解释了为什么 AI4Science 社区普遍把 AlphaFold 和 AlphaGo 并列看。

3. AlphaFold 的技术细节:Evoformer 与 recycling ​

把 AlphaFold2 的关键设计拆开看,每个都值得 RL 工程师借鉴:

组件作用对 RL 的启示
Evoformer 双流氨基酸与共进化信息互相精炼(行/列注意力)"表示反复精炼"比"一层到位"强
recycling(循环重排)同一结构被多次迭代改进与 AlphaGo 的搜索迭代同构
结构模块 SE(3) 约束只生成"合法的三维几何"动作空间约束大幅缩小搜索
置信度头(pLDDT)预测每个残基的置信度模型自带"价值估计"可做主动采样

一个关键点:AlphaFold 从序列直接回归结构坐标,本质上把"推理"压缩进了前向传播;而 AlphaGeometry 把"推理"留给了搜索。两条路线说明:当问题可微时用端到端学习,当问题需要精确演绎时用搜索×学习——这是 AI4Science 里反复出现的设计决策。

INFO

把 AlphaFold 与 RL 联系起来还有一个实际价值:结构预测的"奖励信号"(如折叠能量、实验吻合度)可以作为其他科学任务(分子对接、蛋白设计)的奖励函数。AlphaFold 输出的结构可以直接当作下游 RL 任务(如设计一个能结合特定靶点的蛋白)的模拟器——这是"预测模型 → 生成模型"的管道,2023 年后的蛋白设计工作大量采用这条路线。

三、分子设计与药物发现 ​

1. RL 生成分子:MolDQN 与 REINVENT ​

任务:生成一个满足性质约束的分子(如"预测药效高、毒性低、合成可行")。分子以图/序列表示,生成过程本身是顺序决策:

text
状态 s_t :已生成的分子片段(SMILES 字符串 / 分子图)
动作 a_t :加一个原子 / 一个键 / 一个官能团
奖励 r_t :最终分子的性质打分(对接分数、药效、类药性 QED 等)
终止     :分子完成(满足价键/长度约束)
  • MolDQN(Zhou et al., 2019):用 DQN 在分子图上逐步添加原子/键,直接优化性质(同时做 QED、logP 等单目标优化)。
  • REINVENT(Olivecrona et al., 2017):用策略梯度训练 RNN 生成 SMILES 分子,目标加"性质奖励 + 与预训练先验的 KL 惩罚"——这个"奖励 + KL 到先验"的设计与 RLHF 的 KL 惩罚同构(见LLM 对齐:RLHF 实战)。

2. GFlowNet:从"找到最优分子"到"采样多样好分子" ​

GFlowNets(Generative Flow Networks,Bengio et al., 2021) 是 2020 年代针对分子设计问题提出的新框架:

text
普通 RL(如 MolDQN)    :学一个策略,只找"奖励最高的那一个"分子
GFlowNet               :学一个策略,按"奖励的比例"采样分子
                        P(最终分子 x) ∝ R(x)   (奖励高的分子被采到的概率高)

为什么这很重要:药物发现中"最高奖励的分子"未必是"最好的候选"——因为性质预测本身有误差、合成可行性需要人判断、候选需要多样性。GFlowNet 保证"奖励高的区域多采样、但也保留多样性",比"argmax 式 RL"更适合科学探索。

方法目标多样性适用
贝叶斯优化找最优点低小搜索空间
RL 分子生成(MolDQN/REINVENT)最大化奖励中单目标、性质可打分
GFlowNet按奖励成比例采样高多目标、需多样性、奖励噪声大

3. 落地现实与坑 ​

  • 分子性质的模拟打分器本身不准(对接分数与实验结合能相关度有限)——"仿真赢、实验输"的 Sim2Real 问题在药物里叫 sim2wet-lab gap(见机器人控制与 Sim2Real的同类讨论);
  • RL 生成的分子合成可行性低是最大落地障碍,奖励里必须加合成难度项;
  • 用少量真实实验数据做在线微调(贝叶斯优化式的 active learning)比纯离线生成有效得多。

4. 分子 RL 的评估指标速查 ​

做分子生成 RL,几个行业通用指标必须认识:

指标全称/含义方向用途
QED类药性(0–1)越高越好通用性质
logP脂水分配系数适中(约 1–5)成药性
SA_score合成可及性(1–10)越低越易合成落地关键
对接分数与靶点结合亲和力估计越低(越负)越好活性代理
有效性/新颖性合法分子比例、与已知分子距离越高越好生成质量

坑:单指标最优 ≠ 好分子(QED 高的分子常有合成问题);多指标联合用加权/帕累托更现实——这正是奖励工程页"多目标奖励"的分子版。

5. 一个分子 RL 的训练循环:伪代码 ​

把"RL 生成分子"落到可运行的循环(以策略梯度家族为例):

python
# 分子生成 RL 训练循环(伪代码,含中文注释)
policy = RNN_or_Transformer(smiles_generator)   # 生成 SMILES 的序列模型
prior  = copy(policy)                           # 预训练先验(普通分子语言模型)

for step in range(train_steps):
    smiles = policy.sample(batch_size)           # 生成一批分子
    score  = scorer(smiles)                      # 性质打分:QED/logP/对接分数 加权
    validity = valid(smiles)                     # 合法性校验(价键、语法)
    r = score * validity                         # 非法分子直接 0 分
    # 关键:奖励 + KL 惩罚(防止生成"骗过打分器"的胡言乱语)
    loss = -(r - beta * kl(policy, prior)) * logprob(smiles)
    gradient_update(policy, loss)

三个工程要点(对应正文的坑):

  1. 先验 + KL 惩罚是分子 RL 的"护栏"——与 RLHF 的参考模型同一思想,防止模型退化成"乱编 SMILES 骗分数"(见LLM 对齐:RLHF 实战);
  2. 打分器必须先过"毒理/合成性"门:只优化 QED 会得到"看着像药、做不出来"的分子;
  3. 探索要多样化:如果需要候选池而非单个最优,用 GFlowNet 路线(按奖励比例采样)而不是纯 argmax。

四、实验设计:主动学习与贝叶斯优化 ​

1. 问题:每一轮实验都贵 ​

科学家做实验(筛选化合物、做材料合成、跑仿真)有预算约束。**实验设计(Experimental Design)**要回答"下一批实验该测什么",让信息/收益最大化。这天然是序列决策:

text
状态 s_t :目前所有已测样本的 (输入 x_i, 结果 y_i)
动作 a_t :选择下一批要测的 x
奖励 r_t :测完后的收益(如模型不确定性降低 / 找到更好的 y)
转移     :真实或模拟实验返回 y(x)

2. 主动学习 + RL 化 ​

  • 经典做法是贝叶斯优化(BO):用高斯过程等代理模型预测"哪里最值得测"(探索+利用,本质上和 bandit 同一个权衡,见多臂老虎机页);
  • RL 化的思路:把"采集函数(acquisition function)"本身学出来——让一个策略学会"该测哪里"而不用手工设计 UCB/EI 公式;
  • 多轮预算分配、批量实验设计(一测一批)、以及"测量仪器切换成本"都是 RL 优于静态 BO 的地方。

判断:小规模实验设计用 BO 就够了(简单、样本高效);当问题维度高、实验有动力学(如连续发酵过程)、需要长序列决策时,RL 才值得。别为了用 RL 而 RL。

3. 主动学习 × RL 的融合形态 ​

实验设计与 RL 的融合正在形成几条清晰的路线:

路线做法成熟度
策略式采集函数用 RL 学"下一个测哪"的策略(替代 UCB/EI)研究早期
批式设计 + 约束一次选一批实验,满足仪器/预算约束实用中
闭环实验室(self-driving lab)机器人自动做实验 + RL 决策下一轮前沿试点
分子生成 + BO 混合RL 生成候选、BO 排序、实验验证再反馈工业常用

给团队的路线:先跑通"生成候选 → 模拟打分 → 少量实验验证 → 反馈重训"的闭环,再谈用 RL 替换闭环里的哪一环。数据闭环比算法先进更重要——这是RL 系统解剖页"环境即产品"在科学场景的复现。

五、数学推理:AlphaGeometry / AlphaProof ​

1. 从围棋到数学:搜索×学习的复现 ​

AlphaGeometry(Trinh et al., 2024, Nature)用"符号引擎 + 神经网络引导搜索"解决欧氏几何题,在 IMO 2015–2023 的 30 道几何题上解出 25 道(此前最好方法解出约 10 道)。其结构完全是 AlphaGo 方法论的数学版:

text
符号引擎(环境):给定公理/定理,自动推导(= 确定性的"搜索规则")
神经网络(策略/价值):预测"哪一步推导最可能通往证明"
搜索:MCTS 风格,网络引导 + 符号引擎验证
训练数据:计算机随机生成上亿条几何构型 → 符号引擎解出 → 监督训练

对比AlphaGo 与蒙特卡洛树搜索页的组件:符号引擎≈围棋规则,随机生成数据≈自对弈,网络引导≈策略/价值先验。"搜索×学习"的公式在完全不同的领域又赢了一次。

2. AlphaProof:把 RL 用于形式化证明 ​

2024 年 7 月,DeepMind 发布 AlphaProof:用Lean 形式化证明环境 + RL 训练模型解 IMO 题。要点:

  • 把自然语言题目翻译成 Lean 形式化陈述;
  • 模型生成证明步骤,Lean 编译器当"判官"(奖励=证明是否通过)——奖励完全可自动验证,不需要人类打分;
  • 与推理 RL(RLVR,见前沿进展页)是同一个范式:可验证奖励驱动大规模 RL。

AlphaProof 在 IMO 2024 上取得银牌水平(42 分满分得 28 分,其中代数和数论题满分)。这证明 RL 不仅能"对齐说话",还能"创造数学知识"。

TIP

AlphaGeometry/AlphaProof 给 RL 工程师的最大启示是环境先行:它们成功的前提是有一个可自动验证、可无限生成样本的环境(符号引擎 / Lean 编译器)。想在科学任务里复制这条路径,第一步不是调 PPO,而是把"任务→可验证环境"建好。这也呼应了RL 系统解剖页"环境即产品"。

3. 形式化证明的工程门槛 ​

"用 RL 做数学"不是调个模型就行的,工程门槛集中在三处:

门槛内容现状
形式化翻译把自然语言题目转成 Lean 陈述依赖 LLM+人工校验,瓶颈
证明环境的可扩展定理库(mathlib)规模与检索大型但仍在快速扩展
训练算力上亿样本 + 大规模搜索只有头部机构能负担

理性看待:AlphaProof 的 IMO 银牌是"算法胜利",但"泛化到真实数学研究"还差很远——因为它解决的问题是"题目已给出、答案可验证",而真实数学是"问题要自己提、证明要自己组织"。这个差距提醒我们:AI4Science 的里程碑要按"任务可验证程度"分级评价,不要把一个里程碑说成全能。

六、核聚变等物理控制案例 ​

1. 核聚变等离子体控制 ​

DeepMind 与瑞士等离子体中心合作(Degrave et al., 2022, Nature)用 RL 控制核聚变装置的等离子体形状与位置。要点:

  • 环境是托卡马克的物理模拟器(RAPTOR 等),奖励=达到目标等离子体形态 + 满足约束(避免破裂);
  • 训练出的策略能从噪声观测中控制等离子体,且能在 3–4 天内重新配置适应新装置/新目标——相比传统控制需要数月人工调参,这是 RL 最大的工程价值(快速适配);
  • 但它仍是在仿真→真机的框架里,且真机实验数量极少,风险由安全护栏兜底。

2. 这类"控制型"科学 RL 的共同配方 ​

要素具体做法
高保真模拟器物理仿真(融合、流体、材料)
明确目标+约束形状、温度、稳定性约束
域随机化/鲁棒性应对模拟误差(sim gap)
安全护栏真机试验限量、失败保护
快速重配置RL 策略可对新参数快速再训

这条"模拟器 + 约束 + 护栏 + 快速重训"的流水线,与机器人控制与 Sim2Real几乎逐条对应——物理世界的 RL 工程模板是通用的。

七、科学发现的评估与伦理 ​

1. 评估的三层问题 ​

层次问题现状
任务层模型在基准(CASP、IMO、分子性质预测)上是否达标大多可测、但基准易过拟合
科学层是否产生可发表、可复现的新知识多数停留在"预测好",未闭环验证
影响层是否真正加速发现、改变实验范式少数案例(AlphaFold 结构库、ESM 等)

关键批评:很多"RL for Science"论文只在计算机模拟指标上取胜(对接分数高、预测误差小),离真实实验验证差一步。科学共同体要求"wet-lab 验证"才是硬标准——这再次是 Sim2Real 问题。

2. 伦理与风险 ​

  • 药物/材料生成的滥用:AI 设计的分子可能同时被用作有毒物质(dual-use);
  • 评估透明度:AI 生成的"发现"需要可追溯(训练数据、验证流程);
  • 可复现性:AI4Science 论文常因训练数据/环境不公开而无法复现——与评估与基准页的可复现纪律一脉相承。

WARNING

科研场景的奖励工程有独特的伦理分量:奖励(如"结合能最高")可能诱导模型生成实验上无法合成或实际上有害的分子。奖励函数不只要定义"什么好",还要定义"什么绝不能做"(合成可行性、毒性约束)——这是奖励工程页"奖励即规格"在科学领域最严肃的形态。

八、资源指引 ​

  1. 概念基础:想理解 AlphaProof 的"可验证奖励",先读基于模型的 RL与奖励工程;
  2. 方法谱系:AlphaGo→AlphaZero→MuZero→AlphaGeometry 的"搜索×学习"演进,读AlphaGo 与蒙特卡洛树搜索;
  3. 前沿追踪:GFlowNet、RLVR、AI4Science 的最新工作,读前沿进展;
  4. 工具与数据:AlphaFold 数据库、分子数据集、仿真器的清单,见数据集与工具档案。

工具链速查表 ​

做 AI4Science RL 项目,常用的开源工具集中在下面几类:

类别工具用途
分子表示RDKit、Open BabelSMILES 解析/生成、分子性质计算
蛋白质结构AlphaFold 数据库(AFDB)、ESMFold结构获取/预测
分子生成REINVENT、MolDQN、GFlowNet 实现RL/生成式分子设计
化学信息PubChem、ChEMBL化合物与生物活性数据
数学证明Lean 4 + mathlib、leanprover 社区形式化证明
物理仿真MuJoCo、Isaac、Fusion 模拟器控制类科学任务

建议:先跑通一条最小链路(如"RDKit 生成分子 → 打分器打分 → 用一个小 RL 脚本优化 QED"),再谈大规模。这条链路的每一环都有现成开源实现,是进入 AI4Science RL 的最快路径——也最能验证你是否真的需要 RL(很多时候一个贝叶斯优化就够,见第四节判断)。

延伸阅读 ​

参考资料 ​

  • Jumper, J., et al. (2021). Highly accurate protein structure prediction with AlphaFold. Nature, 596(7873), 583–589.
  • Trinh, T. H., et al. (2024). Solving olympiad geometry without human demonstrations. Nature, 625(7995), 476–482.(AlphaGeometry)
  • DeepMind 官方博客(2024 年 7 月). AI solves IMO problems at silver medal level(AlphaProof 与 AlphaGeometry 2)。
  • Zhou, Z., Kearnes, S., Li, L., Zare, R. N., & Riley, P. (2019). Optimization of Molecules via Deep Reinforcement Learning. Scientific Reports, 9, 10752.(MolDQN)
  • Olivecrona, M., et al. (2017). Molecular de-novo design through deep reinforcement learning. Journal of Cheminformatics, 9, 48.(REINVENT)
  • Bengio, Y., et al. (2021). GFlowNet Foundations. arXiv:2111.09266.
  • Degrave, J., et al. (2022). Magnetic control of tokamak plasmas through deep reinforcement learning. Nature, 602(7897), 414–419.
  • Sutton, R. S., & Barto, A. G. (2018). Reinforcement Learning: An Introduction (2nd ed.). MIT Press.