1. 文献信息
| 项目 | 内容 |
|---|---|
| 题目 | RNAbpFlow: base pair-augmented SE(3) flow matching for conditional RNA 3D structure generation |
| 期刊 | Nature Methods(2026-06-30,Open Access,CC BY-NC-ND 4.0) |
| 作者 | Sumit Tarafder, Debswapna Bhattacharya(Virginia Tech) |
| DOI | 10.1038/s41592-026-03128-4 |
| 代码 / 数据 | GitHub · Zenodo |
一句话:RNAbpFlow 在不依赖多序列比对(Multiple Sequence Alignment,MSA)或同源结构模板的前提下,以核苷酸序列 + 碱基配对(2D)图为条件,用 SE(3) 等变流匹配(flow matching)高效采样全原子 RNA 三维构象集合;碱基对条件化是性能提升的关键。
段末注释:MSA 为同源序列比对,蛋白结构预测常用;RNA 因碱基配对同构性,MSA 构建更困难;流匹配(flow matching)学习从简单分布到数据分布的向量场,采样比扩散模型更省步数。
关联笔记:RNA-FrameFlow / RNA 3D 生成背景;MOO-01 帕累托最优(精度–速度权衡);Math-04 优化
2. 问题背景与动机
RNA 三维结构对 RNA 疗法设计、功能机制理解至关重要,但:
- 构象柔性大:RNA 常呈构象集合而非单一静态结构,传统「单结构预测」不足。
- PDB 数据稀缺:模板法(ModeRNA、RNAbuilder)与物理/片段组装法(FARFAR2、3dRNA、RNAComposer)受限于结构库规模与算力。
- 深度学习依赖进化信息:除 DRfold 外,trRosettaRNA、RhoFold+、NuFold 等多依赖 MSA 或语言模型隐式同源信号;RNA MSA 深度不足时性能骤降。
- 2D 碱基对利用不足:canonical / noncanonical 碱基对与 stacking 是 3D 折叠核心,许多方法未显式、充分地条件化。
- 生成式空白:RNA-FrameFlow 虽用流匹配生成骨架,但为无条件采样,不用序列与碱基对。
RNAbpFlow 的定位:序列 + 碱基对条件 + 流匹配 + 全原子端到端,在 MSA/模板缺失场景(尤其 CASP 硬靶)提供可扩展的构象采样器。
3. 方法架构
RNAbpFlow 要回答的问题是:已知一条 RNA 的碱基序列,以及「谁和谁应该配对」的二维接触图,能否高效地采样出一批三维全原子构象?下面用一个极简例子把整条链路串起来,再展开技术细节。
考虑一条 6 核苷酸发夹:G–C–G–A–A–U。G₁ 与 U₆、C₂ 与 A₅ 形成茎部配对,中间的 G₃、A₄ 构成柔性环区。模型拿到的输入只有两样东西:四色碱基序列,以及一张 $6 \times 6$ 的碱基对矩阵——配对位置格点亮起,其余为 0。它要输出的不是单一结构,而是多达 1000 个略有差异的构象,以刻画 RNA 在溶液中的柔性。
论文 Fig.1 从左到右画的正是这件事(见下图)。左侧每个核苷酸用糖环 C1′ 上的局部坐标架描述,不必直接预测每个原子的 $(x,y,z)$;中间从 $t=0$ 的高斯噪声出发,在序列与碱基对条件的约束下,经 Conditional SE(3) flow matching 逐步推成 $t=1$ 的全原子三维结构;右侧 Fig.1b 则展开网络内部——六层 IPA(Invariant Point Attention,不变点注意力)模块逐层更新每颗核苷酸的刚体帧,并用碱基对相关的辅助损失把配对几何「写进」训练目标。


段末注释:ensemble(构象集合)指同一 RNA 的多种 3D 状态;碱基对图(base-pair graph)是 $L \times L$ 矩阵,标记哪些位置应形成碱基对。
3.1 表示:核苷酸刚体帧 + 全原子重建
直接预测全原子坐标维度太高。RNAbpFlow 沿用 NuFold 的核碱基中心表示(flexible nucleobase center representation):
- 每个核苷酸为特殊欧氏群(Special Euclidean group,SE(3))刚体帧 $T_i = (R_i, t_i)$:原点落在糖环 C1′,朝向由 O4′–C1′–C2′ 三点定义。
- 从帧导出 O4′、C1′、C2′;碱基附着点 N1(嘧啶)/ N9(嘌呤) 由四面体几何插值。
- 其余原子分 10 个子帧,由 9 个可转键二面角 迭代更新,端到端输出全原子坐标(含糖环 puckering:C3′-endo / C2′-endo)。
对 6-mer 发夹,6 颗珠子各有站位与朝向;G₁ 与 U₆ 配对时 C1′ 距离应落在约 10–11 Å,网络先学好帧,再按化学规则长出完整原子。
3.2 条件输入
模型带着两张「说明书」折叠:序列(one-hot 编码的 A/U/C/G)说明每颗珠子是什么碱基;碱基对图说明哪些位置必须靠近。RNAbpFlow 的关键设计是同时使用三通道碱基对图——训练时来自 RNAView、MC-Annotate、DSSR 对同一 PDB 的独立注释,推理时换成 IPKnot、SPOT-RNA、RibonanzaNet 三种 pseudoknot-aware 预测图。三图不做强行 reconciliate,直接作为边特征 bias 输入,宁可略冗余,也不漏掉 canonical / noncanonical 配对差异。
| 模态 | 训练 | 推理(无 native 2D 时) |
|---|---|---|
| 序列 | one-hot(A/U/C/G),长度 $L$ | 同左 |
| 碱基对图 | 三通道 $L \times L \times 3$(RNAView / MC-Annotate / DSSR) | IPKnot / SPOT-RNA / RibonanzaNet |
推理时也支持用户自定义单图(复制三通道)。
段末注释:pseudoknot(伪结)为二级结构中碱基对交叉;INF(Interaction Network Fidelity,互作网络保真度)衡量预测 3D 与参考碱基互作网络一致度。
3.3 网络:FrameFlow + AlphaFold2 结构模块
折叠的「教练」是六层 IPA 堆栈(AlphaFold2 结构模块风格)。网络维护每颗核苷酸的 single 表示和任意两核苷酸间的 pair 表示;碱基对图调制 attention bias,使配对位置信息交换更强。在任意时刻 $t$,速度场网络 $\mathbf{v}_\theta(\mathbf{T}_t, t)$ 根据当前帧预测去噪后的 clean 帧 $(\hat{r}_1, \hat{x}_1)$。
IPA 同时做两件事:用序列特征计算点积亲和力,用当前三维帧计算距离亲和力。两路相加后经 Softmax 更新表示——既看「说明书上谁该配对」,也看「它们现在实际站得有多远」。G₁ 与 U₆ 因此被强化关联,环区 G₃、A₄ 则主要保持链连续,允许更大柔性。Fig.1b 右侧放大图展示的正是这一机制。
3.4 SE(3) 流匹配
流匹配(flow matching)学习从噪声到真实结构的向量场,轨迹比扩散模型更直、采样步数更少,适合一次生成 1000 个构象。RNAbpFlow 在 $\mathbb{R}^3$ 平移与 SO(3) 旋转的乘积流形上构造测地线路径:
$$
\mathbf{T}t = \exp{\mathbf{T}0}!\left(t \cdot \log{\mathbf{T}_0}(\mathbf{T}_1)\right)
$$
平移与旋转分别插值:
$$
\mathbf{x}_t = (1-t)\mathbf{x}_0 + t\mathbf{x}_1, \quad
\mathbf{r}t = \exp{\mathbf{r}0}!\left(t \log{\mathbf{r}_0}(\mathbf{r}_1)\right)
$$
训练时从 PDB 取真实结构为 $\mathbf{T}_1$,加噪得 $\mathbf{T}_0$,随机采样 $t \sim \mathcal{U}[0, 1-\epsilon]$($\epsilon=0.1$),让网络学会在任意中间时刻该往哪推。平移先验为 $\mathcal{N}(0,I_3)$,旋转先验为 IGSO3($\sigma=1.5$);推理时旋转用指数调度 $e^{-ct}$($c=10$)离散积分。对 6-mer 发夹,$t=0$ 时珠子散乱,$t=0.5$ 时茎部开始靠近,$t=1$ 时发夹成形;重复采样 1000 次即得构象集合。相对 RNA-FrameFlow(无条件)与扩散模型,这一范式在保持精度的同时显著降低了 ensemble 采样的计算成本。

3.5 损失函数
训练时不只看整体形状,还显式约束碱基对几何——这是 RNAbpFlow 相对「只看序列」方法大幅提升的关键:
| 项 | 作用 |
|---|---|
| $L_{\mathrm{trans}}$ | 平移向量场 MSE,按 $(1-t)^{-2}$ 加权 |
| $L_{\mathrm{rot}}$ | SO(3) 旋转对数映射损失 |
| $L_{\mathrm{tors}}$ | 9 个二面角 sin/cos 嵌入 MSE |
| $L_{\mathrm{bp3D}}$ | 配对核苷酸 C1′–C1′ 距离 MSE(三注释器并集) |
| $L_{\mathrm{bp2D}}$ | 预测 2D 接触图 vs 三实验图的 BCE |
$$
L_{\mathrm{total}} = 2 L_{\mathrm{trans}} + L_{\mathrm{rot}} + L_{\mathrm{tors}} + L_{\mathrm{bp3D}} + L_{\mathrm{bp2D}}
$$
$L_{\mathrm{bp3D}}$ 把 G₁–U₆、C₂–A₅ 拉到正确距离,$L_{\mathrm{bp2D}}$ 保证输出结构反推的配对图与输入一致。消融实验表明,去掉任一碱基对辅助项,茎区往往拉不近,采样质量明显下降(Fig. 4b)。
3.6 训练配置
- PyTorch Lightning,Adam lr=$10^{-4}$,8× NVIDIA H100,1500 epoch(cross-distillation 集约 36 h)。
- Fine-tune:在 IPKnot / SPOT-RNA / RibonanzaNet 预测 2D 上再训 200 epoch,lr=$10^{-5}$,缩小 noisy vs native 2D 差距。
- Cross-distillation 增广:bpRNA-1m(90) 筛得 2170 条 AF3 高置信预测(plDDT≥60,PAE≤15,无 MSA),与 994 条 PDB 实验结构约 1:2.2 混合 batch。
4. 实验设计与基准
| 基准 | 训练 cutoff | 测试规模 | 对比对象 |
|---|---|---|---|
| RNA3DB 内部 | 2024-04-26,560 训 / 48 测 | 每靶 1000 samples | 自身 ablation |
| RNAJP 采样 | 同上 | 12 个三向 junction | RNAJP(MD 粗粒化) |
| CASP15 | PDB < 2022-04,731 训 | 6 natural + 4 synthetic | DRfold、NuFold、trRosettaRNA、RhoFold+、物理方法等 |
| CASP16 盲测 | PDB ≤ 2024-04-06,994+2170 | 28 靶(主分析 ≤200 nt 共 14 靶) | AF3-server、Yang-Server、AF3/NuFold/trRosettaRNA2/DRfold2 |
公平性:与深度学习竞品比较时均不提供 MSA;物理方法可给 native DBN(DSSR 提取)。
ensemble 选代表结构:用作者先前 lociPARSE 估计 pMoL,从 1000 个样本中选 top 结构用于 CASP15 单模型指标。
主要指标:TM-score(US-align, C3′)、lDDT、GDT-TS、全原子 RMSD、INF(Watson–Crick / NWC / Stack)、MolProbity 立体化学。
5. 主要结果
5.1 相对 RNAJP(构象采样)
在 12 个三向 junction 靶标上各采样 1000 个 decoy,RNAbpFlow 在全局拓扑与局部构象上均优于传统 MD 粗粒化采样器 RNAJP:
| 指标 | RNAbpFlow | RNAJP |
|---|---|---|
| 平均 mean lDDT | 0.66 | 0.59 |
| 平均 mean TM-score | 0.38 | 0.32 |
| 至少 1 个 TM>0.45 的靶比例 | 66.7% | 41.7% |
| 至少 1 个 lDDT>0.75 的靶比例 | 25% | 0% |
| 全部 decoy 中 TM>0.45 占比 | 13.4% | 1.73% |

Fig.2 从三个角度印证了上述结论。汇总表(a)显示 RNAbpFlow 在 TM-score 与 lDDT 上全面领先。3D 叠合图(b)更直观:以 2HGH(55 nt)为例,预测结构(蓝)与 native(绿)几乎重合(TM 0.53),而 RNAJP 仅 0.40;在更长的 3PDR(160 nt)上优势依然保持。互作网络图(c)进一步表明,RNAbpFlow 不仅整体形状更准,碱基对和堆积关系(INF 分数)也恢复得更好。
5.2 CASP15(预测模式)
在 CASP 官方评测中,RNAbpFlow 的优势进一步得到验证。
Natural RNA(6 靶,predicted 2D 条件):RNAbpFlow 优于 NuFold、trRosettaRNA、RhoFold+、DRfold 等(Table 1)。
Native 2D 条件(上界):
- TM-score 0.48 vs predicted 2D 0.40(+20%)
- RMSD 7.77 Å vs 10.70 Å(−27.4%)
- INF-NWC 0.62 vs 0.48(+29.2%)
- 全部 pseudoknot 恢复
物理方法即使给 native DBN,TM-score 最高仅 ~0.34(Vfold)。
5.3 CASP16 盲测(≤200 nt,14 靶)
两年后的 CASP16 盲测提供了更大规模、更严格的检验。
| 对比 | 结论 |
|---|---|
| vs AF3-server / Yang-Server(CASP 官方 top server,用 MSA) | RNAbpFlow ensemble max TM/lDDT 平均更高 |
| 浅 MSA($N_{\mathrm{eff}}\le130$)硬靶 | RNAbpFlow consistently 优于两 server |
| 深 MSA 易靶(如 R1263/R1264) | Server 可比或更好 → 揭示 RNAbpFlow 不借进化信息的 trade-off |
| vs AF3 / NuFold(本地,无 MSA,1000 samples) | RNAbpFlow max TM/lDDT 更优;85.7% 靶 ensemble 含 TM>0.45,AF3 为 57.1% |
| >200 nt | 仍优于 NuFold/trRosettaRNA2/DRfold2;略逊于 AF3;predicted 2D INF 从 0.84→0.51,是主要瓶颈 |

Fig.3 是 CASP16 盲测最亮眼的一组证据。性能表(a)中 RNAbpFlow 以 avg max TM 0.61、lDDT 0.72 居首,超过使用 MSA 的 AF3-server(0.54/0.64)和 Yang-Server(0.54/0.63)。逐靶 ΔTM 柱图(b)显示,14 个靶中多数 RNAbpFlow 占优,尤其在 hard target R1255(124 nt)上优势最大。3D 视觉对比(c)最能说明问题:R1288 上 RNAbpFlow 的蓝绿结构几乎重合(TM 0.63),而两 server 仅 ≈0.28–0.40;R1255 的「分叉手臂」方向,RNAbpFlow 达到 TM 0.71,server 却折向错误方向。在浅 MSA 硬靶上,显式 2D 条件 + 大规模 ensemble 采样可以弥补不借进化信息的短板;但当序列超过 200 nt、predicted 2D 质量下降时,性能瓶颈也随之显现。
5.4 碱基对 fidelity 与条件服从性
上述结果也揭示了一个重要特性:模型对输入碱基对图高度敏感。
- Native 2D 输入:输出 INF vs 输入 ≈ 0.93(高度忠实)。
- Predicted 2D 输入:INF ≈ 0.84——模型强服从输入,即使输入有误也会「忠实实现错误配对」,并引入约 3× 更多 false-positive 碱基对。
- Spearman:输入 INF 与 ensemble lDDT 相关性强于 TM-score → 准确 2D 更利于局部正确性。
5.5 消融(RNA3DB 48 测,1000 samples/靶)
| 配置 | avg max TM | avg max lDDT |
|---|---|---|
| 仅序列(无 2D) | 0.36 | 0.46 |
| 三注释器 2D 联合 | 0.51 | 0.71 |
| 相对 baseline | +41.7% TM | +54.3% lDDT |
三图联合优于任一单图;去掉 bp2D/bp3D 辅助损失均降质。
5.6 Cross-distillation + fine-tune(CASP16 ≤200 nt)
| 变体 | avg max TM | avg max lDDT |
|---|---|---|
| 无 distillation + predicted 2D | 0.50 | 0.61 |
| 有 distillation + predicted 2D | 0.57 | 0.69 |
| distillation + native 2D | 0.68 | 0.77 |
| + fine-tune on predicted 2D | 0.61 | — |
6. 优势、局限与讨论
6.1 优势
- MSA/模板自由:在 RNA MSA 稀缺靶上相对 AF3-server 更有优势(CASP16 14 靶中仅 4 个深 MSA)。
- 显式 2D 条件 + ensemble:一次生成 1000 构象,刻画柔性;碱基对比序列跨物种更保守(作者论点)。
- 流匹配效率:相对扩散,更适合大规模采样(相对 RNA-FrameFlow 有条件、全原子)。
- 端到端全原子:无需后处理 geometry optimization(默认 pipeline);PyRosetta relax 可改善立体化学且几乎不伤 TM/lDDT(Supp. Table 13)。
- 开源:GPLv3 代码 + Zenodo 训练数据。
6.2 局限
- 强依赖 2D 质量:predicted 2D 不准时 3D 上限明显;长 RNA(>200 nt)predicted INF 骤降。
- 立体化学:默认 clash / 键角违规多于物理方法(无内置 refinement);需可选 relax。
- 长度与架构:训练集 ~92% ≤200 nt;超长 RNA 需 subquadratic 架构(稀疏 attention / 局部 message passing)。
- 「忠实错误输入」:predicted 2D 错配会被高 INF 复现,可能增加 spurious pairs。
- CASP15 样本量小($n=6$ natural),统计检验需谨慎。
6.3 作者展望
- 融入 MSA、SHAPE/DMS 化学探测、交联稀疏约束;
- 探索 FR3D 等开放 2D 注释 pipeline;
- 扩展多链 / 复合物(当前 focus 单链 monomer)。
7. 与相关方法对比(概念层)
| 方法 | 进化信息 | 2D 条件 | 生成范式 | 输出 |
|---|---|---|---|---|
| trRosettaRNA / RhoFold+ | MSA / LM | 部分 | 判别 + 能量最小化 | 单结构 |
| NuFold | 可选 | predicted 2D | 判别,核碱基中心 | 单结构 |
| DRfold(2) | 弱/无 | 弱 | 判别 | 单结构 |
| AF3 | MSA + template | 隐式 | 扩散式联合建模 | 少样本 |
| RNA-FrameFlow | 无 | 无 | 无条件流匹配 | 骨架 |
| RNAbpFlow | 无 | 显式三通道 2D | 条件流匹配 | 全原子 ensemble |
与 ProteinMPNN(结构→序列)相反,RNAbpFlow 是 序列+2D→3D 构象分布,同属生成式结构建模谱系。
8. 使用与复现要点
1 | # 仓库:https://github.com/Bhattacharya-Lab/RNAbpFlow |
实践建议:
- 优先提升 2D:IPKnot + SPOT-RNA + RibonanzaNet 共识或投票;长序列尤其重要。
- ensemble 1000 + lociPARSE 选模(CASP15 协议)或按 TM/lDDT 选 top-k。
- 交付前 PyRosetta relax 若下游需要低 clashscore。
- 与 MOO 结合:TM-score vs 采样时间 / vs 2D INF 可画 Pareto 前沿选部署点。
9. 小结
| 维度 | 要点 |
|---|---|
| 核心创新 | 碱基对增强的条件 SE(3) 流匹配 + 核碱基中心全原子表示 + bp2D/bp3D 辅助损失 |
| 适用场景 | 无深 MSA 的 RNA;需要构象集合;已有或可信的 2D(native 或高质量预测) |
| 性能亮点 | CASP16 盲测 ≤200 nt 上 ensemble 质量优于无 MSA 的 AF3,并可与 MSA-server 抗衡 hard targets |
| 主要瓶颈 | predicted 2D 质量;>200 nt;默认立体化学 |
RNAbpFlow 将 RNA 3D 建模从「借进化信息猜单结构」推向「在 2D 约束下流式采样全原子 ensemble」,与 RNA 柔性生物学更一致;工程上,2D 预测 pipeline 的质量将成为与模型本身同等重要的上游环节。
段末注释:SE(3) 为三维特殊欧氏群,旋转+平移对称性;等变(equivariant)网络在该群作用下输出随输入协变,是结构深度学习的标准归纳偏置。
10. 参考文献(原文精选)
- Tarafder S., Bhattacharya D. Nat. Methods (2026). doi:10.1038/s41592-026-03128-4
- Yim J. et al. SE(3) flow matching / FrameFlow — arXiv:2310.05297
- Kagaya Y. et al. NuFold — Nat. Commun. 16, 881 (2025)
- Anand R. et al. RNA-FrameFlow — TMLR (2025)
- Abramson J. et al. AlphaFold 3 — Nature 630, 493–500 (2024)