系列:抗体-05.方法文献系列说明 · 第 02 篇
范式对照:亲和力改造范式 · 方向 4b 生成(全原子序列–结构联合生成;有体外验证)
上篇对照:AntiBARTy Diffusion(潜空间性质引导,无 3D / 无湿实验)
0. 文献卡片
| 项 | 内容 |
|---|---|
| 题名 | AbDiffuser: full-atom generation of in-vitro functioning antibodies |
| 作者 / 机构 | Martinkus, Ludwiczak, Liang, Lafrance-Vanasse, Hotzel, Rajpal, Wu, Cho, Bonneau, Gligorijevic, Loukas 等;Prescient Design / Antibody Engineering,Genentech–Roche(及 ETH Zurich、NYU) |
| 载体 | NeurIPS 2023 spotlight;Adv Neural Inf Process Syst 37:40729–59(书目常标 2024) |
| 链接 | OpenReview · PDF · arXiv:2308.05027 |
| 一句话贡献 | 用 APMixer + 物理投影 + 抗体特异去噪先验,在坐标空间做 SE(3) 等变 扩散,联合生成 配对抗体全原子结构与序列;HER2 上有表达与结合湿实验 |
段末注释:SE(3) 为三维刚体变换群(旋转+平移);等变指输入刚体变换后,输出结构同步变换。全原子此处含骨架与侧链坐标,而非仅 (C_\alpha) / 骨架。
1. 问题与动机
多数蛋白扩散走两条路之一:
- 先骨架后序列(如 RFdiffusion → ProteinMPNN):步骤解耦,早期决策难回退;
- 只重做 CDR:设计空间小,难改框架/ vernier,也难同时探表达、稳定性等。
同时,常用等变 Transformer / 图网络(EGNN)在残基数上内存近似 二次,全原子(含侧链)很难单卡放大。角度空间表示虽易嵌物理约束,但与高斯扩散匹配不佳。
AbDiffuser 的切入点:抗体可变区可用 全局对齐编号 压成固定长度,从而:
- 用类似 MLP-Mixer 的行列混合网络隐式建模残基关系(线性内存);
- 在笛卡尔坐标上做高斯扩散,再用投影层强制键长/键角;
- 把家族先验写进扩散噪声过程本身。
2. 方法总览

| 组件 | 作用 |
|---|---|
| 联合扩散状态 | 原子坐标 (X^{\mathrm{pos}})(高斯噪声)+ 残基类型 (X^{\mathrm{res}})(含 gap 的分类噪声) |
| APMixer | 对齐蛋白上的等变去噪网络(核心架构) |
| Frame averaging | 用 PCA 构造 4 个 SE(3) 帧,块级平均,保手性(非含反射的 E(3)) |
| 投影层 | Kabsch 对齐理想骨架;通用侧链伪原子 → 按氨基酸模板还原全原子 |
| 扩散先验 | (a) AHo 位点特异残基频率;(b) 学习的原子位置条件依赖(GMRF) |
生成时网络联合预测:
[
(\hat X_0^{\mathrm{pos}},\hat X_0^{\mathrm{res}})=\phi(X_t^{\mathrm{pos}},X_t^{\mathrm{res}},t)
]
段末注释:MLP-Mixer 用按行/按列的 MLP 交替混合 token,替代显式自注意力;APMixer(Aligned Protein Mixer,对齐蛋白质混合器)将其改造成面向对齐蛋白族、并配合 SE(3) 帧平均的版本。
3. 实现细节(一):表示与 APMixer
3.1 AHo 对齐:变长 → 固定槽位
采用 AHo(Honegger & Plückthun)编号:每条链映射到 ([1,149]) 结构角色位点。配对抗体表示为 (2\times 149)(重链 149 + 轻链 149)。
- Gap 用「幽灵残基」占位,坐标由邻近真实残基原子线性插值得到;
- 模型通过是否填氨基酸 / 留 gap 内生选择长度,无需事先给定残基数;
- 位点本身携带结构角色(框架 vs 某 CDR),利于学位置特异规则。
段末注释:AHo 是基于结构信息的免疫球蛋白可变域编号方案,几乎覆盖已知抗体长度变异。
输入矩阵规模(骨干示例):(r=2\times 149) 行;每行含残基 one-hot(20 AA + gap)与骨干原子坐标等,列维约 (c=21+4\times 3)。
3.2 APMixer 块
每个块对输入矩阵 (X\in\mathbb{R}^{r\times c}):
- 列混合:对各列做 MLP(跨残基混合特征通道);
- 行混合:对各行做 MLP(残基内特征更新)。
残基–残基关系隐式经由行列交替产生,内存随残基数近似 线性(对比 GNN/注意力的二次)。作者证明底座模型具有 SE(3) 普适性(可逼近任意 SE(3) 等变函数)。
等变实现:在每个块上做 frame averaging(优于仅对整网做一次);嵌入向量拆成三维子向量算帧。输出拆半:一半对坐标等变,一半对残基类型不变。
| 模型(作者 Table 2) | 参数量 | 训练显存(bs=4) | 生成 10 条 |
|---|---|---|---|
| EGNN | 39.3M | 78 GB | 较慢 |
| FA-GNN | 9.4M | 75 GB | — |
| AbDiffuser (APMixer) | 169M | 12 GB | 2.3 min / 3 GB |
同卡可堆到数亿参数,比对应 (E)GNN 高约一个数量级参数、同时更省显存。
3.3 物理投影(坐标空间约束)
扩散与网络可在坐标上自由移动原子;输入与输出都过非参数投影,保证约束:
| 部分 | 做法 |
|---|---|
| 骨架 | 理想 (C,C_\alpha,N,C_\beta) 模板 + Kabsch 最优刚体对齐;(C)–(O) 距约束约 (1.231) Å |
| 侧链 | 生成时序列未知 → 用最多 4 个伪碳原子的通用侧链编码二面角自由度;键长约 (1.54) Å;再按氨基酸理想模板还原全原子 |
相对「纯角度参数化」:更贴合高斯坐标扩散;相对「无投影」:作者消融显示无投影时训练不稳、结构 RMSD 崩坏。
4. 实现细节(二):去噪扩散先验

理论动机(附录):先验与数据分布的 Wasserstein 距离越小,达到同等去噪质量所需的可学习模型越「简单」。
4.1 位点特异残基频率
由训练集估计每位 (i) 的分类分布 (Q^i),离散扩散噪声依赖位点:
[
q(X_t^{\mathrm{res}}\mid X_0^{\mathrm{res}})=\mathrm{Cat}\bigl(X_0^{\mathrm{res}}(\beta_t I+(1-\beta_t)Q^{i})\bigr)
]
框架保守位熵低、CDR 位熵高;gap 频率一并进入 (Q^i)。
4.2 原子位置条件依赖(GMRF)
用 高斯马尔可夫随机场(Gaussian Markov Random Field,GMRF) 刻画坐标相关:精度矩阵为移位图拉普拉斯 (L+aI),邻接 (A) 从数据学习(稀疏条件独立结构),而非仅手写主链相邻相关。去噪时把这些相关编码进前向过程,减轻网络负担。
段末注释:GMRF 用稀疏图表示「无边则条件独立」;此处节点特征为三维原子坐标。
5. 数据与任务设定
| 任务 | 数据 | 结构来源 | 目标 |
|---|---|---|---|
| pOAS 分布匹配 | paired OAS 约 10.5 万 对 | IgFold 折叠 + Rosetta 优化 | 生成「像天然配对抗体」的序列+结构 |
| HER2 binder 扩展 | Mason et al. 2021:Trastuzumab CDR-H3 约 10 位点突变库;约 9k binders / 25k non-binders | 生成模型只训 binder | 探索已知抗原 binder 邻域;可降温 (\tau) 偏模态 |
说明:综述写「在 OAS 上训练」对应主任务 pOAS;抗原结合能力来自 Mason 突变库微调式训练,不是无条件 OAS 就能出 HER2 binder。
另训 APMixer 分类器区分 binder/non-binder(测试准确率约 87.8%),作 in silico (p_{\mathrm{bind}})。
6. 结果与口径
6.1 In silico(pOAS)
相对 Transformer / EGNN / FA-GNN / IgLM(IgLM 数据量更大且含测试相关序列,对比不公平):
- AbDiffuser(含侧链)在自然度、近邻距离、稳定性等 Wasserstein 指标上整体更优;
- 相对 IgFold 集成的骨架 RMSD 约 0.50(单模型 IgFold 基线约 0.42),结构接近参考分布;
- 侧链 Rosetta packing 均分约 0.62(参考优化结构约 0.67;>0.6 通常视为可接受);
- 消融:AHo 频率先验、协方差先验、投影层、侧链联合建模 均有贡献。
6.2 In silico(HER2 / Trastuzumab 突变)
- 相对只改 CDR-H3 的 RefineGNN / MEAN,AbDiffuser 生成整分子 仍可更好贴合 binder 分布;
- 降低采样温度 (\tau) 可抬高预测结合概率,但多样性下降;
- 含侧链版本往往序列相似度与 (p_{\mathrm{bind}}) 更好。
6.3 In vitro(作者核心卖点)
送测 16 个设计:
| 口径 | 数值(作者) |
|---|---|
| 表达 / 纯化 | 100%;平均浓度约 1.25 mg/mL |
| 全体结合率 | 37.5%;结合者 (\mathrm{p}K_D\in[8.32,9.50]),均值约 8.70 |
| 再经 in silico 过滤后 | 结合率 22.2% → 57.1%;均值约 8.78 |
| 最强 binder | (\mathrm{p}K_D=9.50)(略高于同期测得的 Trastuzumab ~9.21);CDR-H3 差 4 位 |
段末注释:(\mathrm{p}K_D=-\log_{10}(K_D)),数值越大亲和力越强(与 (K_D) 方向相反)。
作者强调:相对大规模先筛再 SPR 的路径,用更少精确亲和力测定即可找到强 binder——但任务是 已知药物邻域的突变扩展,不是无亲本、无库的表位从头设计。
7. 局限与风险
| 类型 | 说明 |
|---|---|
| 任务边界 | HER2 结果依赖 Mason binder 集;非抗原结构条件的 de novo binder |
| 结构监督 | pOAS 结构来自 IgFold+Rosetta,非晶体;生成质量相对该代理分布 |
| 对齐依赖 | APMixer 吃固定对齐;换蛋白家族需可靠全局对齐 |
| 配对假设 | 建模 VH–VL 配对 Fv;恒定区 / 糖基化等未在方法核心 |
| 过滤增益 | 57.1% 含人工 in silico 筛选,不可等同「无筛选采样命中率」 |
| 开源与复现 | Genentech 工业工作;以论文方法节为准,权重/代码可得性需自行核实 |
8. 与相近方法对照
| 方法 | 生成对象 | 条件 | 湿实验 |
|---|---|---|---|
| AbDiffuser | 全原子 Fv 序列+结构 | 家族先验;binder 集(HER2) | ✅ HER2 |
| AntiBARTy Diffusion | 序列(潜空间) | 性质类(溶解度) | ❌ |
| DiffAb / MEAN | 多为 CDR | 抗原结构 | 方法文各异 |
| RFantibody | 骨架→序列管线 | 表位指定 | ✅(后续 Nature) |
9. 工程取用建议
- 适用:已有中等规模靶点 binder/突变库,要扩展序列–结构邻域并兼顾表达;或要学配对抗体全原子分布。
- 不适用(单独):仅有抗原 PDB、无阳性序列时的零样本表位设计——需 DiffAb / RFantibody 等结构条件路线。
- 实现要点对齐:AHo (2\times149) + gap 幽灵残基;块级 frame averaging;投影层;(Q^i) 与 GMRF 先验;可选侧链头。
- 本仓库衔接:范式文 4b 成果表已收录 HER2 57.1% 口径;编号工具见 ANARCI(可出 AHo)。
10. 可核对原文要点清单
- APMixer:行列 MLP;线性内存;~169M / 单卡可训
- AHo (2\times149);gap 插值;SE(3) 帧平均(保手性)
- 坐标扩散 + 骨架/侧链投影;非纯角度扩散
- 先验:位点 (Q^i) + 学习 GMRF 协方差
- 数据:pOAS ~105k;HER2 Mason ~9k binders
- 体外:16 设计全表达;过滤后 57.1% 紧结合;最佳 (\mathrm{p}K_D=9.50)
参考文献(本篇)
- Martinkus K, et al. AbDiffuser: full-atom generation of in-vitro functioning antibodies. Adv Neural Inf Process Syst 2024;37:40729–59. (NeurIPS 2023 spotlight; arXiv:2308.05027)
- Tolstikhin et al. MLP-Mixer. NeurIPS 2021.
- Honegger & Plückthun. AHo numbering. J Mol Biol 2001.
- Puny et al. Frame averaging for invariant/equivariant networks. 2022.
- Olsen et al. Observed Antibody Space. Protein Science 2022.
- Mason et al. Optimization of therapeutic antibodies by predicting antigen specificity from antibody sequence. Nat Biomed Eng 2021.