抗体-04.工具-02.抗体从头理性设计开源工具综述

抗体从头理性设计de novo rational antibody design)指在已知或假设的抗原靶标与表位约束下,通过计算生成、筛选并迭代优化 VH/VL(或 VHH)序列,最终获得可表达、可结合、具备成药潜力的候选分子。它与 亲和力成熟(affinity maturation,在已有 binder 上微调)和 免疫动物筛选(hybridoma / display)互补:前者从「零」或「弱模板」出发,后者从实验文库出发。分子架构与 CDR 功能见 抗体-01.结构 系列;结合原理见 抗体-03.互作;亲和力预测工具专篇见 抗体-04.工具-01

本文按端到端工作流组织:先给出流程总览,再逐步列出每步的计算任务、输入输出、开源工具/模型及许可注意点。所称「开源」以 GitHub 可获取代码/权重 为准;PyRosettaAlphaFold3 权重FoldX 等虽广泛使用,但学术/商业许可与权重获取受限,文中单独标注。

配图位于同名资源目录 抗体-04.工具-02.抗体从头理性设计开源工具综述/;正文使用相对子目录路径(如 ./抗体-04.工具-02.抗体从头理性设计开源工具综述/fig01.png),便于本地 Markdown 预览;Hexo 构建时 hexo-asset-image 会自动剥离首段目录、拼到文章永久链接下。流程图正文用 PNG.svg 仅作可编辑源文件。

段末注释CDR(complementarity-determining region,互补决定区)为抗体可变区中直接参与抗原接触的环区;VHH 为单域抗体(纳米抗体)的可变重链片段。


1. 端到端流程总览

理性设计并非严格线性流水线——实践中常在 序列生成 ↔ 结构预测 ↔ 打分过滤 之间多轮迭代。典型闭环如下(图 1–2)。

图 1 抗体从头理性设计端到端流程总览(科普示意)

图 2 步骤 0–8 详细流程、代表工具与迭代反馈

一体化 pipeline(将多步打包)在 2024–2025 年快速涌现,见 §11图 3;单步工具仍是大规模定制流程的积木。


2. 步骤 0:靶标与表位定义

目标:明确抗原序列/结构、构象状态(apo / holo)、表位残基或热点(hotspot),为后续对接约束与 CDR 设计提供几何锚点。

任务 输入 输出 开源工具 / 模型 许可 / 备注
抗原结构预测 氨基酸序列 PDB/mmCIF AlphaFold2ColabFoldESMFoldBoltz-1Boltz-2Chai-1Protenix AF2/Boltz/Chai/Protenix 等多为 Apache/MIT;AF3 代码开源、权重需申请
构象集合 / 柔性 序列或低分辨结构 多构象模型 AFsample2AF-clusterBioEmuESMFold + MD 后处理 表位在柔性 loop 上时需多构象采样
线性 / 构象表位预测(序列) 抗原 FASTA 残基概率、表位片段 BepiPred 3.0 基于 ESM-2GitHub;学术免费
构象表位(结构) 抗原 PDB 表面可及、B-factor 加权表位 DiscoTope 3.0PEPITOElliPro DTU 服务 + 部分可本地部署;DiscoTope 3 用蛋白质语言模型
表位 / 界面残基(复合物) Ab–Ag 复合物 PDB 接触残基、埋藏表面积 FreeSASAProDyPyMOLbiotite 有共晶时作金标准注释
热点约束生成 抗原 PDB + 残基列表 约束文件(RFdiffusion/HADDOCK) 手工 + PyMOL / 自写脚本 RFantibodyGerminalmBER 均支持用户指定 epitope 残基

实践建议:治疗性靶点优先用实验结构AF3/Boltz 高置信域;表位预测工具给出候选集合而非单点真理,宜与保守性、糖基化、跨膜区排除规则联用。抗原 同源多态pH/离子强度 若影响表位,应在步骤 0 固定假设。

段末注释热点(hotspot) 指界面中贡献大部分结合自由能的少数残基,常用于约束扩散设计或对接。


3. 步骤 1:抗体格式与框架选择

目标:确定分子格式(VHHscFvFab、双特异性构建等),选定 框架区(FR) 模板与 VH–VL 配对策略;为 CDR 设计保留可折叠、可表达的骨架。

任务 输入 输出 开源工具 / 数据 许可 / 备注
序列编号与域注释 VH/VL FASTA IMGT/Kabat/Chothia 编号、CDR 边界 ANARCIAbNumber ANARCI 广泛用于工业流程
结构抗体数据库检索 靶标/家族/物种 同源 FR、CDR 长度分布 SAbDabThera-SAbDabABSD SAbDab 提供 PDB、VH–VL 配对、抗原注释
天然配对序列库 物种、链型 百万级抗体序列 OAS(Observed Antibody Space) 训练 PLM、humanness 基准
germline 与 V(D)J 序列 胚系基因、突变位点 IMGT/V-QUEST(Web)、IgBLAST(NCBI) 免疫原性评估输入
VH–VL 配对预测 VH + 多条 VL 候选 配对得分 ABPairDeepAb(配对模块) 共折叠 ipTM 亦可作配对验证
治疗性 FR 模板 格式需求 稳定 FR 序列 Thera-SAbDab 统计、文献模板(如 4-4-20HuCAL 衍生) 无单一官方工具,多从 SAbDab 聚类
纳米抗体 / VHH 模板 序列 VHH 结构、CDR3 长度 SAbDab(nanobody 标签)、NanoNet

实践建议:从头设计通常固定 FR、主要设计 CDR(尤其 CDR-H3);全链从头生成需额外可开发性过滤。VH–VL 错配是常见失败模式,scFv/Fab 设计应显式跑配对预测或共折叠筛选。


4. 步骤 2:结合位点与 CDR 骨架设计

目标:在抗原表位附近生成抗体三维骨架(主链几何),确定 CDR 环形状与相对取向——相当于「结构层面的结合位点设计」。

任务 输入 输出 开源工具 / 模型 许可 / 备注
表位靶向 CDR 骨架扩散 抗原 PDB + hotspot + 抗体 FR 模板 全原子或 backbone 设计 RFantibody(抗体微调 RFdiffusion MIT;RosettaCommons/RFantibody
表位靶向 hallucination 抗原 + epitope + 格式参数 复合物轨迹 GerminalColabDesign + AF-Multimer 梯度) SantiagoMille/germinal;依赖 PyRosetta(学术许可)
模板 + 反传优化 抗原 + binder 模板 + hotspot 优化后复合物 mBERColabDesign + AF-Multimer manifoldbio/mber-open
抗体复合物扩散生成 抗原表位、长度约束 CDR 构象 DiffAb luost26/diffab;扩散模型生成 CDR
多 CDR 协同设计 抗原 + 框架 CDR 序列与结构 dyAb 动态图网络 + 迭代设计
MEAN 等端到端 CDR 抗原结构 + FR CDR 序列/结构 MEAN 几何深度学习 CDR 设计
通用 binder 骨架(非抗体专用) 靶标表面 binder backbone RFdiffusionRFDiffusion3ChromaGenie 2 需后续 graft 到抗体 FR 或作纳米抗体启发
传统对接(刚性/半柔性) 抗原 + 抗体同源模型 对接复合物 HADDOCK3LightDockZDOCKClusPro(Web) HADDOCK3 开源;支持表位约束
Rosetta 抗体对接 抗原 + 抗体 低能对接姿态 SnugDockRosettaAntibody Rosetta 许可

实践建议RFantibodyGerminalmBER 代表当前「表位靶向从头 binder」三条技术路线(扩散 / hallucination / 模板反传)。纳米抗体(VHH)因无 VL,pipeline 更简单、成功率常更高;全长 IgG 还需后续 Fc 与表达格式工程(超出本文 CDR 设计范围)。


5. 步骤 3:序列设计与生成

目标:在固定或近似固定的骨架上,为 CDR(或全长可变区)赋予氨基酸序列,生成候选库。

任务 输入 输出 开源工具 / 模型 许可 / 备注
结构条件序列设计(通用) backbone + 固定位点 序列 ProteinMPNNLigandMPNN MIT;工业界事实标准
CDR 专用 MPNN 抗体 PDB + 设计掩码 CDR 序列 AbMPNN(Germinal 内置)、RFantibody 的 CDR-only MPNN 包装 通常只设计 CDR 环
逆折叠 + 语言模型梯度 骨架 + 目标 序列轨迹 ColabDesignmk_afdesign)、LM-design 与 AF2 梯度联用
抗体序列 PLM 部分序列 / 掩码 全序列、嵌入 AbLangAbLang2AntiBERTyIgLM Oxford / Meta 等开源权重
抗体基础模型(生成式) 条件:物种、CDR 长度、基因等 全序列、标注、inpainting AbBFN2(Bayesian Flow Network) instadeepai/AbBFN2
通用蛋白 PLM 设计 结构 + 序列掩码 突变建议 ESM-IF1ESM-2 + 采样 Meta fair-esm
物理能量 + Monte Carlo 结构 + 突变集 低能序列 Rosetta AntibodyDesignRAbD 需 Rosetta;适合少量精细优化
全原子扩散序列-结构联合 复合物框架 序列+侧链 MultiFlowChroma(部分模式) 研究向,抗体专用仍少

实践建议:主流组合为 骨架(RFdiffusion/Germinal)→ ProteinMPNN/AbMPNN → 结构 repredict 过滤。PLM(AbLangIgLM)常用于梯度引导 hallucination(Germinal 中 ablm_model)或序列后处理(去罕见 motif)。每步宜生成 10²–10⁴ 序列,靠下游结构+打分漏斗至 10¹–10² 合成。


6. 步骤 4:结构与复合物预测

目标:验证设计序列能否折叠为预期抗体构象,并与抗原形成合理复合物——是 in silico 过滤的核心。

任务 输入 输出 开源工具 / 模型 许可 / 备注
抗体 Fv 单体结构 VH/VL 或 VHH 序列 PDB IgFoldImmuneBuilder(ABodyBuilder2/3) Oxford OPIG;秒级;纳米抗体用 NANOBODYBUILDER
通用单链/复合物预测 序列(多链) 复合物结构 + pLDDT/ipTM AlphaFold2-MultimerColabFold 抗体–抗原常用;CDR-H3 置信度常偏低
生物分子相互作用 抗体 + 抗原序列 复合物 AlphaFold3Boltz-1/2Chai-1Protenix AF3/部分模型权重有限制;Boltz 开源权重友好
抗体专用共折叠 VH/VL + Ag 复合物 AF3BoltzIgFold + HADDOCK 串联 无单一「抗体专用」共折叠金标准
构象质量指标 PDB pLDDT、ipTM、PAE、RMSD OpenStructureModelAngelo(辅助)、自研脚本 过滤阈值依项目校准
多 seed ensemble 序列 构象分布 AF2 dropoutAFsample、多次随机 seed 界面柔性大时必做

实践建议:过滤常用:pLDDT > 0.85(FR)CDR-H3 不过低、ipTM / docking score 在候选间排序。设计序列与 repredict 结构 RMSD(尤其 CDR)过大则丢弃。IgFold 作快速单体预筛,Boltz/AF3 作复合物精评,是 2025 年常见分层策略。


7. 步骤 5:对接与界面精修

目标:在预测复合物基础上,优化 CDR–抗原界面 几何(氢键、盐桥、去冲突、packing),减少预测误差。

任务 输入 输出 开源工具 许可 / 备注
数据驱动柔性对接 抗原 + 抗体 + 约束 对接集合 HADDOCK3 GPL;表位/air 约束
轻量蛋白-蛋白对接 两个 PDB 姿态 LightDock GPL
几何对接 + 聚类 受体 + 配体 top poses ZDOCKPiper(部分开源)
抗体专用柔性对接 抗原 + CDR 柔性 精修复合物 SnugDock(Rosetta) CDR loop 采样
侧链 repacking / 最小化 复合物 PDB 低能结构 PyRosettaOpenMM + PDBFixer 工业流程常见
显式溶剂 MD(可选) 复合物 轨迹、稳定性 GROMACSOpenMM 计算贵;用于 lead 精修

实践建议:若步骤 4 已用 AF3/Boltz 高置信共折叠,对接有时可省略,仅做 Rosetta relaxOpenMM 最小化。表位约束对接(HADDOCK)在「预测复合物 ipTM 低但序列合理」时用于重采样姿态


8. 步骤 6:亲和力、稳定性与界面打分

目标:对候选序列/结构排序,选出最值得合成的 top N。详细工具对比见 抗体-04.工具-01

任务 输入 输出 开源 / 可获取工具 许可 / 备注
界面物理评分 复合物 PDB 能量、氢键、形状互补 Rosetta InterfaceAnalyzerPyRosetta 学术许可
突变 ΔΔG(结构) 复合物 + 突变 (\Delta\Delta G_{\mathrm{bind}}) Rosetta Flex ddGmCSM-AB(Web) FoldX 非开源
突变 ΔΔG(ML) 结构/序列 (\Delta\Delta G)、排序 GearBindGraphinityAttABseqProtAttBA 见工具-01 专篇
序列亲和力排序 抗体 + 抗原序列 配对得分 AbRankAbAgIntPreLlamaAffinity 无结构时优先
深度学习界面指标 复合物 结合概率 ProdigyDFIRE 快速、粗筛
免疫特异性 / 脱靶(可选) 序列 + 人蛋白组 同源风险 BLASTDIAMOND 开源

实践建议:从头设计阶段多为 ranking 而非绝对 (K_{\mathrm{D}}) 预测;推荐 结构界面分 + GearBind/AttABseq 排序 + 实验 SPR/BLI 闭环。避免仅用 split-by-mutation 训练的模型在全新表位上过度自信。


9. 步骤 7:可开发性与人源化

目标:在保持结合的前提下,降低聚集、低溶解度、免疫原性、非天然 motif 风险,满足治疗性候选的「可开发性(developability)」门槛。

任务 输入 输出 开源工具 / 平台 许可 / 备注
溶解度 / 可溶表达预测 序列 可溶性概率 SoluProtDeepSolProSo 序列级快速过滤
溶解度(结构) PDB 表面疏水斑块 CamSolCamSol-intrinsic CamSol 学术免费
聚集倾向 序列 热点片段 TANGOWaltzAggrescan3D 开源 / 免费学术
治疗性抗体理化画像 序列 TAP 指标 TAP(Therapeutic Antibody Profiler)、BioPhi 内置 BioPhi MIT
Humanness / 免疫原性 序列 OASis 9-mer、胚系距离 BioPhiOASisSapiens 人源化 + 评分一体
人源化(CDR graft + 回复突变) 鼠源序列 人源化候选 BioPhi HumanizeHumatch Humatch 有开源组件
条件生成人源化序列 鼠源 + 约束 人源序列 AbBFN2(metadata 条件) 生成式人源化
电荷 / pI / 粘度代理 序列 理化性质 BioPhiIPCBiopython 高浓度制剂相关
脱酰胺、氧化、异构化 motif 序列 风险位点 BioPhi、规则脚本(NGMW 等 motif) 治疗性开发常规检查

实践建议:可开发性过滤宜早于大规模合成:先用 TANGO/Aggrescan + SoluProt + BioPhi OASis 去掉明显风险序列,再进入亲和力实验。鼠源或全合成极端 CDR 需显式 人源化Sapiens(BioPhi)与 AbBFN2 可批量生成人源化变体。


10. 步骤 8:序列定稿与合成前校验

目标:统一编号、检查克隆与表达约束,输出最终 VH/VL(或 VHH)序列供基因合成。

任务 输入 输出 开源工具 备注
编号一致性校验 最终序列 IMGT/Kabat 注释 ANARCI 与 CDR 设计掩码对齐
接头 / 格式拼接 VH, VL scFv / Fab 序列 自研脚本、BioPhi Designer (G4S)n linker 长度经验
密码子优化 蛋白序列 DNA(宿主特异) CodonOptimizer(Biopython 生态)、JCat(Web) 避免稀有密码子、重复序列
克隆酶切位点检查 DNA 报告 SnapGene(商业)/ pydna 开源可用 pydna
信号肽 / 标签 格式需求 全长的表达 cassette 文献模板 + SignalP(部分开源) 表达系统依赖

实践建议:定稿序列应保留完整计算溯源(骨架来源、MPNN seed、结构 model、过滤分数),便于实验失败后回溯。建议每个 lead 至少保留 1–2 个 备选回复突变(reversion)用于挽救表达或亲和力。


11. 一体化开源 Pipeline 对比

§2–§9 多步打包的端到端方案(2024–2025 主流):

图 3 RFantibody、Germinal、mBER 一体化 Pipeline 对比

Pipeline 核心流程 适用格式 依赖亮点 开源许可
RFantibody RFdiffusion(抗体微调)→ ProteinMPNN(CDR)→ RF2 过滤 Fab / VHH(HLT 格式) 表位靶向扩散;Rosetta 生态 MIT
Germinal ColabDesign hallucination → AbMPNN → AF3/AF2 共折叠过滤 VHH、scFv 表位残基约束;AbLang/IgLM 梯度 开源;需 PyRosetta、GPU
mBER 模板准备 → AF-Multimer 反传轨迹 → 多维评估 VHH(CLI mber-vhh 模块化 YAML 配置 开源
DiffAb 扩散生成 CDR → 内置评估 Fab 类 学术 CDR 设计经典基线 开源
ColabDesign + 自研脚本 灵活组合 AF-design、MPNN、AbLang 自定义 研究自由度最高 Apache/MIT 组件

选型速查

  • 表位明确 + 纳米抗体:优先 GerminalmBER
  • 需全长 Fab + 工业 Rosetta 流程RFantibody
  • 已有弱结合模板、做 CDR 重设计DiffAb + ProteinMPNN + GearBind 排序;
  • 无 GPU / 快速原型IgFold + HADDOCK3 + AbLang 序列采样 + BioPhi 过滤。

12. 推荐工作流(按场景)

图 4 三种典型场景推荐工作流

12.1 表位靶向 de novo VHH

1
2
3
4
5
6
7
抗原(AF3/Boltz)+ BepiPred/DiscoTope 表位
→ Germinal 或 mBER(epitope 约束)
→ AbMPNN / ProteinMPNN 序列
→ Boltz-1/AF3 共折叠过滤(ipTM、界面接触)
→ GearBind / Prodigy 排序
→ BioPhi(OASis + 可开发性)+ SoluProt
→ ANARCI 定稿 → 基因合成 → BLI/SPR

12.2 基于已知复合物的 CDR 重设计(亲和力成熟前置)

1
2
3
4
5
共晶 / AF 复合物
→ RFdiffusion(局部 CDR 重采样)或 ProteinMPNN(固定 FR)
→ IgFold + AF3 重预测
→ Flex ddG / GearBind / AttABseq
→ 实验 DMS 或定点合成 top 12–24

12.3 序列优先、结构后置(低算力)

1
2
3
4
AbBFN2 / IgLM 条件生成 CDR
→ AbAgIntPre / AbRank 排序
→ IgFold 单体 → AF2-Multimer 对接
→ HADDOCK 精修 → BioPhi 人源化

13. 许可与「开源」边界说明

组件 性质 说明
ProteinMPNN、IgFold、AbLang、Boltz、RFantibody 开源友好 可本地部署、可改代码
AlphaFold2、ColabFold、ESMFold 开源代码 + 公开权重 商业使用需查阅各模型许可
AlphaFold3 代码开源、权重申请 非完全开放权重
PyRosetta / Rosetta 学术免费、商业需授权 Germinal、RFantibody 部分步骤依赖
FoldX 商业软件 工具-01 中作对比,非开源
BepiPred 3.0 学术免费、商业需授权 与 DTU 条款一致

构建生产级 pipeline 时,应在架构图中标注许可链,避免商业转化时踩坑。


14. 工具与资源索引(按步骤)

步骤 工具 链接
表位 BepiPred 3.0 github.com/UberClifford/BepiPred-3.0
结构预测 ColabFold github.com/sokrypton/ColabFold
结构预测 Boltz github.com/jwohlwend/boltz
编号 ANARCI github.com/oxpig/ANARCI
数据库 SAbDab opig.stats.ox.ac.uk/webapps/sabdab
抗体结构 IgFold / ImmuneBuilder github.com/Graylab/IgFold
序列设计 ProteinMPNN github.com/dauparas/ProteinMPNN
PLM AbLang github.com/oxpig/AbLang
生成模型 AbBFN2 github.com/instadeepai/AbBFN2
Pipeline RFantibody github.com/RosettaCommons/RFantibody
Pipeline Germinal github.com/SantiagoMille/germinal
Pipeline mBER github.com/manifoldbio/mber-open
CDR 扩散 DiffAb github.com/luost26/diffab
对接 HADDOCK3 github.com/haddocking/haddock3
人源化 BioPhi github.com/Merck/BioPhi
亲和力 ML GearBind 等 抗体-04.工具-01

15. 小结

抗体从头理性设计的计算闭环可归纳为 「表位锚定 → 框架固定 → 骨架/序列生成 → 结构验证 → 界面打分 → 可开发性/人源化 → 实验合成」。2024–2025 年的关键变化是 表位靶向生成式 pipelineRFantibodyGerminalmBER)与 开源共折叠BoltzChai)使「无共晶、仅序列表位」的设计成为可行路径;但 CDR-H3 不确定性、AF 界面误差标签噪声 仍未解决,实验验证BLI/SPR + 表达量 readout)不可替代。

选型时应先定 格式(VHH vs Fab)表位证据强度,再选一体化 pipeline 或模块化积木;亲和力与人源化工具分别详见 工具-01BioPhi/AbBFN2 文档。计算预测的定位始终是:放大有效序列空间、压缩湿实验合成量,而非单次运行即交付终版药物分子。


参考文献(选)

  1. Watson J. L. et al. De novo design of protein structure and function with RFdiffusion. Nature 2023(RFantibody 基础)。
  2. Bennett N. P. et al. Atomically accurate de novo design of antibodies with RFantibody. bioRxiv 2024(RFantibody)。
  3. Mille S. et al. Efficient generation of epitope-targeted de novo antibodies with Germinal. bioRxiv 2025.
  4. Swanson K. et al. mBER: Manifold Binder Engineering and Refinement. bioRxiv 2025.
  5. Luo S. et al. Antigen-specific antibody design via direct energy-based preference optimization. Nature Machine Intelligence 2024(DiffAb 相关线)。
  6. Ruffolo J. A. et al. Fast, accurate antibody structure prediction from deep learning on massive set of natural antibodies. Nat. Commun. 2023(IgFold)。
  7. Abramson J. et al. Accurate structure prediction of biomolecular interactions with AlphaFold 3. Nature 2024.
  8. Wohlwend J. et al. Boltz-1: Democratizing biomolecular interaction modeling. 2024.
  9. Prihoda D. et al. BioPhi: A platform for antibody design, humanization, and humanness evaluation. mAbs 2022.
  10. Atkinson E. et al. AbBFN2: Antibody sequence generation and labelling with Bayesian Flow Networks. bioRxiv 2025.
-------------本文结束感谢您的阅读-------------