系列:抗体-05.方法文献系列说明 · 第 01 篇
范式对照:亲和力改造范式 · 方向 4b 生成(性质引导 de novo,非抗原条件)
0. 文献卡片
| 项 | 内容 |
|---|---|
| 题名 | AntiBARTy Diffusion for Property Guided Antibody Design |
| 作者 / 机构 | Jordan Venderley / Eli Lilly and Company |
| 载体 | arXiv 预印本,2023-09 |
| 链接 | arXiv:2309.13129 · HTML |
| 一句话贡献 | 先训抗体专用 BART(AntiBARTy),再在其冻结潜空间上训性质条件扩散模型,用 无分类器引导 做 IgG 可变区从头生成(用例:计算机溶解度) |
段末注释:BART(Bidirectional and Auto-Regressive Transformers,双向与自回归变换器)是「编码器看腐蚀序列、解码器做去腐蚀」的序列到序列预训练范式;IgG(Immunoglobulin G,免疫球蛋白 G)是最常见治疗抗体同种型。
1. 问题与动机
工业抗体路径通常是:展示库/杂交瘤拿到抗原特异性 binder → 再改可开发性(溶解度、免疫原性、可制造性等),同时尽量保住亲和力。性质标签往往远少于公开抗体序列;若直接在氨基酸串上训强条件生成器,容易欠拟合或牺牲「像不像抗体」。
作者策略拆成两步:
- 用海量无标签序列学强先验 (p(\text{序列}))(AntiBARTy);
- 把少量性质数据「挂」到冻结潜空间上,用扩散 + 引导采样推向有利性质模式。
相对结构扩散(如 DiffAb)与离散序列引导扩散(如 Gruver et al.),本文刻意走:序列优先、计算便宜、可变长、不依赖抗原 3D、不要求固定编辑预算。
2. 方法总览

| 阶段 | 模块 | 输入 | 输出 | 参数量(作者) |
|---|---|---|---|---|
| A | AntiBARTy(BART) | 腐蚀后的 Fv 序列 | 去腐蚀序列;编码器连续潜表示 | ~16M |
| B | 性质条件 DDPM(U-Net) | 噪声潜向量 + 时间步 ± 性质类 | 去噪潜编码 | ~3M |
| 生成 | CFG 采样 + decoder | (z_T\sim\mathcal{N}(0,I))、引导强度 (w)、链类型 token | 氨基酸序列 | — |
段末注释:Fv(fragment variable,可变片段)含 VH/VL 可变域;DDPM(denoising diffusion probabilistic model,去噪扩散概率模型)通过多步加噪/去噪学习数据分布;CFG(classifier-free guidance,无分类器引导)用「有条件 − 无条件」噪声预测差引导采样,无需单独训练分类器。
端到端采样伪代码:
1 | z_T ~ N(0, I) |
3. 实现细节(一):AntiBARTy
3.1 数据与预处理
| 来源 | 规模 | 备注 |
|---|---|---|
| OAS 人源 IgG 重链 Fv | 2.54 亿 | Observed Antibody Space |
| OAS 人源 IgG 轻链 Fv | 3.42 亿 | 同上 |
| UniProtKB | 0.28 亿 | 增加非抗体蛋白多样性 |
过滤:长度限制在 ([100,140]) 氨基酸;去掉含未知残基 X 的链。
前缀标签:<heavy> / <light> / <protein>;末尾 <EOS>。
段末注释:OAS(Observed Antibody Space,观测到的抗体空间)是清洗、注释后的大规模抗体序列库;UniProtKB(UniProt Knowledgebase)为通用蛋白知识库。
合计量级约 6 亿+ 条,与综述常用「超 6 亿 Fv」表述一致。
3.2 预训练目标与架构
- 目标:BART 去腐蚀——编码器读被破坏序列,解码器重建干净序列。
- 腐蚀类型(训练时 on-the-fly):token masking、插入/删除(indel)、infilling。
- 结构:encoder / decoder 各 6 层注意力;Flash Attention;4×A100;约 6 epoch / 6 天。
- 强腐蚀极限:接近纯 decoder 语言模型;弱腐蚀则保留双向上下文。
相对 encoder-only 抗体 LM(如 AntiBERTy):BART 给出精确自回归似然,作者提到利于 repertoire 的 evolutionary velocity 等分析(本文未展开)。
相对纯 decoder(如 IgLM):多出可冻结的连续编码器潜空间,便于接扩散。
3.3 微调:质量对齐 + max-pooled 条件化
OAS 存在 N 端截断等质量问题。预训练后在 OAS paired 子集(更高质量)上短微调,把生成分布拉回「可被 ANARCI 正确编号」的完整抗体。
关键改动:解码器 cross-attention 改为对编码器输出在序列维做 max-pooling,得到固定维聚合嵌入,再供解码注意。
| 做法 | 作者判断 |
|---|---|
| 全长 token 级 cross-attn | 变长 Fv 难与固定维扩散潜变量对齐 |
| 自然语言 latent diffusion 常用的经验长度采样 | 抗体场景不如 pooling |
| max-pooled 聚合嵌入 | 与扩散生成编码联用时序列质量更好 |
微调后 冻结 AntiBARTy 全参数。

段末注释:ANARCI(Antigen receptor Numbering And Receptor ClassificatIon)用于可变域编号与链型/物种分类,是本文生成质量的粗检工具。
4. 实现细节(二):潜空间性质条件扩散
4.1 为何在潜空间扩散?
在归一化后的编码器连续潜空间训 DDPM,而非离散氨基酸空间:
- 复用已学抗体流形,降低「生成不像抗体」的风险;
- 长度可变:最终长度由 decoder 决定,不绑定固定编辑预算(对比 guided discrete diffusion);
- indel 已在 BART 腐蚀中成为先验一部分,与亲和力成熟中 indel 的生物学角色一致。
4.2 U-Net 与条件融合
- 骨干:3 层 U-Net,约 3M 参数;
- 上采样阶段融合:自编码输入 + 可学习性质类嵌入 + 时间步嵌入;
- 同时支持条件 / 无条件噪声预测,供 CFG 使用。
4.3 性质标签与训练配方(溶解度用例)
| 项 | 设定 |
|---|---|
| 性质来源 | Protein-Sol 对 paired OAS 子集中一批 VH 的 in silico 溶解度 |
| 低溶类 | 分数 (< 0.45) |
| 高溶类 | 分数 (> 0.7) |
| 规模 | 每类约 2 万 条 |
| CFG 训练 | 以概率 0.1 丢弃性质类嵌入(学无条件分支) |
| 类别不平衡 | 条件训练集 10× 上采样 |
无条件分支还使用 AntiBARTy 微调集上的嵌入。
段末注释:Protein-Sol 是基于序列特征的蛋白质溶解度预测工具;本文优化的是其分数景观,不等于实测溶解度。
CFG 噪声预测(符号与常见图像 CFG 一致):
[
\hat{\varepsilon}(z_t,t,c)=\varepsilon_\theta(z_t,t,\varnothing)+w\bigl(\varepsilon_\theta(z_t,t,c)-\varepsilon_\theta(z_t,t,\varnothing)\bigr)
]
其中 (c) 为性质类,(w) 为引导强度。作者观察:推向低溶解度往往需要更大的 (w),才能达到与高溶侧相当的分布偏移。
4.4 解码超参
- decoder 输入初始化:
<heavy>(主结果为重链); - 解码:Gumbel 采样式贪心,温度 0.1(偏确定、低随机性)。
5. 结果与口径
5.1 仅 AntiBARTy(无扩散)
另训「只条件 <heavy> / <light>」版本,各采 1k 条:长度分布可复现高质量训练集;ANARCI 链型全对,germline 物种分布与训练一致;样本彼此唯一。说明微调缓解了预训练集 N 端截断导致的分布污染。
5.2 AntiBARTy Diffusion(溶解度引导)
| 检查项 | 作者报告 |
|---|---|
| 无条件溶解度分布 | 贴近全训练集 |
| 高/低溶条件采样 | Protein-Sol 分数明显分离 |
| ANARCI | 全为重链;>99.9% 人源 germline |
| 新颖性 | >99.9% 不在溶解度训练集;与最近邻有 Levenshtein 距离分布 |
| 潜空间覆盖(UMAP) | 高溶引导避开低溶模式,聚集于高溶区域 |
口径提醒:全部为 in silico;无表达、无 SPR/BLI、无抗原结合实验。数字不可与亲和力成熟论文的「(N) 倍 (K_D)」横比。
6. 局限、风险与任务边界
| 类型 | 说明 |
|---|---|
| 标签代理 | 优化 Protein-Sol,可能与真实溶解/表达脱钩 |
| 无抗原条件 | 不能替代 DiffAb / dyMEAN / RFantibody 等 binder 设计 |
| 无湿实验 | 作者结论亦写明计划实验验证 |
| CFG 强度 | (w) 过大易模式崩塌或「假性质」;高低溶所需 (w) 不对称 |
| 配对 | 主结果在 VH;完整治疗分子还需 VL 配对与恒定区 |
| 数据偏倚 | OAS/人源 IgG 主导;跨物种/特殊格式需另评 |
一句话边界:本方法属于「可开发性/性质引导的序列 de novo」,不是「表位定制亲和力设计」主引擎。
7. 与相近方法对照(选型用)
| 方法 | 条件对象 | 表示空间 | 更适合 |
|---|---|---|---|
| AntiBARTy Diffusion | 序列性质(溶解度等) | BART pooled latent | 性质偏置的合法抗体采样 |
| DiffAb / RFantibody | 抗原结构 / 表位 | 结构(±序列) | 抗原特异性结合 |
| EAGLE | 表位结构 | ESM embedding 上扩散 | 表位条件全长序列 |
| Guided discrete diffusion(Gruver) | 性质 + 编辑预算 | 离散序列 | 固定长度 lead 优化(有实验报道) |
8. 工程取用建议
- 有用时:已有大量无标签抗体序列 + 少量可计算/可预测性质;需要新颖、可变长、像抗体的候选池,并偏向某一性质模式。
- 不够时:必须指定抗原表位、或必须以实测亲和力/溶解度闭环为准——需另接结构条件生成或湿实验筛选。
- 复现注意:原文为 Lilly 内部工作,公开信息以 arXiv 方法节为准;实现时重点对齐——(i) max-pool 潜向量、(ii) 0.1 条件 dropout CFG、(iii) 性质集上采样。
- 本仓库衔接:范式总览 4b;注释质控可用 ANARCI 科普;抗原条件设计见工具-02 与后续方法文献篇目。
9. 可核对原文要点清单
- 数据:OAS 254M VH + 342M VL + UniProt 28M;长度 ([100,140])
- AntiBARTy:6+6 层,~16M;BART 腐蚀;paired 微调 + max-pool
- 扩散:3 层 U-Net,~3M;Protein-Sol 高低溶各 ~20k;mask (p=0.1);条件 10× upsample
- 采样:标准正态潜向量 → CFG → decoder(
<heavy>,Gumbel (T=0.1)) - 结果:in silico 溶解度可分;ANARCI/新颖性高;无湿实验、无抗原设计
参考文献(本篇)
- Venderley J. AntiBARTy Diffusion for Property Guided Antibody Design. arXiv:2309.13129, 2023.
- Lewis et al. BART. ACL 2020.
- Ho & Salimans. Classifier-free diffusion guidance. NeurIPS Workshop 2021.
- Ho et al. Denoising diffusion probabilistic models. NeurIPS 2020.
- Olsen et al. Observed Antibody Space. Protein Science 2022.
- Hebditch et al. Protein-Sol. Bioinformatics 2017.