DLP-Affinity(dual-level protein representation for affinity prediction,双层蛋白质表征亲和力预测)是面向抗体–抗原结合亲和力的仅序列深度学习框架:以微调后的 ESM2-3B 提取残基嵌入,经 R2R(residue-to-residue)刻画局部界面接触、经 GSPE(global stochastic projection embedding)刻画全局蛋白性质,再融合为 (\mathrm{p}K_{\mathrm{d}}) 回归。相对多特征集成方法,它用单一统一模型、纯序列输入,在 AB-Bind 上将 MAE 相对强基线最多降低约 20.9%,在 sdAb-DB 上亦具竞争力。
段末注释:(\mathrm{p}K_{\mathrm{d}}=-\log_{10}K_{\mathrm{D}})((K_{\mathrm{D}}) 单位为 M);sdAb(single-domain antibody,单域抗体)含纳米抗体等;pLM(protein language model,蛋白质语言模型);KAN(Kolmogorov–Arnold Networks)为可学习样条激活的网络结构。
官方资源
| 类型 | 链接 |
|---|---|
| 论文 | Bioinformatics 42(4): btag109 · DOI 10.1093/bioinformatics/btag109 · PubMed |
| 代码 | GitHub: Zy-Wang-bit/DLP_Affinity(当前主分支以 release_package.zip 发布) |
| 归档 | Zenodo 10.5281/zenodo.18437656 · MIT |
| 微调语料来源 | INDI / NaturalAntibody 约 1120 万条抗体序列(学术用途见原数据方条款) |
关联笔记:AbAffinity 架构 · 抗体亲和力预测工具调研 · 亲和力指标总览
1. 要解决什么问题
- 结构稀缺:可靠复合物结构往往滞后于序列库规模;高通量筛选需要只吃序列的亲和力估计。
- 序列信息利用不足:既有序列方法难以同时抓住界面局部接触与全长蛋白全局性质。
- 多样抗体格式:尤其是 sdAb,序列爆炸、结构不足,需要领域适配的 pLM。
形式化:输入抗体序列 (A={a_1,\ldots,a_m}) 与抗原序列 (G={g_1,\ldots,g_n}),预测 (y=-\log_{10}(K_{\mathrm{D}}));训练目标为预测值与真值的 MSE。
2. 整体软件 / 模型结构

论文 Fig.1 逻辑可概括为下图(与官方表述一致):
| 层 | 组件 | 输入 → 输出 | 作用 |
|---|---|---|---|
| 表征骨干 | ESM2-3B + 抗体微调 | 序列 → (L\times 2560) | 上下文残基嵌入 |
| 降维 | KAN 栈 | (2560\to 1)(残基势) | 非线性压缩到互作势 |
| 局部支路 | R2R | (V_{ab},V_{ag}\to H_{AA}) | 类接触图的残基对互作 |
| 全局支路 | GSPE | (X\to h_{pair}) | 定长、置换不变的全局签名 |
| 读出 | FFN | 双层特征 → (\mathrm{p}K_{\mathrm{d}}) | 连续亲和力回归 |
仓库发布形态:GitHub main 目前主要为 release_package.zip(完整源码与数据打包);细节以解压包与 Zenodo 归档为准。
3. 模块详解(对应论文 §3)
3.1 微调 pLM(Fine-tuned ESM2-3B)
- 基座:预训练 ESM2-3B(Lin et al. 2023)。
- 微调数据:约 11 228 599 条抗体序列(INDI / NaturalAntibody)。
- 目标:掩码语言模型(MLM),约 15% 位点掩码;交叉熵损失。
- 领域适配:
- CDR 优先掩码:更关注互补决定区(paratope 相关模式);
- 批次分层:按序列长度平衡重/轻链暴露。
- 训练规模(论文):AdamW、线性 warmup(约 40 step,峰值 LR (10^{-5})),约 3 周 / 16×A40。
- 效果:t-SNE 上家族聚类轮廓系数约 (0.44\to 0.68)(补充材料)。
3.2 R2R:残基–残基互作(局部层)
对应「界面接触 / CDR–表位」直觉。
- 初值:微调 ESM 得到 (X_{ab}\in\mathbb{R}^{L_{ab}\times 2560})、(X_{ag}\in\mathbb{R}^{L_{ag}\times 2560})。
- KAN 投影:压成 (V_{ab}\in\mathbb{R}^{L_{ab}\times 1})、(V_{ag}\in\mathbb{R}^{L_{ag}\times 1})。选用 KAN 是因「高维嵌入 → 互作势」高度非线性,且亲和力数据有限时样条激活更省参、更稳(论文对照 MLP,见补充表)。
- 互作矩阵(外积):
[
M_{\mathrm{inter}}=V_{ab}\otimes V_{ag}^{\top}\in\mathbb{R}^{L_{ab}\times L_{ag}}
]
(M_{\mathrm{inter}}[i,j]) 可理解为第 (i) 个抗体残基与第 (j) 个抗原残基的互作势——无参、全 pairwise,利于小数据、避免注意力漏掉稀有互作模式。
- 与抗体特征拼接再过 KAN,得到残基级互作表征 (H_{AA})。KAN 使用可学习系数的正弦类激活。
3.3 GSPE:全局随机投影嵌入(全局层)
应对「只看局部则难建模整体折叠与长程依赖」:
- 对残基矩阵 (X\in\mathbb{R}^{L\times d}) 采 (m) 个随机向量 (r\sim\mathcal{N}(0,I_d)) 并列归一化,构成投影矩阵 (R)。
- 对每个 (r_i):(P_i=X\cdot r_i\in\mathbb{R}^{L}),再 排序 (\tilde{P}_i=\mathrm{sort}(P_i)) → 置换不变的全局签名(顺序信息已含在 pLM 嵌入中)。
- 拼接 (m) 路投影得蛋白级向量;抗体–抗原对计算缩放后的投影差平方和,经 softplus 类 (\Phi(x)=\log(1+e^{x})) 得到 (h_{pair})。
3.4 双层融合与预测
R2R 的局部表征与 GSPE 的全局对特征送入 前馈网络,输出连续 (\mathrm{p}K_{\mathrm{d}})。消融表明两支路互补:sdAb-DB 上 R2R 贡献更大(紧凑界面),AB-Bind 上 GSPE 同样关键(格式更多样)。
4. 数据与评测结构
| 数据集 | 角色 | 备注 |
|---|---|---|
| sdAb-DB | 单域抗体亲和力基准 | Wilton et al. 2018 |
| AB-Bind | 更广抗体–抗原亲和力基准 | Sirin et al. 2016;本文最大增益场景 |
| INDI ~11M | ESM 微调语料 | 非亲和力标签训练,属领域语言适配 |
| LY-CoV555(7KMG)DMS | 独立突变验证 | AUC≈0.85 区分破坏性 vs 中性突变(定量仍受限) |
主指标:MAE、RMSE、PCC、(R^{2}) 等。论文报告(ESM-FT 版):
| sdAb-DB | AB-Bind | |
|---|---|---|
| MAE | 0.174 | 0.136(相对 DeepNano-seq 约 −20.9%) |
| 相对定位 | 与 DeepNano-seq 接近,但单模型纯序列 | 多数指标 SOTA |
DeepNano-seq 为多特征(含 PSSM)+ 多架构集成;DLP-Affinity 强调可部署的单模型流水线。
5. 端到端数据流(工程视角)
1 | 1)(可选,离线)抗体语料 MLM 微调 → 得到 ESM-FT 权重 |
适用:结构不可得时的筛选、sdAb 序列库排序;论文声明多链 IgG 空间组织尚未充分验证,VH–VL 拼接或图模型为后续扩展。
6. 局限(论文结论)
- 多链抗体(如完整 IgG):R2R 线性化序列,未必刻画重轻链非邻接空间互作。
- 无结构先验:可进一步用 AlphaFold3 等接触图替换外积(GNN)。
- 环境缺失:pH、离子强度、糖基化等未入模。
- 实验闭环:需 SPR / BLI 等实测 (K_{\mathrm{D}}) 验证计算预测。
7. 与 AbAffinity 的边界(站内对照)
| DLP-Affinity | AbAffinity(站内另文) | |
|---|---|---|
| 骨干 | ESM2-3B,微调 | ESM-2 650M,多冻结 |
| 结构归纳 | R2R + GSPE 双层 | 三流(H/L/Ag)+ CDR 池化 + 门控交叉注意力 |
| 强调 | 局部接触图直觉 + 全局随机投影 | 链感知与轻重融合门 |
| 基准焦点 | sdAb-DB、AB-Bind | SAAINT-DB 等(见 AbAffinity 文) |
二者同属「序列亲和力」路线,模块哲学不同,不宜混用仓库权重。
小结
- DLP-Affinity = 微调 ESM2-3B + R2R(局部) + GSPE(全局) → (\mathrm{p}K_{\mathrm{d}})。
- 软件发布以 GitHub / Zenodo 的 release 包为主;方法细节以 Bioinformatics 2026 论文为准。
- 定位:结构稀缺下的可部署单模型序列亲和力预测,尤其照顾 sdAb 与通用 AB-Bind 场景。