5003.大模型-架构-DLP-Affinity-0.整体结构说明

DLP-Affinity(dual-level protein representation for affinity prediction,双层蛋白质表征亲和力预测)是面向抗体–抗原结合亲和力仅序列深度学习框架:以微调后的 ESM2-3B 提取残基嵌入,经 R2R(residue-to-residue)刻画局部界面接触、经 GSPE(global stochastic projection embedding)刻画全局蛋白性质,再融合为 (\mathrm{p}K_{\mathrm{d}}) 回归。相对多特征集成方法,它用单一统一模型、纯序列输入,在 AB-Bind 上将 MAE 相对强基线最多降低约 20.9%,在 sdAb-DB 上亦具竞争力。

段末注释:(\mathrm{p}K_{\mathrm{d}}=-\log_{10}K_{\mathrm{D}})((K_{\mathrm{D}}) 单位为 M);sdAb(single-domain antibody,单域抗体)含纳米抗体等;pLM(protein language model,蛋白质语言模型);KAN(Kolmogorov–Arnold Networks)为可学习样条激活的网络结构。

官方资源

类型 链接
论文 Bioinformatics 42(4): btag109 · DOI 10.1093/bioinformatics/btag109 · PubMed
代码 GitHub: Zy-Wang-bit/DLP_Affinity(当前主分支以 release_package.zip 发布)
归档 Zenodo 10.5281/zenodo.18437656 · MIT
微调语料来源 INDI / NaturalAntibody 约 1120 万条抗体序列(学术用途见原数据方条款)

关联笔记AbAffinity 架构 · 抗体亲和力预测工具调研 · 亲和力指标总览


1. 要解决什么问题

  1. 结构稀缺:可靠复合物结构往往滞后于序列库规模;高通量筛选需要只吃序列的亲和力估计。
  2. 序列信息利用不足:既有序列方法难以同时抓住界面局部接触全长蛋白全局性质
  3. 多样抗体格式:尤其是 sdAb,序列爆炸、结构不足,需要领域适配的 pLM。

形式化:输入抗体序列 (A={a_1,\ldots,a_m}) 与抗原序列 (G={g_1,\ldots,g_n}),预测 (y=-\log_{10}(K_{\mathrm{D}}));训练目标为预测值与真值的 MSE


2. 整体软件 / 模型结构

DLP-Affinity 双层表征架构示意

论文 Fig.1 逻辑可概括为下图(与官方表述一致):
DLP-Affinity 双层表征架构示意

组件 输入 → 输出 作用
表征骨干 ESM2-3B + 抗体微调 序列 → (L\times 2560) 上下文残基嵌入
降维 KAN (2560\to 1)(残基势) 非线性压缩到互作势
局部支路 R2R (V_{ab},V_{ag}\to H_{AA}) 类接触图的残基对互作
全局支路 GSPE (X\to h_{pair}) 定长、置换不变的全局签名
读出 FFN 双层特征 → (\mathrm{p}K_{\mathrm{d}}) 连续亲和力回归

仓库发布形态:GitHub main 目前主要为 release_package.zip(完整源码与数据打包);细节以解压包与 Zenodo 归档为准。


3. 模块详解(对应论文 §3)

3.1 微调 pLM(Fine-tuned ESM2-3B)

  • 基座:预训练 ESM2-3B(Lin et al. 2023)。
  • 微调数据:约 11 228 599 条抗体序列(INDI / NaturalAntibody)。
  • 目标:掩码语言模型(MLM),约 15% 位点掩码;交叉熵损失。
  • 领域适配
    • CDR 优先掩码:更关注互补决定区(paratope 相关模式);
    • 批次分层:按序列长度平衡重/轻链暴露。
  • 训练规模(论文):AdamW、线性 warmup(约 40 step,峰值 LR (10^{-5})),约 3 周 / 16×A40
  • 效果:t-SNE 上家族聚类轮廓系数约 (0.44\to 0.68)(补充材料)。

3.2 R2R:残基–残基互作(局部层)

对应「界面接触 / CDR–表位」直觉。

  1. 初值:微调 ESM 得到 (X_{ab}\in\mathbb{R}^{L_{ab}\times 2560})、(X_{ag}\in\mathbb{R}^{L_{ag}\times 2560})。
  2. KAN 投影:压成 (V_{ab}\in\mathbb{R}^{L_{ab}\times 1})、(V_{ag}\in\mathbb{R}^{L_{ag}\times 1})。选用 KAN 是因「高维嵌入 → 互作势」高度非线性,且亲和力数据有限时样条激活更省参、更稳(论文对照 MLP,见补充表)。
  3. 互作矩阵(外积)

[
M_{\mathrm{inter}}=V_{ab}\otimes V_{ag}^{\top}\in\mathbb{R}^{L_{ab}\times L_{ag}}
]

(M_{\mathrm{inter}}[i,j]) 可理解为第 (i) 个抗体残基与第 (j) 个抗原残基的互作势——无参、全 pairwise,利于小数据、避免注意力漏掉稀有互作模式。

  1. 与抗体特征拼接再过 KAN,得到残基级互作表征 (H_{AA})。KAN 使用可学习系数的正弦类激活。

3.3 GSPE:全局随机投影嵌入(全局层)

应对「只看局部则难建模整体折叠与长程依赖」:

  1. 对残基矩阵 (X\in\mathbb{R}^{L\times d}) 采 (m) 个随机向量 (r\sim\mathcal{N}(0,I_d)) 并列归一化,构成投影矩阵 (R)。
  2. 对每个 (r_i):(P_i=X\cdot r_i\in\mathbb{R}^{L}),再 排序 (\tilde{P}_i=\mathrm{sort}(P_i)) → 置换不变的全局签名(顺序信息已含在 pLM 嵌入中)。
  3. 拼接 (m) 路投影得蛋白级向量;抗体–抗原对计算缩放后的投影差平方和,经 softplus 类 (\Phi(x)=\log(1+e^{x})) 得到 (h_{pair})

3.4 双层融合与预测

R2R 的局部表征与 GSPE 的全局对特征送入 前馈网络,输出连续 (\mathrm{p}K_{\mathrm{d}})。消融表明两支路互补:sdAb-DB 上 R2R 贡献更大(紧凑界面),AB-Bind 上 GSPE 同样关键(格式更多样)。


4. 数据与评测结构

数据集 角色 备注
sdAb-DB 单域抗体亲和力基准 Wilton et al. 2018
AB-Bind 更广抗体–抗原亲和力基准 Sirin et al. 2016;本文最大增益场景
INDI ~11M ESM 微调语料 非亲和力标签训练,属领域语言适配
LY-CoV555(7KMG)DMS 独立突变验证 AUC≈0.85 区分破坏性 vs 中性突变(定量仍受限)

主指标:MAE、RMSE、PCC、(R^{2}) 等。论文报告(ESM-FT 版):

sdAb-DB AB-Bind
MAE 0.174 0.136(相对 DeepNano-seq 约 −20.9%)
相对定位 与 DeepNano-seq 接近,但单模型纯序列 多数指标 SOTA

DeepNano-seq 为多特征(含 PSSM)+ 多架构集成;DLP-Affinity 强调可部署的单模型流水线


5. 端到端数据流(工程视角)

1
2
3
4
5
6
1)(可选,离线)抗体语料 MLM 微调 → 得到 ESM-FT 权重
2) 推理/训练样本:抗体序列 + 抗原序列
3) ESM-FT 前向 → 残基嵌入
4) 并行:R2R 支路 ∥ GSPE 支路
5) 拼接 / 融合 → FFN → pKd
6) 训练:MSE(ŷ, y);推理:库规模打分 / 排序

适用:结构不可得时的筛选、sdAb 序列库排序;论文声明多链 IgG 空间组织尚未充分验证,VH–VL 拼接或图模型为后续扩展。


6. 局限(论文结论)

  1. 多链抗体(如完整 IgG):R2R 线性化序列,未必刻画重轻链非邻接空间互作。
  2. 无结构先验:可进一步用 AlphaFold3 等接触图替换外积(GNN)。
  3. 环境缺失:pH、离子强度、糖基化等未入模。
  4. 实验闭环:需 SPR / BLI 等实测 (K_{\mathrm{D}}) 验证计算预测。

7. 与 AbAffinity 的边界(站内对照)

DLP-Affinity AbAffinity(站内另文)
骨干 ESM2-3B微调 ESM-2 650M,多冻结
结构归纳 R2R + GSPE 双层 三流(H/L/Ag)+ CDR 池化 + 门控交叉注意力
强调 局部接触图直觉 + 全局随机投影 链感知与轻重融合门
基准焦点 sdAb-DB、AB-Bind SAAINT-DB 等(见 AbAffinity 文)

二者同属「序列亲和力」路线,模块哲学不同,不宜混用仓库权重。


小结

  • DLP-Affinity = 微调 ESM2-3B + R2R(局部) + GSPE(全局) → (\mathrm{p}K_{\mathrm{d}})。
  • 软件发布以 GitHub / Zenodo 的 release 包为主;方法细节以 Bioinformatics 2026 论文为准。
  • 定位:结构稀缺下的可部署单模型序列亲和力预测,尤其照顾 sdAb 与通用 AB-Bind 场景。
-------------本文结束感谢您的阅读-------------