Raygun:模板引导的蛋白微型化、改造与放大

项目 内容
题目 Miniaturizing and modifying natural proteins with Raygun
期刊 Nature(2026-07-29,Open Access,CC BY-NC-ND 4.0
作者 Kapil Devkota、Daichi Shonai(共一);通讯 Scott Soderling、Rohit Singh(Duke University 等)
DOI 10.1038/s41586-026-10842-8
代码 / 数据 GitHub: rohitsinghlab/raygun;训练数据 Zenodo;设计序列 AddGene

总体来说:Duke 团队提出 Raygun——以现有蛋白为模板,把蛋白质语言模型(Protein Language Model,PLM)嵌入压缩成固定维度的概率分布,再用 noise(替换强度)与 target length(indel 目标长度)两个参数一次性生成可变长候选(相较于大部分设计方案以替换稳住,本方法主要是考虑了indel来改变蛋白长度);在荧光蛋白、TurboID 生物素连接酶与 EGF–EGFR 结合三条湿实验链路上,部分候选保留了功能,但极端微型化与超高活性工程化性状仍依赖下游筛选或定向进化。


1. 要解决的问题

天然蛋白进化同时依赖点突变indel,但现有计算设计大多只能在固定长度上做替换,或走 de novo 从头生成——能否在保留模板结构与功能语法的前提下,对天然/工程蛋白做大规模、协同的替换 + indel,且计算上可并行、可筛选?

更具体地说:给定一条模板序列,能否只调两个标量,就系统性地生成 10–25%(有时 >50%)缩短、或适度放大的变体,并在功能位点(活性中心、发色团、结合界面)上仍保持合理保留率?


2. 现阶段的常见方案

de novo 路线(RFdiffusion、Genie 2、ESM-3 等)擅长从约束出发「造新蛋白」,但长度通常在生成时固定,生成后再改长度往往只能做替换,indel 空间难以系统搜索

模板引导的替换设计(逆折叠 ProteinMPNN、PLM 嵌入空间采样、inpainting 类 EvoDiff / DPLM)在同长度变体上已较成熟:对单点或局部替换,PLM 嵌入附近采样即可得到功能保留变体。但一旦需要删结构域、缩环区、适配 AAV 包装上限,或在短肽模板上做适度延伸,嵌入维度随序列长度变化,不同长度蛋白的表示不可直接比较,indel 设计在表示层就卡住。

手工结构生物学路线(如 UltraID 删除 TurboID 的 DNA 结合域)能成功,但依赖领域知识指定删哪里;作者希望用数据驱动方式自动找到可删冗余区。

其实也是目前技术实现路径上的一个技术缺口:缺少一种 length-agnostic(长度无关)的模板表示,使「从同一模板出发、任意目标长度、单次采样」成为可 tractable 的设计操作,而不是迭代贪心删残基或固定长度 inpainting。


3. 作者提出的新思路

核心假设:PLM 逐残基嵌入虽随长度变化,但相邻残基信息高度冗余;把序列切成固定数量 $K$ 个 block 并对每 block 做聚合后,可用多元高斯分布近似该蛋白在嵌入空间的「功能–结构语法」,从而把任意长度蛋白映射到同一固定维空间

设计选择对照直觉:

  • 若假设成立:同一模板在不同 target length 下采样,应仍预测为相似 fold(TM-score 等),且功能位点保留率高于随机 indel 基线。
  • 若假设不成立:缩短/放大后结构指标应随机崩溃,或 indel 会集中破坏活性中心——实验上作者报告功能位点保留比高于整体序列保守比(>1.0)。

Raygun 定位是模板引导设计(template-guided design):从天然流形上的蛋白出发向外探索,与 de novo「从远处收敛到流形」互补;AAV 载荷、融合标签体积、结构域裁剪等场景,属于「长度错了但其余性质已对」的工程痛点。

Raygun 固定维概率编码示意(科普漫画;非原文图)

段末注释TM-score 衡量预测结构与模板结构的全局相似性(0–1,越高越像);后文结构保留讨论默认指 AlphaFold3 / OmegaFold 等预测结构相对模板的 TM-score。


4. 方法与原理

4.1 输入 → 输出

输入 含义
模板氨基酸序列 任意天然或工程蛋白
noise $\sigma$ 缩放高斯协方差,控制替换/序列多样性
target length $L_{\mathrm{out}}$ 目标序列长度,驱动 indel
输出 含义
一条长度 $L_{\mathrm{out}}$ 的候选序列 经 ESM-2 解码器从重建嵌入反推

单次生成在 NVIDIA A100 上约 0.3 s;作者称相对 diffusion de novo 路线约 100× 更快(同文比较口径,非独立基准)。

4.2 固定维概率编码

  1. ESM-2 650M 得长度 $n$ 的嵌入矩阵(每残基 1280 维)。
  2. 划分为 $K=50$ 个等长 block(block 内残基数随 $n$ 缩放,如 500 aa 模板约 10 aa/block)。
  3. 对每个 block 的嵌入向量取平均;由中心极限定理,block 统计量近似多元高斯。
  4. 50 个 block × 1280 维 → 固定 64,000 维表示,与原始 $n$ 无关。
  5. 推理时从该分布采样(noise 控制协方差),再解码到指定 $L_{\mathrm{out}}$。

diffusion(EvoDiff、DPLM 等)的差异:Raygun 走单步采样 + 解码器一步去噪,非迭代 denoising;trade-off 是探索方式不同,同长度 benchmark 上作者报告结构/功能保留与 inpainting 方法相当(见 Extended Data Fig. 5f、9b)。

4.3 Raygun 架构(auto-encoder)

  • Encoder:ESM-2 嵌入 → 多级 T-Block(Transformer + 1D 卷积,抓全局与局部)→ Reduction(block 内平均,产出固定长表示)。
  • Decoder:固定长 latent → Repetition(按 $L_{\mathrm{out}}$ 展开为变长嵌入)→ T-Block → 重建嵌入 → 预训练 ESM-2 序列解码器(验证准确率 >99%)。
  • 参数量约 701M;在 UniRef50 ~80k 蛋白上自监督训练(作者亦展示更大数据/更大模型可继续提升)。

训练目标(三轴一致)

  1. 嵌入空间重建损失;
  2. 序列空间交叉熵(经 ESM-2 解码);
  3. size-invariance loss:固定长表示 → 解码更短序列 → 再编码 → 惩罚 latent 漂移(保证跨长度生成稳定)。

推理技巧

  • 一步 recycling:将生成候选再作模板过一遍,提升质量/多样性;
  • decoder 微调:encoder 管多样性、decoder 管保真;对目标家族只微调 decoder 可达 BLOSUM >0.99,且多样性下降有限;
  • 下游过滤:伪对数似然 pLL(PLM 适应度代理)+ 长度校正 pLL(跨长度公平排序);常配合 HMMER/Pfam、TemStaPro、任务专用 predictor(如 GFP 亮度模型)。

原文 Fig.1 为官方总览(Nature 原文 Fig.1);本文为 CC BY-NC-ND,此处不转载原图,以上文字对应原文 Fig.1a–h 流程。


5. 主要结果

5.1 计算内:结构与功能语法保留

血红蛋白(147 aa)CCR1(355)lacZ(1024)mTOR(2549)(跨度约 17×)各生成 2000 候选,保留 length-adjusted pLL 前 5%:

  • ±10% 长度变化内,中位 TM-score ≈ 0.78
  • mTOR 缩短 >500 aa(>20%)时 TM-score 仍约 0.7
  • 更激进设置下可减半或加倍长度、或 >50% 残基替换,结构仍「 broadly 保留」(作者表述,需结合具体蛋白看)。
  • indel 位置:不完全堆在单环区;小幅缩短时略偏 loop,大幅缩短时偏好减弱;α/β 删除比例大致均衡。
  • 功能位点:有注释的活性/结合位点,其保留率相对全序列保守率之比 >1.0(5%/10%/25% 删除率均如此),提示 implicit 偏好 functional site。
  • Pfam 结构域:50–200% 家族长度范围内,50.65% 候选保留结构域;优于匹配 indel/替换率的随机序列基线约 15%
  • EvoDiff / DPLM 同长度对比(60 个酶,匹配序列同一性分布):结构保留与 CLEAN EC 预测功能保留相当;Raygun 额外支持 indel。

5.2 湿实验一:微型化荧光蛋白(eGFP / mCherry)

设置:各 70,000 候选,目标长度 195–235 aa;过滤 = pLL(去掉 90%)+ hmmscan(Pfam)+ 自定义亮度 predictor → 8 条实验验证。

指标 结果(相对模板/数据库)
缩短幅度 eGFP 最多 −25 aa(10.5%) → 199 aa;mCherry −37 aa(15.6%) → 206 aa
与 FPbase 比 2 条短于 96% 已知荧光蛋白
细胞荧光 6/8 有明显荧光(XFP01/02/04/05/06/08);XFP03/07 阴性
发色团约束 硬性指定 XYG motif 或 Hayes et al. ESM-3 GFP 设计中的 6 残基/58–71 约束;多数仍自发保留发色团;1 条含非经典发色团

对照含义:相对 Hayes et al. Science 2025 ESM-3 de novo GFP(固定 229 aa + 强约束),Raygun 走「更短 + 更弱约束」路线,亮度普遍偏低——与荧光蛋白 narrow fitness landscape(Sarkisyan Nature 2016)一致,作者亦预期需定向进化提亮。

5.3 湿实验二:微型化 TurboID

设置:500,000 候选;moderate 195–235 aa + extreme 150–180 aa;过滤含 TemStaPro、pLDDT、TM-score 等 → 11 条验证。

候选 要点
TurboID-1(317 aa,−1%) 有显著生物素连接活性
TurboID-5(304 aa,−6%) 有显著生物素连接活性
TurboID-11(165 aa,约 −50%) 自发删除 DNA 结合域(与手工 UltraID 策略一致);可表达但连接活性不显著
表达 6/11 有 HA western 信号

解读:对多结构域、经定向进化强化过的 supra-evolutionary 活性(TurboID 相对 BirA),PLM 统计 alone 不足以保证极端缩短后仍高活性;moderate 缩短更可靠。

5.4 湿实验三:放大 EGF 提升 EGFR 结合(Adaptyv 竞赛)

设置:模板 EGF 53 aa(接近 Raygun 最短阈值 ~50 aa),放大至 55–57 aa;decoder 在 5 条 EGF-like 序列上微调;10,000 候选;用 ProTrek 三模态 PLM 按序列预测 EGFR 结合潜力排序(非 iPTM/iPAE 结构界面指标)。

变体 $K_{\mathrm{d}}$(µM) 相对 WT EGF(0.759 µM)
EGF-Raygun-1 0.274 更强
EGF-Raygun-2 0.561 更强
WT EGF 0.759

10 条提交中 4 条进入生物测试,2 条结合更强;作者称在同竞赛 EGF 路线中 $K_{\mathrm{d}}$ 最优。序列同一性更低者(Raygun-1 70.7%)反而更好,改动多在外围位点,提示全局上下文影响结合,非仅界面残基。

段末注释$K_{\mathrm{d}}$(dissociation constant,解离常数)越小表示结合越强;EGFR(epidermal growth factor receptor,表皮生长因子受体)为 EGF 靶标。


6. 局限、假设与审慎读法

  1. 训练规模:主文模型仅 ~80k UniRef50;超长蛋白(如 mTOR 2549 aa)零样本重建更难,作者建议微调;更大模型/数据改善有 Supplementary 证据,但主结论仍来自中等规模 checkpoint。
  2. 过滤负荷:高 hit rate 依赖 pLL + Pfam + 任务 predictor 等多级筛选;未过滤候选相对 greedy pLL 删残基基线虽更好保留功能位点,但最终实验 hit rate 仍低(荧光 6/8、TurboID 活性 2/11)。不能把「生成器 implicit 保留」等同于「无需实验」。
  3. 指标与真实功能:TM-score、pLDDT、ProTrek 相似度是代理;TurboID-11 说明「结构/interface 预测过关 ≠ 催化效率保留」,尤其对工程化超高活性酶。
  4. 极端缩小:自发删结构域在 TurboID 上与 UltraID 一致,但 50% 缩短丢活性——Raygun 找得到「像那么回事的序列」,不保证「好用」。
  5. 荧光亮度:成功变体多「有荧光但更暗」;与 de novo GFP 类似,需进化/筛选补亮度。
  6. 生物安全:作者签署 Responsible AI for Biodesign 原则;免疫原性、脱靶等治疗场景风险文中仅原则性讨论,做系统性安全实验。
  7. 许可:代码与数据已开放;文章 CC BY-NC-ND,二次改编图/衍生序列用于商业需另查 AddGene 与许可条款。

7. 其他可对比参考的方法

方案 时间 核心差异 证据类型 何时更值得考虑
EvoDiff / DPLM 等离散 diffusion inpainting 2023–2024 同长度、迭代去噪;mask 指定编辑区 同长度酶功能 benchmark 只需局部替换、不改长度
ProteinMPNN + 结构约束 2022+ 结构条件逆折叠,无 indel 大量结构/design 案例 骨架固定、优化序列/稳定性
Greedy pLL / ESM 删残基 通用 逐位删低 pLL 残基;无全局 indel 协调 文内 eGFP/mCherry/RAS 对照,功能位点保留更差 快速粗缩短、可接受大幅失活
手工结构域删除(UltraID) 2022 领域知识指定删 DNA-binding domain TurboID 172 aa 高活性 已知冗余结构域、要可解释编辑
ESM-3 de novo GFP(Hayes Science 2025) 2025 从头/强约束发色团,非缩短 488 条 de novo 荧光序列 要探索远源序列而非缩模板
RFdiffusion / Genie 2 等 de novo 2023–2024 新骨架/新 fold;长度固定 binder/酶 de novo 无合适模板、需全新几何

Raygun 的差异化在于 indel + 替换同一框架、单次采样、模板保真;若任务仅是 同长度点突变已知删哪一段结构域,上表路线可能更简单、实验 hit rate 更可预期。


8. 对从业者的可操作含义

  1. AAV/融合标签体积:值得用 Raygun 批量生成「略短于包装上限」的载体蛋白/报告基因变体,再用任务 filter + 少量湿实验验证;优先 moderate(10–20%)缩短。
  2. 先跑官方 checkpoint + pLL 排序:GitHub 提供 notebook;注意使用 length-adjusted pLL 跨长度比较。
  3. 酶/探针已是 directed evolution 产物:TurboID 案例表明 >30–50% 缩短需准备进化回路;Raygun 输出适合作 起始库,不是终产物。
  4. 短肽放大(EGF 类):可对极短模板做 magnification + 家族微调 decoder + ProTrek/结合 assay;外围位点可能带来 affinity 增益,需实验确认特异性。
  5. 与 de novo 联用:de novo 得到正确功能但长度超标时,用 Raygun 作 post-hoc 缩短,比重新 diffusion 更省算力(作者 Discussion 主张,需自行验证具体蛋白)。

9. 小结

  • 问题:固定长度 PLM 设计难以系统做 indel,模板引导的大规模「换 + 删 + 加」缺乏统一表示。
  • 思路:$K=50$ block 高斯压缩 → 固定维 latent;noise + target length 两参数控制生成。
  • 最硬证据:EGF-Raygun-1/2 在 Adaptyv 竞赛中 $K_{\mathrm{d}}$ 优于 WT;荧光蛋白 6/8 有活性且 2 条短于 FPbase 96% 条目。
  • 最要紧边界极端微型化supra-evolutionary 酶活性 不能单靠 Raygun + PLM filter;TurboID-11 可表达但无活性即是反例。
  • 发表后对照:48 小时内无新主线;同长度 diffusion/inpainting 与 de novo 仍是互补而非替代。

10. 参考文献与延伸

-------------本文结束感谢您的阅读-------------