miRNA-14.生物表征多组学分析平台分阶段开发计划

本文面向生物药研发团队中的质量分析团队(生物表征方向),结合天士力(Tasly)及行业常见研发组织形态,为全新建设的多组学生物信息分析平台编制分阶段规划建设方案。项目无历史系统包袱;分析内容与交付口径以 miRNA-13 §2.7–§5(生物表征中的转录组/蛋白组分层与服务包)为需求基线,本文件将其转化为可排期的模块开发与验收计划

实施顺序:

1
P0 规划建设 → 转录组(T-I → T-II → T-III)→ 蛋白组(P-I → P-II → P-III)→ 多组学整合 → 平台化

先转录组的排期理由:外泌体/CGT 项目 sRNA-seq 周期短、成本低,利于在首批试点中快速标定 QC 规则与元数据规范;蛋白组依赖质谱搜库与实验协作,在转录组 MVP 验收后再启动,可保证两线标准一次对齐。

段末注释IND(investigational new drug,临床试验申请)申报须完成 CMC 质量概要等资料;CGT(cell and gene therapy,细胞与基因治疗)含细胞治疗、基因治疗及外泌体等先进治疗形态。

系列衔接miRNA-13表征需求基线 §3–§5)、miRNA-06miRNA-07miRNA-04(模块人周)。

配图位于 miRNA-14-生物表征多组学分析平台分阶段开发计划/


0. 整体架构路线图

图 1 生物表征多组学分析平台整体架构路线图

图 1 自上而下:P0 规划建设转录组 / 蛋白组双轨(先转录组验收、再蛋白组;无日历时间轴)→ M-I 多组学整合五类表征服务包输出。右侧 L1–L5miRNA-13 §2.7 表征分析层次;L2 未放行不进入 L4

0.1 路线图读法(逻辑流,非时间轴)

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
                    ┌─────────────────────────────────────┐
│ P0 规划建设 │
│ 架构 · 元数据/SOP · HPC · 服务包定义 │
└──────────────────┬──────────────────┘

┌─────────────────────────────┴─────────────────────────────┐
▼ ▼
┌─────────────────────┐ ┌─────────────────────┐
│ 转录组 │ T-I 验收后启动 │ 蛋白组 │
│ T-I L1→L2→L3 │ ───────────────────────────► │ P-I L1→L2→L3 │
│ T-II L4 │ │ P-II L4 │
│ T-III L5/mRNA │ │ P-III PTM/网络 │
└──────────┬──────────┘ └──────────┬──────────┘
│ │
└──────────────────────┬───────────────────────────────┘

┌─────────────────────────────┐
│ M-I 多组学整合(L5) │
│ 联合判读 · 关联 · 表征指纹 │
└──────────────┬──────────────┘

┌─────────────────────────────┐
│ M-II 平台化 → IND 数据包 │
└──────────────┬──────────────┘

表征QC包 → 深度包 → 工艺可比包 → 多组学整合包 → IND数据包
路线图区块 对应章节 核心产出
P0 §3 标准、HPC、服务包定义、标定样计划
转录组 T-I–III §4 L1–L5 转录组模块;表征 QC / 工艺可比包(RNA 侧)
蛋白组 P-I–III §5 L1–L5 蛋白组模块;QC / 深度 / 可比包(蛋白侧)
M-I §6.1 多组学整合包、联合判读引擎
M-II + 服务包 §6.2 Web 门户、IND 表征数据包

1. 组织背景与平台定位

1.1 部门分工(摘要)

部门 与生物表征平台关系
上游发酵 供体状态 → EV cargo 谱、HCP 背景
下游纯化 杂质谱 → 蛋白组污染 QC
下游制剂 稳定性样品 → 批间一致性
质量分析·生物表征 平台直接服务对象(结构、组成、批间一致)
质量分析·分子功能 活性/效价;共享样本 ID,数据只读对接

1.2 生物表征 vs 分子功能

维度 生物表征(本平台) 分子功能
组学侧重 miRNA/mRNA cargo、蛋白组成、PTM 细胞/生化活性、效价
平台交付 QC 报告、组成矩阵、批间可比性 效价曲线(接口对接)

详见 miRNA-13 §1–§2;组学分析分层见 miRNA-13 §2.7

1.3 岗位职责映射

岗位职责 转录组阶段 蛋白组阶段 整合/平台化
① 多组学平台搭建与解读 T-I–T-III P-I–P-III 多组学关联
② CGT/外泌体/抗体表征体系 EV miRNA QC EV 标志蛋白 + PTM 联合判读
③ 深度挖掘与关联分析 T7–T8 P7–P8 T12/P11
④ 算法、数据库、HPC P0 规划建设 搜库算力扩容 指纹模型、门户

2. 总体规划:先转录组、后蛋白组

2.1 阶段总览

大阶段 子阶段 周期(建议) 主题 里程碑
P0 0–3 月 规划建设 架构蓝图 + 元数据/SOP 定稿 + HPC 投产 + 转录组首条流水线
转录组 T-I 3–9 月 L1–L3 QC 闭环 表征 QC 包(转录组侧)
T-II 9–12 月 L4 组间比较 工艺可比包 + 签名库
T-III 12–15 月 L5 接口 / mRNA 多组学 schema、核酸载荷扩展
蛋白组 P-I 9–15 月 L1–L3 QC 闭环 表征 QC 包(蛋白组侧)
P-II 15–18 月 L4 差异与批间 工艺可比包
P-III 18–21 月 L4 PTM / 网络 表征深度包(抗体线)
整合 M-I 18–24 月 L5 多组学 多组学整合包
平台化 M-II 24–30 月 服务产品化 IND 表征数据包
1
2
3
4
月   0    3    6    9   12   15   18   21   24   30
│P0 │──── T-I ────│T-II│T-III│
│规划 │ │──── P-I ────│P-II│P-III│
│ │ │ │──── M-I ────│── M-II ──│

说明:蛋白组 P-I 在转录组 T-I 验收(约第 9 月)后全面启动;第 9–15 月转录组走 T-II、蛋白组走 P-I,日历并行、逻辑先后

2.2 表征分析五层模型(与 miRNA-13 对齐)

平台建设的需求分层采用 miRNA-13 §2.7L1–L5 模型(较旧 L1–L4 平台架构扩展一层「组间比较」):

层次 名称 转录组关注点 蛋白组关注点 平台开发阶段
L1 数据质控 读段质量、深度、读长分布 鉴定数、FDR、搜库分数 T-I / P-I
L2 身份/纯度 QC miRNA%、污染 RNA、溶血签名 标志蛋白、五组分、血浆/胞内污染 T-I / P-I
L3 组成与批间 表达矩阵、签名、重复性 定量矩阵、归一化、PCA T-IT-II / P-IP-II
L4 组间比较 差异 miRNA、批间漂移 差异蛋白、工艺可比、PTM 趋势 T-II / P-IIP-III
L5 多组学整合 miRNA–靶–蛋白关联 与转录组联合判读 T-III schema + M-I

开发原则

  • L2 未放行,不进入 L4(差异/工艺比较);
  • L5 依赖两线 L2 口径统一
  • 分子功能(效价、细胞活性)不纳入本平台模块,仅预留数据接口。

2.3 表征服务包 × 开发阶段映射

miRNA-13 §5.3 定义对外/对内的表征服务包;本平台按包能力分期交付:

服务包 转录组能力 蛋白组能力 平台就绪阶段
表征 QC 包 L1–L3 + miRNA-13 §3.5 交付物 L1–L3 + §4.5 交付物 T-I + P-I 验收后
表征深度包 + 签名库 T11、批间 PCA + 批间基线、PTM(抗体线) T-II + P-II/P-III
工艺可比包 + 差异 miRNA、富集 T7–T8 + 差异蛋白 P7–P8、X2 T-II + P-II
多组学整合包 T12 联合报告 P11 + 判读引擎 M-I
IND 数据包 章节自动填充 章节自动填充 M-II

2.4 平台模块与表征层次对照(总表)

表征层 转录组模块 蛋白组模块 首交付阶段
L1 T1, T2 P1, P2 T-I / P-I
L2 T3, T4, T5 P3, P5 T-I / P-I
L3 T6, T10 P4, P6, P10, P12 T-I / P-I
L4 T7, T8, T11 P7, P8, X1, X2 T-II / P-II–III
L5 T9, T12 P9, P11 T-III / M-I

2.5 研发场景 × 阶段优先级(建设排期依据)

场景(miRNA-13) 首期必达(≤12 月) 二期扩展(12–21 月)
EV/CGT 制备 QC 表征 QC 包(双组学 L1–L3) 多组学整合包
IND 表征包 转录组 QC 包 + 蛋白 QC 包 + 联合判读试运行 IND 数据包模板
工艺变更可比性 工艺可比包(T-II + P-II)
抗体 CMC 表征 X1 PTM + 深度包蛋白侧
mRNA-LNP / 核酸载荷 T9 mRNA 模块

3. P0 规划建设期(0–3 月)

P0 不是「修补既有系统」,而是从零立项的总体规划与首期建设:在写第一行业务分析代码之前,把架构、标准、算力与合规口径一次定清楚。

3.1 规划建设目标

# 建设目标 产出形态
1 平台架构蓝图 四层模型(L1–L4)、转录组/蛋白组边界、与分子功能团队接口
2 数据与元数据标准 样本表字段、对照类型、SOP 版本绑定规则(对齐 miRNA-05 §3.1
3 QC 与报告规范 转录组/蛋白组报告模板、合格/边缘/不合格标签;对齐 miRNA-13 §3.5、§4.5 交付物清单
4 参考库与版本制度 人/鼠 miRBase、UniProt、cRAPEV 标志物表;发布与回溯机制
5 算力与流水线底座 HPC 环境、Git 仓库、Conda/Snakemake 骨架、审计日志字段
6 表征服务包定义 表征 QC / 深度 / 工艺可比 / 多组学 / IND 五类包的模块边界与报价要素(miRNA-13 §5.3
7 试点项目路线图 首批 EV/CGT 表征服务项目、标定样设计、T-I 验收指标

3.2 规划建设任务清单

任务包 内容 负责协作
P0-A 需求与架构 业务场景梳理(IND 表征服务)、模块地图(T/P 模块)、技术选型 质量分析负责人、注册事务(RA)
P0-B 标准制定 《元数据规范 v1》《QC 判定原则 v1》《报告模板 v1》;转录组/蛋白组 IND 交付物 checklist 实验 SOP、生物表征 + 分子功能
P0-C 基础设施 服务器采购/上架、存储分区、任务调度、备份策略 IT、生物信息
P0-D 参考数据 参考库下载、容器镜像、流水线空跑(mock 数据) 生物信息
P0-E 试点准备 标定样方案(合格/不合格/边缘各类型)、测序排期 实验、测序平台

3.3 资源与预期收益

资源 配置
人力 生物信息 1 FTE(主责)+ 质量分析实验 0.1 FTE + IT 0.1 FTE
算力 64–128 核512 GB–1 TB 内存、20 TB 起存储(按立项预算采购)
软件 Snakemake/NextflowGitConda;以开源栈为主
预估工期 8–12 人周(含评审与文档)
收益 说明
标准先行 T-I/P-I 开发不因字段争议反复变更
合规就绪 自首日即具备版本号、审计字段,满足药企数据完整性要求
排期可控 转录组 3 月内可进入开发,无「边做边补规范」风险

3.4 P0 交付物与验收

  • 《生物表征多组学分析平台架构说明书 v1》
  • 《样本与实验元数据规范 v1》
  • 《表征服务包定义 v1》(五类包与 L1–L5 对应表,见 §2.3)
  • 《转录组 IND 表征交付物 checklist》(miRNA-13 §3.5
  • 《蛋白组 IND 表征交付物 checklist》(miRNA-13 §4.5
  • 参考库目录与版本登记册
  • HPC 环境验收报告(算力、存储、权限、备份)
  • 转录组流水线骨架:预处理 → miRBase 计数(mock 跑通)
  • 《首批试点项目与标定样计划》

P0 门禁:上述文档评审通过 + HPC 可用 + mock 流水线成功,方可启动 T-I


4. 转录组子平台:分阶段与分析内容

转录组专文:miRNA-06;表征分层需求:miRNA-13 §3;QC 指标:miRNA-03

4.0 转录组分析内容总览

本阶段覆盖表征层次:T-I → L1–L3;T-II → L4;T-III → L5 接口 + 可选 mRNA 路线。

模块 名称 表征层 优先级 阶段
T1 数据接入与元数据 L1 P0 T-I
T2 FASTQ 预处理与读段 QC L1 P0 T-I
T3 比对与 miRNA 定量 L2 P0 T-I
T4 污染 RNA 组成 L2 P0 T-I
T5 签名与参考谱 QC L2–L3 P0 T-I
T6 归一化、批次、重复性 L3 P0 T-I
T10 自动化 QC 报告 L3 P0 T-I
T7 差异 miRNA L4 P1 T-II
T8 靶基因与通路富集 L4 P1 T-II
T11 参考签名库 L3–L4 P1 T-II
T9 mRNA/lncRNA 片段 L4(扩展路线) P2 T-III
T12 蛋白组关联接口 L5 P1 T-III / M-I

4.1 阶段 T-I:转录组 QC 闭环(3–9 月)

4.1.1 阶段建设目标

# 建设目标 IND/表征价值
1 交付 表征 QC 包转录组侧(L1–L3 对齐 miRNA-13 §3.5 全部必选项
2 内置溶血、裂解、FBS 污染识别规则 液体活检/培养上清数据从首日即标准化
3 统一 HTML/PDF QC 报告与放行标签 申报附件格式一次定型
4 上机后 24 h 内完成判定与预警 为后续蛋白组/功能实验提供分流依据

4.1.2 本阶段展开的分析内容

T1 数据接入与元数据校验
项目 内容
分析步骤 样本表校验 → FASTQ MD5 → 物种/文库类型/对照标签匹配
输入 FASTQ、样本表(分离方法、物种、PBS/EV-depleted 对照)
输出 校验报告;失败阻断下游
工具 自研校验脚本 + MultiQC 入口
难点 sRNA-seqmRNA-seq 误投递
开发 1–1.5 人周
T2 FASTQ 预处理与读段层 QC
项目 内容
分析步骤 接头修剪 → 长度过滤(15–35 nt)→ 质量过滤 → 读长分布统计
核心指标 总读段、修剪后读段、21–23 nt 主峰、接头%、低质量%
输出 MultiQC 节、读长分布图
工具 fastpcutadaptFastQC
判读 主峰缺失 → 生物学 QC 降级(见 miRNA-03 §2.1
开发 1.5–2 人周
T3 比对注释与 miRNA 定量
项目 内容
分析步骤 bowtie/STAR 比对 miRBase → 成熟体计数 →(可选)isomiR 附录
核心指标 miRNA mapping rate、检出 miRNA 数、Top20 列表
输出 样品 × miRNA 原始计数矩阵
工具 miRDeep2 流程或自研计数
难点 近源家族歧义;默认成熟体合并口径
开发 2–3 人周
T4 污染 RNA 组成分析
项目 内容
分析步骤 分层比对:miRBase + rRNA + GtRNAdb + 宿主基因组
核心指标 miRNA%、rRNA%、tRNA/tRF%、mRNA 片段%、未比对%
输出 组成饼图/条形图;污染超标 flag
表征解读 rRNA/mRNA ↑ → 裂解;tRF ↑ → 应激/凋亡
开发 2 人周
T5 签名与参考谱 QC
项目 内容
分析步骤 Top N 谱图 → 与参考批 Pearson/SpearmanPCA → 溶血/血小板监控
核心指标 miR-451a(溶血)、miR-223-3p(血小板)、与合格批相关 (r)
输出 签名相似度得分;偏离参考簇警告
难点 阈值须本实验室校准,非全球统一
开发 2–3 人周
T6 归一化、批次与重复性
项目 内容
分析步骤 RPM/CPM(QC 用)→ 技术重复相关 → 批次 PCA 监控
核心指标 重复样品 (r)、批次离群
注意 ComBat 不用于 QC 合格判定
开发 1.5–2 人周
T10 自动化 QC 报告与合格判定
项目 内容
分析步骤 汇总 T2–T6 → 规则引擎 → HTML/PDF
必含字段 对齐 miRNA-03 §7 七项
输出标签 合格 / 边缘 / 不合格;边缘触发人工复核
开发 2–3 人周

4.1.3 T-I 资源与收益

资源 配置
人力 生物信息 1 FTE + 测序实验接口 0.15 FTE
数据 首批标定样 ≥9 例(合格/边缘/不合格各类型,见 P0-E 试点计划)
累计开发 12–16 人周(模块 T1–T6 + T10)
收益项 目标能力
单样 QC 周转 1–2 工作日(自动化流水线)
不合格预警 上机后 24 h
服务能力 同期支撑 EV/CGT 转录组 QC 项目 4–6 个
IND 结构化 RNA cargo QC 表可直接嵌入 CMC 附件

4.1.4 T-I 验收标准

  • 100% 试点项目经 T1 接入
  • QC 报告字段与 miRNA-03、P0 模板一致
  • IND 交付物 checklist(§3.5)8 项必选项全部可自动生成
  • 标定样集(≥9 例)判定与专家共识一致率 ≥85%
  • 流水线版本号写入报告页眉
  • 表征 QC 包(转录组侧)评审通过,批准启动 P-I

4.2 阶段 T-II:转录组标准分析(9–12 月)

4.2.1 阶段建设目标

# 建设目标
1 交付 工艺可比包转录组侧(L4
2 固化差异 miRNA 靶基因/通路解读(表征延伸,非效价)
3 签名库 v1 支撑 L3 批间基线
4 覆盖 miRNA-13 §3.4「工艺变更可比性」场景

4.2.2 本阶段展开的分析内容

T7 差异 miRNA 分析
项目 内容
前提 T10 合格或经人工确认之边缘样;n≥3 生物学重复
分析步骤 DESeq2/edgeRFDR 校正 → 火山图/热图
输出 差异 miRNA 表(log2FC、padj
难点 外泌体重复数不足;离群样敏感
开发 1.5–2 人周
T8 靶基因预测与通路富集
项目 内容
分析步骤 TargetScan/miRTarBase 靶基因 → clusterProfiler GO/KEGG
输出 靶基因列表、富集条形图、通路网络(可选)
表征用途 支撑 cargo 生物学解读(非药效)
开发 2 人周
T11 参考签名库 v1
项目 内容
分析步骤 入库合格批 RPM 矩阵 + 元数据(细胞系 × 分离方法 × 试剂批)
功能 新项目自动相似度检索;版本化发布
输出 签名库 API/文件库;相似度报告
开发 2–3 人周(简单文件库 1 人周

4.2.3 T-II 资源与收益

资源 累计 +4–6 人周
收益 课题级差异分析标准化;工艺批间 miRNA 漂移可追溯;支撑对外「深度表征」报价项

4.3 阶段 T-III:转录组扩展(12–15 月)

4.3.1 阶段建设目标

# 建设目标
1 扩展 mRNA/lncRNA cargo 分析能力(按管线需求选配)
2 定稿多组学样品 ID 与联合报告 schema,供蛋白组接入
3 预留抗体/LNP 核酸载荷监测子流程

4.3.2 本阶段展开的分析内容

T9 mRNA / lncRNA 片段分析(可选)
项目 内容
分析步骤 STAR + featureCounts/Salmon;短片段参数
核心指标 基因检出数、片段长度分布、与胞内 RNA-seq 对照
注意 sRNA-seq 双流程维护;建议独立子流水线
开发 3–4 人周
T12 蛋白组关联接口(schema 阶段)
项目 内容
交付 样品配对表结构、联合报告章节模板、不一致判定枚举值
完整落地 见 §6 阶段 M-I
开发 1 人周(schema);与 P11 合计 2–3 人周

4.3.3 T-III 资源与收益

资源 +4–5 人周(含 T9 则 +7–8
收益 覆盖 mRNA cargo 表征;蛋白组按已定 schema 接入,标准一次对齐

4.4 转录组开发周期汇总

子阶段 模块 人周 日历
T-I MVP T1–T6, T10 12–16 3–9 月
T-II 标准 + T7, T8, T11 +4–6 9–12 月
T-III 扩展 + T9, T12 schema +4–8 12–15 月
转录组合计 20–30 15 月

5. 蛋白组子平台:分阶段与分析内容

蛋白组专文:miRNA-07;表征分层需求:miRNA-13 §4;入门:miRNA-08

启动条件:转录组 T-I 验收(表征 QC 包转录组侧就绪);接入 P0 元数据规范与样本 ID 体系。

5.0 蛋白组分析内容总览

本阶段覆盖表征层次:P-I → L1–L3;P-II → L4 差异与批间;P-III → L4 PTM + 网络;M-I → L5

模块 名称 表征层 优先级 阶段
P1 搜库结果接入 L1 P0 P-I
P2 蛋白鉴定 QC L1 P0 P-I
P3 EV 标志蛋白面板(五组分) L2 P0 P-I
P4 无标记定量矩阵 L3 P0 P-I
P5 污染/高丰度蛋白过滤 L2–L3 P0 P-I
P6 缺失值、归一化、批次 L3 P0 P-I
P10 自动化 QC 报告 L3 P0 P-I
P12 NTA/Western 联动 L3(物理互证) P0 P-I
P7 差异蛋白 L4 P1 P-II
P8 功能富集 L4 P1 P-II
X2 批间一致性评价 L4 P1 P-II
X1 PTM 分析(抗体/蛋白) L4 P1 P-III
P9 蛋白互作网络 L4 P2 P-III
P11 转录组/miRNA 关联 L5 P1 M-I

5.1 阶段 P-I:蛋白组 QC 闭环(9–15 月)

5.1.1 阶段建设目标

# 建设目标 IND/表征价值
1 交付 表征 QC 包蛋白组侧(L1–L3 + 五组分) 对齐 miRNA-13 §4.5
2 组学输出对齐 MISEV 五组分蛋白框架 身份/纯度/来源结构化呈现
3 量化血浆 EV 脂蛋白/白蛋白污染 液体活检样品规则内置
4 与转录组 T10 联合判读,统一放行逻辑 多组学三角验证自建设期即贯通

5.1.2 本阶段展开的分析内容

P1 质谱数据 / 搜库结果接入
项目 内容
分析步骤 解析 MaxQuant proteinGroups.txt / FragPipe 输出 → 统一「蛋白 × 样品 × 强度」层
输入 搜库结果 + 运行-样品映射表 + 搜库参数 JSON
输出 标准化蛋白表;引擎元数据存档
注意 搜库在 HPC/实验端完成;DDA/DIA 分支登记
开发 2–2.5 人周
P2 蛋白鉴定 QC
项目 内容
核心指标 蛋白/肽段鉴定数、覆盖度、FDR ≤ 1%、分数分布
判读 与首批标定样/参考标准样比较;随签名库积累迭代基线
难点 EV 总蛋白低 → 鉴定数天然少于全细胞
开发 1.5 人周
P3 EV 标志蛋白面板(五组分框架)
项目 内容
分析步骤 检测 CD63/CD9/CD81/TSG101/Alix/HSP70 → 四跨膜共现评分
五组分覆盖 存在 / 纯度 / 来源 / 共分离 / NVEPmiRNA-13 §4.3 第二层)
对齐 miRNA-12 §6
输出 标志物雷达图、五组分评分表、阳性/阴性对照差值
开发 2–2.5 人周(较初版 +0.5,含五组分报表)
P4 无标记定量与蛋白矩阵
项目 内容
分析步骤 提取 LFQ/DIA 强度 → 构建定量矩阵
核心指标 缺失率、动态范围、检出蛋白数
注意 iBAQ 仅作组成参考
开发 2–3 人周
P5 污染蛋白 / 高丰度蛋白过滤
项目 内容
分析步骤 CRAP + 血浆高丰度库 + EV-TRACKEV 列表 → 污染占比
核心指标 白蛋白、载脂蛋白、核蛋白、角蛋白肽段占比
策略 过滤前后双矩阵;差异分析默认用过滤后并记录规则
开发 1.5 人周
P6 缺失值、归一化与批次
项目 内容
分析步骤 检出率过滤 → median/VSN 归一化 →(可选)ComBat
推荐统计 差异场景优先 MSstats/MSqRob2
难点 MNAR 为主,插补易假阳性
开发 2–2.5 人周
P10 自动化 QC 报告
项目 内容
必含字段 鉴定摘要、标志物面板、污染评估、PCA、合格标签
样式 与转录组 T10 统一;预留联合判读占位符
开发 2 人周
P12 物理指标联动
项目 内容
分析步骤 读入 NTA 粒径/浓度、Western 半定量 → 报告「组学–物理」段
逻辑 物理合格不能替代蛋白/miRNA QC
开发 1–1.5 人周

5.1.3 P-I 资源与收益

资源 配置
人力 生物信息 1 FTE + 质谱实验接口 0.25 FTE
算力 搜库节点扩容(+32 核 或外包搜库)
数据 首批配对 EV 蛋白组(与 T-I 标定样同批或同步设计)
累计开发 14–18 人周
收益项 目标能力
蛋白 QC 周转 2–3 工作日(自动化流水线)
MISEV 蛋白条目 报告逐条对应检查项
三角验证 与 T10 同一样品 ID 并读、联合标签

5.1.4 P-I 验收标准

  • MaxQuant(或 FragPipe)一种引擎 ingest 稳定
  • 五组分 + 污染 + 鉴定 QC 全进 P10
  • IND 交付物 checklist(§4.5)必选项全部可自动生成
  • 与 T10 同批样品联合判读试运行 ≥5 例
  • 表征 QC 包(蛋白组侧)评审通过;双组学 QC 包(T-I + P-I)可对外报价

5.2 阶段 P-II:蛋白组标准分析(15–18 月)

5.2.1 阶段建设目标

# 建设目标
1 交付 工艺可比包蛋白组侧(L4:P7、P8、X2)
2 支撑 miRNA-13 §4.4「工艺变更可比性」场景
3 CQA 候选蛋白清单数据化

5.2.2 本阶段展开的分析内容

P7 差异蛋白分析
项目 内容
分析步骤 MSstats/limmaFDR → 火山图/热图
前提 P10 放行;与 P5 过滤策略一致
开发 1.5–2 人周
P8 功能富集与通路
项目 内容
分析步骤 clusterProfiler GO/KEGG/Reactome;关注 ESCRT/膜运输
开发 1.5 人周
X2 批间一致性评价
项目 内容
分析步骤 批次间 PCA、蛋白谱 Pearson 相关、Hotelling (T^2)(可选)
输入 工艺变更前后多批 P4 矩阵
输出 可比性报告;离群蛋白列表
协作 下游纯化工艺变更通知
开发 2–3 人周

5.2.3 P-II 资源与收益

资源 +5–7 人周
收益 工艺变更可比性报告 ≤5 工作日CQA 蛋白清单数据化

5.3 阶段 P-III:蛋白组扩展(18–21 月)

5.3.1 阶段建设目标

# 建设目标
1 交付 表征深度包蛋白侧:L4 PTM(X1)
2 覆盖 miRNA-13 §4.4「抗体 CMC 表征」「稳定性研究」
3 物理–组学–转录组三源看板(P12 深化)

5.3.2 本阶段展开的分析内容

X1 PTM 分析(抗体/重组蛋白)
项目 内容
分析步骤 糖肽/氧化/脱酰胺搜库 → 修饰位点定量 → 批间修饰率趋势
工具 MaxQuant PTM、糖分析插件
表征用途 IND 结构表征章节;属生物表征核心(非效价)
开发 4–6 人周(依赖质谱专家)
P9 蛋白互作网络(可选)
项目 内容
工具 STRING/Cytoscape
开发 1–1.5 人周

5.3.3 P-III 资源与收益

资源 +5–8 人周;质谱专家 0.3 FTE
收益 抗体/蛋白 IND 表征与 EV 双产品线;PTM 作为规格趋势监测

5.4 蛋白组开发周期汇总

子阶段 模块 人周 日历
P-I MVP P1–P6, P10, P12 15–19 9–15 月
P-II 标准 + P7, P8, X2 +5–7 15–18 月
P-III 扩展 + X1, P9 +5–8 18–21 月
蛋白组合计 25–34 12 月(第 9–21 月)

6. 多组学整合与平台化(18–30 月)

6.1 阶段 M-I:多组学整合(18–24 月)

阶段建设目标

# 建设目标
1 交付 多组学整合包L5
2 落地 miRNA-13 §5.2 联合判读速查表为规则引擎
3 表征指纹模型支撑批间异常调查

展开分析内容

模块 分析内容 开发
T12 + P11 样品配对;miRNA-靶-蛋白三角;联合 QC 规则(见下表) 2–3 人周
联合判读引擎 合格/边缘/不一致/单组学通过 2 人周
表征指纹模型 多组学特征向量 + 异常检测(PCA/Isolation Forest 4–6 人周
关联统计 WGCNA/mixOmics 封装报告 3–4 人周

联合 QC 规则(内置,来源 miRNA-13 §5.2

转录组 蛋白组 判定
miRNA% 高、签名一致 标志蛋白阳性、污染低 合格
miRNA 弱、颗粒有 标志蛋白有 边缘(疑空囊泡)
rRNA/tRNA 胞内/血浆污染高 不合格
miR-451 溶血标注

M-I 资源与收益

资源 生物信息 1 FTE + 算法 0.5 FTE+12–18 人周
收益 联合报告标准化;支撑岗位职责 §3 深度挖掘;为偏差调查提供跨组学证据链

6.2 阶段 M-II:平台化与 IND 交付(24–30 月)

建设目标 交付 资源
IND 表征数据包自动组装 CMC 3.2 章节模板;嵌入 §3.5/§4.5 checklist +20–30 人周
Web 化自助投递 门户、任务队列、服务包下单(QC/深度/可比) 前端 0.5–1 FTE
审计与 CSV 流水线版本、操作日志、计算机化系统验证范围 QA 0.2 FTE

M-II 验收:任选 1 个试点 IND 项目,表征 QC 包 + 可选工艺可比包数据包一键导出通过 RA 预审。


7. 跨阶段资源总表

资源 P0 T-I–III P-I–III M-I–II
生物信息 FTE 1 1 1 0.5–1
质谱/测序协作 0.1 0.15 0.25–0.3 0.2
算法/前端 0.5–1.5
累计人周 8–12 20–30 25–34 32–48
日历 0–3 月 3–15 月 9–21 月 18–30 月

总周期30 个月达成熟态(IND 数据包就绪)。

分期服务能力

时间点 可交付服务包
9 月(T-I) 表征 QC 包·转录组
15 月(P-I) 表征 QC 包·双组学
18 月(T-II + P-II) + 工艺可比包
21 月(P-III) + 表征深度包(抗体 PTM
24 月(M-I) + 多组学整合包
30 月(M-II) + IND 表征数据包

8. KPI 与风险(摘要)

子阶段 结果 KPI
T-I 表征 QC 包(转录组);§3.5 checklist 全自动;24 h 预警
P-I 表征 QC 包(蛋白组);五组分报表;双组学联合试运行 ≥5 例
T-II + P-II 工艺可比包;可比性报告 ≤5 工作日
M-I 多组学整合包;≥1 CQA 假说获实验验证
M-II IND 数据包预审通过;门户服务包下单
风险 对策
P0 标准未定稿即开发 P0 门禁;文档评审通过后方可启动 T-I
蛋白组抢跑导致标准分裂 强制 T-I 验收后启动 P-I
阈值缺乏标定样 P0-E 设计合格/边缘/不合格标定样集
搜库参数口径不一 P1 强制参数 JSON 存档

9. 小结

本平台为全新建设项目,以生物表征为主线,服务天士力生物药研发在 IND 期结构与组成质量评价。五阶段递进逻辑为:

1
2
3
先规划建设(P0)→ 转录组 T-I(QC)→ T-II(差异/签名)→ T-III(mRNA/接口)
→ 蛋白组 P-I(QC)→ P-II(差异/批间)→ P-III(PTM/网络)
→ M-I 多组学整合 → M-II 平台化/IND
  • 需求基线miRNA-13 L1–L5 表征分层 + 五类服务包。
  • 转录组 12 模块:T-I 交付 L1–L3(表征 QC 包);T-II 交付 L4
  • 蛋白组 14 模块:P-I 交付 L1–L3 + 五组分;P-II–III 交付 L4(含 PTM)。
  • M-I 交付 L5 多组学整合包;M-II 交付 IND 表征数据包。

首发路径P0 + T-I(约 9 月)→ P-I(约 15 月)双组学 表征 QC 包可商用;工艺可比与 IND 包按 §2.5 表递推。


延伸阅读

-------------本文结束感谢您的阅读-------------