本文面向生物药研发团队中的质量分析团队(生物表征方向),结合天士力(Tasly)及行业常见研发组织形态,为全新建设的多组学生物信息分析平台编制分阶段规划建设方案。项目无历史系统包袱;分析内容与交付口径以 miRNA-13 §2.7–§5(生物表征中的转录组/蛋白组分层与服务包)为需求基线,本文件将其转化为可排期的模块开发与验收计划。
实施顺序:
1 | P0 规划建设 → 转录组(T-I → T-II → T-III)→ 蛋白组(P-I → P-II → P-III)→ 多组学整合 → 平台化 |
先转录组的排期理由:外泌体/CGT 项目 sRNA-seq 周期短、成本低,利于在首批试点中快速标定 QC 规则与元数据规范;蛋白组依赖质谱搜库与实验协作,在转录组 MVP 验收后再启动,可保证两线标准一次对齐。
段末注释:IND(investigational new drug,临床试验申请)申报须完成 CMC 质量概要等资料;CGT(cell and gene therapy,细胞与基因治疗)含细胞治疗、基因治疗及外泌体等先进治疗形态。
系列衔接:miRNA-13(表征需求基线 §3–§5)、miRNA-06、miRNA-07、miRNA-04(模块人周)。
配图位于 miRNA-14-生物表征多组学分析平台分阶段开发计划/。
0. 整体架构路线图

图 1 自上而下:P0 规划建设 → 转录组 / 蛋白组双轨(先转录组验收、再蛋白组;无日历时间轴)→ M-I 多组学整合 → 五类表征服务包输出。右侧 L1–L5 为 miRNA-13 §2.7 表征分析层次;L2 未放行不进入 L4。
0.1 路线图读法(逻辑流,非时间轴)
1 | ┌─────────────────────────────────────┐ |
| 路线图区块 | 对应章节 | 核心产出 |
|---|---|---|
| P0 | §3 | 标准、HPC、服务包定义、标定样计划 |
| 转录组 T-I–III | §4 | L1–L5 转录组模块;表征 QC / 工艺可比包(RNA 侧) |
| 蛋白组 P-I–III | §5 | L1–L5 蛋白组模块;QC / 深度 / 可比包(蛋白侧) |
| M-I | §6.1 | 多组学整合包、联合判读引擎 |
| M-II + 服务包 | §6.2 | Web 门户、IND 表征数据包 |
1. 组织背景与平台定位
1.1 部门分工(摘要)
| 部门 | 与生物表征平台关系 |
|---|---|
| 上游发酵 | 供体状态 → EV cargo 谱、HCP 背景 |
| 下游纯化 | 杂质谱 → 蛋白组污染 QC |
| 下游制剂 | 稳定性样品 → 批间一致性 |
| 质量分析·生物表征 | 平台直接服务对象(结构、组成、批间一致) |
| 质量分析·分子功能 | 活性/效价;共享样本 ID,数据只读对接 |
1.2 生物表征 vs 分子功能
| 维度 | 生物表征(本平台) | 分子功能 |
|---|---|---|
| 组学侧重 | miRNA/mRNA cargo、蛋白组成、PTM | 细胞/生化活性、效价 |
| 平台交付 | QC 报告、组成矩阵、批间可比性 | 效价曲线(接口对接) |
详见 miRNA-13 §1–§2;组学分析分层见 miRNA-13 §2.7。
1.3 岗位职责映射
| 岗位职责 | 转录组阶段 | 蛋白组阶段 | 整合/平台化 |
|---|---|---|---|
| ① 多组学平台搭建与解读 | T-I–T-III | P-I–P-III | 多组学关联 |
| ② CGT/外泌体/抗体表征体系 | EV miRNA QC | EV 标志蛋白 + PTM | 联合判读 |
| ③ 深度挖掘与关联分析 | T7–T8 | P7–P8 | T12/P11 |
| ④ 算法、数据库、HPC | P0 规划建设 | 搜库算力扩容 | 指纹模型、门户 |
2. 总体规划:先转录组、后蛋白组
2.1 阶段总览
| 大阶段 | 子阶段 | 周期(建议) | 主题 | 里程碑 |
|---|---|---|---|---|
| P0 | — | 0–3 月 | 规划建设 | 架构蓝图 + 元数据/SOP 定稿 + HPC 投产 + 转录组首条流水线 |
| 转录组 | T-I | 3–9 月 | L1–L3 QC 闭环 | 表征 QC 包(转录组侧) |
| T-II | 9–12 月 | L4 组间比较 | 工艺可比包 + 签名库 | |
| T-III | 12–15 月 | L5 接口 / mRNA | 多组学 schema、核酸载荷扩展 | |
| 蛋白组 | P-I | 9–15 月 | L1–L3 QC 闭环 | 表征 QC 包(蛋白组侧) |
| P-II | 15–18 月 | L4 差异与批间 | 工艺可比包 | |
| P-III | 18–21 月 | L4 PTM / 网络 | 表征深度包(抗体线) | |
| 整合 | M-I | 18–24 月 | L5 多组学 | 多组学整合包 |
| 平台化 | M-II | 24–30 月 | 服务产品化 | IND 表征数据包 |
1 | 月 0 3 6 9 12 15 18 21 24 30 |
说明:蛋白组 P-I 在转录组 T-I 验收(约第 9 月)后全面启动;第 9–15 月转录组走 T-II、蛋白组走 P-I,日历并行、逻辑先后。
2.2 表征分析五层模型(与 miRNA-13 对齐)
平台建设的需求分层采用 miRNA-13 §2.7 的 L1–L5 模型(较旧 L1–L4 平台架构扩展一层「组间比较」):
| 层次 | 名称 | 转录组关注点 | 蛋白组关注点 | 平台开发阶段 |
|---|---|---|---|---|
| L1 | 数据质控 | 读段质量、深度、读长分布 | 鉴定数、FDR、搜库分数 | T-I / P-I |
| L2 | 身份/纯度 QC | miRNA%、污染 RNA、溶血签名 | 标志蛋白、五组分、血浆/胞内污染 | T-I / P-I |
| L3 | 组成与批间 | 表达矩阵、签名、重复性 | 定量矩阵、归一化、PCA | T-I–T-II / P-I–P-II |
| L4 | 组间比较 | 差异 miRNA、批间漂移 | 差异蛋白、工艺可比、PTM 趋势 | T-II / P-II–P-III |
| L5 | 多组学整合 | miRNA–靶–蛋白关联 | 与转录组联合判读 | T-III schema + M-I |
开发原则:
- L2 未放行,不进入 L4(差异/工艺比较);
- L5 依赖两线 L2 口径统一;
- 分子功能(效价、细胞活性)不纳入本平台模块,仅预留数据接口。
2.3 表征服务包 × 开发阶段映射
miRNA-13 §5.3 定义对外/对内的表征服务包;本平台按包能力分期交付:
| 服务包 | 转录组能力 | 蛋白组能力 | 平台就绪阶段 |
|---|---|---|---|
| 表征 QC 包 | L1–L3 + miRNA-13 §3.5 交付物 | L1–L3 + §4.5 交付物 | T-I + P-I 验收后 |
| 表征深度包 | + 签名库 T11、批间 PCA | + 批间基线、PTM(抗体线) | T-II + P-II/P-III |
| 工艺可比包 | + 差异 miRNA、富集 T7–T8 | + 差异蛋白 P7–P8、X2 | T-II + P-II |
| 多组学整合包 | T12 联合报告 | P11 + 判读引擎 | M-I |
| IND 数据包 | 章节自动填充 | 章节自动填充 | M-II |
2.4 平台模块与表征层次对照(总表)
| 表征层 | 转录组模块 | 蛋白组模块 | 首交付阶段 |
|---|---|---|---|
| L1 | T1, T2 | P1, P2 | T-I / P-I |
| L2 | T3, T4, T5 | P3, P5 | T-I / P-I |
| L3 | T6, T10 | P4, P6, P10, P12 | T-I / P-I |
| L4 | T7, T8, T11 | P7, P8, X1, X2 | T-II / P-II–III |
| L5 | T9, T12 | P9, P11 | T-III / M-I |
2.5 研发场景 × 阶段优先级(建设排期依据)
| 场景(miRNA-13) | 首期必达(≤12 月) | 二期扩展(12–21 月) |
|---|---|---|
| EV/CGT 制备 QC | 表征 QC 包(双组学 L1–L3) | 多组学整合包 |
| IND 表征包 | 转录组 QC 包 + 蛋白 QC 包 + 联合判读试运行 | IND 数据包模板 |
| 工艺变更可比性 | — | 工艺可比包(T-II + P-II) |
| 抗体 CMC 表征 | — | X1 PTM + 深度包蛋白侧 |
| mRNA-LNP / 核酸载荷 | — | T9 mRNA 模块 |
3. P0 规划建设期(0–3 月)
P0 不是「修补既有系统」,而是从零立项的总体规划与首期建设:在写第一行业务分析代码之前,把架构、标准、算力与合规口径一次定清楚。
3.1 规划建设目标
| # | 建设目标 | 产出形态 |
|---|---|---|
| 1 | 平台架构蓝图 | 四层模型(L1–L4)、转录组/蛋白组边界、与分子功能团队接口 |
| 2 | 数据与元数据标准 | 样本表字段、对照类型、SOP 版本绑定规则(对齐 miRNA-05 §3.1) |
| 3 | QC 与报告规范 | 转录组/蛋白组报告模板、合格/边缘/不合格标签;对齐 miRNA-13 §3.5、§4.5 交付物清单 |
| 4 | 参考库与版本制度 | 人/鼠 miRBase、UniProt、cRAP、EV 标志物表;发布与回溯机制 |
| 5 | 算力与流水线底座 | HPC 环境、Git 仓库、Conda/Snakemake 骨架、审计日志字段 |
| 6 | 表征服务包定义 | 表征 QC / 深度 / 工艺可比 / 多组学 / IND 五类包的模块边界与报价要素(miRNA-13 §5.3) |
| 7 | 试点项目路线图 | 首批 EV/CGT 表征服务项目、标定样设计、T-I 验收指标 |
3.2 规划建设任务清单
| 任务包 | 内容 | 负责协作 |
|---|---|---|
| P0-A 需求与架构 | 业务场景梳理(IND 表征服务)、模块地图(T/P 模块)、技术选型 | 质量分析负责人、注册事务(RA) |
| P0-B 标准制定 | 《元数据规范 v1》《QC 判定原则 v1》《报告模板 v1》;转录组/蛋白组 IND 交付物 checklist | 实验 SOP、生物表征 + 分子功能 |
| P0-C 基础设施 | 服务器采购/上架、存储分区、任务调度、备份策略 | IT、生物信息 |
| P0-D 参考数据 | 参考库下载、容器镜像、流水线空跑(mock 数据) | 生物信息 |
| P0-E 试点准备 | 标定样方案(合格/不合格/边缘各类型)、测序排期 | 实验、测序平台 |
3.3 资源与预期收益
| 资源 | 配置 |
|---|---|
| 人力 | 生物信息 1 FTE(主责)+ 质量分析实验 0.1 FTE + IT 0.1 FTE |
| 算力 | 64–128 核、512 GB–1 TB 内存、20 TB 起存储(按立项预算采购) |
| 软件 | Snakemake/Nextflow、Git、Conda;以开源栈为主 |
| 预估工期 | 8–12 人周(含评审与文档) |
| 收益 | 说明 |
|---|---|
| 标准先行 | T-I/P-I 开发不因字段争议反复变更 |
| 合规就绪 | 自首日即具备版本号、审计字段,满足药企数据完整性要求 |
| 排期可控 | 转录组 3 月内可进入开发,无「边做边补规范」风险 |
3.4 P0 交付物与验收
- 《生物表征多组学分析平台架构说明书 v1》
- 《样本与实验元数据规范 v1》
- 《表征服务包定义 v1》(五类包与 L1–L5 对应表,见 §2.3)
- 《转录组 IND 表征交付物 checklist》(miRNA-13 §3.5)
- 《蛋白组 IND 表征交付物 checklist》(miRNA-13 §4.5)
- 参考库目录与版本登记册
- HPC 环境验收报告(算力、存储、权限、备份)
- 转录组流水线骨架:预处理 → miRBase 计数(mock 跑通)
- 《首批试点项目与标定样计划》
P0 门禁:上述文档评审通过 + HPC 可用 + mock 流水线成功,方可启动 T-I。
4. 转录组子平台:分阶段与分析内容
转录组专文:miRNA-06;表征分层需求:miRNA-13 §3;QC 指标:miRNA-03。
4.0 转录组分析内容总览
本阶段覆盖表征层次:T-I → L1–L3;T-II → L4;T-III → L5 接口 + 可选 mRNA 路线。
| 模块 | 名称 | 表征层 | 优先级 | 阶段 |
|---|---|---|---|---|
| T1 | 数据接入与元数据 | L1 | P0 | T-I |
| T2 | FASTQ 预处理与读段 QC | L1 | P0 | T-I |
| T3 | 比对与 miRNA 定量 | L2 | P0 | T-I |
| T4 | 污染 RNA 组成 | L2 | P0 | T-I |
| T5 | 签名与参考谱 QC | L2–L3 | P0 | T-I |
| T6 | 归一化、批次、重复性 | L3 | P0 | T-I |
| T10 | 自动化 QC 报告 | L3 | P0 | T-I |
| T7 | 差异 miRNA | L4 | P1 | T-II |
| T8 | 靶基因与通路富集 | L4 | P1 | T-II |
| T11 | 参考签名库 | L3–L4 | P1 | T-II |
| T9 | mRNA/lncRNA 片段 | L4(扩展路线) | P2 | T-III |
| T12 | 蛋白组关联接口 | L5 | P1 | T-III / M-I |
4.1 阶段 T-I:转录组 QC 闭环(3–9 月)
4.1.1 阶段建设目标
| # | 建设目标 | IND/表征价值 |
|---|---|---|
| 1 | 交付 表征 QC 包转录组侧(L1–L3) | 对齐 miRNA-13 §3.5 全部必选项 |
| 2 | 内置溶血、裂解、FBS 污染识别规则 | 液体活检/培养上清数据从首日即标准化 |
| 3 | 统一 HTML/PDF QC 报告与放行标签 | 申报附件格式一次定型 |
| 4 | 上机后 24 h 内完成判定与预警 | 为后续蛋白组/功能实验提供分流依据 |
4.1.2 本阶段展开的分析内容
T1 数据接入与元数据校验
| 项目 | 内容 |
|---|---|
| 分析步骤 | 样本表校验 → FASTQ MD5 → 物种/文库类型/对照标签匹配 |
| 输入 | FASTQ、样本表(分离方法、物种、PBS/EV-depleted 对照) |
| 输出 | 校验报告;失败阻断下游 |
| 工具 | 自研校验脚本 + MultiQC 入口 |
| 难点 | sRNA-seq 与 mRNA-seq 误投递 |
| 开发 | 1–1.5 人周 |
T2 FASTQ 预处理与读段层 QC
| 项目 | 内容 |
|---|---|
| 分析步骤 | 接头修剪 → 长度过滤(15–35 nt)→ 质量过滤 → 读长分布统计 |
| 核心指标 | 总读段、修剪后读段、21–23 nt 主峰、接头%、低质量% |
| 输出 | MultiQC 节、读长分布图 |
| 工具 | fastp、cutadapt、FastQC |
| 判读 | 主峰缺失 → 生物学 QC 降级(见 miRNA-03 §2.1) |
| 开发 | 1.5–2 人周 |
T3 比对注释与 miRNA 定量
| 项目 | 内容 |
|---|---|
| 分析步骤 | bowtie/STAR 比对 miRBase → 成熟体计数 →(可选)isomiR 附录 |
| 核心指标 | miRNA mapping rate、检出 miRNA 数、Top20 列表 |
| 输出 | 样品 × miRNA 原始计数矩阵 |
| 工具 | miRDeep2 流程或自研计数 |
| 难点 | 近源家族歧义;默认成熟体合并口径 |
| 开发 | 2–3 人周 |
T4 污染 RNA 组成分析
| 项目 | 内容 |
|---|---|
| 分析步骤 | 分层比对:miRBase + rRNA + GtRNAdb + 宿主基因组 |
| 核心指标 | miRNA%、rRNA%、tRNA/tRF%、mRNA 片段%、未比对% |
| 输出 | 组成饼图/条形图;污染超标 flag |
| 表征解读 | rRNA/mRNA ↑ → 裂解;tRF ↑ → 应激/凋亡 |
| 开发 | 2 人周 |
T5 签名与参考谱 QC
| 项目 | 内容 |
|---|---|
| 分析步骤 | Top N 谱图 → 与参考批 Pearson/Spearman → PCA → 溶血/血小板监控 |
| 核心指标 | miR-451a(溶血)、miR-223-3p(血小板)、与合格批相关 (r) |
| 输出 | 签名相似度得分;偏离参考簇警告 |
| 难点 | 阈值须本实验室校准,非全球统一 |
| 开发 | 2–3 人周 |
T6 归一化、批次与重复性
| 项目 | 内容 |
|---|---|
| 分析步骤 | RPM/CPM(QC 用)→ 技术重复相关 → 批次 PCA 监控 |
| 核心指标 | 重复样品 (r)、批次离群 |
| 注意 | ComBat 不用于 QC 合格判定 |
| 开发 | 1.5–2 人周 |
T10 自动化 QC 报告与合格判定
| 项目 | 内容 |
|---|---|
| 分析步骤 | 汇总 T2–T6 → 规则引擎 → HTML/PDF |
| 必含字段 | 对齐 miRNA-03 §7 七项 |
| 输出标签 | 合格 / 边缘 / 不合格;边缘触发人工复核 |
| 开发 | 2–3 人周 |
4.1.3 T-I 资源与收益
| 资源 | 配置 |
|---|---|
| 人力 | 生物信息 1 FTE + 测序实验接口 0.15 FTE |
| 数据 | 首批标定样 ≥9 例(合格/边缘/不合格各类型,见 P0-E 试点计划) |
| 累计开发 | 12–16 人周(模块 T1–T6 + T10) |
| 收益项 | 目标能力 |
|---|---|
| 单样 QC 周转 | 1–2 工作日(自动化流水线) |
| 不合格预警 | 上机后 24 h 内 |
| 服务能力 | 同期支撑 EV/CGT 转录组 QC 项目 4–6 个 |
| IND | 结构化 RNA cargo QC 表可直接嵌入 CMC 附件 |
4.1.4 T-I 验收标准
- 100% 试点项目经 T1 接入
- QC 报告字段与 miRNA-03、P0 模板一致
- IND 交付物 checklist(§3.5)8 项必选项全部可自动生成
- 标定样集(≥9 例)判定与专家共识一致率 ≥85%
- 流水线版本号写入报告页眉
- 表征 QC 包(转录组侧)评审通过,批准启动 P-I
4.2 阶段 T-II:转录组标准分析(9–12 月)
4.2.1 阶段建设目标
| # | 建设目标 |
|---|---|
| 1 | 交付 工艺可比包转录组侧(L4) |
| 2 | 固化差异 miRNA 靶基因/通路解读(表征延伸,非效价) |
| 3 | 签名库 v1 支撑 L3 批间基线 |
| 4 | 覆盖 miRNA-13 §3.4「工艺变更可比性」场景 |
4.2.2 本阶段展开的分析内容
T7 差异 miRNA 分析
| 项目 | 内容 |
|---|---|
| 前提 | T10 合格或经人工确认之边缘样;n≥3 生物学重复 |
| 分析步骤 | DESeq2/edgeR → FDR 校正 → 火山图/热图 |
| 输出 | 差异 miRNA 表(log2FC、padj) |
| 难点 | 外泌体重复数不足;离群样敏感 |
| 开发 | 1.5–2 人周 |
T8 靶基因预测与通路富集
| 项目 | 内容 |
|---|---|
| 分析步骤 | TargetScan/miRTarBase 靶基因 → clusterProfiler GO/KEGG |
| 输出 | 靶基因列表、富集条形图、通路网络(可选) |
| 表征用途 | 支撑 cargo 生物学解读(非药效) |
| 开发 | 2 人周 |
T11 参考签名库 v1
| 项目 | 内容 |
|---|---|
| 分析步骤 | 入库合格批 RPM 矩阵 + 元数据(细胞系 × 分离方法 × 试剂批) |
| 功能 | 新项目自动相似度检索;版本化发布 |
| 输出 | 签名库 API/文件库;相似度报告 |
| 开发 | 2–3 人周(简单文件库 1 人周) |
4.2.3 T-II 资源与收益
| 资源 | 累计 +4–6 人周 |
|---|---|
| 收益 | 课题级差异分析标准化;工艺批间 miRNA 漂移可追溯;支撑对外「深度表征」报价项 |
4.3 阶段 T-III:转录组扩展(12–15 月)
4.3.1 阶段建设目标
| # | 建设目标 |
|---|---|
| 1 | 扩展 mRNA/lncRNA cargo 分析能力(按管线需求选配) |
| 2 | 定稿多组学样品 ID 与联合报告 schema,供蛋白组接入 |
| 3 | 预留抗体/LNP 核酸载荷监测子流程 |
4.3.2 本阶段展开的分析内容
T9 mRNA / lncRNA 片段分析(可选)
| 项目 | 内容 |
|---|---|
| 分析步骤 | STAR + featureCounts/Salmon;短片段参数 |
| 核心指标 | 基因检出数、片段长度分布、与胞内 RNA-seq 对照 |
| 注意 | 与 sRNA-seq 双流程维护;建议独立子流水线 |
| 开发 | 3–4 人周 |
T12 蛋白组关联接口(schema 阶段)
| 项目 | 内容 |
|---|---|
| 交付 | 样品配对表结构、联合报告章节模板、不一致判定枚举值 |
| 完整落地 | 见 §6 阶段 M-I |
| 开发 | 1 人周(schema);与 P11 合计 2–3 人周 |
4.3.3 T-III 资源与收益
| 资源 | +4–5 人周(含 T9 则 +7–8) |
|---|---|
| 收益 | 覆盖 mRNA cargo 表征;蛋白组按已定 schema 接入,标准一次对齐 |
4.4 转录组开发周期汇总
| 子阶段 | 模块 | 人周 | 日历 |
|---|---|---|---|
| T-I MVP | T1–T6, T10 | 12–16 | 3–9 月 |
| T-II 标准 | + T7, T8, T11 | +4–6 | 9–12 月 |
| T-III 扩展 | + T9, T12 schema | +4–8 | 12–15 月 |
| 转录组合计 | — | 20–30 | 15 月 |
5. 蛋白组子平台:分阶段与分析内容
蛋白组专文:miRNA-07;表征分层需求:miRNA-13 §4;入门:miRNA-08。
启动条件:转录组 T-I 验收(表征 QC 包转录组侧就绪);接入 P0 元数据规范与样本 ID 体系。
5.0 蛋白组分析内容总览
本阶段覆盖表征层次:P-I → L1–L3;P-II → L4 差异与批间;P-III → L4 PTM + 网络;M-I → L5。
| 模块 | 名称 | 表征层 | 优先级 | 阶段 |
|---|---|---|---|---|
| P1 | 搜库结果接入 | L1 | P0 | P-I |
| P2 | 蛋白鉴定 QC | L1 | P0 | P-I |
| P3 | EV 标志蛋白面板(五组分) | L2 | P0 | P-I |
| P4 | 无标记定量矩阵 | L3 | P0 | P-I |
| P5 | 污染/高丰度蛋白过滤 | L2–L3 | P0 | P-I |
| P6 | 缺失值、归一化、批次 | L3 | P0 | P-I |
| P10 | 自动化 QC 报告 | L3 | P0 | P-I |
| P12 | NTA/Western 联动 | L3(物理互证) | P0 | P-I |
| P7 | 差异蛋白 | L4 | P1 | P-II |
| P8 | 功能富集 | L4 | P1 | P-II |
| X2 | 批间一致性评价 | L4 | P1 | P-II |
| X1 | PTM 分析(抗体/蛋白) | L4 | P1 | P-III |
| P9 | 蛋白互作网络 | L4 | P2 | P-III |
| P11 | 转录组/miRNA 关联 | L5 | P1 | M-I |
5.1 阶段 P-I:蛋白组 QC 闭环(9–15 月)
5.1.1 阶段建设目标
| # | 建设目标 | IND/表征价值 |
|---|---|---|
| 1 | 交付 表征 QC 包蛋白组侧(L1–L3 + 五组分) | 对齐 miRNA-13 §4.5 |
| 2 | 组学输出对齐 MISEV 五组分蛋白框架 | 身份/纯度/来源结构化呈现 |
| 3 | 量化血浆 EV 脂蛋白/白蛋白污染 | 液体活检样品规则内置 |
| 4 | 与转录组 T10 联合判读,统一放行逻辑 | 多组学三角验证自建设期即贯通 |
5.1.2 本阶段展开的分析内容
P1 质谱数据 / 搜库结果接入
| 项目 | 内容 |
|---|---|
| 分析步骤 | 解析 MaxQuant proteinGroups.txt / FragPipe 输出 → 统一「蛋白 × 样品 × 强度」层 |
| 输入 | 搜库结果 + 运行-样品映射表 + 搜库参数 JSON |
| 输出 | 标准化蛋白表;引擎元数据存档 |
| 注意 | 搜库在 HPC/实验端完成;DDA/DIA 分支登记 |
| 开发 | 2–2.5 人周 |
P2 蛋白鉴定 QC
| 项目 | 内容 |
|---|---|
| 核心指标 | 蛋白/肽段鉴定数、覆盖度、FDR ≤ 1%、分数分布 |
| 判读 | 与首批标定样/参考标准样比较;随签名库积累迭代基线 |
| 难点 | EV 总蛋白低 → 鉴定数天然少于全细胞 |
| 开发 | 1.5 人周 |
P3 EV 标志蛋白面板(五组分框架)
| 项目 | 内容 |
|---|---|
| 分析步骤 | 检测 CD63/CD9/CD81/TSG101/Alix/HSP70 → 四跨膜共现评分 |
| 五组分覆盖 | 存在 / 纯度 / 来源 / 共分离 / NVEP(miRNA-13 §4.3 第二层) |
| 对齐 | miRNA-12 §6 |
| 输出 | 标志物雷达图、五组分评分表、阳性/阴性对照差值 |
| 开发 | 2–2.5 人周(较初版 +0.5,含五组分报表) |
P4 无标记定量与蛋白矩阵
| 项目 | 内容 |
|---|---|
| 分析步骤 | 提取 LFQ/DIA 强度 → 构建定量矩阵 |
| 核心指标 | 缺失率、动态范围、检出蛋白数 |
| 注意 | iBAQ 仅作组成参考 |
| 开发 | 2–3 人周 |
P5 污染蛋白 / 高丰度蛋白过滤
| 项目 | 内容 |
|---|---|
| 分析步骤 | CRAP + 血浆高丰度库 + EV-TRACK 非 EV 列表 → 污染占比 |
| 核心指标 | 白蛋白、载脂蛋白、核蛋白、角蛋白肽段占比 |
| 策略 | 过滤前后双矩阵;差异分析默认用过滤后并记录规则 |
| 开发 | 1.5 人周 |
P6 缺失值、归一化与批次
| 项目 | 内容 |
|---|---|
| 分析步骤 | 检出率过滤 → median/VSN 归一化 →(可选)ComBat |
| 推荐统计 | 差异场景优先 MSstats/MSqRob2 |
| 难点 | MNAR 为主,插补易假阳性 |
| 开发 | 2–2.5 人周 |
P10 自动化 QC 报告
| 项目 | 内容 |
|---|---|
| 必含字段 | 鉴定摘要、标志物面板、污染评估、PCA、合格标签 |
| 样式 | 与转录组 T10 统一;预留联合判读占位符 |
| 开发 | 2 人周 |
P12 物理指标联动
| 项目 | 内容 |
|---|---|
| 分析步骤 | 读入 NTA 粒径/浓度、Western 半定量 → 报告「组学–物理」段 |
| 逻辑 | 物理合格不能替代蛋白/miRNA QC |
| 开发 | 1–1.5 人周 |
5.1.3 P-I 资源与收益
| 资源 | 配置 |
|---|---|
| 人力 | 生物信息 1 FTE + 质谱实验接口 0.25 FTE |
| 算力 | 搜库节点扩容(+32 核 或外包搜库) |
| 数据 | 首批配对 EV 蛋白组(与 T-I 标定样同批或同步设计) |
| 累计开发 | 14–18 人周 |
| 收益项 | 目标能力 |
|---|---|
| 蛋白 QC 周转 | 2–3 工作日(自动化流水线) |
| MISEV 蛋白条目 | 报告逐条对应检查项 |
| 三角验证 | 与 T10 同一样品 ID 并读、联合标签 |
5.1.4 P-I 验收标准
- MaxQuant(或 FragPipe)一种引擎 ingest 稳定
- 五组分 + 污染 + 鉴定 QC 全进 P10
- IND 交付物 checklist(§4.5)必选项全部可自动生成
- 与 T10 同批样品联合判读试运行 ≥5 例
- 表征 QC 包(蛋白组侧)评审通过;双组学 QC 包(T-I + P-I)可对外报价
5.2 阶段 P-II:蛋白组标准分析(15–18 月)
5.2.1 阶段建设目标
| # | 建设目标 |
|---|---|
| 1 | 交付 工艺可比包蛋白组侧(L4:P7、P8、X2) |
| 2 | 支撑 miRNA-13 §4.4「工艺变更可比性」场景 |
| 3 | CQA 候选蛋白清单数据化 |
5.2.2 本阶段展开的分析内容
P7 差异蛋白分析
| 项目 | 内容 |
|---|---|
| 分析步骤 | MSstats/limma → FDR → 火山图/热图 |
| 前提 | P10 放行;与 P5 过滤策略一致 |
| 开发 | 1.5–2 人周 |
P8 功能富集与通路
| 项目 | 内容 |
|---|---|
| 分析步骤 | clusterProfiler GO/KEGG/Reactome;关注 ESCRT/膜运输 |
| 开发 | 1.5 人周 |
X2 批间一致性评价
| 项目 | 内容 |
|---|---|
| 分析步骤 | 批次间 PCA、蛋白谱 Pearson 相关、Hotelling (T^2)(可选) |
| 输入 | 工艺变更前后多批 P4 矩阵 |
| 输出 | 可比性报告;离群蛋白列表 |
| 协作 | 下游纯化工艺变更通知 |
| 开发 | 2–3 人周 |
5.2.3 P-II 资源与收益
| 资源 | +5–7 人周 |
|---|---|
| 收益 | 工艺变更可比性报告 ≤5 工作日;CQA 蛋白清单数据化 |
5.3 阶段 P-III:蛋白组扩展(18–21 月)
5.3.1 阶段建设目标
| # | 建设目标 |
|---|---|
| 1 | 交付 表征深度包蛋白侧:L4 PTM(X1) |
| 2 | 覆盖 miRNA-13 §4.4「抗体 CMC 表征」「稳定性研究」 |
| 3 | 物理–组学–转录组三源看板(P12 深化) |
5.3.2 本阶段展开的分析内容
X1 PTM 分析(抗体/重组蛋白)
| 项目 | 内容 |
|---|---|
| 分析步骤 | 糖肽/氧化/脱酰胺搜库 → 修饰位点定量 → 批间修饰率趋势 |
| 工具 | MaxQuant PTM、糖分析插件 |
| 表征用途 | IND 结构表征章节;属生物表征核心(非效价) |
| 开发 | 4–6 人周(依赖质谱专家) |
P9 蛋白互作网络(可选)
| 项目 | 内容 |
|---|---|
| 工具 | STRING/Cytoscape |
| 开发 | 1–1.5 人周 |
5.3.3 P-III 资源与收益
| 资源 | +5–8 人周;质谱专家 0.3 FTE |
|---|---|
| 收益 | 抗体/蛋白 IND 表征与 EV 双产品线;PTM 作为规格趋势监测 |
5.4 蛋白组开发周期汇总
| 子阶段 | 模块 | 人周 | 日历 |
|---|---|---|---|
| P-I MVP | P1–P6, P10, P12 | 15–19 | 9–15 月 |
| P-II 标准 | + P7, P8, X2 | +5–7 | 15–18 月 |
| P-III 扩展 | + X1, P9 | +5–8 | 18–21 月 |
| 蛋白组合计 | — | 25–34 | 12 月(第 9–21 月) |
6. 多组学整合与平台化(18–30 月)
6.1 阶段 M-I:多组学整合(18–24 月)
阶段建设目标
| # | 建设目标 |
|---|---|
| 1 | 交付 多组学整合包(L5) |
| 2 | 落地 miRNA-13 §5.2 联合判读速查表为规则引擎 |
| 3 | 表征指纹模型支撑批间异常调查 |
展开分析内容
| 模块 | 分析内容 | 开发 |
|---|---|---|
| T12 + P11 | 样品配对;miRNA-靶-蛋白三角;联合 QC 规则(见下表) | 2–3 人周 |
| 联合判读引擎 | 合格/边缘/不一致/单组学通过 | 2 人周 |
| 表征指纹模型 | 多组学特征向量 + 异常检测(PCA/Isolation Forest) | 4–6 人周 |
| 关联统计 | WGCNA/mixOmics 封装报告 | 3–4 人周 |
联合 QC 规则(内置,来源 miRNA-13 §5.2)
| 转录组 | 蛋白组 | 判定 |
|---|---|---|
| miRNA% 高、签名一致 | 标志蛋白阳性、污染低 | 合格 |
| miRNA 弱、颗粒有 | 标志蛋白有 | 边缘(疑空囊泡) |
| rRNA/tRNA 高 | 胞内/血浆污染高 | 不合格 |
| miR-451 高 | — | 溶血标注 |
M-I 资源与收益
| 资源 | 生物信息 1 FTE + 算法 0.5 FTE;+12–18 人周 |
|---|---|
| 收益 | 联合报告标准化;支撑岗位职责 §3 深度挖掘;为偏差调查提供跨组学证据链 |
6.2 阶段 M-II:平台化与 IND 交付(24–30 月)
| 建设目标 | 交付 | 资源 |
|---|---|---|
| IND 表征数据包自动组装 | CMC 3.2 章节模板;嵌入 §3.5/§4.5 checklist | +20–30 人周 |
| Web 化自助投递 | 门户、任务队列、服务包下单(QC/深度/可比) | 前端 0.5–1 FTE |
| 审计与 CSV | 流水线版本、操作日志、计算机化系统验证范围 | QA 0.2 FTE |
M-II 验收:任选 1 个试点 IND 项目,表征 QC 包 + 可选工艺可比包数据包一键导出通过 RA 预审。
7. 跨阶段资源总表
| 资源 | P0 | T-I–III | P-I–III | M-I–II |
|---|---|---|---|---|
| 生物信息 FTE | 1 | 1 | 1 | 0.5–1 |
| 质谱/测序协作 | 0.1 | 0.15 | 0.25–0.3 | 0.2 |
| 算法/前端 | — | — | — | 0.5–1.5 |
| 累计人周 | 8–12 | 20–30 | 25–34 | 32–48 |
| 日历 | 0–3 月 | 3–15 月 | 9–21 月 | 18–30 月 |
总周期:30 个月达成熟态(IND 数据包就绪)。
分期服务能力:
| 时间点 | 可交付服务包 |
|---|---|
| 9 月(T-I) | 表征 QC 包·转录组 |
| 15 月(P-I) | 表征 QC 包·双组学 |
| 18 月(T-II + P-II) | + 工艺可比包 |
| 21 月(P-III) | + 表征深度包(抗体 PTM) |
| 24 月(M-I) | + 多组学整合包 |
| 30 月(M-II) | + IND 表征数据包 |
8. KPI 与风险(摘要)
| 子阶段 | 结果 KPI |
|---|---|
| T-I | 表征 QC 包(转录组);§3.5 checklist 全自动;24 h 预警 |
| P-I | 表征 QC 包(蛋白组);五组分报表;双组学联合试运行 ≥5 例 |
| T-II + P-II | 工艺可比包;可比性报告 ≤5 工作日 |
| M-I | 多组学整合包;≥1 CQA 假说获实验验证 |
| M-II | IND 数据包预审通过;门户服务包下单 |
| 风险 | 对策 |
|---|---|
| P0 标准未定稿即开发 | P0 门禁;文档评审通过后方可启动 T-I |
| 蛋白组抢跑导致标准分裂 | 强制 T-I 验收后启动 P-I |
| 阈值缺乏标定样 | P0-E 设计合格/边缘/不合格标定样集 |
| 搜库参数口径不一 | P1 强制参数 JSON 存档 |
9. 小结
本平台为全新建设项目,以生物表征为主线,服务天士力生物药研发在 IND 期的结构与组成质量评价。五阶段递进逻辑为:
1 | 先规划建设(P0)→ 转录组 T-I(QC)→ T-II(差异/签名)→ T-III(mRNA/接口) |
- 需求基线:miRNA-13 L1–L5 表征分层 + 五类服务包。
- 转录组 12 模块:T-I 交付 L1–L3(表征 QC 包);T-II 交付 L4。
- 蛋白组 14 模块:P-I 交付 L1–L3 + 五组分;P-II–III 交付 L4(含 PTM)。
- M-I 交付 L5 多组学整合包;M-II 交付 IND 表征数据包。
首发路径:P0 + T-I(约 9 月)→ P-I(约 15 月)双组学 表征 QC 包可商用;工艺可比与 IND 包按 §2.5 表递推。