本文针对外泌体(exosome)质量评估与多组学联合分析场景,从生物信息平台视角拆分转录组与蛋白组两条产品线:每一检测/分析模块说明要解决什么问题、目前主流方法、潜在技术难点与预估开发时间(以 1 名熟手生物信息工程师 为基准,不含纯实验验证与硬件采购;前后端/UI 另计)。
平台架构与专文:总体框架见 miRNA-05-外泌体多组学生物信息分析平台概览;转录组、蛋白组分别见 miRNA-06、miRNA-07。组织与分阶段落地计划见 miRNA-14。本文侧重模块清单与开发排期。
段末注释:EV(extracellular vesicle,细胞外囊泡)为分泌颗粒总称;本规划默认转录组侧以 small RNA 测序(small RNA sequencing,sRNA-seq)/ miRNA-seq 为主,兼及外泌体 mRNA 片段分析;蛋白组侧以 液相色谱-质谱(liquid chromatography–mass spectrometry,LC-MS/MS)无标记定量为主。
前置阅读:miRNA-03-测序分析与外泌体质控(转录组 QC 指标细节)。
1. 平台总体架构
1 | ┌─────────────────────────────────────┐ |
| 维度 | 转录组平台 | 蛋白组平台 |
|---|---|---|
| 核心输入 | FASTQ(sRNA-seq);可选 FASTQ(mRNA-seq) | raw/mzML、搜库结果(MaxQuant/FragPipe 等) |
| 核心输出 | QC 报告、miRNA 表达矩阵、差异列表、签名库比对 | 蛋白鉴定表、定量矩阵、标志物面板、差异蛋白 |
| 外泌体特有 | 溶血/血小板 miRNA、污染 RNA、参考谱 QC | CD63/CD9/CD81 面板、血浆高丰度蛋白过滤 |
| 与系列衔接 | 落实 miRNA-03 全部 QC 字段 |
与 miRNA-03 §6 多组学三角验证对齐 |
平台级公共模块(两条线共用,单独估时 4–6 人周):用户/项目权限、样本表(分离方法、物种、组织、批次)、SOP 版本绑定、任务队列、结果归档、审计日志。
2. 转录组分析平台
2.1 模块总览
| 序号 | 模块 | 优先级 |
|---|---|---|
| T1 | 原始数据接入与元数据校验 | P0 |
| T2 | FASTQ 预处理与读段层 QC | P0 |
| T3 | 比对注释与 miRNA 定量 | P0 |
| T4 | 污染 RNA 组成分析 | P0 |
| T5 | 外泌体 miRNA 签名 / 参考谱 QC | P0 |
| T6 | 归一化、批次效应与重复性 | P0 |
| T7 | 差异 miRNA 分析 | P1 |
| T8 | 靶基因预测与通路富集 | P1 |
| T9 | 外泌体 mRNA/lncRNA 片段分析(可选) | P2 |
| T10 | 自动化 QC 报告与合格判定 | P0 |
| T11 | 参考签名库与对照样本管理 | P1 |
| T12 | 与蛋白组多组学关联接口 | P1 |
T1 原始数据接入与元数据校验
| 项目 | 内容 |
|---|---|
| 要解决的问题 | 测序数据与样本信息错配;缺少分离方法、物种、对照类型导致 QC 无法解释 |
| 主流方法 | LIMS 样本表 + MD5 校验;字段校验(物种、文库类型、接头版本);对照标签(PBS 空白、EV-depleted、母细胞裂解物) |
| 技术难点 | 历史项目元数据不全;多中心命名规范不统一;sRNA-seq 与 mRNA-seq 混传误投递 |
| 预估开发 | 1–1.5 人周(CLI + 表模板);含 Web 表单 +2 人周 |
T2 FASTQ 预处理与读段层 QC
| 项目 | 内容 |
|---|---|
| 要解决的问题 | 接头残留、低质量碱基、长度不符合 miRNA 窗口(~18–40 nt)导致假阴性或污染误判 |
| 主流方法 | fastp / cutadapt 接头修剪;长度过滤(如 15–35 nt);FastQC/MultiQC 汇总;读长分布峰(21–23 nt 主峰) |
| 技术难点 | 不同建库试剂盒接头序列差异;UMI(unique molecular identifier)可选流程分支;极低起始 RNA 导致重复读段高 |
| 预估开发 | 1.5–2 人周(封装 + MultiQC 模板);支持 UMI +1 人周 |
T3 比对注释与 miRNA 定量
| 项目 | 内容 |
|---|---|
| 要解决的问题 | 将读段准确映射到成熟 miRNA / isomiR;统计各 miRNA 读段数供组成与差异分析 |
| 主流方法 | bowtie/STAR + miRBase;miRDeep2/mirdeep 流程;计数层级:成熟体(默认)/ 5p/3p / isomiR(可选) |
| 技术难点 | 近源 miRNA 家族比对歧义;新物种 miRBase 覆盖不足;isomiR 注释粒度与 QC/差异分析口径不一致 |
| 预估开发 | 2–3 人周(单物种 human/mouse 流水线);多物种 +1 人周/种 |
T4 污染 RNA 组成分析
| 项目 | 内容 |
|---|---|
| 要解决的问题 | 区分囊泡 miRNA 与 rRNA/tRNA/mRNA 片段、线粒体 RNA 等泄漏信号,判断制备纯度 |
| 主流方法 | 多库分层比对:miRBase + GtRNAdb + rRNA + 宿主基因组;输出各类型读段占比饼图/条形图 |
| 技术难点 | tRF/tiRNA 与真 miRNA 边界模糊;血浆背景复杂,阈值不能跨项目硬套;未比对读段归属 |
| 预估开发 | 2 人周(与 T3 共用比对框架);可视化报表 +0.5 人周 |
T5 外泌体 miRNA 签名 / 参考谱 QC
| 项目 | 内容 |
|---|---|
| 要解决的问题 | 样品 miRNA 谱是否与供体细胞系/历史合格批次一致;是否出现溶血、血小板、FBS 污染签名 |
| 主流方法 | Top N miRNA 条形图;与参考批 Pearson/Spearman 相关;PCA/层次聚类;溶血标志(miR-451a、miR-16-5p)、血小板标志(miR-223-3p 等)监控 |
| 技术难点 | 无通用「外泌体金标准 miRNA 清单」,参考库需实验室自建;细胞类型依赖强;判定规则需在 SOP 中预先定义 |
| 预估开发 | 2–3 人周(含参考谱上传与比对);自动化合格/边缘/不合格标签 +1 人周 |
T6 归一化、批次效应与重复性
| 项目 | 内容 |
|---|---|
| 要解决的问题 | 文库深度、批次、操作者差异导致样品间不可比;技术重复离散误判为生物学差异 |
| 主流方法 | RPM/CPM(组成 QC);差异场景 DESeq2/edgeR(TMM);探索性批次校正 ComBat(QC 判定慎用);重复样品相关性 |
| 技术难点 | 外泌体 miRNA 内参选择争议(如血浆 miR-423-5p);小样本批次校正过拟合;RPM 对低丰度 miRNA 不稳定 |
| 预估开发 | 1.5–2 人周 |
T7 差异 miRNA 分析
| 项目 | 内容 |
|---|---|
| 要解决的问题 | 组间(处理/疾病/批次对比)哪些 miRNA 显著变化;控制假阳性 |
| 主流方法 | DESeq2 / edgeR / limma-voom;FDR(false discovery rate)校正;火山图 / 热图;需 n≥3 生物学重复 |
| 技术难点 | 外泌体样品 RNA 量少、重复数常不足;离群样品对离散度估计影响大;isomiR 层级差异与成熟体合并策略 |
| 预估开发 | 1.5–2 人周(R/Python 封装 + 标准图表) |
T8 靶基因预测与通路富集
| 项目 | 内容 |
|---|---|
| 要解决的问题 | 差异 miRNA 的潜在靶基因与通路;为功能验证提供候选 |
| 主流方法 | TargetScan / miRTarBase / DIANA 预测;GO/KEGG 富集(clusterProfiler);可选 GSEA |
| 技术难点 | 预测靶基因假阳性高;外泌体 miRNA 为分泌态,与胞内靶网络不完全等同;多 miRNA 协同调控难建模 |
| 预估开发 | 2 人周 |
T9 外泌体 mRNA / lncRNA 片段分析(可选)
| 项目 | 内容 |
|---|---|
| 要解决的问题 | 部分项目除 miRNA 外需评估 EV 中 mRNA/lncRNA 片段谱,辅助来源与功能推断 |
| 主流方法 | 标准 RNA-seq 流程(STAR + featureCounts/Salmon);短片段偏向的比对参数;与胞内 RNA-seq 分开解读 |
| 技术难点 | EV mRNA 降解严重、丰度低;与游离 RNA 区分;与 sRNA-seq 双流程维护成本 |
| 预估开发 | 3–4 人周(可选模块,建议二期) |
T10 自动化 QC 报告与合格判定
| 项目 | 内容 |
|---|---|
| 要解决的问题 | 实验/分析人员无需手工拼图即可交付可审计 QC;结论可追溯至 SOP 条款 |
| 主流方法 | MultiQC + 定制 HTML/PDF 模板;字段对齐 miRNA-03 §7(读长、miRNA%、污染%、Top20、PCA、溶血标志、重复性、合格标签) |
| 技术难点 | 阈值版本管理与 SOP 同步;多语言/多中心报告样式;失败样品「边缘」区间的人机协同判定 |
| 预估开发 | 2–3 人周 |
T11 参考签名库与对照样本管理
| 项目 | 内容 |
|---|---|
| 要解决的问题 | 积累实验室合格批次 miRNA 谱、阴性对照谱,供新项目自动比对 |
| 主流方法 | 数据库存储归一化 miRNA 矩阵 + 元数据;版本化签名(细胞系 × 分离方法 × 试剂批);相似度检索 API |
| 技术难点 | 历史数据归一化口径不一致;签名随培养条件漂移;权限与脱敏(临床样本) |
| 预估开发 | 2–3 人周(一期简单文件库 1 人周) |
T12 与蛋白组多组学关联接口
| 项目 | 内容 |
|---|---|
| 要解决的问题 | 同一外泌体样品 miRNA 与蛋白变化是否一致;标志物三角验证 |
| 主流方法 | 样品 ID 对齐;miRNA-靶基因-蛋白三角;相关分析 / WGCNA 模块重叠;统一报告章节 |
| 技术难点 | 转录本-蛋白滞后;miRNA 靶预测噪声;两组学批次独立引入伪相关 |
| 预估开发 | 2–3 人周(依赖蛋白组平台 T12 对齐) |
2.2 转录组平台开发周期汇总
| 阶段 | 包含模块 | 预估(人周) | 说明 |
|---|---|---|---|
| MVP(QC 闭环) | T1–T6 + T10 | 12–16 | 满足外泌体质控交付,不含差异与富集 |
| 标准分析 | MVP + T7 + T8 | +4–5 | 可支撑组间比较课题 |
| 完整版 | 标准 + T11 + T12 | +4–6 | 签名库 + 多组学 |
| 可选 | T9 | +3–4 | mRNA/lncRNA 二期 |
含 Web 门户、权限、可视化大屏:整体 ×1.5–2;含 CI/CD 与容器化:+3–4 人周。
3. 蛋白组分析平台
3.1 模块总览
| 序号 | 模块 | 优先级 |
|---|---|---|
| P1 | 质谱原始数据 / 搜库结果接入 | P0 |
| P2 | 蛋白鉴定 QC | P0 |
| P3 | 外泌体标志蛋白面板验证 | P0 |
| P4 | 无标记定量与蛋白矩阵 | P0 |
| P5 | 污染蛋白 / 高丰度蛋白过滤 | P0 |
| P6 | 缺失值、归一化与批次校正 | P0 |
| P7 | 差异蛋白分析 | P1 |
| P8 | 功能富集与通路分析 | P1 |
| P9 | 蛋白互作网络 | P2 |
| P10 | 自动化 QC 报告 | P0 |
| P11 | 与转录组 / miRNA 关联 | P1 |
| P12 | 与物理指标(NTA/Western)元数据联动 | P1 |
P1 质谱原始数据 / 搜库结果接入
| 项目 | 内容 |
|---|---|
| 要解决的问题 | 统一不同搜库引擎输出;样本-运行-文件对应关系清晰 |
| 主流方法 | MaxQuant proteinGroups.txt / FragPipe/MSFragger + IonQuant;mzTab;ProteomeDiscoverer 导出;SDRF 样式元数据 |
| 技术难点 | 搜库参数(FDR、酶切、修饰)不一致导致跨批次不可比;DDA vs DIA 定量口径不同 |
| 预估开发 | 2–2.5 人周(MaxQuant + 一种 DIA 流程) |
P2 蛋白鉴定 QC
| 项目 | 内容 |
|---|---|
| 要解决的问题 | 鉴定数过少、搜库质量差、伪蛋白进入下游;评估实验是否成功 |
| 主流方法 | 蛋白/肽段数、覆盖度、Andromeda/Percolator 分数分布;FDR ≤ 1% 过滤;每样鉴定数、肽段数箱线图 |
| 技术难点 | 外泌体总蛋白量低,鉴定数天然低于全细胞裂解;复杂基质(血浆)动态范围极大 |
| 预估开发 | 1.5 人周 |
P3 外泌体标志蛋白面板验证
| 项目 | 内容 |
|---|---|
| 要解决的问题 | 蛋白层面确认样品含典型 EV 标志、排除非 EV 污染 |
| 主流方法 | 检测 CD63、CD9、CD81、TSG101、Alix、HSP70 等(EV-TRACK / MISEV 指南);四跨膜蛋白共现评分;与阴性对照比 |
| 技术难点 | 无单一金标准蛋白;MV/lipoprotein 共分离;低丰度时标志蛋白未鉴定不等于不存在(需 Western 补证) |
| 预估开发 | 1.5–2 人周(面板配置 + 评分规则) |
P4 无标记定量与蛋白矩阵
| 项目 | 内容 |
|---|---|
| 要解决的问题 | 生成样品 × 蛋白定量矩阵,供 QC 比较与差异分析 |
| 主流方法 | LFQ(label-free quantification,MaxQuant LFQ);DIA:DirectDIA / OpenSWATH / DIA-NN;iBAQ 仅作组成参考 |
| 技术难点 | EV 蛋白动态范围宽;低输入导致 LFQ 缺失率高;DIA 谱库构建依赖样品组成 |
| 预估开发 | 2–3 人周(接 P1 引擎输出) |
P5 污染蛋白 / 高丰度蛋白过滤
| 项目 | 内容 |
|---|---|
| 要解决的问题 | 血浆 白蛋白、载脂蛋白、核内蛋白、角蛋白(实验污染)干扰 EV 蛋白谱解读 |
| 主流方法 | CRAP 污染库;Plasma Proteome Database 高丰度列表;EV-TRACK 非 EV 蛋白清单;自定义实验室黑名单 |
| 技术难点 | 血浆 EV 与 lipoprotein 物理共分离;过度过滤误删真实 cargo;细胞培养 FBS 蛋白背景 |
| 预估开发 | 1.5 人周 |
P6 缺失值、归一化与批次校正
| 项目 | 内容 |
|---|---|
| 要解决的问题 | MNAR(missing not at random)缺失;运行间系统偏差 |
| 主流方法 | 过滤:至少 n 个样品非缺失;插补:MinProb / QRILC / kNN(谨慎);归一化:median / VSN / Quantile;批次:ComBat / limma removeBatchEffect |
| 技术难点 | 外泌体低丰度蛋白 MNAR 为主,插补易引入假差异;小样本 ComBat 不稳定 |
| 预估开发 | 2–2.5 人周 |
P7 差异蛋白分析
| 项目 | 内容 |
|---|---|
| 要解决的问题 | 组间显著变化蛋白;控制多重检验 |
| 主流方法 | limma;MSstats / MSqRob2(专用于质谱);t 检验 + FDR(大样本);火山图 / 热图 |
| 技术难点 | 重复数少时方差不稳;离群运行;需与 P5 过滤策略联动避免「去污染=去信号」 |
| 预估开发 | 1.5–2 人周 |
P8 功能富集与通路分析
| 项目 | 内容 |
|---|---|
| 要解决的问题 | 差异蛋白参与的 GO、KEGG、Reactome 通路;解释生物学主题 |
| 主流方法 | clusterProfiler / DAVID / g:Profiler;GSEA(预排序);外泌体相关通路(膜运输、ESCRT、融合)关注 |
| 技术难点 | 鉴定数少时富集 power 不足;膜蛋白 / 脂质结合蛋白注释偏倚 |
| 预估开发 | 1.5 人周 |
P9 蛋白互作网络(可选)
| 项目 | 内容 |
|---|---|
| 要解决的问题 | 差异蛋白间的互作模块;候选 hub 蛋白 |
| 主流方法 | STRING / BioGRID;Cytoscape 导出;模块聚类 |
| 技术难点 | EV 蛋白组覆盖度有限,网络不完整;高丰度污染蛋白成为假 hub |
| 预估开发 | 1–1.5 人周(二期) |
P10 自动化 QC 报告
| 项目 | 内容 |
|---|---|
| 要解决的问题 | 统一交付鉴定摘要、标志蛋白面板、污染评估、重复性、合格建议 |
| 主流方法 | 模板化 HTML/PDF;与 MISEV2023 检查项对齐;联动 P2–P5 图表 |
| 技术难点 | 与转录组报告风格统一;「蛋白 QC 通过但 miRNA 不通过」的联合判读逻辑 |
| 预估开发 | 2 人周 |
P11 与转录组 / miRNA 关联
| 项目 | 内容 |
|---|---|
| 要解决的问题 | miRNA 下调/上调与靶蛋白是否呼应;多组学一致性评分 |
| 主流方法 | 样品配对;miRNA-靶 mRNA-蛋白三角;Spearman 相关;multiOmics 包 / 自定义网络 |
| 技术难点 | 蛋白半衰期与 miRNA 时序不同步;靶预测假阳性;两组学独立批次 |
| 预估开发 | 2–3 人周(与 T12 协同开发) |
P12 与物理指标元数据联动
| 项目 | 内容 |
|---|---|
| 要解决的问题 | NTA 粒径/浓度、Western、电镜 与组学 QC 三角验证(对齐 miRNA-03 §6) |
| 主流方法 | 元数据表字段:NTA 峰径、颗粒浓度、Western 条带强度(半定量);报告内嵌「组学-物理」一致性段落 |
| 技术难点 | 物理指标手工录入易错;NTA 与 EV 身份不等价;多源数据时间戳对齐 |
| 预估开发 | 1–1.5 人周 |
3.2 蛋白组平台开发周期汇总
| 阶段 | 包含模块 | 预估(人周) | 说明 |
|---|---|---|---|
| MVP(QC 闭环) | P1–P6 + P10 + P12 | 14–18 | 鉴定、标志物、污染、定量、报告 |
| 标准分析 | MVP + P7 + P8 | +3–4 | 差异 + 富集 |
| 完整版 | 标准 + P9 + P11 | +3–4.5 | 网络 + 多组学 |
| DIA 分支 | 若并行支持 DDA + DIA | +3–5 | 谱库与定量引擎额外分支 |
4. 多组学联合与项目级排期
4.1 联合判读逻辑(平台应内置)
| 场景 | 转录组信号 | 蛋白组信号 | 建议判定 |
|---|---|---|---|
| 理想 | miRNA% 高、签名一致 | 四跨膜蛋白阳性、污染低 | 合格 |
| 空囊泡疑云 | miRNA 谱弱但颗粒有 | 标志蛋白有、RNA 低 | 边缘,建议补 Bioanalyzer |
| 制备污染 | rRNA/tRNA 高 | 胞内/血浆污染蛋白高 | 不合格 |
| 溶血/血小板 | miR-451 等升高 | 血红蛋白相关肽段(若有) | 标注干扰,降级结论 |
4.2 推荐实施顺序
与 miRNA-14 对齐:先转录组 MVP,后蛋白组 MVP,整合置于两线 QC 闭环之后。
1 | Phase 0(2–3 月) 公共模块 + 元数据规范 + SOP 阈值定稿 |
| 里程碑 | 交付物 | 累计预估 |
|---|---|---|
| M1 | 双平台 QC 闭环 + 单样报告 | ~14–16 人周(并行可日历 8–10 周) |
| M2 | 组间差异 + 标准项目模板 | ~20–24 人周 |
| M3 | 多组学联合 + 参考库 | ~26–30 人周 |
以上为纯分析流水线 + 报告;不含质谱搜库 HPC 集群运维、LIMS 商用采购、临床注册验证。
5. 风险与依赖
| 风险 | 影响 | 缓解 |
|---|---|---|
| SOP 阈值未在项目启动前定稿 | QC 自动判定缺乏依据 | Phase 0 用标定样集(合格/边缘/不合格)校准 |
| 仅有 sRNA-seq 无蛋白组 | 多组学模块闲置 | 先交付转录组 MVP,蛋白组接口预留 schema |
| 搜库引擎单一 | 合作方数据格式不兼容 | P1 抽象统一蛋白矩阵层 |
| 临床样本合规 | 签名库不能出域 | 脱敏 ID + 权限分级 |
小结
- 转录组平台以外泌体 sRNA-seq/miRNA-seq 质控为核心(T2–T6、T10),再扩展差异、富集与签名库;MVP 约 12–16 人周。
- 蛋白组平台以 LC-MS/MS 鉴定-QC-标志物-污染-定量为主线(P1–P6、P10);MVP 约 14–18 人周。
- 两平台并行、共享样本元数据时,日历时间可压缩至 8–10 周 交付 QC 闭环;多组学联合建议放在 Phase 3。
- 阈值与合格规则须与实验 SOP 同步,并参照
miRNA-03与 MISEV2023 指南汇总 迭代。
后续可扩展:具体流水线命令与 WDL/Nextflow 编排(待补)。