高通量 B 细胞受体(B cell Receptor,BCR)/ T 细胞受体(T cell Receptor,TCR)测序(AIRR-seq)会产出海量 V(D)J 重排序列。不同实验室、注释工具、公共数据库若各用各的列名与语义,数据就难以合并与复现。AIRR(Adaptive Immune Receptor Repertoire,适应性免疫受体组库)标准正是为解决这一问题:由 AIRR Community(The Antibody Society 下属研究社区)维护,定义组库数据的描述、存储与共享规范。
段末注释:AIRR 一词既指生物学上的「组库」本身,也指该社区发布的数据标准;下文未特别说明时,「AIRR 格式」指数据标准。
权威文档:AIRR Community Documentation
1. AIRR 是什么:两层含义
1.1 生物学含义
适应性免疫受体组库指某个体、某组织或某时间点下,由 BCR(含抗体可变区) 与 TCR 组成的 全部 V(D)J 重排序列集合。每条链来自胚系 V、D、J 片段的重组,CDR3 区高度多样,组库规模可从 $10^3$ 到 $10^8$ 条不等。
1.2 数据标准含义
AIRR Standards 是一套开放规范,使注释结果、研究元数据与公共库之间可互操作。主要组件包括:
| 组件 | 作用 |
|---|---|
| MiAIRR | 研究/reporting 最小信息集:样本、建库、测序、分析流程等元数据 |
| Rearrangement Schema | 单条 V(D)J 注释记录的标准字段(最常用) |
| AIRR Data Model | 组库、样本、 repertoire 等对象间的关系 |
| AIRR Data Commons | 公共组库数据的提交、查询与下载 API |
| Reference software | 读写、校验 AIRR 格式数据的参考实现 |
2. Rearrangement:核心数据对象
Rearrangement(重排) 在标准中指:一条已完成 V(D)J 注释的 BCR/TCR 链序列,以及与之关联的全套注释。注释按 8 类 组织:

| 类别 | 英文 | 典型内容 |
|---|---|---|
| 输入 | Input | 原始 sequence、质量值等 |
| 标识 | Identifiers | sequence_id,用于跨表/跨库关联 |
| 主注释 | Primary Annotations | locus、v_call、d_call、j_call、productive、junction |
| 比对注释 | Alignment Annotations | 与胚系的比对序列、CIGAR、得分、E-value |
| 比对位置 | Alignment Positions | 各基因在 query/germline 上的起止坐标 |
| 区域序列 | Region Sequence | fwr1…fwr4、cdr1…cdr3 序列片段 |
| 区域位置 | Region Positions | 各 FR/CDR 在序列上的起止 |
| Junction 长度 | Junction Lengths | junction 子区长度 |
官方定义:Rearrangement Schema
3. 文件格式约定(TSV)
Rearrangement 数据通常存为 制表符分隔(TSV) 文件,扩展名 .tsv。
3.1 结构
1 | sequence_id sequence rev_comp productive v_call d_call j_call ... |
- 首行:列名(header),字段名使用
snake_case - 数据行:一条 Rearrangement 一行
- 无引号:字段值不应加引号;值内不得含制表符或换行
3.2 编码与类型
| 规则 | 说明 |
|---|---|
| 编码 | ASCII 或 UTF-8 |
| 布尔值 | T = true,F = false |
| 空值 | 空字符串 ""(required 列也必须存在,但值可为空) |
| 坐标 | 1-based 闭区间,与 IMGT/INSDC 一致,不用 </> 部分坐标 |
3.3 Required 列
Schema 规定若干列 必须在 header 中出现(值仍可为空),例如:
| 字段 | 含义 |
|---|---|
sequence_id |
查询序列唯一 ID |
sequence |
输入核苷酸序列(常为未修饰的 query) |
rev_comp |
是否相对输入做了反向互补 |
productive |
是否预测为有效(可表达)重排 |
v_call / d_call / j_call |
V、D、J 胚系基因及等位基因 |
sequence_alignment / germline_alignment |
比对后的 query 与胚系序列 |
junction / junction_aa |
Junction 区核酸/氨基酸序列 |
完整字段列表(含 optional)见 官方 Fields 表。
3.4 自定义列
工具可在 TSV 中增加 不与标准字段同名的自定义列(建议仍用 snake_case)。例如 RIOT 的 conserved_C23_present 等验证标志即属扩展。
4. 关键概念辨析
4.1 Junction 与 CDR3
标准采用 IMGT 定义:
junction/junction_aa:CDR3 加上 两侧保守的 Cys(半胱氨酸)/ Trp(色氨酸)或 Phe(苯丙氨酸)密码子cdr3_start/cdr3_end等坐标:不含 上述两个保守残基
因此 junction 序列通常比「狭义 CDR3 环」两端各多 1 个保守氨基酸。
4.2 Productive(有效重排)
Schema 未强制唯一算法,推荐采用 IMGT 定义,需同时满足:
- 编码区为开放阅读框(Open Reading Frame,ORF)
- 起始密码子、剪接位点、调控元件无缺陷
- 无内部终止密码子
- Junction 区读框正确(in-frame)
对应字段:productive(T/F)、常配合 stop_codon、vj_in_frame、v_frameshift 等辅助判断。
4.3 Locus 与基因命名
locus:链/座位类型,推荐 IMGT 命名,如IGH、IGK、IGL、TRA、TRB、TRD、TRGv_call等:推荐与所用胚系库 nomenclature 一致,如IGHV4-59*01
4.4 CIGAR 字符串
V/D/J 比对细节用 SAM 风格 CIGAR 表示(M、I、D、S、N、=、X 等),参考序列为对应基因的 germline。详见 官方 CIGAR 说明。
5. 与相关标准/工具的关系
| 体系 | 关系 |
|---|---|
| IMGT | 编号、locus、junction/CDR3 语义与 IMGT 对齐;v_call 常写 IMGT 等位基因名 |
| MiAIRR | 描述「这一组 Rearrangement 来自哪项研究、哪份样本」;Rearrangement TSV 是序列级注释表 |
| ANARCI | 输出 (位点, aa) 列表,不原生组织为 AIRR TSV |
| RIOT(riot-na) | 输出 AirrRearrangementEntryNT/AA,为 AIRR Rearrangement 的裁剪扩展 |
| Immcantation | R/Bioconductor 生态,常用 AIRR 兼容 TSV 作为输入 |
| AIRR Data Commons | 公共组库入库与查询入口 |
抗体工具选型可参考:抗体-04.工具-06 IMGT/ANARCI/RIOT 对比。
6. 最小可读示例(概念)
下列为说明用简化行,非完整 required 列集:
1 | sequence_id sequence rev_comp productive v_call d_call j_call junction junction_aa locus |
解读要点:
productive=T:预测可表达;F可能含终止码或移码d_call=.(空):轻链或无 D 基因参与时 D 为空junction:含 CDR3 及 flanking 保守残基对应序列
7. 查阅与实现
| 资源 | 链接 |
|---|---|
| 标准总览 | docs.airr-community.org |
| Rearrangement Schema | Rearrangements |
| MiAIRR 报告规范 | Study Reporting |
| 参考实现(Python/R) | Software Libraries |
| 规范源码 | airr-community/airr-standards |
参考文献
- AIRR Community. AIRR Community Documentation
- Vander Heiden J.A. et al. AIRR Community recommendations for sharing immune-repertoire sequencing data. Nature Immunology (2017)
- Christley S. et al. The ADC API: A Web API for the Programmatic Query and Download of Data from the AIRR Data Commons. Frontiers in Big Data (2020)