偏相关(partial correlation)度量在控制第三变量(或变量集)后,两变量间的相关;相关矩阵汇总多变量两两相关,是特征选择与共线性诊断的基础。
段末注释:共线性(collinearity)指自变量间高度相关,使回归系数不稳定。
系列:01 总论 | 多重比较:Math-01-20
1. 为什么需要偏相关(D1)

$X$ 与 $Y$ 相关可能因共同受 $Z$ 驱动(混杂)。偏相关 $r_{XY \cdot Z}$ 控制 $Z$ 后剩余关联。
2. 偏相关公式(D2–D3)

简单偏相关(控制单个 $Z$):
$$
r_{XY \cdot Z} = \frac{r_{XY} - r_{XZ} r_{YZ}}{\sqrt{(1-r_{XZ}^2)(1-r_{YZ}^2)}}
$$
多变量控制可用相关矩阵求逆(精度矩阵)或 pingouin.partial_corr。
3. 相关矩阵(D4)
$p$ 个变量 → $p \times p$ 对称矩阵 $\mathbf{R}$,对角为 1。
| 任务 | 方法 |
|---|---|
| 可视化 | 热图(heatmap) |
| 显著性 | 每对 $H_0:\rho=0$;$m=p(p-1)/2$ 次检验 |
| 多重比较 | BH FDR |
| 置信区间 | Fisher $z$ 变换 |
4. 适用场景(D5–D7)

| 场景 | 用法 |
|---|---|
| biomarker 控制年龄/性别 | 偏相关 |
| 基因共表达网络 | 相关矩阵 + FDR |
| ML 特征筛选 | $ |
| 共线性诊断 | $ |
5. 局限与误用(D8)

| 问题 | 说明 |
|---|---|
| $p$ 大 $n$ 小 | 矩阵奇异;需 $n>p$ 或正则化 |
| 不校正多重 | 假阳性基因对 |
| 偏相关≠因果 | 仍可能有未测混杂 |
| 仅线性 | 非线性用距离相关 / MIC |
| 相关筛选泄漏 | ML 应用 train 集内做 |
6. 示例代码
1 | import numpy as np |
7. 小结
- 偏相关剔除混杂;相关矩阵 + FDR 用于多变量筛选。
- 特征选择见 相关分析-相关系数;ML 注意数据泄漏。
系列导航:02 Pearson | 00 规划