Student t 分布(t-distribution)是小样本、总体方差未知时对样本均值进行推断的参考分布,t 检验的统计量即在 $H_0$ 下服从该分布。
段末注释:t 检验(t-test)比较样本均值与假设值或两组均值差异,$\sigma$ 未知时用 t 分布确定临界值。
读前说明:连续分布,下文给出 PDF。系列:00 规划 | 前置:20.正态。
1. 产生背景与直观

1908 年威廉·戈塞特(笔名 Student)在吉尼斯啤酒厂研究小样本质量:总体 $\sigma$ 未知时,用样本标准差 $s$ 标准化均值,统计量不再服从标准正态,而呈更重尾的 t 分布。直觉:
- 仅 5~10 次重复实验估计酶活均值
- $\sigma$ 用 $s$ 估计带来的额外不确定性
2. 定义与参数
$T \sim t(\nu)$($\nu$ 为自由度,degrees of freedom):
| 要素 | 内容 |
|---|---|
| 支撑集 | $(-\infty, +\infty)$ |
| 参数 | $\nu > 0$(常为整数,也可推广到实数) |
构造(与正态、卡方的关系):
$$
T = \frac{Z}{\sqrt{V/\nu}}, \quad Z \sim \mathcal{N}(0,1),; V \sim \chi^2_\nu,; Z \perp V
$$
3. PDF 与 CDF

3.1 PDF
$$
f(t) = \frac{\Gamma\left(\frac{\nu+1}{2}\right)}{\sqrt{\nu\pi},\Gamma\left(\frac{\nu}{2}\right)} \left(1 + \frac{t^2}{\nu}\right)^{-\frac{\nu+1}{2}}
$$
3.2 性质
- 对称,单峰,均值 0($\nu > 1$),方差 $\dfrac{\nu}{\nu-2}$($\nu > 2$)
- $\nu \to \infty$ 时 $t(\nu) \to \mathcal{N}(0,1)$
- 尾部比正态更厚 → 小样本推断更保守
3.3 CDF / 分位数
用 scipy.stats.t.cdf / ppf;双侧 95% 临界值 $t_{0.975,,\nu}$。
4. 数字特征
| $\nu$ | 方差 | 与正态对比 |
|---|---|---|
| 1 | 不存在(Cauchy 特例) | 极重尾 |
| 2 | $\infty$ | 仍很重尾 |
| 5 | $5/3 \approx 1.67$ | 明显厚尾 |
| 30 | $\approx 1.07$ | 接近 $\mathcal{N}(0,1)$ |
| $\infty$ | 1 | 标准正态 |
5. 与其他分布的关系
| 关系 | 说明 |
|---|---|
| 正态 | $\nu \to \infty$ 极限为 $\mathcal{N}(0,1)$ → 20.正态 |
| Cauchy | $t(1)$ 即标准柯西分布 |
| F 分布 | $F = \dfrac{t_1^2/\nu_1}{t_2^2/\nu_2}$(独立 t 平方比) |
| 样本均值 | $n$ 个 $\mathcal{N}(\mu,\sigma^2)$ 样本,$\dfrac{\bar{X}-\mu}{s/\sqrt{n}} \sim t(n-1)$ |
| 贝叶斯 | 正态–逆 Gamma 后验预测 t |
6. 前提假设
| 假设 | 含义 | 违背时 |
|---|---|---|
| 正态总体 | $X_i\stackrel{\mathrm{i.i.d.}}{\sim}N(\mu,\sigma^2)$ | 厚尾/偏态 → 非参数/稳健 |
| i.i.d. 样本 | 观测独立同分布 | 配对/重复测量 → 配对 $t$ |
| $\sigma$ 未知 | 用样本标准差 $s$ 估计 | $\sigma$ 已知大样本 → 正态/Z |
| 简单随机抽样 | 无系统偏倚 | 复杂设计 → 校正/混合模型 |
段末注释:$\nu\to\infty$ 时 $t$ 趋近标准正态;双样本 $t$ 还需方差齐性(或 Welch 修正)。
7. 适用场景

| 场景 | 示例 |
|---|---|
| 单样本 t 检验 | 酶活均值 vs WT($\sigma$ 未知) |
| 双样本 t 检验 | 两组突变体活性比较 |
| 配对 t 检验 | 处理前后同一批样品 |
| 回归系数 | $\hat{\beta}_j$ 的 t 统计量 |
| 置信区间 | $\bar{x} \pm t_{\alpha/2,,n-1}, s/\sqrt{n}$ |
8. 局限与误用

| 误用 | 后果 |
|---|---|
| 数据严重非正态仍用 t | I 类错误率失真;用非参或变换 |
| 方差不齐仍用合并 t | 用 Welch t |
| 多次检验不校正 | 假阳性膨胀 |
| $n$ 很大仍纠结 t vs Z | 二者几乎等价,Z 可接受 |
| 忽略配对结构用独立 t | 检验功效下降 |
9. 参数估计与推断
9.1 自由度
单样本:$\nu = n - 1$;两样本合并:$\nu = n_1 + n_2 - 2$;Welch:Satterthwaite 近似。
9.2 t 检验
单样本统计量:
$$
t = \frac{\bar{x} - \mu_0}{s / \sqrt{n}} \sim t(n-1) \quad \text{(在 } H_0: \mu=\mu_0 \text{ 下)}
$$
详见 两组数据差异显著性检验、Math-01.显著性检验-02.t检验(规划)。
10. 示例与代码
场景:突变组 8 个酶活 vs 对照假设 $\mu=1$;配对与独立双样本。
1 | import numpy as np |
11. 小结
- $t(\nu)$:正态除以 $\sqrt{\chi^2/\nu}$;厚尾,小样本均值推断基准。
- $\nu = n-1$ 时对应单样本 t;$\nu \to \infty$ → 正态。
- 使用前检查正态性与方差齐性;非正态考虑 Welch 或非参。
系列导航:20.正态 | Math-01 显著性检验
参考文献
- Student. The Probable Error of a Mean. Biometrika 1908.
- scipy.stats.t