抽样分布(sampling distribution)描述统计量(如 $\bar{X}$、$S^2$)在重复抽样下的概率规律,是连接样本数据与 正态、t、卡方、F 的理论桥梁——检验的临界值来自抽样分布,而非原始数据分布。
段末注释:统计量(statistic)是由样本计算的函数,不含未知参数;参数(parameter)描述总体。
读前说明:本篇为推断衔接专论,下文给出核心抽样分布公式。系列:00 规划 | 前置:20.正态。
1. 产生背景与直观

同一总体反复抽 $n$ 个样本,每次算 $\bar{X}$,$\bar{X}$ 的值会波动——其分布叫 $\bar{X}$ 的抽样分布。原始数据可能偏态,但 $\bar{X}$ 在大 $n$ 下常近正态(CLT)。
2. 基本设定
设 $X_1,\ldots,X_n$ i.i.d.,总体均值 $\mu$,方差 $\sigma^2$:
| 统计量 | 定义 |
|---|---|
| 样本均值 | $\bar{X} = \dfrac{1}{n}\sum_{i=1}^n X_i$ |
| 样本方差 | $S^2 = \dfrac{1}{n-1}\sum_{i=1}^n (X_i-\bar{X})^2$ |
| 标准化均值 | $Z = \dfrac{\bar{X}-\mu}{\sigma/\sqrt{n}}$ |
3. 核心抽样分布

3.1 正态总体:$\bar{X}$ 的分布
若 $X_i \sim \mathcal{N}(\mu, \sigma^2)$,则精确地:
$$
\bar{X} \sim \mathcal{N}\left(\mu,, \frac{\sigma^2}{n}\right)
$$
3.2 $\sigma$ 已知:Z 统计量
$$
Z = \frac{\bar{X}-\mu}{\sigma/\sqrt{n}} \sim \mathcal{N}(0,1)
$$
3.3 $\sigma$ 未知:t 统计量
$$
T = \frac{\bar{X}-\mu}{S/\sqrt{n}} \sim t_{n-1}
$$
→ 27.t 分布
3.4 样本方差与 $\chi^2$
正态总体下:
$$
\frac{(n-1)S^2}{\sigma^2} \sim \chi^2_{n-1}, \quad \bar{X} \perp S^2
$$
→ 26.卡方
3.5 两样本方差比:F 统计量
独立正态两样本,$S_1^2,S_2^2$ 为样本方差:
$$
F = \frac{S_1^2/\sigma_1^2}{S_2^2/\sigma_2^2} \sim F_{n_1-1,, n_2-1}
$$
→ 28.F 分布
4. 数字特征
| 统计量 | $\mathbb{E}$ | $\mathrm{Var}$(正态总体) |
|---|---|---|
| $\bar{X}$ | $\mu$ | $\sigma^2/n$ |
| $S^2$ | $\sigma^2$ | $2\sigma^4/(n-1)$ |
$\bar{X}$ 的标准误(standard error):$\mathrm{SE}(\bar{X}) = \sigma/\sqrt{n}$,估计为 $s/\sqrt{n}$。
5. 分布关系链
| 链条 | 说明 |
|---|---|
| CLT | 任意总体,$n$ 大:$\bar{X}$ 近似 $\mathcal{N}(\mu,\sigma^2/n)$ → 40.极限 |
| Z → t | 用 $S$ 替 $\sigma$ → 重尾 t |
| $\chi^2$ + Z → t | $T = Z/\sqrt{V/(n-1)}$ |
| 两个 $\chi^2$ → F | 方差比 |
| 多元 | Hotelling $T^2$ → 30.多元正态 |
6. 前提假设
以下假设针对由样本统计量诱导的抽样分布:
| 假设 | 含义 | 违背时 |
|---|---|---|
| 总体正态(精确) | $X_i\sim N(\mu,\sigma^2)$ 时 $\bar X,\ s^2$ 的精确分布 | 非正态 → CLT 近似或 Bootstrap |
| i.i.d. 简单随机样本 | 观测独立同分布 | 复杂抽样 → 设计校正 |
| 两样本独立 | 双样本 $t$/F 中两组独立 | 配对 → 配对 $t$ |
| CLT 大样本(近似) | $n$ 足够大时 $\bar X$ 近似正态 | 小样本偏态 → 精确/非参数 |
段末注释:抽样分布是连接总体分布与 Math-01 显著性检验 的桥梁。
7. 适用场景

| 场景 | 抽样分布 |
|---|---|
| 单样本 t 检验 | $T \sim t_{n-1}$ |
| 置信区间 | $\bar{X} \pm t_{\alpha/2}, s/\sqrt{n}$ |
| ANOVA 方差分析 | F 统计量 |
| QC 重复性 | $\bar{X}$ 的控制图限 |
| 功效分析 | 基于 $\bar{X}$ 分布定 $n$ |
8. 局限与误用

| 问题 | 说明 |
|---|---|
| $n$ 小 + 非正态 | t 区间覆盖不足 |
| 非独立样本 | 抽样分布公式失效 |
| $\sigma$ 已知却用 t | 保守但可接受 |
| 多次 peeking | 反复看数据 → 假阳性膨胀 |
| 混淆数据与抽样分布 | 对原始 $X_i$ 做 t 检验 vs 对 $\bar{X}$ 的分布 |
9. 推断要点
9.1 单样本均值
$H_0: \mu=\mu_0$,$\sigma$ 未知:
$$
T = \frac{\bar{X}-\mu_0}{S/\sqrt{n}} \sim t_{n-1} \quad \text{(在 } H_0 \text{ 下)}
$$
9.2 与 Math-01 衔接
完整检验步骤见 Math-01 显著性检验 与 两组数据差异显著性检验。
10. 示例与代码
场景:模拟正态总体,验证 $\bar{X}$ 分布与 $T$ 统计量。
1 | import numpy as np |
11. 小结
- 抽样分布回答「统计量在重复抽样下如何波动」。
- 正态总体:$\bar{X}$ 正态、$(n-1)S^2/\sigma^2$ 卡方、$T$ 为 t;两样本方差比为 F。
- CLT 将 $\bar{X}$ 的近似正态推广到非正态总体($n$ 大)。
参考文献
- Casella G., Berger R. Statistical Inference.
- scipy.stats.t