本文汇总 Math-00 数学分布 系列中各分布之间的极限与近似关系,回答「何时可用简单分布替代复杂分布」——这是选择检验方法、样本量规划与近似推断的理论依据。
段末注释:CLT(central limit theorem)为中心极限定理;LLN(law of large numbers)为大数定律。
读前说明:本篇为关系专论,不对应单一分布的 PMF/PDF;下文给出核心极限公式。系列:00 规划 | 01 总论。
1. 为什么需要极限近似

精确计算往往复杂:二项 PMF 含组合数、小样本 $t$ 检验用精确分布。当 $n$ 大或参数满足条件时,极限分布给出闭式近似,计算更快、与经典检验直接对接。
2. 收敛类型
| 类型 | 符号 | 含义 |
|---|---|---|
| 依分布收敛 | $X_n \xrightarrow{d} X$ | CDF 点点收敛 |
| 依概率收敛 | $X_n \xrightarrow{p} \mu$ | LLN |
| 几乎必然 | $X_n \xrightarrow{a.s.} \mu$ | 强 LLN |
实务中「$n$ 足够大时近似成立」指依分布收敛。
3. 核心极限公式

3.1 二项 → 泊松
若 $X_n \sim \mathrm{Binomial}(n, p_n)$,$np_n \to \lambda$($n \to \infty$,$p_n \to 0$):
$$
X_n \xrightarrow{d} \mathrm{Poisson}(\lambda)
$$
经验法则:$n \ge 20$ 且 $p \le 0.05$,或 $np < 10$ 时 Poisson 近似可用。→ 11.二项、12.泊松
3.2 二项 → 正态(de Moivre–Laplace)
$n$ 大,$np$ 与 $n(1-p)$ 均 $\ge 5$:
$$
\frac{X - np}{\sqrt{np(1-p)}} \xrightarrow{d} \mathcal{N}(0,1)
$$
→ 20.正态
3.3 泊松 → 正态
$\lambda$ 大(常 $\lambda \ge 10$):
$$
\frac{X - \lambda}{\sqrt{\lambda}} \approx \mathcal{N}(0,1)
$$
3.4 中心极限定理(CLT)
i.i.d. $X_i$,$\mathbb{E}[X_i]=\mu$,$\mathrm{Var}(X_i)=\sigma^2$:
$$
\frac{\bar{X}_n - \mu}{\sigma/\sqrt{n}} \xrightarrow{d} \mathcal{N}(0,1)
$$
3.5 t → 正态
$\nu \to \infty$:$t_\nu \xrightarrow{d} \mathcal{N}(0,1)$。→ 27.t
3.6 其他
| 关系 | 条件 |
|---|---|
| $\chi^2_\nu$ → 正态 | $\nu$ 大 |
| $\mathrm{Binomial} \to \mathrm{Beta}$ | 贝叶斯极限 |
| 几何 → 指数 | 连续化等待时间 |
4. 数字特征在极限下的传递
| 源分布 | 极限 | 期望/方差 |
|---|---|---|
| Bin($n,p$) | Po($\lambda$) | $np \to \lambda$,$np(1-p) \to \lambda$ |
| Bin($n,p$) | Normal | $\mu=np$,$\sigma^2=np(1-p)$ |
| Po($\lambda$) | Normal | $\mu=\sigma^2=\lambda$ |
| $\bar{X}_n$ | Normal | $\mu$ 不变,$\mathrm{Var}(\bar{X}_n)=\sigma^2/n$ |
5. 分布族关系图

1 | Bernoulli(p) |
6. 前提假设(各近似通用)
每种极限/近似都有独立前提,使用前须逐条核对:
| 近似 | 核心前提 | 常见失效 |
|---|---|---|
| 二项 → 泊松 | $n\to\infty,,p\to 0,,np\to\lambda$ | $n$ 小或 $p$ 不小 |
| 二项 → 正态 | $n$ 大,$np$ 与 $n(1-p)$ 均 $\ge 5$(经验) | $p$ 极端小样本 |
| 泊松 → 正态 | $\lambda$ 大 | $\lambda$ 小 |
| $t$ → 正态 | $\nu\to\infty$ | 小 $\nu$ 厚尾 |
| 超几何 → 二项 | $N\gg n$ | $n/N$ 大 |
| CLT | i.i.d. 有限方差,$n$ 大 | 厚尾/强相关 |
段末注释:近似是计算便利而非理论替代;边界情形应优先精确分布或模拟。
7. 适用场景
| 场景 | 用哪种近似 |
|---|---|
| 稀有事件计数 | Bin → Poisson |
| 大样本比例 Z 检验 | Bin → Normal |
| RNA-seq 大 $\lambda$ 基因 | Poisson → Normal |
| 样本均值置信区间 | CLT → Normal |
| 小样本 $\sigma$ 未知 | 用 t,勿强行 Normal |
8. 局限与误用

| 误用 | 后果 |
|---|---|
| $np$ 过小仍用正态 | 比例检验 I 类错误失真 |
| Poisson 过离散仍用 Poisson | 低估方差 → 假阳性 |
| 偏态/重尾用 CLT | $n$ 需更大;或改用 bootstrap |
| 小 $\nu$ 用 Z 代替 t | 置信区间过窄 |
| 忽略连续性校正 | 离散→连续近似偏差 |
连续性校正(二项→正态):
$$
P(X \le k) \approx \Phi\left(\frac{k + 0.5 - np}{\sqrt{np(1-p)}}\right)
$$
9. 何时用精确 vs 近似
| 条件 | 建议 |
|---|---|
| $n \le 30$,$p$ 近 0/1 | 精确二项 |
| $np < 5$ 或 $n(1-p) < 5$ | 精确二项或 Poisson |
| $n$ 大,$0.1 < p < 0.9$ | 正态近似 + 连续性校正 |
| $\sigma$ 未知,$n$ 小 | t 检验 |
| 任意分布,$n$ 大 | CLT 用于 $\bar{X}$ |
10. 数值演示
场景:比较 Bin(100, 0.05) 与 Poisson(5)、Normal(5, 4.75) 的 PMF/CDF。
1 | import numpy as np |
11. 小结
- Bin → Po → Normal 是离散计数最常用的近似链;条件为 $np$、$\lambda$ 足够大。
- CLT 保证样本均值渐近正态;t 是小样本 $\sigma$ 未知的修正。
- 近似前检查条件;不满足时用精确检验或 bootstrap。
参考文献
- Feller W. An Introduction to Probability Theory and Its Applications.
- scipy.stats 各分布文档