本页为 Math-00 数学分布 子系列的总论,建立阅读后续各分布专篇的公共语言。单分布写作结构见 00.系列规划。
段末注释:随机变量(random variable)将随机试验结果映射为实数的函数,记 $X$;PMF/PDF/CDF 分别描述离散/连续/通用的概率规律。
1. 随机变量与分布函数
1.1 离散 vs 连续
| 类型 | 取值 | 概率描述 | 典型分布 |
|---|---|---|---|
| 离散 | 可数点 | PMF $P(X=x)$ | 伯努利、二项、泊松、几何、多项 |
| 连续 | 区间 | PDF $f(x)$,$P(X=x)=0$ | 正态、均匀、Gamma、Beta、t |
1.2 累积分布函数 CDF
对任意随机变量:
$$
F(x) = P(X \le x)
$$
- 离散:$F(x) = \sum_{t \le x} P(X=t)$
- 连续:$F(x) = \int_{-\infty}^{x} f(t),\mathrm{d}t$
分位数 $x_p$ 满足 $F(x_p)=p$。详见 百分位数。
2. 数字特征
| 量 | 定义 | 直觉 |
|---|---|---|
| 期望 $\mathbb{E}[X]$ | $\sum x,P(X=x)$ 或 $\int x f(x)\mathrm{d}x$ | 长期平均 |
| 方差 $\mathrm{Var}(X)$ | $\mathbb{E}[(X-\mathbb{E}[X])^2]$ | 波动幅度 |
| 标准差 $\sigma$ | $\sqrt{\mathrm{Var}(X)}$ | 与 $X$ 同量纲 |
| 协方差 | $\mathrm{Cov}(X,Y)=\mathbb{E}[(X-\mu_X)(Y-\mu_Y)]$ | 两变量联动 |
3. 分布选型决策树(核心)

1 | 数据是什么类型? |
4. 已发布分布速查
| 篇号 | 分布 | 直觉(一句话) | 参数 | $\mathbb{E}$ | $\mathrm{Var}$ |
|---|---|---|---|---|---|
| 10 | Bernoulli | 单次抛硬币:只关心这一次是正面还是反面。 | $p$ | $p$ | $p(1-p)$ |
| 11 | Binomial | 固定抛 $n$ 次:问一共成功(正面)多少次? | $n,p$ | $np$ | $np(1-p)$ |
| 12 | Poisson | 固定窗口内计数:不关心「抛了多少次」,只问在时间/空间内稀有事件发生了多少次;二项在 $n\to\infty,,p\to 0,,np\to\lambda$ 时的极限。 | $\lambda$ | $\lambda$ | $\lambda$ |
| 13 | Geometric | 一直抛,等第 1 次成功:问首次成功时总共抛了多少次(或此前失败了多少次)? | $p$ | $(1-p)/p$ | $(1-p)/p^2$ |
| 14 | Neg. Binomial | 一直抛,等第 $r$ 次成功:问第 $r$ 次成功时总共抛了多少次(或此前失败了多少次)?亦可描述方差大于均值的过离散计数。 | $r,p$ | $r(1-p)/p$ | $r(1-p)/p^2$ |
| 15 | Multinomial | 固定抛 $n$ 次 $K$ 面骰:问各面分别出现几次?(二项向多分类推广) | $n,p_i$ | $np_i$ | $np_i(1-p_i)$ |
| 16 | Hypergeom. | 罐里 $N$ 球、$K$ 个红球,无放回抽 $n$ 个:问抽到几个红球?(有限总体修正) | $N,K,n$ | $nK/N$ | $np(1-p)\frac{N-n}{N-1}$ |
| 20 | Normal | 连续对称的钟形误差:大量独立微小扰动叠加,或样本均值的大样本近似。 | $\mu,\sigma^2$ | $\mu$ | $\sigma^2$ |
| 21 | Log-normal | 取对数后像正态的正值:浓度、酶活、表达量等右偏、只能为正的数据。 | $\mu,\sigma^2$* | — | — |
| 22 | Exponential | 等下一次事件还要多久:恒定发生率下的无记忆等待时间(连续版「几何」)。 | $\lambda$ | $1/\lambda$ | $1/\lambda^2$ |
| 23 | Uniform | 区间 $[a,b]$ 内任一点等可能:随机数引擎起点、有界参数的无信息先验。 | $a,b$ | $(a+b)/2$ | $(b-a)^2/12$ |
| 24 | Gamma | 等第 $k$ 次事件一共等了多久:多个独立指数等待时间之和;推广指数寿命模型。 | $\alpha,\beta$ | $\alpha/\beta$ | $\alpha/\beta^2$ |
| 25 | Beta | 成功概率 $p$ 本身不确定:在 $(0,1)$ 上描述对比例/概率的先验或后验信念。 | $\alpha,\beta$ | $\alpha/(\alpha+\beta)$ | — |
| 26 | Chi-square | $\nu$ 个标准正态的平方和:拟合优度、列联表等检验统计量的参考分布。 | $\nu$ | $\nu$ | $2\nu$ |
| 27 | t | 正态总体、$\sigma$ 未知:用样本标准差代替 $\sigma$ 后,均值推断的参考分布(比正态更厚尾)。 | $\nu$ | $0$ ($\nu>1$) | $\nu/(\nu-2)$ |
| 28 | F | 两个 $\chi^2$ 之比:比较两组方差、ANOVA 的参考分布。 | $d_1,d_2$ | $d_2/(d_2-2)$ | — |
| 29 | Weibull | 风险率可随时间变:$k=1$ 退化为指数;描述老化、磨损等非恒定失效强度。 | $k,\lambda$ | $\lambda\Gamma(1+1/k)$ | — |
| 30 | MVN | 多个变量联合钟形:均值向量 + 协方差矩阵刻画线性相关;边缘与条件仍为正态。 | $\boldsymbol{\mu},\boldsymbol{\Sigma}$ | $\boldsymbol{\mu}$ | $\boldsymbol{\Sigma}$ |
| 31 | $\bar{X}$(正态总体) | 样本自身的分布:从正态总体抽 $n$ 个,$\bar X$、$s^2$ 服从什么规律?(连接总体与检验) | $\mu,\sigma^2,n$ | $\mu$ | $\sigma^2/n$ |
*对数正态:$\mu,\sigma^2$ 为 $\log X$ 的正态参数。
5. 前提假设速查
选型分布前,先核对数据生成机制是否满足该分布的前提假设;各专篇 §6 有完整表格与违背时的替代分布。下表为系列级摘要:
| 篇号 | 分布 | 核心前提(摘要) |
|---|---|---|
| 10 | Bernoulli | 单次二元;$p$ 恒定 |
| 11 | Binomial | 固定 $n$;i.i.d.;同 $p$;有放回或 $N\gg n$ |
| 12 | Poisson | 独立;恒定 $\lambda$;固定窗口;等离散 |
| 13 | Geometric | 独立 Bernoulli;恒定 $p$;无上限;等首次成功 |
| 14 | Neg. Binomial | 过离散计数,或等待第 $r$ 次成功 |
| 15 | Multinomial | 固定 $n$;$K$ 类互斥;$p_i$ 恒定;独立 |
| 16 | Hypergeom. | 有限 $N$;已知 $K$;无放回 |
| 20 | Normal | 连续对称/钟形;推断时 i.i.d. 或 CLT |
| 21 | Log-normal | $X>0$;$\log X$ 近似正态 |
| 22 | Exponential | $X\ge 0$;无记忆;恒定风险率 |
| 23 | Uniform | 有界 $[a,b]$;等密度 |
| 24 | Gamma | $X>0$;独立指数和(经典构造) |
| 25 | Beta | $p\in(0,1)$;比例/概率的不确定性 |
| 26 | $\chi^2$ | 独立 $N(0,1)$ 平方和;检验统计量参考分布 |
| 27 | $t$ | 正态总体;i.i.d.;$\sigma$ 未知 |
| 28 | $F$ | 正态各组;方差齐;检验统计量参考分布 |
| 29 | Weibull | $X\ge 0$;可建模时变风险率 |
| 30 | MVN | 联合正态;$\boldsymbol\Sigma$ 正定 |
| 31 | 抽样分布 | 总体正态(精确)或 CLT;i.i.d. 样本 |
| 40 | 极限近似 | 各近似有独立条件(见专篇) |
| 50 | ML 损失 | 数据按声明分布 i.i.d. 生成 |
段末注释:前提假设(model assumptions)描述数据应如何产生分布才成立;局限与误用(各专篇 §8)说明假设失效后的后果与替代方案。
6. 极限关系(预告)
完整推导见 40.极限与近似关系:
| 收敛 | 条件 |
|---|---|
| Binomial → Poisson | $n \to \infty$, $p \to 0$, $np \to \lambda$ |
| Binomial → Normal | $n$ 大,$np$ 与 $n(1-p)$ 均不太小 |
| Poisson → Normal | $\lambda$ 大 |
| t → Normal | $\nu \to \infty$ |
| 样本均值 → Normal | CLT,$n$ 大 |
7. 与检验、ML 的对应
| 任务 | 参考分布 | 系列 |
|---|---|---|
| 小样本均值 | t | 31 抽样 → 27 t → Math-01 |
| 多元联合 | MVN | 30 |
| 比例/计数 | Binomial / Poisson / NB | 11、12、14 |
| 方差比 / ANOVA | F | 28 |
| 拟合优度 | $\chi^2$ | 26 |
| 分类 0/1 | Bernoulli | 10 → Logistic |
| 多分类 K 类 | Multinomial | 15 → Softmax |
| 损失选型 | 分布—NLL | 50 |
| 比例贝叶斯 | Beta | 25 |
| 回归残差 | Normal | 20 |
8. scipy 通用用法
1 | from scipy import stats |
9. 推荐阅读路线
- 本文总论 → 2. 按数据类型从决策树选 1~2 篇专论 → 3. 31 抽样分布(做检验前) → 4. Math-01 显著性检验
酶学/生信:12 泊松 → 14 负二项 → 21 对数正态 → 26/28 检验
10. 小结
分布是统计推断的语法:先识别数据类型与生成机制,核对前提假设(§5 速查 + 各专篇 §6),再选 PMF/PDF 族,最后对接检验或 ML 似然。后续专篇逐分布展开细节。