Math-00.数学分布-10.伯努利分布

伯努利分布(Bernoulli distribution)描述单次随机试验只有两种结果(成功/失败、是/否)的概率模型,是离散分布体系中最基本的「二元随机变量」。

读前说明:本文为离散分布,下文给出 PMF(probability mass function,概率质量函数),不写 PDF(probability density function,概率密度函数)。系列入口:Math-00.数学分布-00.系列规划

段末注释PMF 给出离散随机变量各取值点的概率;连续分布才用 PDF,伯努利只有 PMF。


1. 产生背景与直观

图 1 伯努利试验直观

雅各布·伯努利(Jacob Bernoulli)在研究独立重复试验时发现:若每次试验「成功」概率恒为 $p$,则单次结果可用极简模型刻画。典型直觉:

  • 抛一枚(可能不公平的)硬币:正面 = 1,反面 = 0
  • 某个突变「有害/无害」:有害 = 1
  • 质检「合格/不合格」:合格 = 1

核心思想:世界先被简化为二元标签,再谈多次试验(→ 二项分布)。


2. 定义与参数

随机变量 $X \sim \mathrm{Bernoulli}(p)$:

要素 内容
支撑集 ${0, 1}$
参数 $p \in (0, 1)$,单次成功概率
记号 $X \sim \mathrm{Ber}(p)$ 或 $\mathrm{Bernoulli}(p)$

3. PMF 与 CDF

本节给出 CDF(cumulative distribution function,累积分布函数)$F(x)=P(X\le x)$ 及上文已定义的 PMF。

图 2 PMF 仅两点非零

3.1 PMF

$$
P(X=x) = p^x(1-p)^{1-x}, \quad x \in {0, 1}
$$

即 $P(X=1)=p$,$P(X=0)=1-p$。

3.2 CDF

$$
F(x) = P(X \le x) = \begin{cases}
0 & x < 0 \
1-p & 0 \le x < 1 \
1 & x \ge 1
\end{cases}
$$

分位数:中位数在 $p \le 0.5$ 时为 0,$p > 0.5$ 时为 1;无连续分位点。详见 百分位数


4. 数字特征

公式
期望 $\mathbb{E}[X] = p$
方差 $\mathrm{Var}(X) = p(1-p)$
偏度 $\dfrac{1-2p}{\sqrt{p(1-p)}}$
峰度 $\dfrac{1-6p(1-p)}{p(1-p)}$(超额峰度)

$p=\frac{1}{2}$ 时方差最大($0.25$)。


5. 与其他分布的关系

关系 说明
二项分布特例 $\mathrm{Binomial}(n=1, p) = \mathrm{Bernoulli}(p)$ → 11.二项
几何分布 首次成功所需试验次数,每次底为 Bernoulli → 13.几何
Logistic 回归 $Y \sim \mathrm{Ber}(p_i)$,$p_i=\sigma(\mathbf{w}^\top \mathbf{x}_i)$
Beta–Bernoulli 共轭 先验 $p \sim \mathrm{Beta}(\alpha,\beta)$,Beta(Beta distribution,贝塔分布)为共轭先验;观测后验仍为 Beta

6. 前提假设

使用 Bernoulli 建模前,应确认数据生成过程满足:

假设 含义 违背时
二元结果 单次试验仅两类(成功/失败、是/否) 多分类 → 多项
$p$ 恒定 成功概率在观测期间不变 时变 $p$ → 混合模型或分层
单次试验 随机变量描述一次试验结果 固定 $n$ 次成功数 → 二项
独立(多次用时) 重复使用时各次试验相互独立 批次相关 → 层次/相关模型

段末注释:Bernoulli 是单次二元试验;推断中 $n$ 次独立 Bernoulli 的充分统计量为成功次数,对应二项分布。


7. 适用场景

图 3 适用场景

场景 示例
二分类标签 患者是否患病、酶突变是否有害
分类模型 Logistic 回归、感知机:$Y\in{0,1}$
单次 QC(quality control,质量控制) 一次测序 run 是否通过质控阈值
贝叶斯推断 成功率的 Beta 后验更新

8. 局限与误用

图 4 局限

误用 后果
用 Bernoulli 建模计数(如 3 次突变) 应使用 二项泊松
忽略试验不独立 $p$ 估计有偏,置信区间失真
$p$ 接近 0/1 时正态近似 小样本比例检验失效,应用精确二项检验
将多分类硬压成二元 信息损失,应使用 多项分布

9. 参数估计与推断

9.1 参数估计

观测 $n$ 次独立 Bernoulli,成功 $k$ 次;MLE(maximum likelihood estimation,极大似然估计)为

$$
\hat{p}_{\mathrm{MLE}} = \frac{k}{n}
$$

贝叶斯(Beta 先验 $\mathrm{Beta}(\alpha_0,\beta_0)$)后验均值:

$$
\mathbb{E}[p \mid \text{data}] = \frac{\alpha_0 + k}{\alpha_0 + \beta_0 + n}
$$

9.2 假设检验

  • 单样本比例检验:$H_0: p=p_0$,大样本用 Z 检验(Z-test,大样本比例检验),小样本用精确二项检验
  • Math-01 显著性检验 系列衔接

10. 示例与代码

场景:100 个酶突变体中 23 个「活性提升」(记为 1),估计 $p$;比例 CI(confidence interval,置信区间)采用 Wilson 得分区间(Wilson score interval,Wilson 得分区间)。

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
"""伯努利/二项比例估计示例"""
import numpy as np
from scipy import stats

n, k = 100, 23
p_hat = k / n

# 单点 PMF(一次试验)
p = p_hat
print("P(X=1) =", stats.bernoulli.pmf(1, p))
print("E[X] =", stats.bernoulli.mean(p), " Var =", stats.bernoulli.var(p))

# 95% 置信区间(二项精确 / Wilson 得分区间)
ci = stats.binomtest(k, n, p=0.5).proportion_ci(confidence_level=0.95, method='wilson')
print(f"p_hat={p_hat:.3f}, 95% CI Wilson: [{ci.low:.3f}, {ci.high:.3f}]")

# 模拟
rng = np.random.default_rng(42)
samples = stats.bernoulli.rvs(p=0.23, size=1000, random_state=rng)
print("模拟均值 ≈", samples.mean())

11. 小结

  • Bernoulli单次二元试验的基准分布,参数仅 $p$。
  • 期望 $p$,方差 $p(1-p)$;是 Binomial(1,p) 的特例。
  • 分类 ML(machine learning,机器学习)的 0/1 标签、比例推断的逻辑起点;多次试验需升级到二项/泊松。

系列导航00 规划 | 下一篇:11.二项分布


参考文献

  1. Ross S. M. Introduction to Probability Models.
  2. scipy.stats.bernoulli
-------------本文结束感谢您的阅读-------------