本页讲解变分推断(variational inference,VI)——用简单分布 $q(\theta)$ 近似难算的后验 $p(\theta \mid D)$。
段末注释:ELBO(evidence lower bound,证据下界)$\mathcal{L}(q) = \mathbb{E}_q[\log p(D,\theta)] - \mathbb{E}q[\log q(\theta)]$ 是 VI 的优化目标;最大化 ELBO 等价于最小化 $D{\mathrm{KL}}(q | p(\theta \mid D))$。
系列入口:00.系列规划 | 前置:01 总论、Math-05/03 KL
1. 动机(D1–D2)

后验 $p(\theta \mid D) = \dfrac{p(D \mid \theta)p(\theta)}{p(D)}$ 的分母 边际似然 $p(D)$ 通常不可积。
VI 思路:在族 $\mathcal{Q}$ 中找 $q^*(\theta) \approx p(\theta \mid D)$。
$$
q^* = \arg\min_{q \in \mathcal{Q}} D_{\mathrm{KL}}\big(q(\theta) ,|, p(\theta \mid D)\big)
$$
2. ELBO(D3)

$$
\log p(D) = \mathcal{L}(q) + D_{\mathrm{KL}}(q | p(\theta \mid D)) \ge \mathcal{L}(q)
$$
$$
\mathcal{L}(q) = \mathbb{E}_q[\log p(D \mid \theta)] + \mathbb{E}_q[\log p(\theta)] - \mathbb{E}_q[\log q(\theta)]
$$
| 项 | 含义 |
|---|---|
| $\mathbb{E}_q[\log p(D \mid \theta)]$ | 数据拟合 |
| $\mathbb{E}_q[\log p(\theta)] - \mathbb{E}_q[\log q(\theta)]$ | 对先验的 KL 惩罚 |
均值场(mean-field):$q(\theta) = \prod_j q_j(\theta_j)$,坐标上升或 SGD 优化。
3. 与 VAE 的关系(D6)
VAE(variational autoencoder):
- 隐变量 $z$,$q_\phi(z \mid x)$ 近似 $p(z \mid x)$
- 最大化 ELBO = 重建项 $-$ $D_{\mathrm{KL}}(q_\phi | p(z))$
- 与 Math-05/06 最大熵 的 softmax 正则不同路径,同属概率生成建模
4. 跨领域应用(D7)

| 领域 | 应用 | VI 角色 |
|---|---|---|
| 生成模型 | VAE、VQ-VAE | 近似 $p(z \mid x)$ |
| 主题模型 | LDA 变分 EM | 近似文档-主题后验 |
| 贝叶斯神经网络 | Bayes by Backprop | 权重后验 $q(w)$ |
| 时间序列 | 状态空间模型 | 滤波/平滑变分 |
| NLP | 神经网络变分推断 | 隐变量语法/语义 |
| 科学反演 | 物理参数估计 | 高维后验近似 |
| 推荐 | 概率矩阵分解 | 用户/物品隐向量 |
5. VI vs MCMC(D6–D8)

| VI | MCMC(06) | |
|---|---|---|
| 速度 | 快(SGD) | 慢(链收敛) |
| 精度 | 受 $q$ 族限制 | 渐近精确 |
| 多峰后验 | 易漏模 | 可采样多模 |
| 可扩展性 | 适合大模型 | 高维困难 |
Amortized VI:用神经网络 $q_\phi(z \mid x)$ 一次前向,所有 $x$ 共享 $\phi$ → VAE 核心。
6. 极简高斯 VI 示例(D12)
1 | import numpy as np |