本页讲解贝叶斯模型选择——用边际似然 $p(D \mid M)$ 比较模型,自动惩罚过复杂模型。
段末注释:边际似然(marginal likelihood)$p(D \mid M) = \int p(D \mid \theta, M), p(\theta \mid M), d\theta$ 对参数积分,复杂度高的模型若拟合提升不足则得分更低;BIC(Bayesian information criterion,贝叶斯信息准则)为其 Laplace 近似。
系列入口:00.系列规划 | 前置:02 MLE/MAP、Math-08/10 调参
1. 为何不只比似然(D1–D2)

训练似然 $p(D \mid \hat{\theta})$ 随参数增多几乎单调升 → 会选过拟合模型。
边际似然积分掉 $\theta$:
$$
p(D \mid M) = \int p(D \mid \theta, M), p(\theta \mid M), d\theta
$$
实现 Occam 剃刀:简单模型若已足够解释数据,得分更高。
2. BIC 与 AIC(D3)

BIC(大样本近似):
$$
\mathrm{BIC} = -2 \log \hat{L} + k \log n
$$
AIC:
$$
\mathrm{AIC} = -2 \log \hat{L} + 2k
$$
| 准则 | 惩罚强度 | 倾向 |
|---|---|---|
| AIC | $2k$ | 预测导向,略复杂 |
| BIC | $k \log n$ | $n$ 大时更简模型 |
| 边际似然 | 先验依赖 | 贝叶斯完整 |
$k$ = 自由参数个数,$n$ = 样本量,$\hat{L}$ = 最大似然。
3. 贝叶斯模型平均(D4)
BMA(Bayesian model averaging):不硬选一个模型,按 $p(M \mid D)$ 加权预测:
$$
p(x_{\mathrm{new}} \mid D) = \sum_M p(x_{\mathrm{new}} \mid M, D), p(M \mid D)
$$
减少模型不确定性被忽视的风险。
4. 跨领域应用(D7)

| 领域 | 选择对象 | 常用准则 |
|---|---|---|
| 回归 | 多项式阶数、变量子集 | BIC、Lasso CV |
| 时间序列 | ARMA(p,q) 阶 | AIC/BIC |
| 系统发育 | 进化树拓扑 | 边际似然( stepping stone) |
| 混合模型 | 成分数 $K$ | BIC、变分下界 |
| 神经架构 | 层数/宽度(小模型) | CV、早停(Math-08/05) |
| 协变量选择 | 流行病学 | Spike-and-slab 贝叶斯 |
| 高斯过程 | 核函数 | 边际似然优化 |
5. 局限(D8)

| 问题 | 说明 |
|---|---|
| BIC 需 $n$ 大 | 小样本 BIC 不准 |
| 候选集依赖 | 真模型不在集合内无解 |
| 深网参数 $k$ 巨大 | BIC 不适用,用 CV |
| 边际似然计算难 | 非共轭需 06 MCMC 或 05 VI |
6. sklearn BIC 示例(D12)
1 | import numpy as np |
7. 小结
边际似然 / BIC 在可解释参数模型中优于裸比 train loss。下一篇:10 不确定性量化。
系列导航:06 MCMC | Math-08/06 CV