Math-07.贝叶斯推断-10.不确定性量化

本页讲解不确定性量化(uncertainty quantification,UQ)——贝叶斯后验自然给出预测分布;工程上还需校准检验。

段末注释认知不确定性(epistemic uncertainty)来自参数/模型未知,随数据增加可降;偶然不确定性(aleatoric uncertainty)来自数据固有噪声,不可消。

系列入口00.系列规划 | 前置:01 总论06 MCMC


1. 两类不确定性(D1–D3)

图 1 Epistemic vs Aleatoric

类型 来源 能否用更多数据消除
认知 参数、模型、分布外 部分可以
偶然 测量噪声、内在随机

后验预测

$$
p(y_{\mathrm{new}} \mid D) = \int p(y_{\mathrm{new}} \mid \theta), p(\theta \mid D), d\theta
$$

同时含两类不确定性(若似然含噪声参数)。


2. 预测区间与可信区间(D3)

图 2 95% 预测带

区间 含义
参数可信区间 $\theta$ 的 95% 后验区间(贝叶斯)
预测区间 $y_{\mathrm{new}}$ 的 95% 区间(含噪声)
频率置信区间 重复抽样覆盖(Math-01

预测区间通常更宽——还包含 $y$ 的随机性。


3. 校准(D6–D7)

图 3 可靠性图

分类:模型给 $p(y=1 \mid x) = 0.7$,则约 70% 此类样本应真为 1。

可靠性图(reliability diagram):分 bin 比较预测概率 vs 实际频率

方法 作用
温度缩放 后处理校准 softmax
Platt scaling logistic 校准分数
贝叶斯后验 天然概率,仍可能 miscalibrated
Deep Ensembles 多模型离散近似认知不确定

ECE(expected calibration error):预测概率与经验频率的平均偏差。


4. 跨领域应用(D7)

领域 UQ 需求 典型方法
医疗诊断 低置信拒诊 贝叶斯 NN、集成
自动驾驶 感知框置信度 MC Dropout、Ensemble
天气预报 降水概率区间 集合预报
金融风控 违约概率区间 贝叶斯 logistic
药物研发 活性预测 CI 高斯过程
大模型 幻觉检测 token 概率、语义熵
工业质检 异常分数阈值 后验预测界

5. 局限(D8)

图 4 UQ 误用

问题 说明
过度自信 深网 softmax 未校准
分布外 训练外输入,UQ 不可信
单点 MAP 无不确定,需全后验
区间 ≠ 因果 仅相关预测

6. 校准曲线示例(D12)

1
2
3
4
5
6
7
8
9
10
11
12
13
import numpy as np

# 模拟: pred_prob vs actual frequency in bins
bins = np.linspace(0, 1, 11)
pred = np.random.beta(2, 2, 500)
# 故意 miscalibrated: 实际频率偏低
actual = pred * 0.7 + 0.05
ece = 0.0
for i in range(len(bins) - 1):
mask = (pred >= bins[i]) & (pred < bins[i + 1])
if mask.sum() > 0:
ece += mask.mean() * abs(pred[mask].mean() - actual[mask].mean())
print(f"ECE (示意) = {ece:.3f}")

7. 小结

贝叶斯价值在完整预测分布而非单点。下一篇:20 贝叶斯优化

系列导航07 模型选择 | 20 BO

-------------本文结束感谢您的阅读-------------