本页讲解不确定性量化(uncertainty quantification,UQ)——贝叶斯后验自然给出预测分布;工程上还需校准检验。
段末注释:认知不确定性(epistemic uncertainty)来自参数/模型未知,随数据增加可降;偶然不确定性(aleatoric uncertainty)来自数据固有噪声,不可消。
系列入口:00.系列规划 | 前置:01 总论、06 MCMC
1. 两类不确定性(D1–D3)

| 类型 | 来源 | 能否用更多数据消除 |
|---|---|---|
| 认知 | 参数、模型、分布外 | 部分可以 |
| 偶然 | 测量噪声、内在随机 | 否 |
后验预测:
$$
p(y_{\mathrm{new}} \mid D) = \int p(y_{\mathrm{new}} \mid \theta), p(\theta \mid D), d\theta
$$
同时含两类不确定性(若似然含噪声参数)。
2. 预测区间与可信区间(D3)

| 区间 | 含义 |
|---|---|
| 参数可信区间 | $\theta$ 的 95% 后验区间(贝叶斯) |
| 预测区间 | $y_{\mathrm{new}}$ 的 95% 区间(含噪声) |
| 频率置信区间 | 重复抽样覆盖(Math-01) |
预测区间通常更宽——还包含 $y$ 的随机性。
3. 校准(D6–D7)

分类:模型给 $p(y=1 \mid x) = 0.7$,则约 70% 此类样本应真为 1。
可靠性图(reliability diagram):分 bin 比较预测概率 vs 实际频率。
| 方法 | 作用 |
|---|---|
| 温度缩放 | 后处理校准 softmax |
| Platt scaling | logistic 校准分数 |
| 贝叶斯后验 | 天然概率,仍可能 miscalibrated |
| Deep Ensembles | 多模型离散近似认知不确定 |
ECE(expected calibration error):预测概率与经验频率的平均偏差。
4. 跨领域应用(D7)
| 领域 | UQ 需求 | 典型方法 |
|---|---|---|
| 医疗诊断 | 低置信拒诊 | 贝叶斯 NN、集成 |
| 自动驾驶 | 感知框置信度 | MC Dropout、Ensemble |
| 天气预报 | 降水概率区间 | 集合预报 |
| 金融风控 | 违约概率区间 | 贝叶斯 logistic |
| 药物研发 | 活性预测 CI | 高斯过程 |
| 大模型 | 幻觉检测 | token 概率、语义熵 |
| 工业质检 | 异常分数阈值 | 后验预测界 |
5. 局限(D8)

| 问题 | 说明 |
|---|---|
| 过度自信 | 深网 softmax 未校准 |
| 分布外 | 训练外输入,UQ 不可信 |
| 单点 MAP | 无不确定,需全后验 |
| 区间 ≠ 因果 | 仅相关预测 |
6. 校准曲线示例(D12)
1 | import numpy as np |
7. 小结
贝叶斯价值在完整预测分布而非单点。下一篇:20 贝叶斯优化。