Math-08.泛化与正则-07.集成与Bagging

本页从泛化视角看集成学习(ensemble learning):组合多个模型以降低预测方差。

段末注释Bagging(Bootstrap Aggregating)对训练集自助采样训练多个基学习器,预测取平均或投票;随机森林(Random Forest)在 Bagging 基础上对特征子采样。

系列入口00.系列规划 | 前置:02 偏差方差


1. 为何集成有效(D3)

图 1 多模型平均降方差

设 $M$ 个模型误差独立、同方差 $\sigma^2$,平均预测:

$$
\mathrm{Var}\left(\frac{1}{M}\sum_{m=1}^M \hat{f}_m\right) = \frac{\sigma^2}{M} \quad (\text{独立时})
$$

降 Variance,对高方差基学习器(深树)尤其有效。


2. Bagging 与随机森林(D3)

图 2 Bootstrap + 特征子采样

步骤 Bagging 随机森林
样本 有放回抽样 $n$ 同左
特征 全特征 每分裂随机 $\sqrt{p}$ 或 $\log p$
聚合 回归平均 / 分类投票 同左

OOB(out-of-bag):未抽中样本作免费验证。


3. Boosting 对比(D6)

Boosting(如 GBDT)顺序拟合残差 → 降 Bias,但易过拟合需浅树+正则+早停(05 早停)。

Bagging/RF Boosting
主要效应 降方差 降偏差
基学习器 深树常见 浅树常见
并行 顺序

4. 跨领域应用(D7)

图 3 集成场景

领域 集成用法 效果
tabular 竞赛 XGBoost/LightGBM 融合 Kaggle 常胜
遥感分类 多随机森林投票 抗单景噪声
生物标志物 RF 特征重要性 + 稳定性选择 可解释 + 稳健
医疗影像 多模型/多 patch 平均 降单次推理方差
集成预报 多数值模型 ensemble 气象、 epidemiology
深度网络 Snapshot/SWA 权重平均 平坦极小泛化更好

5. 局限(D8)

图 4 局限

问题 说明
基学习器高度相关 平均降方差有限
推理成本 $M$ 倍模型
可解释性 黑箱叠加
Boosting 过拟合 需早停、子采样

6. sklearn 示例(D12)

1
2
3
4
5
6
7
from sklearn.ensemble import RandomForestClassifier
from sklearn.datasets import make_classification

X, y = make_classification(n_samples=500, n_features=20, random_state=0)
rf = RandomForestClassifier(n_estimators=200, max_features="sqrt", random_state=0)
rf.fit(X, y)
print("OOB estimate:", rf.oob_score_ if hasattr(rf, "oob_score_") else "enable oob=True")

7. 小结

Bagging/RF 是表格与高维特征上强泛化 baseline。下一篇:10 过拟合诊断与调参

系列导航06 交叉验证 | 20 Scaling Laws

-------------本文结束感谢您的阅读-------------