本页从泛化视角看集成学习(ensemble learning):组合多个模型以降低预测方差。
段末注释:Bagging(Bootstrap Aggregating)对训练集自助采样训练多个基学习器,预测取平均或投票;随机森林(Random Forest)在 Bagging 基础上对特征子采样。
1. 为何集成有效(D3)

设 $M$ 个模型误差独立、同方差 $\sigma^2$,平均预测:
$$
\mathrm{Var}\left(\frac{1}{M}\sum_{m=1}^M \hat{f}_m\right) = \frac{\sigma^2}{M} \quad (\text{独立时})
$$
降 Variance,对高方差基学习器(深树)尤其有效。
2. Bagging 与随机森林(D3)

| 步骤 | Bagging | 随机森林 |
|---|---|---|
| 样本 | 有放回抽样 $n$ | 同左 |
| 特征 | 全特征 | 每分裂随机 $\sqrt{p}$ 或 $\log p$ |
| 聚合 | 回归平均 / 分类投票 | 同左 |
OOB(out-of-bag):未抽中样本作免费验证。
3. Boosting 对比(D6)
Boosting(如 GBDT)顺序拟合残差 → 降 Bias,但易过拟合需浅树+正则+早停(05 早停)。
| Bagging/RF | Boosting | |
|---|---|---|
| 主要效应 | 降方差 | 降偏差 |
| 基学习器 | 深树常见 | 浅树常见 |
| 并行 | 易 | 顺序 |
4. 跨领域应用(D7)

| 领域 | 集成用法 | 效果 |
|---|---|---|
| tabular 竞赛 | XGBoost/LightGBM 融合 | Kaggle 常胜 |
| 遥感分类 | 多随机森林投票 | 抗单景噪声 |
| 生物标志物 | RF 特征重要性 + 稳定性选择 | 可解释 + 稳健 |
| 医疗影像 | 多模型/多 patch 平均 | 降单次推理方差 |
| 集成预报 | 多数值模型 ensemble | 气象、 epidemiology |
| 深度网络 | Snapshot/SWA 权重平均 | 平坦极小泛化更好 |
5. 局限(D8)

| 问题 | 说明 |
|---|---|
| 基学习器高度相关 | 平均降方差有限 |
| 推理成本 | $M$ 倍模型 |
| 可解释性 | 黑箱叠加 |
| Boosting 过拟合 | 需早停、子采样 |
6. sklearn 示例(D12)
1 | from sklearn.ensemble import RandomForestClassifier |
7. 小结
Bagging/RF 是表格与高维特征上强泛化 baseline。下一篇:10 过拟合诊断与调参。
系列导航:06 交叉验证 | 20 Scaling Laws