Math-08.泛化与正则-04.Dropout与数据增强

本页介绍 Dropout数据增强(data augmentation)——不直接改损失项,却显著改善泛化。

段末注释Dropout 训练时以概率 $p$ 随机置零神经元输出,相当于指数级集成子网络;数据增强通过对输入施加语义保持变换,扩大有效训练集。

系列入口00.系列规划 | 前置:03 L1/L2


1. Dropout(D3)

图 1 训练随机失活

训练:$y = m \odot a$,$m_i \sim \mathrm{Bernoulli}(1-p)$
推理:$y = (1-p),a$ 或 inverted dropout 训练时缩放

超参 典型值
FC 层 $p=0.5$
Transformer $p=0.1$–$0.3$

效应:降 co-adaptation、近似 Bagging(07 集成)。


2. 数据增强(D3)

图 2 增强 = 扩大有效 n

对 $(x,y)$ 构造 $(T(x), y)$,$T$ 不改变标签。

模态 常见 $T$ 应用例子
图像 翻转、裁剪、颜色抖动 皮肤镜分类、卫星地物识别
语音 加噪、变速、SpecAugment 方言命令词识别
文本 同义词替换、回译 情感分析、垃圾邮件检测
时序 抖动、窗口切片 工业传感器故障预警
分子图 子图采样、节点扰动 分子性质预测(GNN)
蛋白序列 随机掩码、片段裁剪 功能预测预训练(类似 MLM)

3. 与 BatchNorm 关系(D6)

Dropout 与 BN 同层曾争议;现代 Transformer 多用 Dropout + LayerNormMath-04/10)。


4. 跨领域注意(D7)

图 3 增强需符合物理/语义

领域 合理增强 危险增强
医学影像 小幅旋转、弹性形变 翻转左右不对称器官
** OCR ** 透视、模糊 改变字符顺序
基因组序列 反向互补(DNA) 随机改密码子破坏翻译
表格数据 SMOTE 合成少数类 破坏特征间物理约束

5. 局限(D8)

图 4 局限

问题 说明
Dropout 过大 欠拟合
增强过强 标签语义破坏
推理未关 Dropout model.eval()
小数据仅靠增强 仍不足,需正则+CV

6. PyTorch 片段(D12)

1
2
3
4
5
6
7
8
9
import torch.nn as nn

model = nn.Sequential(
nn.Linear(784, 256),
nn.ReLU(),
nn.Dropout(p=0.5),
nn.Linear(256, 10),
)
# 训练: model.train(); 评估: model.eval()

7. 小结

Dropout 正则化网络;增强 正则化数据。下一篇:05 早停

系列导航07 集成 | 10 诊断

-------------本文结束感谢您的阅读-------------