本页介绍 Dropout 与数据增强(data augmentation)——不直接改损失项,却显著改善泛化。
段末注释:Dropout 训练时以概率 $p$ 随机置零神经元输出,相当于指数级集成子网络;数据增强通过对输入施加语义保持变换,扩大有效训练集。
1. Dropout(D3)

训练:$y = m \odot a$,$m_i \sim \mathrm{Bernoulli}(1-p)$
推理:$y = (1-p),a$ 或 inverted dropout 训练时缩放
| 超参 | 典型值 |
|---|---|
| FC 层 | $p=0.5$ |
| Transformer | $p=0.1$–$0.3$ |
效应:降 co-adaptation、近似 Bagging(07 集成)。
2. 数据增强(D3)

对 $(x,y)$ 构造 $(T(x), y)$,$T$ 不改变标签。
| 模态 | 常见 $T$ | 应用例子 |
|---|---|---|
| 图像 | 翻转、裁剪、颜色抖动 | 皮肤镜分类、卫星地物识别 |
| 语音 | 加噪、变速、SpecAugment | 方言命令词识别 |
| 文本 | 同义词替换、回译 | 情感分析、垃圾邮件检测 |
| 时序 | 抖动、窗口切片 | 工业传感器故障预警 |
| 分子图 | 子图采样、节点扰动 | 分子性质预测(GNN) |
| 蛋白序列 | 随机掩码、片段裁剪 | 功能预测预训练(类似 MLM) |
3. 与 BatchNorm 关系(D6)
Dropout 与 BN 同层曾争议;现代 Transformer 多用 Dropout + LayerNorm(Math-04/10)。
4. 跨领域注意(D7)

| 领域 | 合理增强 | 危险增强 |
|---|---|---|
| 医学影像 | 小幅旋转、弹性形变 | 翻转左右不对称器官 |
| ** OCR ** | 透视、模糊 | 改变字符顺序 |
| 基因组序列 | 反向互补(DNA) | 随机改密码子破坏翻译 |
| 表格数据 | SMOTE 合成少数类 | 破坏特征间物理约束 |
5. 局限(D8)

| 问题 | 说明 |
|---|---|
| Dropout 过大 | 欠拟合 |
| 增强过强 | 标签语义破坏 |
| 推理未关 Dropout | model.eval() |
| 小数据仅靠增强 | 仍不足,需正则+CV |
6. PyTorch 片段(D12)
1 | import torch.nn as nn |
7. 小结
Dropout 正则化网络;增强 正则化数据。下一篇:05 早停。