本页讲解 L1/L2 正则化——通过惩罚权重大小降低方差、提升泛化。
段末注释:L2 正则(Ridge)惩罚 $|\boldsymbol{\theta}|_2^2$,权重平滑缩小;L1 正则(Lasso)惩罚 $|\boldsymbol{\theta}|_1$,产生稀疏解。
系列入口:00.系列规划 | 前置:Math-03/06 范数、02 偏差方差
1. 目标函数(D3)

$$
\min_{\boldsymbol{\theta}} \ L(\boldsymbol{\theta}) + \lambda \Omega(\boldsymbol{\theta})
$$
| 正则 | $\Omega(\boldsymbol{\theta})$ | 效应 |
|---|---|---|
| L2 (Ridge) | $|\boldsymbol{\theta}|_2^2$ | 权重整体缩小,共线性稳定 |
| L1 (Lasso) | $|\boldsymbol{\theta}|_1$ | 许多 $\theta_j \to 0$,特征选择 |
| Elastic Net | $\alpha|\boldsymbol{\theta}|_1 + (1-\alpha)|\boldsymbol{\theta}|_2^2$ | 折中 |
$\lambda \ge 0$ 控制正则强度;过大 → 欠拟合。
2. 与优化器(D6)
线性模型:Ridge 闭式 $(X^\top X + \lambda I)^{-1}X^\top y$(Math-03/07)。
神经网络:weight decay — Math-04/04 AdamW 将 decay 与梯度更新解耦:
$$
\boldsymbol{\theta} \leftarrow \boldsymbol{\theta} - \eta(\nabla L + \lambda \boldsymbol{\theta})
$$
3. 跨领域应用(D7)

| 领域 | 场景 | 常用正则 |
|---|---|---|
| 基因组 GWAS | 数万 SNP、样本数千 | Lasso 选关联位点 |
| 文本分类 | 百万维 bag-of-words | L2 logistic 防过拟合 |
| 推荐系统 | 高维稀疏用户特征 | L2 嵌入 + L1 可选 |
| 量化金融 | 多因子共线 | Ridge 稳定系数 |
| 深度视觉 | ResNet 微调 | weight decay $10^{-4}$ 量级 |
| 蛋白序列模型 | 大型 Transformer 微调 | AdamW decay |
4. 选 $\lambda$(D7)

- 验证集 / 交叉验证(06 CV)网格搜索 $\lambda$
- 学习曲线:随 $\lambda$ 增大,train↑ val 可能先降后升
5. 局限(D8)

| 问题 | 说明 |
|---|---|
| Lasso 相关特征 | 随机选一个,Elastic Net 更好 |
| $\lambda$ 与 lr 混淆 | Adam 中应用 AdamW |
| 批归一化层 | 通常不对 BN 参数 decay |
| 仅 L2 不能删特征 | 需 L1 或显式特征选择 |
6. sklearn 示例(D12)
1 | from sklearn.linear_model import Ridge, Lasso |
7. 小结
L2 通用降方差;L1 稀疏特征选择。下一篇:04 Dropout。