Math-08.泛化与正则-03.L1与L2正则化

本页讲解 L1/L2 正则化——通过惩罚权重大小降低方差、提升泛化。

段末注释L2 正则(Ridge)惩罚 $|\boldsymbol{\theta}|_2^2$,权重平滑缩小;L1 正则(Lasso)惩罚 $|\boldsymbol{\theta}|_1$,产生稀疏解。

系列入口00.系列规划 | 前置:Math-03/06 范数02 偏差方差


1. 目标函数(D3)

图 1 L2 约束权重球

$$
\min_{\boldsymbol{\theta}} \ L(\boldsymbol{\theta}) + \lambda \Omega(\boldsymbol{\theta})
$$

正则 $\Omega(\boldsymbol{\theta})$ 效应
L2 (Ridge) $|\boldsymbol{\theta}|_2^2$ 权重整体缩小,共线性稳定
L1 (Lasso) $|\boldsymbol{\theta}|_1$ 许多 $\theta_j \to 0$,特征选择
Elastic Net $\alpha|\boldsymbol{\theta}|_1 + (1-\alpha)|\boldsymbol{\theta}|_2^2$ 折中

$\lambda \ge 0$ 控制正则强度;过大 → 欠拟合。


2. 与优化器(D6)

线性模型:Ridge 闭式 $(X^\top X + \lambda I)^{-1}X^\top y$(Math-03/07)。

神经网络weight decayMath-04/04 AdamW 将 decay 与梯度更新解耦:

$$
\boldsymbol{\theta} \leftarrow \boldsymbol{\theta} - \eta(\nabla L + \lambda \boldsymbol{\theta})
$$


3. 跨领域应用(D7)

图 2 Ridge vs Lasso 选型

领域 场景 常用正则
基因组 GWAS 数万 SNP、样本数千 Lasso 选关联位点
文本分类 百万维 bag-of-words L2 logistic 防过拟合
推荐系统 高维稀疏用户特征 L2 嵌入 + L1 可选
量化金融 多因子共线 Ridge 稳定系数
深度视觉 ResNet 微调 weight decay $10^{-4}$ 量级
蛋白序列模型 大型 Transformer 微调 AdamW decay

4. 选 $\lambda$(D7)

图 3 $\lambda$ 与 train/val 曲线

  • 验证集 / 交叉验证06 CV)网格搜索 $\lambda$
  • 学习曲线:随 $\lambda$ 增大,train↑ val 可能先降后升

5. 局限(D8)

图 4 局限

问题 说明
Lasso 相关特征 随机选一个,Elastic Net 更好
$\lambda$ 与 lr 混淆 Adam 中应用 AdamW
批归一化层 通常不对 BN 参数 decay
仅 L2 不能删特征 需 L1 或显式特征选择

6. sklearn 示例(D12)

1
2
3
4
5
6
7
8
9
10
11
from sklearn.linear_model import Ridge, Lasso
from sklearn.model_selection import cross_val_score
import numpy as np

X = np.random.randn(200, 50)
y = X @ np.random.randn(50) + 0.1 * np.random.randn(200)

for lam in [0.01, 0.1, 1.0, 10.0]:
m = Ridge(alpha=lam)
s = cross_val_score(m, X, y, cv=5, scoring="neg_mean_squared_error").mean()
print(f"alpha={lam}, CV MSE={-s:.3f}")

7. 小结

L2 通用降方差;L1 稀疏特征选择。下一篇:04 Dropout

系列导航02 偏差方差 | 06 交叉验证

-------------本文结束感谢您的阅读-------------