本页为 01.知识-02.Math 下 Math-08 泛化与正则 子系列的索引与规划。衔接 Math-04 优化、Math-07 贝叶斯推断、Math-02/20 特征选择。
段末注释:泛化(generalization)指模型在未见数据上的表现;正则化(regularization)通过约束复杂度抑制过拟合。
一、系列定位
| 维度 | 说明 |
|---|---|
| 前置 | Math-01(检验)、Math-02(特征选择)、Math-04(训练) |
| 目标 | 诊断过拟合/欠拟合,选择正则与验证策略 |
| 与 Math-07 | 贝叶斯先验 ↔ L2 正则;边际似然 ↔ 模型选择 |
| 与 Math-03 | 范数正则 ↔ Math-03/06 范数 |
| 跨领域应用 | 各篇正文以表格给出 CV、NLP、基因组、金融、蛋白工程等例子(不链 Math 目录外文章) |
二、命名规范
1 | Math-08.泛化与正则-{篇号}.{标题}.md |
| 篇号段 | 用途 |
|---|---|
| 00 | 系列规划(本文) |
| 01 | 总论(训练/验证/测试、泛化误差) |
| 02–09 | 偏差-方差、正则、Dropout、早停 |
| 10–19 | 交叉验证、诊断调参、集成 |
| 20–29 | 大模型 Scaling、Double Descent |
三、篇目索引
| 篇号 | 文件名 | 状态 | 要点 |
|---|---|---|---|
| 00 | Math-08.泛化与正则-00.系列规划.md |
本文 | — |
| 01 | Math-08.泛化与正则-01.总论.md |
已完成 | 泛化 gap、评估协议、跨领域例子 |
| 02 | Math-08.泛化与正则-02.偏差方差分解.md |
已完成 | Bias-Variance、模型容量 |
| 03 | Math-08.泛化与正则-03.L1与L2正则化.md |
已完成 | Ridge、Lasso、weight decay |
| 04 | Math-08.泛化与正则-04.Dropout与数据增强.md |
已完成 | 随机失活、不变性增强 |
| 05 | Math-08.泛化与正则-05.EarlyStopping与验证集.md |
已完成 | 早停、checkpoint |
| 06 | Math-08.泛化与正则-06.交叉验证.md |
已完成 | k-fold、GroupKFold、CV 泄漏 |
| 07 | Math-08.泛化与正则-07.集成与Bagging.md |
已完成 | 方差削减、随机森林 |
| 10 | Math-08.泛化与正则-10.过拟合诊断与调参.md |
已完成 | 学习曲线、网格搜索 |
| 20 | Math-08.泛化与正则-20.ScalingLaws与DoubleDescent.md |
已完成 | 幂律、双下降 |
配图:每篇 fig01–fig04 共 36 张 PNG。
四、单篇建议维度
- 要解决的泛化问题(D1)
- 公式或机制(D3)
- 跨领域应用例子(D7)
- 误用(验证泄漏、测试集偷看)(D8)
- sklearn / PyTorch 示例(D12)
五、推荐阅读路线
1 | Math-02/20 特征选择(Filter、FDR) |
六、小结
Math-08 泛化与正则 系列已全部发布:经典偏差-方差与正则工具 + 大模型 Scaling 补充视角;与 Math-04 训练、Math-01 检验形成 ML 实验闭环。
段末注释:Double Descent(双下降)指模型容量增大时测试误差先升后降的现象;Scaling Laws(缩放定律)描述大模型性能随参数/数据/算力的幂律关系。