本页为 01.知识-02.Math 下 Math-04 优化 子系列的索引与规划。前置建议:Math-03 线性代数、Math-00/50 分布与 ML 损失。
段末注释:优化(optimization)在参数空间中搜索使目标函数(损失)最小化的解;SGD(stochastic gradient descent,随机梯度下降)用 mini-batch 梯度近似全量梯度。
一、系列定位
| 维度 | 说明 |
|---|---|
| 前置 | Math-03(梯度向量、Hessian 矩阵)、Math-00/50(损失函数) |
| 目标 | 理解训练循环中的目标函数、更新规则、学习率与收敛 |
| 与 Math-05 | 交叉熵/KL 作为优化目标 → 信息论系列 |
| 与 Math-06 | 链式法则求梯度 → 矩阵微积分系列 |
| 与存量 | XGBoost、损失函数 |
二、命名规范
1 | Math-04.优化-{篇号}.{标题}.md |
| 篇号段 | 用途 |
|---|---|
| 00 | 系列规划(本文) |
| 01 | 总论(优化问题形式化、局部/全局极小) |
| 02–09 | 一阶/二阶方法、约束优化 |
| 10–19 | 深度学习训练(batch norm、warmup…) |
| 20–29 | 大模型(混合精度、ZeRO、微调策略) |
三、篇目索引
| 篇号 | 文件名 | 状态 | 要点 |
|---|---|---|---|
| 00 | Math-04.优化-00.系列规划.md |
本文 | — |
| 01 | Math-04.优化-01.总论.md |
已发布 | 无约束/约束、凸性概览 |
| 02 | Math-04.优化-02.凸优化基础.md |
已发布 | 凸集、凸函数、KKT 预览 |
| 03 | Math-04.优化-03.梯度下降与SGD.md |
已发布 | 批量/随机、收敛条件 |
| 04 | Math-04.优化-04.Momentum与Adam.md |
已发布 | Adam、AdamW、偏差校正 |
| 05 | Math-04.优化-05.学习率与调度.md |
已发布 | warmup、cosine、OneCycle |
| 06 | Math-04.优化-06.约束优化与Lagrange.md |
已发布 | SVM、KL 约束预览 |
| 07 | Math-04.优化-07.二阶与牛顿法.md |
已发布 | Newton、L-BFGS、XGBoost 二阶 |
| 10 | Math-04.优化-10.深度学习训练实践.md |
已发布 | 梯度裁剪、累积、BN |
| 20 | Math-04.优化-20.大模型训练与微调.md |
已发布 | 混合精度、LoRA 学习率 |
四、单篇建议维度
- 优化问题形式 $\min_\theta L(\theta)$(D2)
- 更新公式与超参数(D3)
- 收敛性与学习率影响(D5)
- 适用场景与框架默认(D7)
- 局限(非凸、鞍点、调参敏感)(D8)
- PyTorch / sklearn 示例(D12)
五、推荐阅读路线
1 | Math-00/50 分布与 ML 损失 |
六、小结
Math-04 优化 规划内专篇已全部完成(01–07 + 10 + 20,共 9 篇 + 36 图)。下一步:Math-06 矩阵微积分。
段末注释:Adam(Adaptive Moment Estimation)结合动量与自适应学习率;AdamW 将权重衰减与梯度更新解耦。