Math-04.优化-00.系列规划

本页为 01.知识-02.MathMath-04 优化 子系列的索引与规划。前置建议:Math-03 线性代数Math-00/50 分布与 ML 损失

段末注释优化(optimization)在参数空间中搜索使目标函数(损失)最小化的解;SGD(stochastic gradient descent,随机梯度下降)用 mini-batch 梯度近似全量梯度。


一、系列定位

维度 说明
前置 Math-03(梯度向量、Hessian 矩阵)、Math-00/50(损失函数)
目标 理解训练循环中的目标函数、更新规则、学习率与收敛
与 Math-05 交叉熵/KL 作为优化目标 → 信息论系列
与 Math-06 链式法则求梯度 → 矩阵微积分系列
与存量 XGBoost损失函数

二、命名规范

1
Math-04.优化-{篇号}.{标题}.md
篇号段 用途
00 系列规划(本文)
01 总论(优化问题形式化、局部/全局极小)
02–09 一阶/二阶方法、约束优化
10–19 深度学习训练(batch norm、warmup…)
20–29 大模型(混合精度、ZeRO、微调策略)

三、篇目索引

篇号 文件名 状态 要点
00 Math-04.优化-00.系列规划.md 本文
01 Math-04.优化-01.总论.md 已发布 无约束/约束、凸性概览
02 Math-04.优化-02.凸优化基础.md 已发布 凸集、凸函数、KKT 预览
03 Math-04.优化-03.梯度下降与SGD.md 已发布 批量/随机、收敛条件
04 Math-04.优化-04.Momentum与Adam.md 已发布 Adam、AdamW、偏差校正
05 Math-04.优化-05.学习率与调度.md 已发布 warmup、cosine、OneCycle
06 Math-04.优化-06.约束优化与Lagrange.md 已发布 SVM、KL 约束预览
07 Math-04.优化-07.二阶与牛顿法.md 已发布 Newton、L-BFGS、XGBoost 二阶
10 Math-04.优化-10.深度学习训练实践.md 已发布 梯度裁剪、累积、BN
20 Math-04.优化-20.大模型训练与微调.md 已发布 混合精度、LoRA 学习率

四、单篇建议维度

  1. 优化问题形式 $\min_\theta L(\theta)$(D2)
  2. 更新公式与超参数(D3)
  3. 收敛性与学习率影响(D5)
  4. 适用场景与框架默认(D7)
  5. 局限(非凸、鞍点、调参敏感)(D8)
  6. PyTorch / sklearn 示例(D12)

五、推荐阅读路线

1
2
3
4
5
6
Math-00/50 分布与 ML 损失
→ Math-03/02 向量与矩阵
→ Math-04.优化-01.总论
→ 03 SGD → 04 Adam → 05 学习率
→ 10 DL 实践 / 20 大模型
→ Math-06 矩阵微积分(自定义层)

六、小结

Math-04 优化 规划内专篇已全部完成(01–07 + 10 + 20,共 9 篇 + 36 图)。下一步:Math-06 矩阵微积分

段末注释Adam(Adaptive Moment Estimation)结合动量与自适应学习率;AdamW 将权重衰减与梯度更新解耦。

-------------本文结束感谢您的阅读-------------