本页为 Math-08 泛化与正则 子系列总论。训练 loss 低不等于模型好用——关键在未见数据上的表现。
段末注释:泛化误差(generalization error)是模型在生成分布上与训练数据同分布但未被用于训练的样本上的期望损失;过拟合(overfitting)指训练表现远优于泛化表现。
系列入口:00.系列规划 | 前置:Math-04/03 SGD、Math-02/20 特征选择
1. 三块数据的角色(D1–D2)

| 集合 | 用途 | 可调超参? |
|---|---|---|
| 训练集 | 拟合参数 $\boldsymbol{\theta}$ | — |
| 验证集 | 选模型、调 lr、早停 | ✓ |
| 测试集 | 最终报告性能 | ✗(只用一次) |
泛化 gap:
$$
\text{gap} = L_{\mathrm{test}} - L_{\mathrm{train}}
$$
gap 过大 → 过拟合;train 与 val 都高 → 欠拟合。
2. 过拟合 vs 欠拟合(D3)

| 现象 | 训练 loss | 验证 loss | 典型原因 |
|---|---|---|---|
| 欠拟合 | 高 | 高 | 模型太简单、特征不足 |
| 合适 | 中 | 接近 train | 容量与数据匹配 |
| 过拟合 | 很低 | 升高 | 容量过大、样本少、噪声标签 |
3. 跨领域例子(D7)

| 领域 | 任务示例 | 泛化难点 |
|---|---|---|
| 计算机视觉 | 医学 CT 结节检测 | 训练医院与部署医院设备/协议不同(域偏移) |
| 自然语言处理 | 新闻主题分类 | 训练语料年份与线上文本分布漂移 |
| 基因组学 | 肿瘤突变致病性预测 | 训练集族群与临床队列族群不一致 |
| 推荐系统 | 点击率预估 | 新用户/新物品冷启动,历史交互稀疏 |
| 表格学习 | 信用违约预测 | 经济周期变化导致特征分布漂移 |
| 蛋白工程 | 突变体活性回归 | 实验室批次效应、测量噪声、序列空间巨大 |
共同主题:有限样本 + 高维特征 → 必须控制复杂度并规范评估。
4. 工具箱概览(D4–D6)
1 | 偏差-方差诊断 [02] |
与 Math-04 优化(训练)、Math-01 检验(显著性)互补。
5. 常见误用(D8)

| 误用 | 后果 |
|---|---|
| 在测试集上调参 | 测试集不再是「未见过」 |
| 全数据标准化后再划分 | 验证/测试信息泄漏到训练 |
| 重复样本跨 fold | CV 分数过于乐观 |
| 只报 train accuracy | 无法判断泛化 |
6. 小结
泛化评估是 ML 科学性的底线。下一篇:02 偏差-方差分解。