Math-09.特征预处理与变换-01.总论

本页为 Math-09 特征预处理与变换 子系列总论。原始数据很少直接适合模型——量纲、偏态、缺失、类别 都需处理。

段末注释特征工程(feature engineering)含构造新特征与预处理;本系列聚焦对已有特征的数学变换,而非深度表示学习。

系列入口00.系列规划 | 前置:Math-03/06 范数Math-08/01 泛化


1. 为何需要预处理(D1–D2)

图 1 原始 → 变换 → 模型

问题 后果 典型变换
量纲不一 距离/L2 被大单位主导 02 标准化
右偏分布 t 检验/线性假设违背 03 log/Box-Cox
类别变量 模型需数值输入 04 编码
缺失/异常 无法训练或拉偏估计 05 缺失异常

2. 预处理地图(D4–D6)

图 2 选型决策树(示意)

1
2
3
4
5
6
7
8
9
10
11
12
13
14
连续数值
├─ 右偏 / 方差随均值增大 → 03 log / Box-Cox
├─ 不同量纲 → 02 Standard / Robust
├─ 有界 [0,1] 需求 → MinMax
└─ 线性模型 + 高维 → 06 PCA / Whitening

类别
├─ 低基数 → One-Hot
├─ 高基数 → Target / Hash / Embedding
└─ 有序 → Ordinal

全流程
→ 10 Pipeline(train fit only)
→ 20 领域默认(ImageNet、BPE 等)

Math-04/03 SGD:缩放改善 条件数;与 Math-01/08 正态性:变换后再检验。


3. 跨领域例子(D7)

图 3 各领域预处理重点

领域 典型预处理 说明
表格金融 RobustScaler、Winsorize 极端收益、缺失评级
计算机视觉 减均值除标准差、/255 ImageNet 统计或数据集自身
NLP 分词、子词、位置编码 非传统 scaler,见 20
基因组表达 $\log_2(x+1)$、分位数归一化 计数/FPKM 右偏
蛋白工程 序列编码、标准化 assay 读数 批次效应常单独建模
推荐系统 用户/物品 ID Embedding 高基数类别
工业传感器 去趋势、滑动 z-score 时序非平稳

4. 常见误用(D8)

图 4 预处理误用

误用 后果
全数据 fit scaler 再划分 泄漏08/01
测试集上做 log 参数估计 Box-Cox $\lambda$ 应用 train 估计值
树模型强行 z-score 通常不必,但无害
忽略类别泄漏 Target Encoding 未 CV 内 fit
变换后不记录逆变换 预测区间无法还原原单位

5. 小结

预处理是 ML 可复现性有效泛化的基础。下一篇:02 标准化与归一化

系列导航10 Pipeline | Math-08/06 CV

-------------本文结束感谢您的阅读-------------