本页为 Math-09 特征预处理与变换 子系列总论。原始数据很少直接适合模型——量纲、偏态、缺失、类别 都需处理。
段末注释:特征工程(feature engineering)含构造新特征与预处理;本系列聚焦对已有特征的数学变换,而非深度表示学习。
系列入口:00.系列规划 | 前置:Math-03/06 范数、Math-08/01 泛化
1. 为何需要预处理(D1–D2)

| 问题 | 后果 | 典型变换 |
|---|---|---|
| 量纲不一 | 距离/L2 被大单位主导 | 02 标准化 |
| 右偏分布 | t 检验/线性假设违背 | 03 log/Box-Cox |
| 类别变量 | 模型需数值输入 | 04 编码 |
| 缺失/异常 | 无法训练或拉偏估计 | 05 缺失异常 |
2. 预处理地图(D4–D6)

1 | 连续数值 |
与 Math-04/03 SGD:缩放改善 条件数;与 Math-01/08 正态性:变换后再检验。
3. 跨领域例子(D7)

| 领域 | 典型预处理 | 说明 |
|---|---|---|
| 表格金融 | RobustScaler、Winsorize | 极端收益、缺失评级 |
| 计算机视觉 | 减均值除标准差、/255 | ImageNet 统计或数据集自身 |
| NLP | 分词、子词、位置编码 | 非传统 scaler,见 20 |
| 基因组表达 | $\log_2(x+1)$、分位数归一化 | 计数/FPKM 右偏 |
| 蛋白工程 | 序列编码、标准化 assay 读数 | 批次效应常单独建模 |
| 推荐系统 | 用户/物品 ID Embedding | 高基数类别 |
| 工业传感器 | 去趋势、滑动 z-score | 时序非平稳 |
4. 常见误用(D8)

| 误用 | 后果 |
|---|---|
| 全数据 fit scaler 再划分 | 泄漏(08/01) |
| 测试集上做 log 参数估计 | Box-Cox $\lambda$ 应用 train 估计值 |
| 树模型强行 z-score | 通常不必,但无害 |
| 忽略类别泄漏 | Target Encoding 未 CV 内 fit |
| 变换后不记录逆变换 | 预测区间无法还原原单位 |
5. 小结
预处理是 ML 可复现性与有效泛化的基础。下一篇:02 标准化与归一化。
系列导航:10 Pipeline | Math-08/06 CV