ml-dimensionalitylisted
Install: claude install-skill fieldlu/Machine-learning-skills
# 高维数据的降维/特征选择决策框架
## R — 原文 (Reading)
> "在高维情形下出现的数据样本稀疏、距离计算困难等问题,是所有机器学习方法共同面临的
> 严重障碍,被称为'维数灾难'(curse of dimensionality)。缓解维数灾难的一个重要途径
> 是降维(dimension reduction)。"
>
> — 周志华《机器学习》第10章10.1-10.2节
> "L1 范数和 L2 范数正则化都有助于降低过拟合风险,但前者还会带来一个额外的好处:
> 它比后者更易于获得'稀疏'(sparse)解……基于 L1 正则化的学习方法就是一种嵌入式特征
> 选择方法,其特征选择过程与学习器训练过程融为一体,同时完成。"
>
> — 周志华《机器学习》第11章11.4节
---
## I — 方法论骨架 (Interpretation)
高维不是"特征太多"一个数字问题,而是**有效自由度可能远低于表观维度**的结构问题——数据往往暗藏一个低维嵌入。整个决策框架是一条诊断链:
1. **先诊断症状**:最近邻与最远邻的距离比值趋近 1(距离集中)、样本密度骤降——命中即宣告 kNN 类方法失效,别再调参硬扛。
2. **再问本质维度在哪**:任务相关的信息若集中在少数方向→线性路线(PCA:既可理解为"最大可分投影"也可理解为"最小重构误差",两种相反直觉推出同一方法是根基稳固的信号);若沿弯曲流形分布→流形路线(Isomap 用测地线代替直线距离,警惕噪声桥接造成短路);若全局结构光滑但非线性→核化(KPCA)。
3. **特征选择是另一条腿**:过滤法快而粗糙,包裹法准而昂贵,嵌入式(L1)把选择并入训练。注意贪心搜索注定局部最优,LVW 型随机搜索在限时下可能无解。
4. **高维小样本必正则化**:p≫n 时普通最小二乘秩亏、闭式解失效、系数爆炸——正则项不是可选项。L1 的菱形等值线让解落在坐标轴上从而自动完成特征选择。
5. **两处视角升级**:(a) 与其找空间不如直接学距离——度量学习把反复手调的相似度权重参数化为马氏矩阵端到端学;(b) 信息不全的任务先找"稀疏域"再谈恢复——压缩感知/矩阵补全证明欠定方程因稀疏先验起死回生。
---
## A1 — 书中的应用 (Past Application)
### 案例 1: 虫子爬 S 形曲面 — 测地线动机 (c28)
- **问题**: 一只虫子在 S 形曲面上爬行,曲面上的两点间"本真距离"是什么?
- **方法论的使用**: 作者指出欧氏直线距离是"抄近路"穿过三维空��,不是虫子贴面爬行的测地线;流形学习的做法是用近邻图上的最短路近似测地线,再在低维还原。
- **结论**: 数据沿弯曲流形分布时线性 PCA 会破坏拓扑,需走流形路线;且要警惕噪声点桥接环两侧造成"短路"。
- **结果**: 该类比成为 Isomap 动机的标准传播载体,也构成"线性不行→全局核化还是局部流形"分流点的直觉基础。
### 案例 2: L1 vs L2 等值线图解 (c29)
- **问题**: 为什么 L1 比 L2 更容易产生稀疏解?
- **方法论的使用**: 作者用等值线图说明:L1 的菱形约束边界有尖角,与损失等值线的交点容易落在坐标轴上(分量恰为 0);L2 的圆滑边界交点多在象限内(稠密收缩)。
- **结论**: 求解过程本身就是特征选择;但也暗示 L1 不总产稀疏解,不能当口诀用。
- **结果**: 该图解成为"想要自动特