← ClaudeAtlas

ml-svm-playbooklisted

SVM 使用决策树:可分性判断→硬/软间隔→核函数选型→C 与 γ 调优→规模可行性。用户问 "SVM 参数怎么选""选哪个核 / kernel choice""C 和 gamma""支持向量机适用场景",或完美可 分而沾沾自喜、大数据上硬跑非线性核时激活。纪律:默认软间隔(完美线性可分可能是过拟合假 象);文本用线性核、不明先试高斯核;核选择是最大变数且未决;非线性核不低于 O(m²)。 不适用于:横向选型(ml-task-matching)、需自然概率输出的场景。trigger: support vector machine, kernel trick, soft margin, hinge loss, RBF kernel, 核函数。
fieldlu/Machine-learning-skills · ★ 0 · AI & Automation · score 66
Install: claude install-skill fieldlu/Machine-learning-skills
# SVM 使用决策树 — 从间隔到核到 C/γ 的完整走法 ## R — 原文 (Reading) > "直观上看,应该去找位于两类训练样本'正中间'的划分超平面……该划分超平面对训练样本局部扰 > 动的'容忍'性最好。……这个划分超平面所产生的分类结果是最鲁棒的,对未见示例的泛化能力最 > 强。" > > — 周志华,《机器学习》第6章 6.1节 "间隔与支持向量" > "然而在现实任务中,原始样本空间内也许并不存在一个能正确划分两类样本的超平面。……可将样 > 本从原始空间映射到一个更高维的特征空间,使得样本在这个特征空间内线性可分。" > > — 周志华,《机器学习》第6章 6.3节 "核函数" > "'核函数选择'成为支持向量机的最大变数。若核函数选择���合适,则意味着将样本映射到了一个不 > 合适的特征空间,很可能导致性能不佳。"(边注:"对文本数据通常采用线性核,情况不明时可先尝 > 试高斯核") > > — 周志华,《机器学习》第6章 6.3节 --- ## I — 方法论骨架 (Interpretation) SVM 的一切设计都从一个观察出发:能把两类分开的超平面有无穷多个,要选的是"正中间"、对局部扰动容忍性最好的那一个——最大化间隔等价于最小化 ‖w‖²。由此长出一棵四层决策树: 1. **可分性**:原空间线性可分吗?不可分就升维——有限维原空间必存在使其可分的高维特征空间;核函数 κ(·,·) 让你不必显式计算那个(可能无穷维的)映射。 2. **硬还是软**:即便找到了完美分开训练集的解,也很难断定它不是过拟合造成的。所以现实任务默认软间隔:引入松弛变量允许少数样本越界,用常数 C 折中"间隔大"与"违约少"。 3. **选哪个核**��核隐式定义特征空间,选错核 = 映射进错误空间,调参救不回来。经验序列:文本/高维稀疏 → 线性核;情况不明 → 先试高斯核;仍不行 → 考虑多核组合(借集成思想)。 4. **调 C 与 γ**:C 是对越界的容忍度旋钮,γ 控制高斯核的作用半径;二者都要靠交叉验证定,且选定后在全量数据上重训。 贯穿始终的一条暗线:SVM 的解只由少数支持向量决定,其复杂度主要与支持向量数目有关——这既是它的效率来源,也是大规模数据上的天花板。 --- ## A1 — 书中的应用 (Past Application) ### 案例 1: 最大间隔超平面的鲁棒性论证 (c18) - **问题**: 无穷多个能分开两类的超平面,凭什么选间隔最大的? - **方法论的使用**: 作者给出直觉论证——由于训练集的局限性或噪声,训练集外样本可能比训练样本更贴近分隔界,多数超平面会因此出错,唯有居中的超平面受影响最小。 - **结论**: 最大间隔不是几何审美,是对未见样本泛化能力的直接下注;随后形式化为支持向量、间隔与 min ½‖w‖² 基本型。 - **结果**: 对偶求解后 KKT 条件显示最终模型仅与支持向量有关——"训练完成后,大部分的训练样本都不需保留",这一稀疏性成为 SVM 的标志性性质。 ### 案例 2: 异或问题的核技巧升维 (c19) - **问题**: 异或在二维原空间非线性可分(呼应 ch05 感知机的困境),怎么办? - **方法论的使用**: 映射到合适的三维空间即线性可分;但 φ(x)ᵀφ(z) 直接计算开销巨大甚至无穷维,于是用核函数在原空间直接算出高维内积——"核技巧"。定理 6.1 给出合法性判据:对称函数的核矩阵半正定即可作核。 - **