← ClaudeAtlas

ml-methodology-routerlisted

ML 方法论问题总入口(Machine Learning Methodology Router),统辖 38 个子 skill 的决策方法合集。 用户提出任何涉及机器学习决策/判断的问题时应最先激活本 skill:先判断其处于工作流哪一段 (选型前 / 实验设计与数据准备 / 模型族内部施工 / 训练与调参 / 结果诊断 / 特殊场景 / 大模型场景 / 工程交付 / 专项进阶 / LLM 应用与运维),再派发到对应子 skill 并说明理由。 触发信号:"该用什么算法/模型"、"X 和 Y 哪个好"、"榜单第一为什么输"、"怎么设计实验/评估"、 "过拟合了怎么办"、"效果不好"、"accuracy 99% 却没用"、"类别不平衡"、"冲榜/集成/融合模型"、 "特征太多/降维"、"聚类分几类"、"贝叶斯/概率图/生成模型"、"loss 不降/NaN"、 "warmup/Adam 还是 SGD"、"dropout 设多少"、"超参怎么搜/Optuna"、"结果复现不了/checkpoint 存什么"、 "是不是有泄漏"、"多分类怎么拆"、"只有几百条标注"、"强化学习适不适合"、"要可解释的规则"、 "Transformer 还是 CNN"、"要不要微调/LoRA"、"prompt 时好时坏"、"LLM 榜单可信吗"、"模型要上线"、 "结果好得可疑"、"理论保证何时能信"、"牛顿法还是梯度下降/KKT 对偶"、"该不该用 CNN/卷积核感受野"、 "RNN 还是 LSTM/门控/seq2seq"、"AutoML 靠谱吗/NAS 怎么回事"、"相关还是因果/混杂/反事实/ 政策评估归因"、"LIME/SHAP 怎么选/黑箱怎么解释"、"联邦学习怎么做/差分隐私 ε/数据不出域"、 "RAG 还是长上下文/切块/embedding 选型/引用溯源"、"多模态融合/CLIP 零样本"、"RLHF/PPO 还是 DPO/奖励黑客"、"影子金丝雀 A-B/PSI 漂移/什么时候重训";英文: "which model should I use", "how to evaluate", "overfitting", "class imbalance", "data leakage", "hyperparameter search", "reproducibility", "fine-tune vs prompt", "b
fieldlu/Machine-learning-skills · ★ 0 · AI & Automation · score 66
Install: claude install-skill fieldlu/Machine-learning-skills
# ML 方法论总控路由(ML Methodology Router) ## R — 原文 (Reading) > 机器学习的本质是从有限样本出发在巨大假设空间中做选择以获得泛化能力,因此一切学习系统的设计都围绕"如何评估、如何选择、如何缓解过拟合"这三个问题展开。"泛化"——学得模型适用于没在训练集中出现的新样本的能力,是全书唯一最高目标。 > > — 周志华《机器学习》第1章绪论主旨(据阶段 0 BOOK_OVERVIEW 整书理解提炼) --- ## I — 方法论骨架 (Interpretation) 本 skill 是三十八个子 skill 的调度器,自己不做任何具体分析。它做的事只有一件:在任何 ML 方法论问题被回答之前,先定位"用户此刻卡在工作流的哪一段",再把问题交给管那一段的子 skill。 西瓜书的论证顺序就是这张路由图的来源:第1章先立根本目标(泛化)并证明"脱离任务谈算法优劣无意义"(NFL),第2章立刻建立评判武器库(评估方法 × 性能度量 × 比较检验 + 偏差-方差归因),之后各模型族、集成、降维、概率建模才围绕这条评估主线并列展开。也就是说:**先明确任务与目标,再谈怎么评,最后才轮到用什么模型**——用户的提问无论从哪句开始,都可以映射回这条主干上的某个位置。 批A 九个子 skill 原文锚定于西瓜书;批B/批C 十八个新子 skill 是对原书时代局限的外推补全:深度训练栈、HPO、实验可复现、特征工程、泄漏防御出自工程实践共识,Transformer/预训练范式/提示方法/LLM 评估出自经典文献共识;批D 五个新子 skill 补数学与架构基础(优化方法/CNN/RNN/AutoML-NAS/对齐 RLHF),批E 六个新子 skill 补应用与交叉学科(因果推断/XAI/联邦隐私/RAG/多模态/MLOps)——派发到这些 skill 时应保留其自带的时代边界声明。 十段工作流(路由表的分组依据): 1. **选型前**——问题还没被刻画清楚,或正在争论"谁更强"、该不该进某个范式; 2. **实验设计与数据准备**——要跑实验、定度量、管数据、记过程; 3. **模型族内部施工**——已选定某族模型,需要该族的专属决策树; 4. **训练与调参**——训练动力学故障、正则配置、超参与架构搜索; 5. **结果诊断**——已有结果但不符合预期,需要归因; 6. **特殊场景**——问题带有结构性特殊信号(不平衡/高维/集成); 7. **大模型场景**——架构选型、范式档位、提示施工、LLM 能力评估; 8. **工程交付**——上线前审计、理论适用性横向审查; 9. **专项进阶**——横切的方法论深水区:优化理论、因果思维、事后解释、隐私保护; 10. **LLM 应用与运维**——对齐生产、检索增强、多模态建模、上线后生命周期。 --- ## A1 — 书中的应用 (Past Application) ### 案例 1: 全书章节编排本身就是一次路由决策 - **问题**: 为什么一本机器学习教材在讲任何具体模型之前,先用整整一章讲"模型评估与选择"? - **方法论的使用**: 周志华把第2章(评估三件套 + 偏差-方差分解)置于所有模型章(线性/决策树/神经网络/SVM/贝叶斯,第3–7章)之前——编排上的主张是:没有科学的尺子,就没有资格谈模型好坏。 - **结论**: 第2章成为全书枢纽,此后每章结尾都回扣"泛化性能"这条主线。 - **结果**: BOOK_OVE