← ClaudeAtlas

ml-pitfall-auditlisted

新项目/新模型上线前的六问前提审查清单。报告"指标虚高""线下好线上崩""加数据反而 变差""结果不可复现",或上线/投稿前需健全性检查时调用。六问:训练数据无偏采样吗/ 测试错误率独立采样吗/分布形式假设对吗/集成个体误差独立吗/未标记样本同分布且相似→ 相似吗/完美表现是不是信息泄露。每问配诊断信号+修正方案。不适用于已定位的单一技术 问题、纯工程bug。trigger: data leakage, 数据穿越, assumption check, 线下线上 不一致, offline online gap, too good to be true, sanity check, 审稿被质疑。
fieldlu/Machine-learning-skills · ★ 0 · AI & Automation · score 66
Install: claude install-skill fieldlu/Machine-learning-skills
# ML 前提审计清单 (Pitfall Audit) ## R — 原文 (Reading) > "此类方法有一个关键:模型假设必须准确,即假设的生成式模型必须与真实数据分布吻合; > 否则利用未标记数据反倒会降低泛化性能。遗憾的是,在现实任务中往往很难事先做出准确的 > 模型假设,除非拥有充分可靠的领域知识。" > > — 周志华《机器学习》第13章13.2节 > "再缩放的思想虽简单,但实际操作却并不平凡,主要因为'训练集是真实样本总体的无偏采样' > 这个假设往往并不成立,也就是说,我们未必能有效地基于训练集观测几率来推断出真实几率。" > > — 周志华《机器学习》第3章3.6节 --- ## I — 方法论骨架 (Interpretation) 机器学习教科书教的是"前提成立时怎么办";这个 skill 处理的是**前提本身塌了**的情形。书里每个流行技巧背后都藏着一个几乎从不被检查的前提:再缩放假设训练集无偏采样(x18)、交叉验证 t 检验假设错误率独立采样(x11)、极大似然假设分布族正确(x27)、集成指数下降假设误差独立(x32)、半监督假设未标记样本同分布且"相似样本相似输出"(x45)、一切离线评估假设没有信息泄露(x15/x43)。这些前提单独看都是某章的一个脚注,但它们共享同一个结构:**结论的有效范围由一条未被观测的假设决定,且假设失效时的症状恰好长得像"方法不太行"或"运气不错"**——于是被误诊为调参问题或好消息。本 skill 把六个前提聚成一张上线前检查表:每一问都有明确的诊断信号(可观测)、失效后果(可预期)与修正动作(可执行),把"事后翻车归因"前移为"事前三十秒审查"。 --- ## A1 — 书中的应用 (Past Application) ### 案例 1: 半监督的反噬警告 (x45, 配 c32) - **问题**: 西瓜地里只有少量瓜知道好坏(有标记),大量瓜不知道——直接利用未标记瓜一定能提升模型吗? - **方法论的使用**: 作者先摆出正面机制(聚类假设/流形假设桥接有标记与未标记),随即给出惊悚反转:生成式方法的模型假设不准时,海量未标记数据会把模型拽偏,泛化性能**下降**而非上升;并介绍 S4VM 式最坏情形保护。 - **结论**: 未标记数据不是免费午餐,使用前必须验证桥接假设,并保留纯监督基线对照。 - **结果**: "假设错了会倒扣分"成为全书前提审查主题最强的跨章证据之一。 ### 案例 2: 高维小样本下的完美表现 (x15 并入 x43) - **问题**: p/n=50 的回归任务 R²=0.95、线性 SVM 训练精度 100%——该高兴吗? - **方法论的使用**: 作者指出高维小样本下普通最小二乘秩亏、闭式解失效,解凭实现细节随机;而"完美线性可分"可能恰是过拟合假象(升维总能分开=记住噪声)。 - **结论**: 训练集满分是红旗不是捷报;动作是加正则、调小 C、交叉验证复核,而非庆祝上线。 - **结果**: 与验证集设计纪律合并,构成第六问"完美表现是不是泄露/过拟合"的诊断原型。 --- ## A2 — 触发场景 (Future Trigger) ★ ### 用户会在什么情境下需要这个 skill? 1. 离线 AUC 涨了 5 个点、上线后效果持平甚至下跌,找不到原因。 2. 模型表现"好得不真实"(99%+ 准确率、R²=0.95 on p≫n),想确认是不是哪里出了问题。 3. 论文投稿前自查,或审稿人质疑"10