ml-explainability-xailisted
Install: claude install-skill fieldlu/Machine-learning-skills
# 可解释性方法论 — 先问"解释给谁看、干什么用",再挑工具
## R — 原文 (Reading)
> (转述)Ribeiro 等指出:人们对模型的信任有两个层面——相信它在预测,与相信它能被部署;全局指标掩盖不了单个样本上不可理喻的行为。他们主张用局部忠实:在待解释样本邻域内拟合一个可理解的线性代理,以此近似黑箱在该点附近的决策依据(LIME)。
>
> — Marco Ribeiro 等, ""Why Should I Trust You?": Explaining the Predictions of Any Classifier" (KDD 2016)
> (转述)Lundberg 等把 Shapley 值从合作博弈论引入特征归因:把预测视为各特征的联合产出,按公理化公平原则(有效性/缺失性/一致性)将贡献唯一地分派给每个特征(SHAP),并给出与多种既有归因方法的统一视角。
>
> — Scott Lundberg & Su-In Lee, "A Unified Approach to Interpreting Model Predictions" (NeurIPS 2017)
> (转述)显著性图类方法(对输入求梯度并可视化)成为视觉模型解释的主流直觉工具;但后续研究反复提醒:梯度饱和、平滑选择等实现细节会让同一模型对同一样本给出截然不同的"解释",解释的稳定性本身需要检验。
>
> — saliency map 方法族的社区共识(Simonyan 2014 起源;Adebayo 2018 等健全性检验)
---
## I — 方法论骨架 (Interpretation)
可解释性不是一个属性,是三种不同的需求,混着谈必然选错工具:
- **信任动机**(用户/业务方愿不愿意采纳):要的是"这个决定讲得通",个案级故事即可;
- **调试动机**(开发者找模型哪里学坏了):要的是暴露异常模式——重要性排序里冒出不可能的特征(如病历号),就是数据泄漏或管道 bug 的信号;
- **合规审计动机**(监管要求可申诉的决策):要的是稳定、有文档、可复现的解释,且方法本身经得起质证——这里事后解释的随意性是大问题。
**选型的第一刀**:内在可解释 vs 事后解释。若可解释是硬约束且精度代价可承受(信贷规则、医疗筛查初筛),直接用透明的模型族(线性/树/规则),解释即模型本身,无忠实度问题;若必须用黑箱(精度差距不可放弃),才进入事后解释工具箱。
**事后解释三件套**:
- **LIME**: 在目标样本邻域扰动采样、拟合稀疏线性代理——快、直观、任意模型可用,但每次结果有随机波动,适合快速个案侦查;
- **SHAP**: 博弈论分派的公理化归因——理论性质好(加和一致)、有统一实现,但计算贵、且"分派公平"不等于"特征在现实中起因果作用";
- **saliency/反事实解释**: 视觉场景看热力图,或问"改动哪个输入最少能翻转预测"——后者特别适合申诉场景("收入再高两万就会通过")。
**正确用法与误用的分界线**:全局重要性排序用于找数据与管道问题、校验模型是否依赖合理证据;个案解释用于申诉复核与人机协同。误用是把事后解释读成因果声明——"SHAP 说年龄贡献最大"只说明模型用了年龄,不说明改年龄会改变真实结果。**高保真 vs 高可用的权衡**贯穿全程:越忠实的解释往往越难懂(完整 SHAP 交互矩阵没人看得懂),越易懂的代理越可能失真——选型时必须声明你牺牲了哪一头。
---
## A1 —