← ClaudeAtlas

ml-federated-privacylisted

隐私保护机器学习决策链:判断该不该上联邦学习并给配置路线。当数据因合规(医疗/金融)、 数据主权不能集中,用户问"联邦学习怎么做/FedAvg 原理"、担心模型泄露训练数据、纠结 差分隐私 ε 怎么定时激活。动作:集中化资格判定→FedAvg 与 non-IID 现实(i.i.d. 假设 在联邦场景失效)→威胁模型与成员推断→DP 预算直觉→工程配置。不适用于:数据可合法集中 的普通训练、攻击实现细节。触发词: federated learning 联邦学习, FedAvg, 数据不出域, differential privacy 差分隐私, membership inference 成员推断, non-IID, 梯度泄漏
fieldlu/Machine-learning-skills · ★ 0 · AI & Automation · score 66
Install: claude install-skill fieldlu/Machine-learning-skills
# 隐私保护机器学习 — 先问"能不能集中",再谈"怎么联邦" ## R — 原文 (Reading) > (转述)McMahan 等提出 FedAvg:把训练下放到终端设备——各客户端在本地数据上跑若干步 SGD,只把更新后的权重上传服务器做加权平均(权重正比于各端样本量),如此多轮迭代;相比每次上传梯度的朴素方案,通信量大幅下降,使"亿万手机共同训练一个模型而不上传原始数据"在工程上成立。 > > — Brendan McMahan 等, "Communication-Efficient Learning of Deep Networks from Decentralized Data" (AISTATS 2017) > (转述)Kairouz 等在联邦学习系统综述中强调:真实联邦场景的数据是统计异质的——每个客户端的本地分布互不相同且都不同于总体分布,这导致本地最优方向与全局最优方向系统性偏离,收敛困难、客户端漂移、个性化与泛化的张力贯穿全部设计;非独立同分布不是需要清洗的异常,而是问题定义本身的一部分。 > > — Peter Kairouz 等, "Advances and Open Problems in Federated Learning" (2021, 综述) > (转述)差分隐私(Dwork 起):一个算法是 ε-差分隐私的,当任意单条记录的加入或移除对输出分布的改变不超过由 ε 刻画的倍数——隐私因此成为可量化、可组合的数学性质而非一句"我们脱敏了";代价是注入的噪声随隐私预算收紧而增大。 > > — Cynthia Dwork 差分隐私框架的通行表述(Dwork & Roth 综述) --- ## I — 方法论骨架 (Interpretation) **第一步永远是资格判定:为什么数据不能集中?** 医疗病历跨院共享受法规限制;金融风控特征涉及监管红线;手机键盘词库、可穿戴健康数据的主权天然属于用户;企业间"数据孤岛"各有商业顾虑。如果数据其实可以合法集中(同一主体内部、已获授权),直接集中训练几乎总是更好——FL 的通信成本、调参难度、精度损失只有在"不得不"时才值得付。 **核心机制一句话**:数据不动模型动——FedAvg 让各参与方本地训练、只上传模型更新,服务器聚合成全局模型再下发。两个变体维度:横向联邦(各方特征空间相同、用户不同——两家银行的同类客户)vs 纵向联邦(用户重叠、特征不同——银行+电商看同一批人);跨设备(海量终端、单端数据少、随时掉线)vs 跨机构(参与方少而稳定、单方数据大)。 **威胁模型先行**:"数据没出域"不等于"隐私安全"。上传的梯度/参数本身可能反推原始数据(梯度泄露攻击可重建高分辨率训练图像);更现实的威胁是**成员推断**——判断"某条记录是否在训练集里",医疗场景这一条就足以致命(暴露某人患病史)。防线按需叠加:差分隐私(对更新加噪,提供数学保证)、安全聚合(服务器只见总和不见个体)、安全多方计算/同态加密(纵向联邦的交换环节)。**DP 预算直觉**: ε 是"单条记录能影响输出的上限倍数",ε 越小越私密但噪声越大;常见工作区在个位数到几十之间,且预算随查询次数累积——它是一笔会花完的钱。 **回扣西瓜书**:全书一切评估与泛化论证建立在 i.i.d. 假设上,而 FL 里每个客户端就是一个分布——i.i.d. 在这里系统性失效。non-IID 下 FedAvg 会发生"客户端漂移",全局模型可能明显劣于集中训练(gap 大小取决于分布差异程度),