← ClaudeAtlas

ml-overfitting-modernlisted

深度场景的正则化工具箱与过拟合诊断手册。当用户问 Dropout 放哪层/比例多少、weight decay 与 L2 区别、数据增强怎么配、标签平滑、正则叠加是否欠拟合,或报"训练 loss 为 0 而 gap 很大"时激活; 含双下降甄别——插值训练集却泛化良好时,经典"gap=过拟合"直觉需重新标定;纪律:先单手段消融 再组合。不适用于:传统模型过拟合(ml-diagnosis)、训练不动/NaN(ml-deep-training-playbook)。 触发词: dropout, weight decay, label smoothing, double descent
fieldlu/Machine-learning-skills · ★ 0 · AI & Automation · score 66
Install: claude install-skill fieldlu/Machine-learning-skills
# 现代正则化手册 — 深度过拟合的工具箱与"gap≠过拟合"的新信号 ## R — 原文 (Reading) > (转述)Srivastava 等提出 Dropout:训练时以概率 p 随机丢弃单元,阻止单元间的共适应,效果近似于同时训练指数级多的共享权重的子网络并集成;推理时不丢弃、按保留概率缩放权重。 > > — Nitish Srivastava 等《Dropout》(JMLR 2014) > (转述)Goodfellow 教科书将深度网络的泛化归为容量控制问题:数据集增强是对算法所知的不变性先验的最直接注入;早停被描述为极其廉价、几乎无副作用的超参数——验证集上未见改善即停。 > > — Goodfellow, Bengio & Courville《Deep Learning》第 7 章(2016) > (转述)Szegedy 等在 Inception 工作中提出标签平滑:把 one-hot 目标向均匀分布做小比例收缩,可抑制 logits 无界增大带来的过自信,改善泛化。 > > — Christian Szegedy 等《Rethinking the Inception Architecture》(2016) > (转述)Belkin 等指出:现代过参数化模型在样本量越过插值阈值后,测试误差可随模型规模再次下降——"偏差-方差 U 形权衡"之外存在双下降现象,经典统计直觉在大模型区间需要修正。 > > — Mikhail Belkin 等《Reconciling modern machine learning practice and the bias-variance trade-off》(PNAS 2019) --- ## I — 方法论骨架 (Interpretation) 西瓜书的正则化叙事是"控制假设空间复杂度":剪枝、早停、L2/L1 都是把模型往简单推。深度时代这套叙事要补两块: **第一块:工具箱换血。** 深度网络的主力正则不再是惩罚项,而是五件套——①Dropout(随机失活近似隐式集成);②数据增强(对输入空间注入不变性先验,NLP 对应回译/词替换,视觉对应裁剪翻转混类);③权重衰减(AdamW 解耦后才真正起效,与朴素"L2 加进梯度"不是一回事);④标签平滑(压制过自信 logits);⑤早停(最廉价的默认项)。它们的共同点:都不改损失函数形式,而是改变优化轨迹或信息通路。 **第二块:诊断标定重画。** 经典判据"train-val gap 大 = 过拟合"在过参数化区间失效:现代网络常能零误差拟合训练集同时泛化良好(良性过拟合/插值),且测试误差随规模呈双下降曲线。因此深度场景的过拟合判定要看三条新证据:验证曲线是否已回升(而非只看 gap 绝对值)、增强/增数据能否缩小 gap(有效则真是方差问题)、同配置多 seed 的 gap 波动(排除噪声误报)。 操作纪律:正则强度是和容量联动的旋钮——加正则���先确认当前处于欠拟合端还是过拟合端;叠加多种手段必须逐个消���,因为正则叠加过量会制造"假性欠拟合",症状与病根恰好相反。 --- ## A1 — 文献中的经典应用 (Past Application) *(本批主题超出西瓜书覆盖范围,A1 改引奠基文献的经典案例,均为学界公认的原始实验叙述)* ### 案例 1: Dropout 在全连接网上的验证 - **问题**: 大型全连接网络极易过拟合,集成又受算力限制无法训几十个副本。 - **方法论的使用**: 训练中