ml-deep-training-playbooklisted
Install: claude install-skill fieldlu/Machine-learning-skills
# 深度训练排障手册 — 训练不动时按固定顺序逐层排除
## R — 原文 (Reading)
> (转述)Glorot 与 Bengio 主张:初始化应让信号在前向与反向传播中都保持稳定的方差尺度,否则深层网络的激活与梯度会随深度指数衰减或放大;He 等随后针对 ReLU 的单边响应修正方差系数,使极深���络从第一步起就能有效收敛。
>
> — Xavier Glorot & Yoshua Bengio (2010);Kaiming He 等《Delving Deep into Rectifiers》(2015)
> (转述)Ioffe 与 Szegedy 提出:把每层输入按 mini-batch 统计量重新标准化,可显著缓解训练中层间输入分布的持续漂移,从而允许更大学习率、放宽对初始化的敏感度;训练用批统计量、推理须换滑动平均统计量。
>
> — Sergey Ioffe & Christian Szegedy《Batch Normalization》(2015)
> (转述)He 等观察到 56 层普通网络的训练误差反而高于 20 层——退化源于优化困难而非过拟合;将堆叠层重构为学习相对输入的残差映射(F(x)+x)后,上百层网络得以稳定训练。
>
> — Kaiming He 等《Deep Residual Learning for Image Recognition》(2016)
---
## I — 方法论骨架 (Interpretation)
深度训练失败极少是单一的神秘原因,绝大多数落在一条确定的排查链上。链的骨架由四组奠基工作搭起:
- **初始化**(Glorot & Bengio 2010; He 2015)���各层激活与梯度方差若不被刻意稳定,信号会沿深度指数衰减或放大——训练不动先问"第一层出来的东西还活着吗"。
- **归一化**(BatchNorm 2015 / LayerNorm 2016):对层间输入重新标准化,允许更大学习率并放宽初始化敏感度;卷积/大批量场景 BN、序列与 Transformer 场景 LN 是当前共识分工。
- **优化器**(momentum 2013; Adam 2015; AdamW 2019):SGD+动量泛化口碑好但对超参娇气;Adam 系鲁棒省心,但权重衰减必须与自适应更新解耦(AdamW)才真正生效。
- **调度**(warmup + 余弦/线性衰减,Vaswani 2017 起):初期小步试探防热启动发散,后期退火���精修。
操作纪律三条:①先证明数据管道是通的(小样本过拟合测试),再谈优化器;②一次只动一个变量,否则涨跌都无法归因;③把梯度范数当仪表盘看——消失查激活/初始化/缺残差,爆炸上裁剪与降学习率。
---
## A1 — 文献中的经典应用 (Past Application)
*(本批主题超出西瓜书覆盖范围,A1 改引奠基文献的经典案例,均为学界公认的原始实验叙述)*
### 案例 1: ResNet 与"退化问题"的定性
- **问题**: He 等在 CIFAR-10 上发现 56 层普通卷积网的训练误差反而高于 20 层——不是过拟合(训练误差也高),是更深的网络优化不动。
- **方法论的使用**: 先把"加深必然更好"的假设拆开,确认瓶颈在优化端而非容量端;再将堆叠层重构为 F(x)+x 的残差形式,给恒等映射留出默认通路,让梯度拥有跨层高速通道。
- **结论**: 退化是优化问题而非容量问题;残差重构后 152 层网