ml-cnn-visionlisted
Install: claude install-skill fieldlu/Machine-learning-skills
# 卷积网络的适用判断 — 归纳偏好匹配了才值得用
## R — 原文 (Reading)
> **来源说明**: 本 skill 属扩充批D——主题超出西瓜书覆盖范围(西瓜书第 5 章未涉及卷积网络),R 段改引 CNN 奠基文献并标注来源性质;凡无法保证逐字精确处一律标(转述)。
> Convolutional networks combine three architectural ideas to ensure some degree of shift and distortion invariance: local receptive fields, shared weights, and spatial or temporal sub-sampling.(转述)
>
> — 转述自 Y. LeCun 等《Gradient-Based Learning Applied to Document Recognition》(Proc. IEEE, 1998), 即 LeNet-5 论文(来源性质:奠基论文公认表述)
> Degradation is not caused by overfitting: deeper plain networks have higher *training* error. We hypothesize that it is easier to optimize the residual mapping than the original, unreferenced mapping—letting stacked layers fit F(x) = H(x) − x, so H(x) = F(x) + x with identity shortcuts.(转述)
>
> — 转述自 K. He 等《Deep Residual Learning for Image Recognition》(CVPR 2016)(来源性质:奠基论文公认表述)
---
## I — 方法论骨架 (Interpretation)
用不用 CNN,取决于数据的**信号结构**与卷积的**归纳偏好**是否对得上,而不是"这是不是图像任务"的表面标签:
- **归纳偏好三件套**: 局部性(相邻像素相关性强,特征先在小邻域内提取)、参数共享(同一模式在图中任何位置同样有用——平移不变性)、下采样层次化(浅层边缘纹理→深层部件语义)。信号满足这三条(图像、谱图、某些时频表示)→ 卷积是高性价比先验;不满足 → 先验变成枷锁。
- **组件决策链**: ①感受野靠堆叠——两层 3×3 等效 5×5 视野但参数更少、非线性更多,VGG 式小核堆叠是默认;②池化的职责是把空间分辨率降下来换取平移鲁棒性与计算量控制,现代替代品是步长卷积;③BatchNorm 插在卷积后、激活前,让深层堆叠可训(其工程细节归 `ml-deep-training-playbook`);④通道数随深度递增、分辨率随深度递减,是"语义变浓、位置变粗"的标准交换。
- **架构演进逻辑**: LeNet 证明手写数字可端到端;AlexNet 靠 GPU+ReLU+Dropout 把同一思想放大到 ImageNet;VGG 用统一的小核堆叠把"深度换表达力"推到 19 层;再加深撞上**退化问题**——更深的普通网络训练误差反而更高(优化困难而非过拟合)。ResNet 的残差连接 F(x)+x 给恒等映射留出默认通路,梯度获得跨层高速通道,上百层从此可训。
- *