ml-transformer-eralisted
Install: claude install-skill fieldlu/Machine-learning-skills
# Transformer 时代架构选型 — 规模与形态决定骨架,而非流行度
## R — 原文 (Reading)
> (转述)Vaswani 等提出 Transformer:完全基于注意力机制,摒弃递归与卷积;自注意力把每个位置表示为查询(Q)、键(K)、值(V)三元组参与全局交互,配合位置编码注入顺序信息;在机器翻译上以更短的训练时间达到当时最优质量。
>
> — Vaswani 等《Attention Is All You Need》(NeurIPS 2017)
> (转述)Kaplan 等系统报告规模定律:模型性能随参数量、数据量、算力的幂律平滑提升,且跨多个数量级成立——这为"投入多大模型配多少数据"提供了外推依据。
>
> — Jared Kaplan 等《Scaling Laws for Neural Language Models》(2020)
---
## I — 方法论骨架 (Interpretation)
西瓜书第 5 章的神经网络叙事止于 BP 与浅层网络,对"该搭什么骨架"没有给出现代答案。本 skill 补全这个决策:**架构选择是归纳偏好的选择,而归纳偏好必须同时匹配任务的数据形态和数据规模。**
三条决策轴:
- **数据形态轴**: 图像的局部平移不变性 → 卷积先验仍高效;有序序列 + 长程依赖 → 自注意力的全局交互占优;纯数值表格小样本 → 树集成先验常胜一切深度骨架。
- **数据规模轴**: Transformer 是低归纳偏好(弱先验)架构,靠数据喂养出结构知识——数据不足时它的"万能"恰是劣势;CNN/RNN 内置强先验,小数据下反而稳。
- **算力轴**: 自注意力对序列长度平方复杂度;长文档/高分辨率场景要么接受成本、要么换高效变体。
两个必须内化的概念直觉:①QKV 把"信息检索"显式化——查询去和所有键匹配相关度,按相关度加权取值,多层堆叠后实现动态路由;②自注意力本身是置换等变的,不知道词序,位置编码是把顺序信息注入模型的唯一通道。
反流行纪律:**"Transformer 万能"是这个时代最流行的误区**。架构流行度反映的是大规模基准上的边际收益,不是你那个小任务的正确答案。
---
## A1 — 文献中的经典应用 (Past Application)
*(本批主题超出西瓜书覆盖范围,A1 改引奠基文献的经典案例,均为学界公认的原始实验叙述)*
### 案例 1: Transformer 取代 RNN 的原始论证
- **问题**: 序列建模长期由 RNN/LSTM 统治,但其顺序计算本性阻碍并行、长距离依赖路径过长。
- **方���论的使用**: 作者不是简单宣布注意力更强,而是逐项对比归纳偏好:循环层串行处理、路径长 O(n);自注意力全并行、任意两位置路径长 O(1)。再以翻译质量和训练成本双指标实测验证。
- **结论**: 在大规模 WMT 数据上,放弃"逐步递归"先验换取并行性与短路径是净收益。
- **结果**: Transformer 成为 NLP 主导架构并外溢到语音/图像;但论证本身也划定了边界——收益前提是大数据,这正是 ViT 后续实证的方向。
### 案例 2: ViT 的"数据量决定胜负"实验
- **问题**: 没有卷积先验的纯 Transformer 能不能做图像?
- **方法论的使用**: Dosovitskiy 等把图像切块当词元直接喂标准 Transformer,在 ImageNet 量级(1.28M)与 JF