← ClaudeAtlas

ml-transformer-eralisted

深度时代的架构选型决策。当用户问"该用 CNN/RNN 还是 Transformer"、注意力机制/QKV 是什么、 位置编码有什么用、"数据够不够训",或想"全都上 Transformer"时激活。按数据形态×数据规模× 算力三轴匹配架构:小表格数据 GBDT 常胜神经网络、小数据 CNN/RNN 仍是正解、大规模序列才轮到 Transformer;含 QKV 直觉与位置编码必要性。不适用于:训练不动(ml-deep-training-playbook)、 自训还是微调未定(ml-pretraining-paradigm)。触发词: transformer vs cnn, QKV, positional encoding, 架构选型
fieldlu/Machine-learning-skills · ★ 0 · AI & Automation · score 66
Install: claude install-skill fieldlu/Machine-learning-skills
# Transformer 时代架构选型 — 规模与形态决定骨架,而非流行度 ## R — 原文 (Reading) > (转述)Vaswani 等提出 Transformer:完全基于注意力机制,摒弃递归与卷积;自注意力把每个位置表示为查询(Q)、键(K)、值(V)三元组参与全局交互,配合位置编码注入顺序信息;在机器翻译上以更短的训练时间达到当时最优质量。 > > — Vaswani 等《Attention Is All You Need》(NeurIPS 2017) > (转述)Kaplan 等系统报告规模定律:模型性能随参数量、数据量、算力的幂律平滑提升,且跨多个数量级成立——这为"投入多大模型配多少数据"提供了外推依据。 > > — Jared Kaplan 等《Scaling Laws for Neural Language Models》(2020) --- ## I — 方法论骨架 (Interpretation) 西瓜书第 5 章的神经网络叙事止于 BP 与浅层网络,对"该搭什么骨架"没有给出现代答案。本 skill 补全这个决策:**架构选择是归纳偏好的选择,而归纳偏好必须同时匹配任务的数据形态和数据规模。** 三条决策轴: - **数据形态轴**: 图像的局部平移不变性 → 卷积先验仍高效;有序序列 + 长程依赖 → 自注意力的全局交互占优;纯数值表格小样本 → 树集成先验常胜一切深度骨架。 - **数据规模轴**: Transformer 是低归纳偏好(弱先验)架构,靠数据喂养出结构知识——数据不足时它的"万能"恰是劣势;CNN/RNN 内置强先验,小数据下反而稳。 - **算力轴**: 自注意力对序列长度平方复杂度;长文档/高分辨率场景要么接受成本、要么换高效变体。 两个必须内化的概念直觉:①QKV 把"信息检索"显式化——查询去和所有键匹配相关度,按相关度加权取值,多层堆叠后实现动态路由;②自注意力本身是置换等变的,不知道词序,位置编码是把顺序信息注入模型的唯一通道。 反流行纪律:**"Transformer 万能"是这个时代最流行的误区**。架构流行度反映的是大规模基准上的边际收益,不是你那个小任务的正确答案。 --- ## A1 — 文献中的经典应用 (Past Application) *(本批主题超出西瓜书覆盖范围,A1 改引奠基文献的经典案例,均为学界公认的原始实验叙述)* ### 案例 1: Transformer 取代 RNN 的原始论证 - **问题**: 序列建模长期由 RNN/LSTM 统治,但其顺序计算本性阻碍并行、长距离依赖路径过长。 - **方���论的使用**: 作者不是简单宣布注意力更强,而是逐项对比归纳偏好:循环层串行处理、路径长 O(n);自注意力全并行、任意两位置路径长 O(1)。再以翻译质量和训练成本双指标实测验证。 - **结论**: 在大规模 WMT 数据上,放弃"逐步递归"先验换取并行性与短路径是净收益。 - **结果**: Transformer 成为 NLP 主导架构并外溢到语音/图像;但论证本身也划定了边界——收益前提是大数据,这正是 ViT 后续实证的方向。 ### 案例 2: ViT 的"数据量决定胜负"实验 - **问题**: 没有卷积先验的纯 Transformer 能不能做图像? - **方法论的使用**: Dosovitskiy 等把图像切块当词元直接喂标准 Transformer,在 ImageNet 量级(1.28M)与 JF