← ClaudeAtlas

ml-multimodallisted

多模态建模决策链:判断任务是否真需要跨模态并选融合策略。当用户问"要不要上多模态"、 纠结早期/晚期/注意力融合怎么选、想理解 CLIP 对比对齐与零样本迁移、遇到模态缺失(图片 加载失败/某模态数据稀疏)、或多模态评测不知道单模态消融等特殊坑时激活。动作:单模态 够吗判定→融合三型选型→CLIP 对齐路线→缺失与不平衡处理→评测特殊性。 不适用于已确定单模态的常规建模、多模态大模型机制研究。触发词: multimodal 多模态, 图文匹配, CLIP, 零样本迁移 zero-shot, fusion 融合策略, early/late fusion, 模态缺失 missing modality, 模态坍塌, VQA
fieldlu/Machine-learning-skills · ★ 0 · AI & Automation · score 66
Install: claude install-skill fieldlu/Machine-learning-skills
# 多模态建模决策 — 单模态够不够,融合怎么融 ## R — 原文 (Reading) > (转述)Radford 等提出 CLIP:放弃固定类别标签,改用自然语言作监督——对 4 亿网络图文对做对比学习,把配对图文的表征拉近、错对的推远;由此学得的联合嵌入空间支持零样本迁移:新分类任务无需训练,把类别名写成句子编码后与图像表征比相似度即可分类。 > > — Alec Radford 等, "Learning Transferable Visual Models From Natural Language Supervision" (ICML 2021) > (转述)多模态文献的长期共识:融合时机是核心设计轴——早期融合在输入/特征层拼接(信息全但噪声互扰),晚期融合在各模态独立预测后合并(稳健且天然抗单模态缺失,代价是丢失跨模态交互),注意力中间融合让一个模态的表示动态查询另一模态(表达力强,成为当前主流);没有普适最优,选择取决于模态间互补度与数据规模。 > > — 多模态融合方法族的综述共识(Baltrušaitis 等综述以来的通行的三分法) --- ## I — 方法论骨架 (Interpretation) **第一问永远是"单模态够吗"**。加模态的理由必须来自信息增量:任务里存在只有另一模态才携带的信息(视频鉴伪要看音频、商品搜索要图配文)。如果文本已经够用(多数纯文档任务),上多模态只会带来标注成本、对齐工程与过拟合风险——多一个模态不是免费的升级,是翻倍的失败面。 **融合三型按互补结构选**: - **早期(特征级)**: 各模态编码后在特征层拼接进统一模型——适合两模态细粒度交织的任务(VQA 里问题决定看图的哪里),但对单侧噪声敏感; - **晚期(决策级)**: 各模态独立建模、输出层投票/加权——适合模态质量参差或常缺一侧的场景(医疗影像+化验单,缺哪路都能出预测),代价是无法学到"图像细节呼应文字描述"这类交互; - **中间(注意力级)**: 一个模态的 token 对另一模态做 cross-attention——表达力最强、当前主流,但需要更多数据与调参功夫。 **CLIP 的核心直觉值得单独掌握**:它证明了"对齐"本身就是一种强大的预训练——不用人工标注类别,只要海量图文对 + 对比损失,就能学出一个图像与语言共享的语义空间;零样本迁移是这个空间的免费赠品(分类变成"图和哪个类名最像")。这改变了范式:多模态能力可以来自"对齐现成单模态骨干",不必从零联合训练。 **现实的两块硬骨头**:①**模态缺失**是常态而非异常——真实管线里图片会加载失败、某模态历史数据就是稀疏;设计时要问"缺一侧还能不能跑",晚期融合天然抗缺失,早/中融合需要缺失感知的训练策略;②**模态不平衡**——一个模态信号强/数据多时会主导训练,另一个沦为装饰品(模型名义上是双模态实际只用了单模态),诊断手段是单模态消融对照。 **评测的特殊性**:多模态任务的分数提升要拆开审——是真融合收益还是某个模态单独就够(消融检验);跨模态检索类指标与下游任务表现不总是一致;且基准污染同样存在(测试图文对可能进了预训练语料)。 --- ## A1 — 文献中的经典应用 (Past Application) *(本批主题超出西瓜书覆盖范围,A1 改引学界公认的经典案例与公开记录)* ### 案例 1: CLIP 的零样本 ImageNet 实验 - **问题**: 传统视觉模型的迁移路线是"ImageNet 预训→下游