ml-prompting-methodologylisted
Install: claude install-skill fieldlu/Machine-learning-skills
# 提示工程方法论 — 把 prompt 当代码做回归测试
## R — 原文 (Reading)
> (转述)Brown 等发现:大模型的少样本能力对提示构造高度敏感——示例的选择、顺序乃至格式都会显著改变表现;同一模型不同提示间的差距可与不同方法间的差距一样大,因此提示本身是需要谨慎设计的对象。
>
> — Tom Brown 等《Language Models are Few-Shot Learners》(NeurIPS 2020)
> (转述)Wei 等提出思维链提示:在少样本示例中附带中间推理步骤,可显著提升算术、常识与符号推理类任务的性能——其收益是推理规模带来的涌现性质,小模型上并不出现。
>
> — Jason Wei 等《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》(NeurIPS 2022)
---
## I — 方法论骨架 (Interpretation)
提示工程最大的误区是把它当"文字润色玄学":凭感觉改措辞、碰运气换示例、好坏全看当天模型心情。本 skill 的立场是:**prompt 是代码**——有输入分布、有行为逻辑、有 bug,因此也应该像软件一样被测试和管理。
四个子系统:
- **示例选择系统**: few-shot 示例不是装饰而是"上下文中的程序"。按覆盖多样性 + 与查询的相似度选择,控制顺序偏差(同一组示例换个顺序结果会变),示例格式必须与期望输出严格一致。
- **推理链系统**: 思维链是给多步推理任务的专用工具——让模型把中间步骤显式写出以减少跳步错误;在简单分类/抽取任务上它只增加 token 成本与延迟而不增加正确率。先判断任务是否有"中间步骤",再决定是否上 CoT。
- **结构化约束系统**: 输出格式的稳定性靠 schema(JSON Schema/类型声明/字段枚举)约束 + 失败重试解析,不靠在 prompt 里反复礼貌恳求。
- **版本管理与评估系统**: 每个 prompt 改动 = 一次代码提交;固定一个回归测试集(几十条覆盖典型与边界的样本),每次改动跑分对比,涨了才合入。没有评估的 prompt 迭代等于闭眼开车。
这条骨架直接回应 GPT-3 论文披露的核心事实——提示敏感性是真实存在的系统性现象,对抗它的唯一武器就是评估驱动的受控迭代。
---
## A1 — 文献中的经典应用 (Past Application)
*(本批主题超出西瓜书覆盖范围,A1 改引奠基文献的经典案例,均为学界公认的原始实验叙述)*
### 案例 1: GPT-3 论文对提示敏感性的系统实测
- **问题**: 少样本性能到底受哪些提示因素影响?影响多大?
- **方法论的使用**: 作者固定模型、逐一变换单一因素做消融:示例数量(0→1→…)、示例顺序、示例格式、是否自然语言任务描述。
- **���论**: 全部因素都有实质影响——示例数带来平滑增益但边际递减;顺序波动可使方差大到"相当于换一个方法";元描述与格式一致性各有独立贡献。
- **结果**: 这组消融成为"提示是被设计的对象而非附属品"的直接证据,也定义了本 skill "单变量改动+���定评估集"纪律的出处。
### 案例 2: 思维链的适用边界实验
- **问题**: 让模型"一步一步想"是不是对所有任务都有效?
- **方法论的使用**: Wei 等在三类任务(算术应用题、常识问答、符号推理