blind-ab-verifylisted
Install: claude install-skill aaronartistzhang-afk/DailyWork
# blind-ab-verify(防污染盲�� A/B 闭环)
改动已经落地了(新版 prompt / 新版 skill / 两版文案),现在要回答一个问题:**新版真的更好吗,还是只是我以为更好?** 人一旦知道「哪个是我改的新版」,盲读就废了——会不自觉地帮新版找优点。本 skill 把这道判断固化成一条闭环:**每个变体交给一个完全隔离、不知道自己是哪一臂的子代理生成 → 打成去标签的盲包(含对照组)→ 你本人离线盲读打分 → 回灌解析 → 三段式 verdict + blind-packet 留痕。** 从生成到打分,谁是新版这件事对判者永远保密,直到回灌那一刻。
**它不产 PRD、不设计方案、不做线上实验**——**模式 A** 只在「改动已落地、要判两版优劣、且这个判断必须人工盲读」这个窄口上工作(单版 skill 包能否独立跑通见下方**模式 B**)。
## 何时用 / 不用
- **用**:一个 prompt / skill 改动已经落地,要在不被变体标签污染的前提下判新旧两版谁更好;两版一句话文案要盲读选一个;怀疑之前的「新版更好」结论是自己脑补出来的,想要一次干净的复验。
- **不用**:
- **动工前**要对抗式地设计 / 审查方案(找漏洞、定结构、GO/NO-GO)→ 用 `debate`(生成 PRD)或 `codex-review-gate`(跨模型审查门禁)。这两个是**左移**——在改动**之前**。本 skill 是**右移**——在改动**之后**判效果。
- 需要真实线上流量、真实用户行为的效果验证 → 那是 eng-gated 的 live-RPC / `custom_rpc_server` 实验,**不是本 skill 能做的**(见下方「保真度天花板」——本 skill 只能到 prompt-level,越过这条线的主张一律标 UNPROVEN)。
- 单轮、无对照、纯主观的比稿 → 直接比即可,不必上盲测机器(**若目的是验单个 skill 包能否照说明书独立跑通,见下方模式 B**)。
**一句话分工判据**:动工前的对抗设计 / 审查 = 左移(`debate` / `codex-review-gate`);改动落地后两个变体谁更好且需人工盲读 = 右移**模式 A**、单个 skill 包独立复现验收 = 右移**模式 B**(均**本 skill**)。底座是 `dispatching-parallel-agents` 的并行原语,本 skill 在其上加一层**盲测语义**(去标签、对照、盲序、回灌)。
---
## 铁律一:分臂隔离(防污染的地基)
**每一臂 = 一个独立子代理,彼此不共享上下文。** 这是整套方法的地基,塌了后面全废。分臂子代理一律 `model=opus`(执行层模型分工惯例)。
给每个分臂子代理的 prompt 必须满足**分臂三铁律**:
1. **无变体标签**:prompt 里不出现「这是新版 / 旧版 / OLD / NEW / 变体 A / 你是被改进的那个」。子代理不知道自己是哪一臂。
2. **无假设**:不写「我们认为新版会更自然」「预期这版能修好掉奖问题」。任何方向性暗示都会让子代理往那个方向使劲,制造伪信号。
3. **无预期结果**:不写「应该输出带奖励的文案」「理想情况下 CTR 更高」。让它按 prompt 本身产出,不迎合。
配套两条硬约束:
4. **版本 pin 死**:每臂用到的 ski