← ClaudeAtlas

ml-llm-evaluationlisted

大模型评估纪律:榜单分数是参照物不是成绩单——benchmark 与真实任务存在分布鸿沟,NFL 教训在 LLM 时代重演,外推无效。当用户问"榜单排名和实测为什么不一致"、"测试集是不是被污染"、 "用 GPT 打分靠谱吗",或要组织人工评估时激活。动作:自有分布抽测补鸿沟;三探针查污染; 人工评估先定 rubric 与一致性校验;LLM-as-judge 校正位置/自偏爱/长度偏差。不适用于:通用三层 评估设计(ml-evaluation-design)。触发词: benchmark, leaderboard, 数据污染 contamination, LLM-as-judge, 人工评估
fieldlu/Machine-learning-skills · ★ 0 · AI & Automation · score 66
Install: claude install-skill fieldlu/Machine-learning-skills
# 大模型评估纪律 — 榜单分数是参照物不是成绩单 ## R — 原文 (Reading) > (转述)GPT-3 论文在报告少样本结果的同时明确警示:训练语料与基准测试间存在意外的重叠风险,作者以 n-gram 重叠检查并声称其对结果影响轻微——但这一检查方法本身被后续工作证明是宽松的。 > > — Tom Brown 等《Language Models are Few-Shot Learners》(NeurIPS 2020) > (转述)Liang 等对主流模型开展大规模整体评估(HELM),主张评估应覆盖准确性之外的多维度(稳健性、公平性、偏见、效率),并以标准化协议统一测量条件,因为单榜单一维度的排名无法代表真实能力结构。 > > — Percy Liang 等《Holistic Evaluation of Language Models》(2022) > (转述)Zheng 等系统检验 LLM-as-judge:大模型裁判与人类偏好有较高一致率,但存在位置偏差(倾向特定答案位置)、自增强偏差(偏爱自己家族模型的输出)、长度偏差(偏爱更长的回答);可通过交换位置、多裁判等手段缓解。 > > — Lianmin Zheng 等《Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena》(NeurIPS 2023) --- ## I — 方法论骨架 (Interpretation) 西瓜书的评估三件套(留出/交叉验证 × 度量 × 比较检验)建立在一个前提上:**测试集与训练过程严格隔离**。LLM 时代这个前提系统性崩塌——网络规模的预训练语料几乎必然吞下公开 benchmark 的题目及其变体。于是 NFL 定理的教训以新形态重演:脱离你的具体任务分布谈"哪个模型更强",与脱离问题谈算法优劣同样无意义。 四条纪律: 1. **榜单 = 参照物不是成绩单**。榜单衡量的是"在该基准分布上的表现",与你的任务分布之间的鸿沟必须用自有抽测填补;跨榜单外推排名("A 比 B 高 2 分所以选 A")是无效推理。 2. **先查污染再信分数**。任何"模型 X 在我领域数据上考了高分"都要过一遍污染检查:n-gram 重叠、成员推断迹象、"改写题目后分数跳水"的行为学探针。 3. **人工评估先定协议再收分**。没有评分细则(rubric)、没有评分者一致性指标(如 Kappa)、没有盲评,人工分数只是意见不是测量。 4. **机器裁判须校正已知偏差**。位置偏差→交换候选顺序双向评;自偏爱→避免让模型评自己家族的输出;长度偏差→报告时按长度分层核对。 总纲一句话:**评估的对象永远是"模型×任务分布"这对组合,不是模型本身。** --- ## A1 — 文献中的经典应用 (Past Application) *(本批主题超出西瓜书覆盖范围,A1 改引奠基文献的经典案例,均为学界公认的原始实验叙述)* ### 案例 1: GPT-3 论文主动披露污染隐患 - **问题**: 网络级语料训练出的模型可能在 benchmark 题目上"见过答案",少样本成绩的可信度存疑。 - **方法论的使用**: 作者主动统计训练集与测试基准间的 n-gram 重叠率,并在剔除疑似重叠样本后复算成绩对比。 - **结论**: 报告称重叠对总体结果影响有限(转述),但承认检测手段粗糙、逐样本影响无法排除。 - **结果**: 这是头部实验室首次把污染检查写入旗舰论文的先例;其方法的宽松性后