📑 本页目录(点开跳转)
11 · 评测体系:Benchmark 的真相
⏱ 26 分钟 | ⭐ 看懂别人的分数:四类榜、五个陷阱、一个你能自己算的置信区间
🎯 一句话
榜单分数远不如你想象的可信。 这一页讲通用 benchmark 分成哪四类、它们会在哪五个地方骗人,以及为什么「A 比 B 高 3 分」这句话在统计上常常什么都没说。
⭐ 反过来的那一半——那该拿什么做决定、怎么给自己建一把尺子——在下一页 11b · 私有评测集怎么建。
🗺️ Benchmark 的四种类型
| 类型 | 代表 | 测什么 | 局限 |
|---|---|---|---|
| 知识问答 | MMLU、GPQA | 多选题,学科知识 | 容易被污染、和实际能力脱节 |
| 真实任务 | SWE-bench(修真实 GitHub issue) | 端到端完成任务 | ⭐ 最接近现实,但贵且慢 |
| 人类偏好 | LMArena(两两盲测投票 Elo) | 人更喜欢谁 | 受"话痨/排版好看"影响,有讨好偏差 |
| 专项能力 | 数学、代码、长上下文、多语言 | 单点能力 | 只反映局部 |
⚠️ 这张表缺了整整一类:Agent 基准。 上面四类测的都是「模型答得对不对」, 而现在真正影响选型的问题往往是「它能不能在一个有工具、有状态、会多轮的环境里把事办完」——这两件事分数不相关。
🔗 《智能体工程教程》14 · 评测 Evals 有一张五个基准的速查表: SWE-bench(真实 GitHub issue,⭐ 看到这三个字先问是哪一版,Verified 是人工核验过的 500 题子集,分数不可直接比)、 τ-bench(客服场景,用户由另一个模型扮演)、GAIA(多工具协作,答案是唯一短字符串)、 WebArena(自建可复现网站里的浏览器任务)、OSWorld(真实操作系统里的跨应用桌面任务)。
⭐ 去那里的真正理由不是记住这五个名字,是抄它们的判分手法——分数会过期,手法不会: τ-bench 的
pass^k(k 次全对才算过,面向客户的 Agent 必须看它)、WebArena / OSWorld 的状态校验(不看 Agent 说了什么,只看世界被改成了什么样——结果状态校验的实例;权限与安全过程约束仍需另外验证)、
GAIA 的唯一短答案(把开放问题改造成能精确匹配的形式,代码评分器就能接管)。 这三招你都能直接搬进下一页要建的那个私有评测集。
🕳️ 五个必须知道的陷阱
① 数据污染(最严重)
信息关系
② 饱和
关键信息
🔗 智能体教程第 14 章讲过:饱和的评测应该"毕业"进回归套件。
③ 过拟合榜单
针对 benchmark 优化(刷榜),但泛化到真实任务不行。「为考试而学」。
④ 测量噪声
🔗 智能体教程第 14 章的数据:光是基础设施配置差异,就能造成 6 个百分点的分差——常常大于模型之间的真实差距。
实用结论:对 3 个百分点以内、未说明测试条件的差距保持怀疑。
⑤ 报告条件不对等(最不容易察觉)
同一个 benchmark,测出来的分数可以差很多:
比较前核对这些设置
- 提示词不同 (有的用了精心调过的 few-shot)
- 采样温度不同 (T=0 vs T=1)
- 跑几次取最好 (pass@8 报成 pass@1)⭐
- 有没有用工具/联网
- 输出解析的宽松程度("答案是 B" 算不算对)
⚠️ 各家发布分数时,往往【给自己用最优配置,给对手用默认配置】
🔑 看到任何模型对比图,先找这三行小字: ① 用的什么提示词 ② 跑了几次怎么取 ③ 温度是多少。 找不到 → 这张图只能当广告看。
🧮 一个能自己算的例子:为什么 3 分不算差距
算一算
评测集 100 题,模型 A 答对 82 题,模型 B 答对 79 题
Q:A 真的比 B 强吗?
二项分布的标准误:√(p(1−p)/n) = √(0.8×0.2/100) ≈ 4.0%
→ 95% 置信区间约 ±7.8%
⭐ 82% 和 79% 的置信区间【大幅重叠】
→ 这个差距在统计上【毫无意义】
💡 推论:100 题的评测集,只能分辨 8 个百分点以上的差距。 想分辨 3 个点,你需要约 700 题——
🔗 这和推荐算法 12 · 评估与 AB 实验算 A/B 实验样本量是同一套数学。
🔗 这一章连到哪里
| 去哪 | 为什么 |
|---|---|
| 11b · 私有评测集怎么建 ⭐ | 本页说「别人的分数不能全信」,下一页说那该拿什么做决定:一个下午就能建好的私有评测集,以及建的时候最容易犯的三个错 |
| 智能体工程 14 · 评测 Evals ⭐ | 本页测的是「模型答得对不对」,那一章测的是「Agent 能不能把事办完」——完全不同的一类基准(τ-bench / GAIA / WebArena / OSWorld)。本页陷阱 ②(饱和)和 ④(6 个点的基础设施噪声)的原始出处就在那里(⚠️ 陷阱 ③「刷榜过拟合」那一章没讲,它讲的是反过来的一面:基准被模型追上了就该换题) |
| 数据这一关 13 · 评测集也是数据 | 把陷阱 ① 变成可执行的体检:四种查污染的办法,以及 ⭐ 查污染不能看总分要看分组差——2% 污染率下总分只虚高 0.6pp(肉眼看不见),但「见过组 vs 没见过组」的差已经稳定在 27 个百分点 |
| 模型上线之后 12 · AB实验你以为你懂了 | 「100 题只能分辨 8 个点」本质是样本量问题;那一章给了样本量、偷看(peeking)、多重比较这三个最常见的翻车点 |
📦 深挖的话要学什么(榜单这一侧)
📍 每条后面标了它在哪: 📗 本库有 = 站内已经讲透,点进去就行;📙 半有 = 站内讲了一半,另一半得外找; 📕 要外找 = 站内没有,得去论文或别处。 (这份清单以前只列词不说去哪,指到的坑有些站内根本没挖过,按图索骥会扑空。) ⭐ 评测这两页的深挖清单是全站"本库有"命中率最高的几张之一——评测这件事同时被四个板块从不同角度讲过。
- 主流 benchmark 的设计与局限:MMLU/GPQA/SWE-bench/AIME/LiveBench 各自测什么、怎么被攻破 → 📙 半有:智能体工程 14 · 评测Evals 的「公开基准都在测什么(以及测不到什么)」把 SWE-bench、SWE-bench Verified(人工核验的 500 题子集)、τ-bench 的构造方式和各自的盲区摊开讲了,⚠️ 还给了一条能直接用的纪律:看到「SWE-bench」三个字先问是哪一版——不同版本的分数不可直接比。MMLU / GPQA / AIME 这几个纯知识类基准的构造细节站内没有,要外找
- 污染检测:n-gram 重叠、canary string、私有 holdout 集 → 📗 本库有,而且比本页细得多:数据这一关 13 · 评测集也是数据 给了四种查法(去重 / n-gram 重叠 / 改写测试 / 新鲜题对照)和 n 该取多少的实跑精确率-召回率表;⭐ 最有用的一条是查污染不能看总分要看分组差——2% 污染率下总分只虚高 0.6pp(看不见),但"见过组 vs 没见过组"的差已经稳定在 27 个百分点。本页说「数据污染是最严重的陷阱」,那一章是把它变成可执行体检的地方。 ⚠️ 只有 canary string 站内没有
- 动态评测:LiveBench 类(题目持续更新,防污染) → 📙 半有:「什么时候该换评测集」在 数据这一关 13 有专门一节,智能体工程 14 的第 7 步「监控饱和」和第 8 步「长期维护」讲的是同一件事的工程侧。但 LiveBench 这类"公开榜单持续换题"的具体机制站内没有,要外找
- 人类偏好评测:Elo/Bradley-Terry 模型、标注一致性、讨好偏差校正
→ 📗 本库有:Bradley–Terry 在 强化学习基础 12 · RLHF全流程(
L = −log σ(r(win) − r(lose)),只关心分数的差,所以打出来的分没有绝对含义——这正是它能被用来排名的原因);标注一致性在 数据这一关 10 · 标注一致性怎么量;讨好/长度偏差这一侧,RL 12 里点了 ⚠️ 标注者倾向选长的 → 模型变啰嗦,人类一致率仅 70~80% 就是精度天花板
✅ 检查点
- 四类 benchmark 各有什么局限?
- 这四类之外还缺了整整一类,是哪一类?为什么它和前四类的分数不相关?
- 什么是数据污染?为什么私有的、新发布的评测集才有说服力?
- 「报告条件不对等」是什么意思?看模型对比图时先找哪三行小字?
- 100 题的评测集能分辨多大的差距?想分辨 3 个点需要多少题?
- 看到「A 模型比 B 高 2 分」该怎么想?
- LMArena 这类人类偏好评测有什么偏差?
👀 答案
- 知识问答易污染且脱离实际;真实任务最接近现实但贵慢;人类偏好受话痨和排版影响;专项能力只反映局部。
- Agent 基准(τ-bench / GAIA / WebArena / OSWorld)。前四类测「模型答得对不对」,它测「能不能在有工具、有状态、会多轮的环境里把事办完」——这两件事分数不相关。
- 评测题目出现在互联网上被爬进训练数据,模型等于背过答案。私有/新发布的题没进过训练数据,才能反映真实能力。
- 各家发布分数时往往给自己用最优配置、给对手用默认配置(提示词、温度、跑几次取最好、有没有用工具、解析宽松程度)。先找三行小字:①用的什么提示词 ②跑了几次怎么取 ③温度是多少。找不到就只能当广告看。
- 100 题时二项标准误约 4%,95% 置信区间约 ±7.8% → 只能分辨 8 个百分点以上的差距。想分辨 3 个点需要约 700 题。
- 保持怀疑——基础设施噪声就能造成 6 个百分点差距,100 题的评测集本身也分辨不了 2 分。要看测试条件是否说明、是否多次运行、置信区间多大。
- 讨好偏差:回答话多、排版好看、语气讨喜的更容易赢,不一定更正确。还有位置偏差等。
🛑 可以停在这里
读到这里,你已经能拿公开榜单做粗筛(排除明显不行的),并且能一眼看出一张模型对比图是不是广告。 什么时候回来看下一页:当你真的要在两三个模型之间做决定时——粗筛之后那一步(你自己的私有评测集)才是决定性的,本页给不了答案。
⚡ 走神救援
先记住这几件事
- 榜单测的是特定题目和配置,不等于你的产品表现。
- 比较前核对提示、采样次数、工具条件与统计波动。
- 把知识、真实任务、偏好和专项能力分开看,再用自己的任务复测。
下一节 👉 11b-私有评测集怎么建.md