🏠 总目录📚 本教程 11 · 评测体系:榜单 ← →
📑 本页目录(点开跳转)

11 · 评测体系:Benchmark 的真相

⏱ 26 分钟 | ⭐ 看懂别人的分数:四类榜、五个陷阱、一个你能自己算的置信区间


🎯 一句话

榜单分数远不如你想象的可信。 这一页讲通用 benchmark 分成哪四类、它们会在哪五个地方骗人,以及为什么「A 比 B 高 3 分」这句话在统计上常常什么都没说。

⭐ 反过来的那一半——那该拿什么做决定、怎么给自己建一把尺子——在下一页 11b · 私有评测集怎么建。


🗺️ Benchmark 的四种类型

类型 代表 测什么 局限
知识问答 MMLU、GPQA 多选题,学科知识 容易被污染、和实际能力脱节
真实任务 SWE-bench(修真实 GitHub issue) 端到端完成任务 ⭐ 最接近现实,但贵且慢
人类偏好 LMArena(两两盲测投票 Elo) 人更喜欢谁 受"话痨/排版好看"影响,有讨好偏差
专项能力 数学、代码、长上下文、多语言 单点能力 只反映局部

⚠️ 这张表缺了整整一类:Agent 基准。 上面四类测的都是「模型答得对不对」, 而现在真正影响选型的问题往往是「它能不能在一个有工具、有状态、会多轮的环境里把事办完」——这两件事分数不相关。

🔗 《智能体工程教程》14 · 评测 Evals 有一张五个基准的速查表: SWE-bench(真实 GitHub issue,⭐ 看到这三个字先问是哪一版,Verified 是人工核验过的 500 题子集,分数不可直接比)、 τ-bench(客服场景,用户由另一个模型扮演)、GAIA(多工具协作,答案是唯一短字符串)、 WebArena(自建可复现网站里的浏览器任务)、OSWorld(真实操作系统里的跨应用桌面任务)。

⭐ 去那里的真正理由不是记住这五个名字,是抄它们的判分手法——分数会过期,手法不会: τ-bench 的 pass^k(k 次全对才算过,面向客户的 Agent 必须看它)、

WebArena / OSWorld 的状态校验(不看 Agent 说了什么,只看世界被改成了什么样——结果状态校验的实例;权限与安全过程约束仍需另外验证)、

GAIA 的唯一短答案(把开放问题改造成能精确匹配的形式,代码评分器就能接管)。 这三招你都能直接搬进下一页要建的那个私有评测集。


🕳️ 五个必须知道的陷阱

① 数据污染(最严重)

信息关系

评测题目→出现在互联网上→被爬进训练数据
模型"背过"答案→分数虚高
这就是为什么 新发布的、私有的评测集 才有说服力
也是为什么各家要专门做"去污染"工序(主线第 4 章)

② 饱和

关键信息

MMLU 从 30% 涨到 90%+ 之后,就失去区分度了
剩下的题要么太难要么标注有误
差 1 分毫无意义

🔗 智能体教程第 14 章讲过:饱和的评测应该"毕业"进回归套件。

③ 过拟合榜单

针对 benchmark 优化(刷榜),但泛化到真实任务不行。「为考试而学」。

④ 测量噪声

🔗 智能体教程第 14 章的数据:光是基础设施配置差异,就能造成 6 个百分点的分差——常常大于模型之间的真实差距。

实用结论:对 3 个百分点以内、未说明测试条件的差距保持怀疑。

⑤ 报告条件不对等(最不容易察觉)

同一个 benchmark,测出来的分数可以差很多:

比较前核对这些设置

  • 提示词不同 (有的用了精心调过的 few-shot)
  • 采样温度不同 (T=0 vs T=1)
  • 跑几次取最好 (pass@8 报成 pass@1)⭐
  • 有没有用工具/联网
  • 输出解析的宽松程度("答案是 B" 算不算对)

⚠️ 各家发布分数时,往往【给自己用最优配置,给对手用默认配置】

🔑 看到任何模型对比图,先找这三行小字: ① 用的什么提示词 ② 跑了几次怎么取 ③ 温度是多少。 找不到 → 这张图只能当广告看。


🧮 一个能自己算的例子:为什么 3 分不算差距

算一算

评测集 100 题,模型 A 答对 82 题,模型 B 答对 79 题

Q:A 真的比 B 强吗?

二项分布的标准误:√(p(1−p)/n) = √(0.8×0.2/100) ≈ 4.0%

→ 95% 置信区间约 ±7.8%

⭐ 82% 和 79% 的置信区间【大幅重叠】

→ 这个差距在统计上【毫无意义】

💡 推论:100 题的评测集,只能分辨 8 个百分点以上的差距。 想分辨 3 个点,你需要约 700 题——

🔗 这和推荐算法 12 · 评估与 AB 实验算 A/B 实验样本量是同一套数学。


🔗 这一章连到哪里

去哪 为什么
11b · 私有评测集怎么建 ⭐ 本页说「别人的分数不能全信」,下一页说那该拿什么做决定:一个下午就能建好的私有评测集,以及建的时候最容易犯的三个错
智能体工程 14 · 评测 Evals ⭐ 本页测的是「模型答得对不对」,那一章测的是「Agent 能不能把事办完」——完全不同的一类基准(τ-bench / GAIA / WebArena / OSWorld)。本页陷阱 ②(饱和)和 ④(6 个点的基础设施噪声)的原始出处就在那里(⚠️ 陷阱 ③「刷榜过拟合」那一章没讲,它讲的是反过来的一面:基准被模型追上了就该换题)
数据这一关 13 · 评测集也是数据 把陷阱 ① 变成可执行的体检:四种查污染的办法,以及 ⭐ 查污染不能看总分要看分组差——2% 污染率下总分只虚高 0.6pp(肉眼看不见),但「见过组 vs 没见过组」的差已经稳定在 27 个百分点
模型上线之后 12 · AB实验你以为你懂了 「100 题只能分辨 8 个点」本质是样本量问题;那一章给了样本量、偷看(peeking)、多重比较这三个最常见的翻车点

📦 深挖的话要学什么(榜单这一侧)

📍 每条后面标了它在哪: 📗 本库有 = 站内已经讲透,点进去就行;📙 半有 = 站内讲了一半,另一半得外找; 📕 要外找 = 站内没有,得去论文或别处。 (这份清单以前只列词不说去哪,指到的坑有些站内根本没挖过,按图索骥会扑空。) ⭐ 评测这两页的深挖清单是全站"本库有"命中率最高的几张之一——评测这件事同时被四个板块从不同角度讲过。


✅ 检查点

  1. 四类 benchmark 各有什么局限?
  2. 这四类之外还缺了整整一类,是哪一类?为什么它和前四类的分数不相关?
  3. 什么是数据污染?为什么私有的、新发布的评测集才有说服力?
  4. 「报告条件不对等」是什么意思?看模型对比图时先找哪三行小字?
  5. 100 题的评测集能分辨多大的差距?想分辨 3 个点需要多少题?
  6. 看到「A 模型比 B 高 2 分」该怎么想?
  7. LMArena 这类人类偏好评测有什么偏差?
👀 答案
  1. 知识问答易污染且脱离实际;真实任务最接近现实但贵慢;人类偏好受话痨和排版影响;专项能力只反映局部。
  2. Agent 基准(τ-bench / GAIA / WebArena / OSWorld)。前四类测「模型答得对不对」,它测「能不能在有工具、有状态、会多轮的环境里把事办完」——这两件事分数不相关。
  3. 评测题目出现在互联网上被爬进训练数据,模型等于背过答案。私有/新发布的题没进过训练数据,才能反映真实能力。
  4. 各家发布分数时往往给自己用最优配置、给对手用默认配置(提示词、温度、跑几次取最好、有没有用工具、解析宽松程度)。先找三行小字:①用的什么提示词 ②跑了几次怎么取 ③温度是多少。找不到就只能当广告看。
  5. 100 题时二项标准误约 4%,95% 置信区间约 ±7.8% → 只能分辨 8 个百分点以上的差距。想分辨 3 个点需要约 700 题。
  6. 保持怀疑——基础设施噪声就能造成 6 个百分点差距,100 题的评测集本身也分辨不了 2 分。要看测试条件是否说明、是否多次运行、置信区间多大。
  7. 讨好偏差:回答话多、排版好看、语气讨喜的更容易赢,不一定更正确。还有位置偏差等。

🛑 可以停在这里

读到这里,你已经能拿公开榜单做粗筛(排除明显不行的),并且能一眼看出一张模型对比图是不是广告。 什么时候回来看下一页:当你真的要在两三个模型之间做决定时——粗筛之后那一步(你自己的私有评测集)才是决定性的,本页给不了答案。

⚡ 走神救援

先记住这几件事

下一节 👉 11b-私有评测集怎么建.md

打卡记录保存在你的浏览器里,首页能看到总进度