📑 本页目录(点开跳转)
11b · 私有评测集:建一把自己的尺子
⏱ 18 分钟 | ⭐ 一个下午就能建好,20–50 条就够开始
🎯 一句话
别人的榜单回答"谁通用能力强",你的私有评测回答"谁适合我"。后者才是你要的。
上一页拆了公开榜单的四类和五个陷阱,结论是「别人的分数只能拿来粗筛」。 这一页接着说:那粗筛之后拿什么做决定——一套 20–50 条、从你自己线上日志里捞出来的题。
🧭 那该怎么正确判断一个模型
操作步骤
- ❌ 错误做法:看榜单排名,选第一名
- ✅ 正确做法:
- 用 benchmark 做粗筛(排除明显不行的)
- 拿你自己的 20–50 个真实任务做私有评测 ⭐ 这才是决定性的
- 关注和你场景匹配的专项(做代码就看代码,做中文就看中文)
- 实测成本和延迟(分数不代表能用)
- 小流量 A/B(如果已有系统)
🔑 一句话:别人的榜单回答"谁通用能力强",你的私有评测回答"谁适合我"。后者才是你要的。
🔨 私有评测集:一个下午就能建好
流程图
⚠️ 三个建评测集时的常见错误:
| 错误 | 后果 |
|---|---|
| 只放难题 | 分数全是 20% 上下,没有区分度 |
| 只放当前模型答错的 | 换个模型后这套题失去代表性 |
| 不分维度只看总分 | 总分持平,但其实"格式变好了、事实变差了"——你看不见 ⭐ |
💡 上一页那个置信区间在这里还要再用一次:20–50 条只够告诉你「这个模型在我的场景里明显不行 / 看起来能用」, 不够分辨两个都能用的模型谁高 3 个点(那要几百条)。所以别拿一套 30 条的题去宣布「A 比 B 强」—— 它的用途是挡住明显的退步,不是排名。
🧪 这两页有一半站内已经讲透
⭐ 最实用的那一半不在这里,在 《智能体工程教程》第 14 章—— 它讲的是「怎么给自己的系统造一套评测」,这两页讲的是「怎么看懂别人的榜单、以及入门版的自己造」。两边这样对应:
| 那一章讲的 | 在这里的对应 |
|---|---|
| 从真实失败取 20–50 个任务 | 本页私有评测集的建法 |
| 三类评分器(代码/模型/人工) | 完全通用 |
| 不强制唯一解题路径 | 同时验证权限、审批、预算与业务副作用约束 |
| pass@k vs pass^k | 一致性度量 |
| 读转录、校准评委 | 同样必做 |
| 基础设施噪声、饱和 | 就是上一页的陷阱 ④(测量噪声)和 ②(饱和) |
| 分维度看,别只看总分 | 同样适用 |
💡 所以读完那一章再读这两页,这里几乎不是新知识——而是「把同一套方法论换到模型选型这个场景上」。 反过来,先读到这里的人,动手做评测时请一定去那一章:这两页给的是常识、陷阱和入门版建法,那一章给的是可执行的八步。
🔗 想再深一层,去哪一套
| 去哪 | 为什么 |
|---|---|
| 智能体工程 14 · 评测 Evals ⭐ | 本页的「一个下午就能建好」是入门版;那里的八步是能撑住长期维护的版本(⭐ 最贵也最容易跳过的是第 2 步写无歧义任务+参考解、第 3 步正反平衡、第 6 步读转录) |
| 智能体工程 19 · 挑战项目B-评测驱动开发 | 想动手:那是一个从零建一套评测再靠它驱动开发的完整项目 |
| 数据这一关 13 · 评测集也是数据 ⭐ | 你这套题本身也是数据:怎么抽样、多大才够(把置信区间算出来)、有没有被污染、评分器准不准、结果该怎么报,全在那一章 |
| 数据这一关 10 · 标注一致性怎么量 | 用了 LLM-as-Judge 或人工打分就绕不开这个:判官和人的一致率才是这套评测的精度上限 |
📦 深挖的话要学什么(自己那把尺子这一侧)
📍 每条后面标了它在哪: 📗 本库有 = 站内已经讲透,点进去就行;📙 半有 = 站内讲了一半,另一半得外找; 📕 要外找 = 站内没有,得去论文或别处。
- LLM-as-Judge:偏差(位置偏差、长度偏差、自我偏好)与校准方法 → 📙 半有:智能体工程 14 的「三类评分器」把模型评分器必须对照人类专家校准立成了规矩,数据这一关 13 有「评分器也要校准」一节。但位置偏差 / 长度偏差 / 自我偏好这三种偏差各自的表现和纠正手段,站内没有专门讲,要外找
- 统计:置信区间、多次运行的方差、显著性判断 → 📗 本库有:数据这一关 13 的「多大才够:把置信区间算出来」直接回答上一页那个「为什么 3 分不算差距」,也回答本页「我这套题该建多大」;模型上线之后 12 · AB实验你以为你懂了 给了样本量、偷看(peeking)、多重比较这三个最常见的翻车点;测量噪声那一侧还有 Claude博客 · 智能体评测-03 基础设施噪声
- 领域评测集构建:怎么为你的业务造一套有区分度的题 → 📗 本库有,这是这两页最该点开的一条:智能体工程 14 的八步(⭐ 最贵也最容易跳过的是第 2 步写无歧义任务+参考解、第 3 步正反平衡——只测正例会让系统学成"什么都做"、第 6 步读转录);抽样和"多大才够"配 数据这一关 13
需要的前置:不多——智能体工程 14 的评测方法论,加一点 A/B 实验的统计常识(推荐算法 12 · 评估与 AB 实验 那一章就够)。这两块站内都是现成的。
⚖️ 要不要深挖
| 你的情况 | 建议 |
|---|---|
| 做应用、要选模型 | 🟡 这两页 + 智能体工程第 14 章已经够用 |
| 要为团队建评测体系 | ✅ 值得,但重点是「造私有评测集」不是研究公开榜单 |
| 做模型研发 | ✅ 必须 |
| 写技术选型报告 / 做技术决策 | ✅ 至少要懂上一页那五个陷阱,否则容易被榜单误导 |
🔑 我的判断:这块不值得单独成套—— 最核心的方法论已经完整地在智能体工程第 14 章里了,这两页补的只是「通用 benchmark 的常识和陷阱」加一个入门版的建法。
✅ 深挖直接去《智能体工程教程》第 14 章, 那里有三类评分器、pass@k vs pass^k、评委校准的完整方法论; 挑战项目 B 会让你亲手建一套。
✅ 检查点
- 正确的模型选型流程是哪五步?哪一步是决定性的?
- 建私有评测集该从哪里取题?为什么不能自己编?
- 建评测集的三个常见错误是什么?
- 三种评分方式(代码 / LLM-as-Judge / 人工)怎么选?哪种优先?
- 一套 30 条的私有评测集,能不能用来宣布「A 模型比 B 强 3 个点」?为什么?
- 「不分维度只看总分」会漏掉什么?
👀 答案
- benchmark 粗筛 → 自己的 20–50 个真实任务做私有评测(决定性的一步) → 看和场景匹配的专项 → 实测成本和延迟 → 小流量 A/B。
- 从线上日志和用户反馈里捞真实失败案例。不能自己编,因为编的题总是太规整,测不出真实问题。20–50 条就够开始,别等"建完整套"才开始用。
- ①只放难题(分数全在 20% 上下,没区分度)②只放当前模型答错的(换模型后失去代表性)③不分维度只看总分(总分持平但其实格式变好、事实变差,你看不见)。
- 能写代码判的一律优先用代码评分器(最可靠);判不了但有明确标准的用 LLM-as-Judge,⚠️ 但它必须先对照人类校准;剩下真正主观的才人工抽样。
- 不能。上一页算过:100 题的置信区间就已经有 ±7.8%,30 条更粗。这套题的用途是挡住明显的退步、看出「在我的场景里能不能用」,不是给两个都能用的模型排名——想分辨 3 个点要几百条。
- 漏掉维度之间的此消彼长:总分持平,实际可能是"格式变好了、事实准确性变差了"。所以第 ③ 步要按业务分维度打标签(意图理解 / 格式 / 事实准确 / 语气…)。
🛑 可以停在这里
读到这里,你已经有一条能今天下午就走完的路:捞 20–50 条真实失败案例 → 分维度打标签 → 定评分方式 → 拿它去选模型。 什么时候回来看后面:当这套题开始要长期维护(换模型、加维度、防它自己饱和),或者你发现评分器和人的判断对不上时——去智能体工程 14 的八步。
⚡ 走神救援
先记住这几件事
- 从真实输入和失败案例建立一个小而可维护的私有评测集。
- 写清期望行为并分维度评分,自动判定不了的部分再引入经过校准的裁判。
- 小样本适合发现明显退步,不适合把细小分差解释成确定排名。
下一节 👉 12-对齐与AI安全.md