🏠 总目录📚 本教程 11b · 私有评测集 ← →
📑 本页目录(点开跳转)

11b · 私有评测集:建一把自己的尺子

⏱ 18 分钟 | ⭐ 一个下午就能建好,20–50 条就够开始


🎯 一句话

别人的榜单回答"谁通用能力强",你的私有评测回答"谁适合我"。后者才是你要的。

上一页拆了公开榜单的四类和五个陷阱,结论是「别人的分数只能拿来粗筛」。 这一页接着说:那粗筛之后拿什么做决定——一套 20–50 条、从你自己线上日志里捞出来的题。


🧭 那该怎么正确判断一个模型

操作步骤

  1. ❌ 错误做法:看榜单排名,选第一名
  2. ✅ 正确做法:
  3. 用 benchmark 做粗筛(排除明显不行的)
  4. 拿你自己的 20–50 个真实任务做私有评测 ⭐ 这才是决定性的
  5. 关注和你场景匹配的专项(做代码就看代码,做中文就看中文)
  6. 实测成本和延迟(分数不代表能用)
  7. 小流量 A/B(如果已有系统)

🔑 一句话:别人的榜单回答"谁通用能力强",你的私有评测回答"谁适合我"。后者才是你要的。

🔨 私有评测集:一个下午就能建好

流程图

① 翻线上日志 / 用户反馈,捞出【真实失败的 20-50 个案例】⭐
不要自己编题——编的题总是太规整,测不出真实问题
② 每条记下:输入、期望的输出特征、为什么当时错了
③ 分维度打标签(按你的业务分:意图理解 / 格式 / 事实准确 / 语气…)
④ 定评分方式:
· 能写代码判的→代码评分器(最可靠,优先)
· 判不了但有标准→LLM-as-Judge(要校准)
· 主观的→人工抽样
⭐ 20-50 条就够开始了。别等"建完整套"才开始用

⚠️ 三个建评测集时的常见错误:

错误 后果
只放难题 分数全是 20% 上下,没有区分度
只放当前模型答错的 换个模型后这套题失去代表性
不分维度只看总分 总分持平,但其实"格式变好了、事实变差了"——你看不见 ⭐

💡 上一页那个置信区间在这里还要再用一次:20–50 条只够告诉你「这个模型在我的场景里明显不行 / 看起来能用」, 不够分辨两个都能用的模型谁高 3 个点(那要几百条)。所以别拿一套 30 条的题去宣布「A 比 B 强」—— 它的用途是挡住明显的退步,不是排名。


🧪 这两页有一半站内已经讲透

⭐ 最实用的那一半不在这里,在 《智能体工程教程》第 14 章—— 它讲的是「怎么给自己的系统造一套评测」,这两页讲的是「怎么看懂别人的榜单、以及入门版的自己造」。两边这样对应:

那一章讲的 在这里的对应
从真实失败取 20–50 个任务 本页私有评测集的建法
三类评分器(代码/模型/人工) 完全通用
不强制唯一解题路径 同时验证权限、审批、预算与业务副作用约束
pass@k vs pass^k 一致性度量
读转录、校准评委 同样必做
基础设施噪声、饱和 就是上一页的陷阱 ④(测量噪声)和 ②(饱和)
分维度看,别只看总分 同样适用

💡 所以读完那一章再读这两页,这里几乎不是新知识——而是「把同一套方法论换到模型选型这个场景上」。 反过来,先读到这里的人,动手做评测时请一定去那一章:这两页给的是常识、陷阱和入门版建法,那一章给的是可执行的八步。


🔗 想再深一层,去哪一套

去哪 为什么
智能体工程 14 · 评测 Evals ⭐ 本页的「一个下午就能建好」是入门版;那里的八步是能撑住长期维护的版本(⭐ 最贵也最容易跳过的是第 2 步写无歧义任务+参考解、第 3 步正反平衡、第 6 步读转录)
智能体工程 19 · 挑战项目B-评测驱动开发 想动手:那是一个从零建一套评测再靠它驱动开发的完整项目
数据这一关 13 · 评测集也是数据 ⭐ 你这套题本身也是数据:怎么抽样、多大才够(把置信区间算出来)、有没有被污染、评分器准不准、结果该怎么报,全在那一章
数据这一关 10 · 标注一致性怎么量 用了 LLM-as-Judge 或人工打分就绕不开这个:判官和人的一致率才是这套评测的精度上限

📦 深挖的话要学什么(自己那把尺子这一侧)

📍 每条后面标了它在哪: 📗 本库有 = 站内已经讲透,点进去就行;📙 半有 = 站内讲了一半,另一半得外找; 📕 要外找 = 站内没有,得去论文或别处。

需要的前置:不多——智能体工程 14 的评测方法论,加一点 A/B 实验的统计常识(推荐算法 12 · 评估与 AB 实验 那一章就够)。这两块站内都是现成的。


⚖️ 要不要深挖

你的情况 建议
做应用、要选模型 🟡 这两页 + 智能体工程第 14 章已经够用
要为团队建评测体系 ✅ 值得,但重点是「造私有评测集」不是研究公开榜单
做模型研发 ✅ 必须
写技术选型报告 / 做技术决策 ✅ 至少要懂上一页那五个陷阱,否则容易被榜单误导

🔑 我的判断:这块不值得单独成套—— 最核心的方法论已经完整地在智能体工程第 14 章里了,这两页补的只是「通用 benchmark 的常识和陷阱」加一个入门版的建法。

✅ 深挖直接去《智能体工程教程》第 14 章, 那里有三类评分器、pass@k vs pass^k、评委校准的完整方法论; 挑战项目 B 会让你亲手建一套。


✅ 检查点

  1. 正确的模型选型流程是哪五步?哪一步是决定性的?
  2. 建私有评测集该从哪里取题?为什么不能自己编?
  3. 建评测集的三个常见错误是什么?
  4. 三种评分方式(代码 / LLM-as-Judge / 人工)怎么选?哪种优先?
  5. 一套 30 条的私有评测集,能不能用来宣布「A 模型比 B 强 3 个点」?为什么?
  6. 「不分维度只看总分」会漏掉什么?
👀 答案
  1. benchmark 粗筛 → 自己的 20–50 个真实任务做私有评测(决定性的一步) → 看和场景匹配的专项 → 实测成本和延迟 → 小流量 A/B。
  2. 从线上日志和用户反馈里捞真实失败案例。不能自己编,因为编的题总是太规整,测不出真实问题。20–50 条就够开始,别等"建完整套"才开始用。
  3. ①只放难题(分数全在 20% 上下,没区分度)②只放当前模型答错的(换模型后失去代表性)③不分维度只看总分(总分持平但其实格式变好、事实变差,你看不见)。
  4. 能写代码判的一律优先用代码评分器(最可靠);判不了但有明确标准的用 LLM-as-Judge,⚠️ 但它必须先对照人类校准;剩下真正主观的才人工抽样。
  5. 不能。上一页算过:100 题的置信区间就已经有 ±7.8%,30 条更粗。这套题的用途是挡住明显的退步、看出「在我的场景里能不能用」,不是给两个都能用的模型排名——想分辨 3 个点要几百条。
  6. 漏掉维度之间的此消彼长:总分持平,实际可能是"格式变好了、事实准确性变差了"。所以第 ③ 步要按业务分维度打标签(意图理解 / 格式 / 事实准确 / 语气…)。

🛑 可以停在这里

读到这里,你已经有一条能今天下午就走完的路:捞 20–50 条真实失败案例 → 分维度打标签 → 定评分方式 → 拿它去选模型。 什么时候回来看后面:当这套题开始要长期维护(换模型、加维度、防它自己饱和),或者你发现评分器和人的判断对不上时——去智能体工程 14 的八步。

⚡ 走神救援

先记住这几件事

下一节 👉 12-对齐与AI安全.md

打卡记录保存在你的浏览器里,首页能看到总进度