🏠 总目录 📚 资料库智能体评测

Designing AI-Resistant Technical Evaluations(设计抗 AI 的技术评估)

📄 来自 Claude 官方博客
原文标题
Designing AI-Resistant Technical Evaluations(设计抗 AI 的技术评估)
原文链接
https://www.anthropic.com/engineering/AI-resistant-technical-evaluations
作者
Tristan Hume(Anthropic 性能优化团队负责人)
发布日期
2026-01-21
⚠️ 本页是原文的中文结构化整理笔记(保留架构、数据、案例、结论),并非逐字翻译。具体参数与功能名更新很快,落地前请点击上方链接核对原文。

12 分钟 | 🧪 怎么测那些「说不清对错」的任务

🎯 一句话

有些任务天然难评测:写作质量、方案好坏、代码可读性。⭐ 应对思路不是找一个完美指标,而是把模糊的整体判断,拆成一组各自明确的小判断

📑 本页目录

随着 AI 能力进步,技术招聘评估的失效速度超出预期。Anthropic 性能工程岗的 take-home 测试三年内被迫迭代三个版本——在模型持续变强的世界里,设计能有效区分人类技能的评估越来越难。

原版 take-home 的设计

被 AI 连续击穿的过程

考虑过又否决的方案

  1. 禁止 AI: 无法执行,且与真实工作条件脱节
  2. 提高及格线到「显著超过 Claude Code」: 不现实——人类一半时间花在理解问题上
  3. 接受失效: 评估就失去了意义

V3 的探索

公开挑战与数据

原版 take-home 已公开、不限时。不限时条件下人类专家仍占优:

选手 成绩(周期数,越少越好)
Opus 4(多个小时后) 2,164
Opus 4.5(11.5 小时后) 1,487
Opus 4.5(更长时间+改进) 1,363
最强人类 约 1,548

打破 1,487 周期的候选人可联系 performance-recruiting@anthropic.com。

关键洞察

  1. 时间维度很关键: 不限时时人类保有优势;时间约束偏向 AI
  2. 训练数据效应: AI 在有大量既有资料的问题上表现最好
  3. 分布外问题更抗 AI: 新颖问题空间比贴近真实工作的题目更持久
  4. 工具判断力: 需要决定「是否值得投入建调试器/优化基础设施」的测试,能考察纯技术输出之外的人类推理

作者的结语耐人寻味:「真实性可能已是我们负担不起的奢侈品。」这种张力——评估既要代表实际工作又要抗 AI——可能随模型进步变得根本无法调和。


✅ 检查点

  1. 为什么有些任务「难评测」?
  2. 把整体判断拆成小判断,好处是什么?
  3. 用模型当评委(LLM-as-judge)的主要陷阱是什么?
👀 答案
  1. 因为它们没有唯一正确答案,且好坏是多维的。「这篇文章写得好吗」实际上混合了准确性、结构、可读性、是否切题等多个维度,笼统打一个分,不同评委甚至同一评委不同次都不一致
  2. ⭐ 三个好处:①每个小判断的一致性高得多(「是否引用了来源」比「是否可信」好判断);②能定位问题出在哪个维度,而不只是知道分数低;③可以按维度分别设权重,反映你真正在乎什么。
  3. 位置偏好和自我偏好:评委模型倾向于选排在前面的候选,也倾向于给自己(或同族模型)生成的内容更高分。缓解:交换顺序各测一次取平均;用不同族的模型当评委;给出明确评分标准而不是让它自由发挥。此外还要用人工标注的小样本去校准评委,确认它和人的判断相关。

🛑 可以停在这里

走神救援
难评测的任务=没有唯一正确答案且好坏是多维的——「文章写得好吗」混合了准确性/结构/可读性/切题度,笼统打分不同次都不一致。⭐⭐核心思路:把模糊的整体判断拆成一组各自明确的小判断,三个好处:每个小判断一致性高得多(「是否引用来源」比「是否可信」好判断)、能定位问题在哪个维度可按维度设权重。⚠️LLM-as-judge 的主要陷阱是位置偏好和自我偏好:倾向选排前面的、倾向给自己(或同族模型)的内容高分。缓解:交换顺序各测一次取平均、用不同族模型当评委、给明确评分标准,并用人工标注的小样本校准评委确认它和人的判断相关。