Designing AI-Resistant Technical Evaluations(设计抗 AI 的技术评估)
📄 来自 Claude 官方博客
- 原文标题
- Designing AI-Resistant Technical Evaluations(设计抗 AI 的技术评估)
- 原文链接
- https://www.anthropic.com/engineering/AI-resistant-technical-evaluations
- 作者
- Tristan Hume(Anthropic 性能优化团队负责人)
- 发布日期
- 2026-01-21
⚠️ 本页是原文的中文结构化整理笔记(保留架构、数据、案例、结论),并非逐字翻译。具体参数与功能名更新很快,落地前请点击上方链接核对原文。
🎯 一句话
有些任务天然难评测:写作质量、方案好坏、代码可读性。⭐ 应对思路不是找一个完美指标,而是把模糊的整体判断,拆成一组各自明确的小判断。
随着 AI 能力进步,技术招聘评估的失效速度超出预期。Anthropic 性能工程岗的 take-home 测试三年内被迫迭代三个版本——在模型持续变强的世界里,设计能有效区分人类技能的评估越来越难。
原版 take-home 的设计
- 4 小时(后改 2 小时)优化一个模拟加速器上的树遍历代码
- 模拟器具备 TPU 式特征:手动管理内存、VLIW(多并行执行单元)、SIMD 向量化、多核分布
- 设计原则:比传统 50 分钟面试更接近真实工程;真实环境、无人观察、不用边做边讲;留出构建调试工具的空间;明确允许使用 AI(反映实际工作方式);高信噪比、不要求窄领域知识、有趣
- 效果:1,000+ 人完成,经此录用的数十位工程师表现优秀
被 AI 连续击穿的过程
- 2025-05: Claude 3.5 Sonnet 已超过 50% 的人类申请者;预发布的 Opus 4 在 4 小时限制内胜过几乎所有候选人 → 推出 V2(更干净的起始代码、更多机器特性、缩短为 2 小时)
- Opus 4.5: 不到 1 小时达到 V2 及格线且继续优化;被告知目标周期数时还能找出非显而易见的变通方案 → 「在我们的 take-home 上,最优策略变成了全权委托给 Claude Code」
考虑过又否决的方案
- 禁止 AI: 无法执行,且与真实工作条件脱节
- 提高及格线到「显著超过 Claude Code」: 不现实——人类一半时间花在理解问题上
- 接受失效: 评估就失去了意义
V3 的探索
- 尝试一(失败): 基于 TPU 数据转置和 bank 冲突规避设计新题——Opus 4.5 找到未预料的解法;打补丁后它用 "ultrathink" 扩展思考照样解出。教训:这类问题训练数据太多
- 尝试二(有效): 借鉴解谜游戏 Shenzhen I/O 的思路——在严格受限的指令集上对多个独立谜题优化最少指令数。Claude 在这些题上失败了,初步结果与候选人质量相关性良好
- 策略转变:从「模拟真实工作」转向「模拟新颖工作」——评估搬进不熟悉的问题空间
公开挑战与数据
原版 take-home 已公开、不限时。不限时条件下人类专家仍占优:
| 选手 | 成绩(周期数,越少越好) |
|---|---|
| Opus 4(多个小时后) | 2,164 |
| Opus 4.5(11.5 小时后) | 1,487 |
| Opus 4.5(更长时间+改进) | 1,363 |
| 最强人类 | 约 1,548 |
打破 1,487 周期的候选人可联系 performance-recruiting@anthropic.com。
关键洞察
- 时间维度很关键: 不限时时人类保有优势;时间约束偏向 AI
- 训练数据效应: AI 在有大量既有资料的问题上表现最好
- 分布外问题更抗 AI: 新颖问题空间比贴近真实工作的题目更持久
- 工具判断力: 需要决定「是否值得投入建调试器/优化基础设施」的测试,能考察纯技术输出之外的人类推理
作者的结语耐人寻味:「真实性可能已是我们负担不起的奢侈品。」这种张力——评估既要代表实际工作又要抗 AI——可能随模型进步变得根本无法调和。
✅ 检查点
- 为什么有些任务「难评测」?
- 把整体判断拆成小判断,好处是什么?
- 用模型当评委(LLM-as-judge)的主要陷阱是什么?
👀 答案
- 因为它们没有唯一正确答案,且好坏是多维的。「这篇文章写得好吗」实际上混合了准确性、结构、可读性、是否切题等多个维度,笼统打一个分,不同评委甚至同一评委不同次都不一致。
- ⭐ 三个好处:①每个小判断的一致性高得多(「是否引用了来源」比「是否可信」好判断);②能定位问题出在哪个维度,而不只是知道分数低;③可以按维度分别设权重,反映你真正在乎什么。
- ⭐ 位置偏好和自我偏好:评委模型倾向于选排在前面的候选,也倾向于给自己(或同族模型)生成的内容更高分。缓解:交换顺序各测一次取平均;用不同族的模型当评委;给出明确评分标准而不是让它自由发挥。此外还要用人工标注的小样本去校准评委,确认它和人的判断相关。
🛑 可以停在这里
⚡ 走神救援
⭐难评测的任务=没有唯一正确答案且好坏是多维的——「文章写得好吗」混合了准确性/结构/可读性/切题度,笼统打分不同次都不一致。⭐⭐核心思路:把模糊的整体判断拆成一组各自明确的小判断,三个好处:每个小判断一致性高得多(「是否引用来源」比「是否可信」好判断)、能定位问题在哪个维度、可按维度设权重。⚠️LLM-as-judge 的主要陷阱是位置偏好和自我偏好:倾向选排前面的、倾向给自己(或同族模型)的内容高分。缓解:交换顺序各测一次取平均、用不同族模型当评委、给明确评分标准,并用人工标注的小样本校准评委确认它和人的判断相关。