🏠 总目录 📚 资料库模型选择

Claude Models Explained: Choosing the Best Model for Your Use Case(Claude 模型详解与选型)

📄 来自 Claude 官方博客
原文标题
Claude Models Explained: Choosing the Best Model for Your Use Case(Claude 模型详解与选型)
原文链接
https://claude.com/blog/claude-models-explained-choosing-the-best-model-for-your-use-case
作者
Anthropic
发布日期
2026-07-24
⚠️ 本页是原文的中文结构化整理笔记(保留架构、数据、案例、结论),并非逐字翻译。具体参数与功能名更新很快,落地前请点击上方链接核对原文。

10 分钟 | 🧠 选型不是选最强,是选最合适

🎯 一句话

模型选型的实际决策变量只有三个:任务难度、延迟要求、单位成本。⭐ 最常见的错误是全流程用同一个模型——而真实系统里不同环节的难度差异极大。

📑 本页目录

从最强的可用模型开始,再通过调整 effort 级别优化性能与成本。 Claude 各模型的差异主要不在领域专长,而在能处理的问题难度以及相应的速度/价格权衡。

模型阵容

模型 定位 适用场景
Mythos / Fable 能力最强的前沿模型 跨领域前沿能力;编码、长时运行 Agent、新颖问题求解。Mythos 限制供有双重用途网络安全/生物学工作的组织使用;Fable 面向公众开放并附加保障措施
Opus 强大的企业级 推理密集型任务,行业基准排名靠前。如果内部测试表明 Opus 能胜任,其速度/价格优势可能优于 Fable
Sonnet 全能均衡 性能、速度、成本的平衡点;适合高并发子 Agent 和通用工作
Haiku 快且便宜 成本最低、速度最快;适合高频、对延迟敏感的负载

选型的四个关键问题

  1. 任务难度: 复杂、多步骤、或以前没解决过的问题需要更强的模型
  2. 延迟要求: 面向客户的高频工作偏向 Sonnet
  3. 访问限制: Mythos 供应受限,组织按角色限制访问
  4. 单位经济性: 只要质量达标,高并发场景适合更低档位的模型

顾问策略(Advisor Strategy)

用低成本模型执行、由强模型把关的组合:

「Sonnet 5 + Fable 5 顾问」在 SWE-bench Pro 上达到 Fable 分数的 90% 以上,成本仅为 63%。

评估方法

基于生产负载的自定义评估优于标准基准——尤其当前沿模型已把公开基准分数刷饱和时。好的评估能区分「模型真实能力不足」与「配置/环境问题」。

结论

模型选型需要同时理解能力档位和具体用例需求。组织应当建立稳健的自有评估体系,而不是仅凭基准分数来区分顶级模型之间的差异。


✅ 检查点

  1. 模型选型的三个实际决策变量是什么?
  2. 为什么「全流程用同一个模型」通常是浪费?
  3. 什么时候该升级到更强的模型,而不是继续优化提示词?
👀 答案
  1. 任务难度、延迟要求、单位成本。三者互相制约,没有哪个模型在三个维度上同时最优。
  2. 因为真实系统里不同环节的难度差异极大:意图分类、格式转换、字段抽取这类任务小模型就够;而多步推理、代码重构、复杂规划才需要最强的模型。⭐ 正确做法是分级路由:简单环节用快而便宜的,难环节才上强模型。
  3. ⭐ 判据是「错误的性质」:如果错误是格式不对、漏了要求、答非所问——这是提示词问题,继续优化提示词;如果错误是推理链条断裂、多步任务中途走偏、需要的知识确实不具备——这才是能力上限,该换模型。⚠️ 在能力不足的模型上反复调提示词,是最常见的时间浪费。

🛑 可以停在这里

走神救援
模型选型的三个决策变量:任务难度、延迟要求、单位成本,没有模型在三个维度同时最优。⭐最常见的错误是全流程用同一个模型——真实系统里环节难度差异极大:意图分类/格式转换/字段抽取小模型就够,多步推理/代码重构/复杂规划才需要最强的;正确做法是分级路由。⭐⭐该换模型还是该调提示词,判据是「错误的性质」格式不对/漏要求/答非所问 → 提示词问题推理链条断裂/多步中途走偏/知识确实不具备 → 能力上限,换模型。⚠️ 在能力不足的模型上反复调提示词是最常见的时间浪费。