📑 本页目录(点开跳转)
02 · 模型与 Effort:选对大脑
⏱ 20 分钟 | ⭐ 核心
🎯 一句话
「效果不好」有两个独立的旋钮可调:模型 = 能力上限,effort = 投入程度。 分不清这两个,你会永远在瞎调——而且大多数「模型不行」其实是第三个问题。
🎛️ 一、两个旋钮,别拧混
- 便宜快 贵慢但聪明
- 提示词能【引导】模型,但无法【扩展】它的底层能力
- 不只是"思考时间"——是整体的彻底程度:
- · 读多少文件 · 调多少次工具
- · 做多少验证 · 试多少个方案
🔑 一个关键区分
模型能力 = 天花板 (固定的,改不了)
effort = 站多高 (可调的,但不能超过天花板)
→ effort 拉满也够不着的东西,只能换模型
→ 换了大模型但 effort 很低,等于买了梯子不爬
🩺 二、诊断口诀(每天用)
| 症状 | 病因 | 该调什么 |
|---|---|---|
| 跳过文件、没跑测试、任务做一半就宣布完成 | 不够勤快 | 提高 effort |
| 上下文完整、明显认真做了,却自信地做错 | 能力不够 | 换更大的模型 |
| 输出跑题、格式不对、答非所问 | 原料有问题 | 改提示词/上下文(第 3、4 章)⭐ |
| 前几轮好、后面变笨 | 上下文腐烂 | 压缩或清空(第 4 章) |
🔑 口诀: 上限不够换模型,够而不稳调 effort,跑题走神查上下文。
⚠️ 但先做这个自检
遇到"效果不好"时,按这个顺序排查(从便宜到贵):
① 任务表述清楚吗? ← 免费,且最常见 ⭐
② 上下文里有垃圾吗? ← 免费
③ 需要的信息给全了吗? ← 便宜
④ effort 够吗? ← 中等
⑤ 模型够强吗? ← 最贵
新手从 ⑤ 开始查,老手从 ① 开始查。
💡 官方的说法:「先用默认值,再去拧旋钮。」 大多数「模型不行」其实是「提示词不行」或「上下文脏了」。
💰 三、三个反直觉的成本事实
① 大模型可能反而更便宜
小模型:单价低,但可能要跑 40 轮试错
大模型:单价高,但 8 轮就做完了
总成本 = 单价 × 轮数
↑ 别只看左边这一项
尤其在 Agent 场景:每一轮都要重发完整历史(第 1 章), 轮数增加时 token 消耗是超线性的——小模型多跑的那 32 轮,每轮都在重复付费。
② 顾问策略:小模型干活 + 大模型把关
- ↓
- 关键决策 → 大模型审查/仲裁
- 完成时 → 大模型验收
📌 官方数据:这种组合能用约 63% 的成本达到 90%+ 的效果。
什么时候升级到大模型(触发条件示例): - 小模型连续两轮失败 - 涉及不可逆操作(删除、部署、付款) - 最终产出验收 - 模型自己表示不确定
这就是很多生产系统的真实配置——第 13 章多 Agent 研究系统就是主导用大模型、子任务用小模型。
③ 长上下文比你以为的贵
Agent 第 1 轮: 发 2K token
Agent 第 10 轮: 发 20K token(历史累积)
Agent 第 30 轮: 发 60K token
→ 同样是"一轮",第 30 轮的成本是第 1 轮的 30 倍
两个对策(详见第 4 章): - Prefix Caching:稳定内容放前面,能被缓存复用 - 压缩:定期把历史总结掉
🗺️ 四、场景速查表
| 任务类型 | 建议 | 理由 |
|---|---|---|
| 分类、抽取、格式转换、翻译 | 小模型 | 定义明确,能力够用,量大要省钱 |
| 日常编码、写文档、常规 Agent 任务 | 中档 | 性价比区间 |
| 架构设计、难 bug、多步推理 | 大模型 | 需要真正的推理能力 |
| 高风险决策(不可逆操作) | 大模型 | 错误代价 >> token 成本 |
| 大批量 + 偶尔需要高水平判断 | 顾问策略 ⭐ | 63% 成本 90% 效果 |
| 不确定 | 先中档跑通流程,再用数据决定升降 | 别提前优化 |
🧠 五、Effort 该怎么调
effort 高不总是好的:
| 场景 | effort | 理由 |
|---|---|---|
| 简单事实查询、格式转换 | 低 | 高 effort 是浪费,还更慢 |
| 日常编码 | 中 | — |
| 难 bug、架构决策、有客观验证的任务 | 高 | 值得多试几次 |
| 创意写作 | 中低 | 过度分析有时伤害自然感 |
| 成本敏感的高频任务 | 低 + 路由 | 复杂的才升级(第 6 章路由) |
⚠️ 一个常见浪费:默认全开最高 effort。 推理 token 也要付费,而且长思考可能是答案本身的 10–100 倍。 按任务类型路由,别一刀切。
🔨 六、动手:三格实验
挑你手头的一个真实任务(不是 demo),跑三格:
| 实验 | 配置 | 记录 |
|---|---|---|
| A | 小模型 + 默认 effort | 质量 / 耗时 / 成本 |
| B | 小模型 + 高 effort | 变好了吗? |
| C | 大模型 + 默认 effort | 变好了吗? |
怎么读结果:
B 明显好于 A → 你原来的问题是【不够勤快】→ 调 effort 就够,省钱
C 明显好于 A,B 没帮助 → 是【能力不够】→ 必须换模型
B 和 C 都没帮助 → ⭐ 问题在提示词/上下文,不在模型
把结论写下来——这是你自己的选型基准线,比任何博主的评测都有用。
⚠️ 七、时效提醒
会变的:具体型号名、价格、上下文长度、benchmark 排名
↑ 半年就过期,只当量级感
不会变的:
· 「模型 = 能力上限,effort = 投入程度」这个二元结构
· 「先查提示词再换模型」的排查顺序
· 顾问策略的思路
· 算总账不算单价
🔗 想系统了解模型选型的全貌,见全景导论。
🕳️ 八、五个常见坑
| 坑 | 症状 | 修 |
|---|---|---|
| 一上来就换最强模型 | 花了钱效果没变 | 先查提示词和上下文(免费) |
| 只看单价不算总账 | 选了便宜模型结果更贵 | 算 单价 × 轮数 |
| effort 一刀切开满 | 简单任务又慢又贵 | 按任务类型路由 |
| 忘了长上下文的复利 | 后期成本失控 | Prefix Caching + 压缩 |
| 换代后不重测 | 一直用着过时的配置 | 模型升级后重跑三格实验 |
📚 延伸阅读
- Claude 模型详解与选型
- 在 Claude Code 中选择模型与 effort 级别
- 全景导论 09 · 推理范式 —— effort 这个旋钮背后是什么:模型「想久一点」在推理时到底多做了什么、为什么它能换来准确率、以及成本是怎么随之涨的
- 全景导论 13 · LLMOps —— 选型只是第一步。多个模型混用之后的成本建模(p50 / p95 单次对话成本)、模型路由、以及按功能入口做账单归因(找出那个吃掉 60% 预算的功能)在那一章
- 模型上线之后 03 · 灰度影子与回滚 —— 换模型本身是一次上线。影子流量、灰度节奏、回滚的前置条件在这一章;⚠️ 全景导论 13 只把「有灰度和 A/B 能力」列进了上线清单,机制在这里
✅ 检查点
- 模型和 effort 各决定什么?两者是什么关系?
- Agent 跳过测试就宣布完成——调哪个旋钮?
- 遇到"效果不好"的正确排查顺序是什么?为什么新手容易搞反?
- 为什么复杂任务上大模型可能总成本更低?Agent 场景为什么更明显?
- 顾问策略是什么?大概省多少?什么时候触发升级?
- effort 应该总是开满吗?
- 三格实验里,B 和 C 都没帮助说明什么?
👀 答案
- 模型 = 能力上限(天花板,固定),effort = 投入的彻底程度(站多高,可调但不能超过天花板)。effort 拉满还够不着就只能换模型。
- 提高 effort——这是「不够勤快」不是「不够聪明」。
- ①任务表述 ②上下文有没有垃圾 ③信息给全了吗 ④effort ⑤模型。从便宜到贵。新手直接从 ⑤ 开始,因为换模型是最容易做的动作,但大多数问题其实在 ①②。
- 总成本 = 单价 × 轮数,大模型轮数少。Agent 场景更明显因为每轮都重发完整历史,轮数多时 token 消耗是超线性的。
- 小模型执行 + 大模型把关,约 63% 成本拿 90%+ 效果。触发升级:连续两轮失败、不可逆操作、最终验收、模型自称不确定。
- 不该。推理 token 也要付费,长思考可能是答案的 10-100 倍。简单任务开满是浪费且更慢,应按任务类型路由。
- 问题不在模型也不在 effort,而在提示词或上下文。
🛑 可以停在这里
⚡ 走神救援
两个独立旋钮:模型=能力天花板(一组冻结的权重,固定,提示词能引导却无法扩展它)、effort=站多高(可调但不超天花板)——effort 不只是思考时间,是读多少文件、调多少次工具、做多少验证的整体彻底程度;拉满还够不着就只能换模型,换了大模型却给低 effort 等于买了梯子不爬。诊断口诀:上限不够换模型,够而不稳调effort,跑题走神查上下文——跳过文件、没跑测试、做一半就宣布完成=不够勤快;上下文完整却自信地做错=能力不够;前几轮好后面变笨=上下文腐烂,压缩或清空。⚠️但排查顺序应从便宜到贵:①提示词②上下文③信息全不全④effort⑤模型——新手从⑤开始,老手从①开始,官方的说法是「先用默认值,再去拧旋钮」。成本三事实:①算总账不算单价(总成本=单价×轮数,小模型可能跑 40 轮试错、大模型 8 轮就完事;Agent 场景每轮重发完整历史,多跑的 32 轮每轮都在重复付费,token 超线性)②⭐顾问策略63%成本90%效果(连续两轮失败/不可逆操作/最终验收/模型自称不确定时升级)③长上下文有复利(第 1 轮 2K、第 10 轮 20K、第 30 轮 60K token,第 30 轮成本是第 1 轮的 30 倍,用PrefixCaching+压缩)。⚠️effort别一刀切开满,推理token也花钱,长思考可能是答案本身的 10–100 倍,该按任务类型路由。三格实验:B好=调effort,C好=换模型,⭐都没用=问题在提示词或上下文。
下一节 👉 03-提示词工程.md