🏠 总目录📚 本教程 02 · 模型与 effort
📑 本页目录(点开跳转)

02 · 模型与 Effort:选对大脑

20 分钟 | ⭐ 核心


🎯 一句话

「效果不好」有两个独立的旋钮可调:模型 = 能力上限effort = 投入程度。 分不清这两个,你会永远在瞎调——而且大多数「模型不行」其实是第三个问题


🎛️ 一、两个旋钮,别拧混

模型能力(小 → 大)↑ effort / 思考预算小模型 + 高 effort❌ 最差的一格想很久,也想不深大模型 + 高 effort架构设计 · 复杂调试最贵,留给真难题小模型 + 低 effort分类 · 抽取 · 路由量大、便宜、能跑批大模型 + 低 effort日常对话 · 写代码多数场景的默认档
两个旋钮是正交的,别当成一个。⭐ 左上角那格最容易被忽略:小模型给再多思考预算,也补不上能力的差 —— 它只会慢,不会更聪明。真正该省的是右上角,那格贵得最快。
旋钮 1:模型(Model)= 用哪组冻结的权重
  • 便宜快 贵慢但聪明
  • 提示词能【引导】模型,但无法【扩展】它的底层能力
💡 决定"能不能想明白"
旋钮 2:Effort = 投入多少工作量
  • 不只是"思考时间"——是整体的彻底程度:
  • · 读多少文件 · 调多少次工具
  • · 做多少验证 · 试多少个方案
💡 决定"愿不愿意做彻底"

🔑 一个关键区分

   模型能力  = 天花板   (固定的,改不了)
   effort   = 站多高   (可调的,但不能超过天花板)

   → effort 拉满也够不着的东西,只能换模型
   → 换了大模型但 effort 很低,等于买了梯子不爬

🩺 二、诊断口诀(每天用)

症状 病因 该调什么
跳过文件、没跑测试、任务做一半就宣布完成 不够勤快 提高 effort
上下文完整、明显认真做了,却自信地做错 能力不够 换更大的模型
输出跑题、格式不对、答非所问 原料有问题 改提示词/上下文(第 3、4 章)⭐
前几轮好、后面变笨 上下文腐烂 压缩或清空(第 4 章)

🔑 口诀上限不够换模型,够而不稳调 effort,跑题走神查上下文。

⚠️ 但先做这个自检

   遇到"效果不好"时,按这个顺序排查(从便宜到贵):

   ① 任务表述清楚吗?        ← 免费,且最常见 ⭐
   ② 上下文里有垃圾吗?       ← 免费
   ③ 需要的信息给全了吗?     ← 便宜
   ④ effort 够吗?           ← 中等
   ⑤ 模型够强吗?            ← 最贵

   新手从 ⑤ 开始查,老手从 ① 开始查。

💡 官方的说法「先用默认值,再去拧旋钮。」 大多数「模型不行」其实是「提示词不行」或「上下文脏了」。


💰 三、三个反直觉的成本事实

① 大模型可能反而更便宜

   小模型:单价低,但可能要跑 40 轮试错
   大模型:单价高,但 8 轮就做完了

   总成本 = 单价 × 轮数
            ↑ 别只看左边这一项

尤其在 Agent 场景:每一轮都要重发完整历史(第 1 章), 轮数增加时 token 消耗是超线性的——小模型多跑的那 32 轮,每轮都在重复付费。

② 顾问策略:小模型干活 + 大模型把关

日常步骤 → 小/中模型执行

📌 官方数据:这种组合能用约 63% 的成本达到 90%+ 的效果

什么时候升级到大模型(触发条件示例): - 小模型连续两轮失败 - 涉及不可逆操作(删除、部署、付款) - 最终产出验收 - 模型自己表示不确定

这就是很多生产系统的真实配置——第 13 章多 Agent 研究系统就是主导用大模型、子任务用小模型。

③ 长上下文比你以为的贵

   Agent 第 1 轮:  发 2K token
   Agent 第 10 轮: 发 20K token(历史累积)
   Agent 第 30 轮: 发 60K token

   → 同样是"一轮",第 30 轮的成本是第 1 轮的 30 倍

两个对策(详见第 4 章): - Prefix Caching:稳定内容放前面,能被缓存复用 - 压缩:定期把历史总结掉


🗺️ 四、场景速查表

任务类型 建议 理由
分类、抽取、格式转换、翻译 小模型 定义明确,能力够用,量大要省钱
日常编码、写文档、常规 Agent 任务 中档 性价比区间
架构设计、难 bug、多步推理 大模型 需要真正的推理能力
高风险决策(不可逆操作) 大模型 错误代价 >> token 成本
大批量 + 偶尔需要高水平判断 顾问策略 63% 成本 90% 效果
不确定 先中档跑通流程,再用数据决定升降 别提前优化

🧠 五、Effort 该怎么调

effort 高不总是好的

场景 effort 理由
简单事实查询、格式转换 高 effort 是浪费,还更慢
日常编码
难 bug、架构决策、有客观验证的任务 值得多试几次
创意写作 中低 过度分析有时伤害自然感
成本敏感的高频任务 低 + 路由 复杂的才升级(第 6 章路由)

⚠️ 一个常见浪费:默认全开最高 effort。 推理 token 也要付费,而且长思考可能是答案本身的 10–100 倍按任务类型路由,别一刀切。


🔨 六、动手:三格实验

挑你手头的一个真实任务(不是 demo),跑三格:

实验 配置 记录
A 小模型 + 默认 effort 质量 / 耗时 / 成本
B 小模型 + effort 变好了吗?
C 模型 + 默认 effort 变好了吗?

怎么读结果

   B 明显好于 A  →  你原来的问题是【不够勤快】→ 调 effort 就够,省钱
   C 明显好于 A,B 没帮助  →  是【能力不够】→ 必须换模型
   B 和 C 都没帮助  →  ⭐ 问题在提示词/上下文,不在模型

把结论写下来——这是你自己的选型基准线,比任何博主的评测都有用。


⚠️ 七、时效提醒

   会变的:具体型号名、价格、上下文长度、benchmark 排名
   ↑ 半年就过期,只当量级感

   不会变的:
   · 「模型 = 能力上限,effort = 投入程度」这个二元结构
   · 「先查提示词再换模型」的排查顺序
   · 顾问策略的思路
   · 算总账不算单价

🔗 想系统了解模型选型的全貌,见全景导论


🕳️ 八、五个常见坑

症状
一上来就换最强模型 花了钱效果没变 先查提示词和上下文(免费)
只看单价不算总账 选了便宜模型结果更贵 算 单价 × 轮数
effort 一刀切开满 简单任务又慢又贵 按任务类型路由
忘了长上下文的复利 后期成本失控 Prefix Caching + 压缩
换代后不重测 一直用着过时的配置 模型升级后重跑三格实验

📚 延伸阅读


✅ 检查点

  1. 模型和 effort 各决定什么?两者是什么关系?
  2. Agent 跳过测试就宣布完成——调哪个旋钮?
  3. 遇到"效果不好"的正确排查顺序是什么?为什么新手容易搞反?
  4. 为什么复杂任务上大模型可能总成本更低?Agent 场景为什么更明显?
  5. 顾问策略是什么?大概省多少?什么时候触发升级?
  6. effort 应该总是开满吗?
  7. 三格实验里,B 和 C 都没帮助说明什么?
👀 答案
  1. 模型 = 能力上限(天花板,固定),effort = 投入的彻底程度(站多高,可调但不能超过天花板)。effort 拉满还够不着就只能换模型。
  2. 提高 effort——这是「不够勤快」不是「不够聪明」。
  3. ①任务表述 ②上下文有没有垃圾 ③信息给全了吗 ④effort ⑤模型。从便宜到贵。新手直接从 ⑤ 开始,因为换模型是最容易做的动作,但大多数问题其实在 ①②。
  4. 总成本 = 单价 × 轮数,大模型轮数少。Agent 场景更明显因为每轮都重发完整历史,轮数多时 token 消耗是超线性的。
  5. 小模型执行 + 大模型把关,约 63% 成本拿 90%+ 效果。触发升级:连续两轮失败、不可逆操作、最终验收、模型自称不确定。
  6. 不该。推理 token 也要付费,长思考可能是答案的 10-100 倍。简单任务开满是浪费且更慢,应按任务类型路由。
  7. 问题不在模型也不在 effort,而在提示词或上下文

🛑 可以停在这里

走神救援

两个独立旋钮:模型=能力天花板(一组冻结的权重,固定,提示词能引导却无法扩展它)effort=站多高(可调但不超天花板)——effort 不只是思考时间,是读多少文件、调多少次工具、做多少验证的整体彻底程度;拉满还够不着就只能换模型,换了大模型却给低 effort 等于买了梯子不爬。诊断口诀:上限不够换模型,够而不稳调effort,跑题走神查上下文——跳过文件、没跑测试、做一半就宣布完成=不够勤快;上下文完整却自信地做错=能力不够;前几轮好后面变笨=上下文腐烂,压缩或清空。⚠️但排查顺序应从便宜到贵:①提示词②上下文③信息全不全④effort⑤模型——新手从⑤开始,老手从①开始,官方的说法是「先用默认值,再去拧旋钮」。成本三事实:①算总账不算单价(总成本=单价×轮数,小模型可能跑 40 轮试错、大模型 8 轮就完事;Agent 场景每轮重发完整历史,多跑的 32 轮每轮都在重复付费,token 超线性)②⭐顾问策略63%成本90%效果(连续两轮失败/不可逆操作/最终验收/模型自称不确定时升级)③长上下文有复利(第 1 轮 2K、第 10 轮 20K、第 30 轮 60K token,第 30 轮成本是第 1 轮的 30 倍,用PrefixCaching+压缩)。⚠️effort别一刀切开满,推理token也花钱,长思考可能是答案本身的 10–100 倍,该按任务类型路由。三格实验:B好=调effort,C好=换模型,⭐都没用=问题在提示词或上下文。

下一节 👉 03-提示词工程.md

打卡记录保存在你的浏览器里,首页能看到总进度