🏠 总目录📚 本教程 09 · 推理范式 ← →
📑 本页目录(点开跳转)

09 · 推理范式:让它想清楚再答

⏱ 28 分钟 | ⭐ 概念多但都不难


🎯 一句话

模型是「一个字一个字往外蹦」的(第 2 章),所以不给它思考的空间,它就只能凭直觉答。推理范式做的事就是:用生成的 token 换取思考的深度。


🧠 底层原理:为什么「让它先想」有效

流程图

模型每生成一个 token,只做固定量的计算。
直接要答案→所有推理必须压缩在最后那几个 token 里→做不到
让它先写思考过程→每一步推理都有 token 承载
中间结果被写进上下文,后续步骤可以引用
相当于给了它一块"草稿纸"

💡 一句话:思考 = 计算,而 token 是计算的载体。 这也是「测试时扩展(Test-time Scaling)」的理论基础——推理时多花算力,能换到更好的结果。

🧮 一个能算出来的直觉

算一算

一个模型有 L 层。生成一个 token = 走完 L 层 = 固定的计算量。

问题:"37 × 48 = ?"

直接答: 1 个 token 的计算量 → 必须"一眼看出"答案 ❌

写推理过程: 37×40=1480, 37×8=296, 1480+296=1776

约 40 个 token → 【40 倍的计算量】✅

而且中间结果 1480、296 被【写进了上下文】,

后面的步骤可以直接读,不用重新推

⭐ 两个收益:更多计算 + 中间结果可复用(相当于外部记忆)

🔑 这解释了一个反直觉的现象: 让模型"把过程写出来",即使那段过程你根本不看,答案也会变准。 因为过程本身就是计算,不是给你看的。

⚠️ 一个重要的边界:推理链不等于真实推理过程

因果链

模型写出来的"思考过程",不一定是它【真正】得出答案的路径
有研究显示:改变提示里的暗示,模型会给出不同答案,
但它写的推理过程【不会提到那个暗示】,而是编一套自洽的理由
⚠️ 所以:
· 推理链能【提升准确率】 ✅(因为它确实提供了计算)
· 但不能当作【可信的解释】 ❌

💡 实践含义:别把模型的推理链当作审计证据。 它在高风险场景(医疗、金融、法务)里是说服力很强但不可靠的东西—— 这恰恰是最危险的组合。


🪜 六种范式(从简单到复杂)

① CoT 思维链(Chain-of-Thought)

结果对照

「请一步一步思考」/ 「Let's think step by step」
模型写出推理过程再给答案
✅ 最简单,数学/逻辑题提升明显
⚠️ 现代模型很多已内建,不必总是手动加

② Self-Consistency 自洽性

结果对照

同一问题跑 5 次(温度调高)→取多数答案
✅ 显著提升准确率
❌ 成本 ×5
👉 适合高价值、有唯一正确答案的任务

③ ReAct(推理 + 行动)

操作步骤

Thought: 我需要查一下今年的销售数据
Action: search_db("2026 sales")
Observation: [返回结果]
Thought: 数据显示 Q2 下滑,我需要看原因
Action: ·
循环直到得出答案

🔗 这就是 Agent 的主循环——本站《智能体工程教程》第 1 章从零写的就是它。ReAct 是它的理论原型。

④ Reflexion 自我反思

因果链

做一遍→自己批判→根据批判重做
✅ 有客观反馈(测试、编译器)时效果好
⚠️ 没有外部反馈时,自我批判容易流于形式
—— 智能体教程第 12 章:自评有系统性正面偏差
所以生产上更常用「独立的评估者」而非自我反思

⑤ ToT 思维树(Tree-of-Thought)

对照

不是一条链,而是探索多个分支 + 剪枝

✅ 适合有搜索空间的问题(规划、谜题)

❌ 成本高、实现复杂,实际用得少

⑥ 长思考 / 推理模型(2024+)

结果对照

不是提示技巧,而是训练出来的能力:
模型在给答案前先生成一长段内部推理(可能几千 token)
训练方式:用可验证的奖励(数学答案对错、代码能否通过测试)
做强化学习→模型自己学会"慢慢想"
(第 4 章的 GRPO 等)
✅ 数学、代码、复杂推理大幅提升
❌ 慢、贵;简单任务上是浪费

⚖️ 关键权衡:什么时候值得让它「多想」

任务类型 建议
事实查询、格式转换、分类 ⛔ 别加推理,浪费钱和时间
数学、逻辑、多步推导 ✅ 值得
代码调试、架构设计 ✅ 值得
创意写作 🟡 有时有害(过度分析伤害自然感)
高价值、错了代价大的决策 ✅ 值得,甚至上 Self-Consistency

🔑 成本意识:推理 token 也是要付钱的,且长思考可能是答案本身的 10–100 倍。 不要默认全开。 按任务类型路由(智能体教程第 6 章的「路由」工作流)。

📊 六种范式的成本-收益速查

范式 成本倍数 什么时候它是最优解
直接回答 1× 事实查询、格式转换、分类 ⭐ 默认
CoT 2~5× 多步逻辑,且模型没内建思考
长思考模型 10~100× 数学、代码、复杂推理
Self-Consistency ×N(N 次采样) 有唯一正确答案 + 错了代价大 ⭐
ReAct 视轮数 需要外部信息/工具(不是"想得更深"能解决的)
Reflexion 2~3× 有客观反馈(测试能跑、编译器会报错)

💡 最容易选错的一组: 问题是"信息不够"时,加再多思考也没用——你需要的是 ReAct(去查),不是 CoT(再想想)。 反过来,信息齐全但推理复杂时,给工具也没用。 先判断瓶颈是"缺信息"还是"缺计算",再选范式。 ⭐


🔗 和站内其他章的关系

左列有的来自日常用 LLM 的经验,有的在站内别的板块讲过——碰上过哪几条就从哪几条接进来,一条没碰过也不影响读这一章。

你可能已经知道的 这一章的对应
Agent 循环(智能体第 1 章) ReAct 就是它的理论原型
生成与评估分离(智能体第 12 章) Reflexion 的局限正是自评偏差
effort 旋钮(智能体第 2 章) 「让它多想」的产品化封装
生成式推荐的测试时扩展(推荐第 14 章) 同一个概念在另一个领域
路由工作流(智能体第 6 章) 用来决定哪些任务开推理

📦 深挖的话要学什么

📍 每条后面标了它在哪: 📗 本库有 = 站内已经讲透,点进去就行;📙 半有 = 站内讲了一半,另一半得外找; 📕 要外找 = 站内没有,得去论文或别处。 (这份清单以前只列词不说去哪,指到的坑有些站内根本没挖过,按图索骥会扑空。)

需要的前置:第 4 章(训练/对齐)会让你理解「长思考是怎么训出来的」。


⚖️ 要不要深挖

你的情况 建议
做应用 🟡 本章内容基本够用——知道有哪些范式、什么时候用
想优化复杂任务的效果 ✅ 值得学 Self-Consistency 和路由策略
想训练推理模型 ✅ 深挖训练层(并入第 4 章一起学)
做研究 ✅ 这是当前最热的方向之一

🔑 我的判断:这块内容量不足以单独成套,且提示层的技巧变化快(很多已被模型内建)。

✅ 现状更新:提示层的实战部分已经在 《智能体工程教程》第 3 章提示词工程里了; ReAct 循环在第 1 章;生成-评估分离在第 12 章。 训练层(长思考怎么训出来)看本导论主线 4 · 它怎样从续写机变助手即可。


✅ 检查点

  1. 为什么「让模型先想再答」有效?用第 2 章的知识解释,并说出两个收益。
  2. 为什么说"即使你不看那段推理过程,答案也会更准"?
  3. 推理链能当作可信的解释吗?这在什么场景下特别危险?
  4. ReAct 和 Agent 的主循环是什么关系?
  5. Reflexion 的局限是什么?生产上更常用什么替代?
  6. 长思考模型是提示技巧还是训练出来的能力?
  7. 「瓶颈是缺信息还是缺计算」——这个判断决定了什么?
  8. 什么任务不该开推理?
👀 答案
  1. 模型每生成一个 token 只做固定量计算,直接要答案等于把所有推理压缩在最后几个 token 里。两个收益:①更多计算(40 个 token 就是 40 倍计算量)②中间结果被写进上下文可复用(相当于外部记忆)。
  2. 因为过程本身就是计算,不是给你看的。token 是计算的载体,写出来就等于分配了更多算力。
  3. 不能。研究显示改变提示里的暗示会改变模型答案,但它写的推理过程不会提到那个暗示,而是编一套自洽的理由。在医疗/金融/法务等高风险场景特别危险——因为它"说服力很强但不可靠",这是最糟的组合。
  4. ReAct(Thought→Action→Observation 循环)就是 Agent 循环的理论原型,你写的那 60 行就是它的实现。
  5. 没有外部客观反馈时,自我批判容易流于形式——自评有系统性正面偏差。生产上用独立上下文的评估者替代。
  6. 训练出来的能力。用可验证奖励(数学对错、代码能否通过测试)做强化学习训出来的。
  7. 决定选哪种范式。缺信息 → ReAct(去查),加再多思考也没用;缺计算 → CoT/长思考,给工具也没用。这是最容易选错的一组。
  8. 事实查询、格式转换、分类等简单任务——浪费 token 和时间。创意写作有时也有害(过度分析伤害自然感)。

🛑 可以停在这里

⚡ 走神救援

先记住这几件事

下一节 👉 10-多模态.md

打卡记录保存在你的浏览器里,首页能看到总进度