🏠 总目录📚 本教程 09 · 推理范式
📑 本页目录(点开跳转)

09 · 推理范式:让它想清楚再答

28 分钟 | ⭐ 概念多但都不难


🎯 一句话

模型是「一个字一个字往外蹦」的(第 2 章),所以不给它思考的空间,它就只能凭直觉答。推理范式做的事就是:用生成的 token 换取思考的深度


🧠 底层原理:为什么「让它先想」有效

   模型每生成一个 token,只做固定量的计算。
   直接要答案 → 所有推理必须压缩在最后那几个 token 里 → 做不到

   让它先写思考过程 → 每一步推理都有 token 承载
                    → 中间结果被写进上下文,后续步骤可以引用
                    → 相当于给了它一块"草稿纸"

💡 一句话思考 = 计算,而 token 是计算的载体。 这也是「测试时扩展(Test-time Scaling)」的理论基础——推理时多花算力,能换到更好的结果

🧮 一个能算出来的直觉

   一个模型有 L 层。生成一个 token = 走完 L 层 = 固定的计算量。

   问题:"37 × 48 = ?"

   直接答:      1 个 token 的计算量  → 必须"一眼看出"答案 ❌
   写推理过程:  37×40=1480, 37×8=296, 1480+296=1776
                约 40 个 token → 【40 倍的计算量】✅
                而且中间结果 1480、296 被【写进了上下文】,
                后面的步骤可以直接读,不用重新推

   ⭐ 两个收益:更多计算 + 中间结果可复用(相当于外部记忆)

🔑 这解释了一个反直觉的现象让模型"把过程写出来",即使那段过程你根本不看,答案也会变准。 因为过程本身就是计算,不是给你看的。

⚠️ 一个重要的边界:推理链不等于真实推理过程

   模型写出来的"思考过程",不一定是它【真正】得出答案的路径

   → 有研究显示:改变提示里的暗示,模型会给出不同答案,
     但它写的推理过程【不会提到那个暗示】,而是编一套自洽的理由

   ⚠️ 所以:
   · 推理链能【提升准确率】 ✅(因为它确实提供了计算)
   · 但不能当作【可信的解释】 ❌

💡 实践含义别把模型的推理链当作审计证据。 它在高风险场景(医疗、金融、法务)里是说服力很强但不可靠的东西—— 这恰恰是最危险的组合。


🪜 六种范式(从简单到复杂)

① CoT 思维链(Chain-of-Thought)

   「请一步一步思考」/ 「Let's think step by step」
   → 模型写出推理过程再给答案
   ✅ 最简单,数学/逻辑题提升明显
   ⚠️ 现代模型很多已内建,不必总是手动加

② Self-Consistency 自洽性

   同一问题跑 5 次(温度调高)→ 取多数答案
   ✅ 显著提升准确率
   ❌ 成本 ×5
   👉 适合高价值、有唯一正确答案的任务

③ ReAct(推理 + 行动)⭐

   Thought:  我需要查一下今年的销售数据
   Action:   search_db("2026 sales")
   Observation: [返回结果]
   Thought:  数据显示 Q2 下滑,我需要看原因
   Action:   ...
   → 循环直到得出答案

🔗 这就是 Agent 的主循环——本站《智能体工程教程》第 1 章从零写的就是它。ReAct 是它的理论原型。

④ Reflexion 自我反思

   做一遍 → 自己批判 → 根据批判重做
   ✅ 有客观反馈(测试、编译器)时效果好
   ⚠️ 没有外部反馈时,自我批判容易流于形式
      —— 智能体教程第 12 章:**自评有系统性正面偏差**
      → 所以生产上更常用「独立的评估者」而非自我反思

⑤ ToT 思维树(Tree-of-Thought)

   不是一条链,而是探索多个分支 + 剪枝
   ✅ 适合有搜索空间的问题(规划、谜题)
   ❌ 成本高、实现复杂,实际用得少

⑥ 长思考 / 推理模型(2024+)⭐

   不是提示技巧,而是**训练出来的能力**:
   模型在给答案前先生成一长段内部推理(可能几千 token)

   训练方式:用可验证的奖励(数学答案对错、代码能否通过测试)
             做强化学习 → 模型自己学会"慢慢想"
             (第 4 章的 GRPO 等)

   ✅ 数学、代码、复杂推理大幅提升
   ❌ 慢、贵;简单任务上是浪费

⚖️ 关键权衡:什么时候值得让它「多想」

任务类型 建议
事实查询、格式转换、分类 ⛔ 别加推理,浪费钱和时间
数学、逻辑、多步推导 ✅ 值得
代码调试、架构设计 ✅ 值得
创意写作 🟡 有时有害(过度分析伤害自然感)
高价值、错了代价大的决策 ✅ 值得,甚至上 Self-Consistency

🔑 成本意识:推理 token 也是要付钱的,且长思考可能是答案本身的 10–100 倍。 不要默认全开。 按任务类型路由(智能体教程第 6 章的「路由」工作流)。

📊 六种范式的成本-收益速查

范式 成本倍数 什么时候它是最优解
直接回答 事实查询、格式转换、分类 ⭐ 默认
CoT 2~5× 多步逻辑,且模型没内建思考
长思考模型 10~100× 数学、代码、复杂推理
Self-Consistency ×N(N 次采样) 有唯一正确答案 + 错了代价大 ⭐
ReAct 视轮数 需要外部信息/工具(不是"想得更深"能解决的)
Reflexion 2~3× 有客观反馈(测试能跑、编译器会报错)

💡 最容易选错的一组问题是"信息不够"时,加再多思考也没用——你需要的是 ReAct(去查),不是 CoT(再想想)。 反过来,信息齐全但推理复杂时,给工具也没用。 先判断瓶颈是"缺信息"还是"缺计算",再选范式。


🔗 和你已知的关系

左列有的来自日常用 LLM 的经验,有的在站内别的板块讲过——碰上过哪几条就从哪几条接进来,一条没碰过也不影响读这一章

你可能已经知道的 这一章的对应
Agent 循环(智能体第 1 章) ReAct 就是它的理论原型
生成与评估分离(智能体第 12 章) Reflexion 的局限正是自评偏差
effort 旋钮(智能体第 2 章) 「让它多想」的产品化封装
生成式推荐的测试时扩展(推荐第 14 章) 同一个概念在另一个领域
路由工作流(智能体第 6 章) 用来决定哪些任务开推理

📦 深挖的话要学什么

📍 每条后面标了它在哪: 📗 本库有 = 站内已经讲透,点进去就行;📙 半有 = 站内讲了一半,另一半得外找; 📕 要外找 = 站内没有,得去论文或别处。 (这份清单以前只列词不说去哪,指到的坑有些站内根本没挖过,按图索骥会扑空。)

需要的前置:第 4 章(训练/对齐)会让你理解「长思考是怎么训出来的」。


⚖️ 要不要深挖

你的情况 建议
做应用 🟡 本章内容基本够用——知道有哪些范式、什么时候用
想优化复杂任务的效果 ✅ 值得学 Self-Consistency 和路由策略
想训练推理模型 ✅ 深挖训练层(并入第 4 章一起学)
做研究 ✅ 这是当前最热的方向之一

🔑 我的判断:这块内容量不足以单独成套,且提示层的技巧变化快(很多已被模型内建)。

现状更新:提示层的实战部分已经在 《智能体工程教程》第 3 章提示词工程里了; ReAct 循环在第 1 章;生成-评估分离在第 12 章。 训练层(长思考怎么训出来)看本导论第 4 章即可。


✅ 检查点

  1. 为什么「让模型先想再答」有效?用第 2 章的知识解释,并说出两个收益。
  2. 为什么说"即使你不看那段推理过程,答案也会更准"?
  3. 推理链能当作可信的解释吗?这在什么场景下特别危险?
  4. ReAct 和 Agent 的主循环是什么关系?
  5. Reflexion 的局限是什么?生产上更常用什么替代?
  6. 长思考模型是提示技巧还是训练出来的能力?
  7. 「瓶颈是缺信息还是缺计算」——这个判断决定了什么?
  8. 什么任务不该开推理?
👀 答案
  1. 模型每生成一个 token 只做固定量计算,直接要答案等于把所有推理压缩在最后几个 token 里。两个收益:①更多计算(40 个 token 就是 40 倍计算量)②中间结果被写进上下文可复用(相当于外部记忆)。
  2. 因为过程本身就是计算,不是给你看的。token 是计算的载体,写出来就等于分配了更多算力。
  3. 不能。研究显示改变提示里的暗示会改变模型答案,但它写的推理过程不会提到那个暗示,而是编一套自洽的理由。在医疗/金融/法务等高风险场景特别危险——因为它"说服力很强但不可靠",这是最糟的组合。
  4. ReAct(Thought→Action→Observation 循环)就是 Agent 循环的理论原型,你写的那 60 行就是它的实现。
  5. 没有外部客观反馈时,自我批判容易流于形式——自评有系统性正面偏差。生产上用独立上下文的评估者替代。
  6. 训练出来的能力。用可验证奖励(数学对错、代码能否通过测试)做强化学习训出来的。
  7. 决定选哪种范式。缺信息 → ReAct(去查),加再多思考也没用;缺计算 → CoT/长思考,给工具也没用。这是最容易选错的一组。
  8. 事实查询、格式转换、分类等简单任务——浪费 token 和时间。创意写作有时也有害(过度分析伤害自然感)。

🛑 可以停在这里

走神救援

原理:思考=计算,token是载体,不给空间就只能凭直觉答。⭐两个收益:更多计算(写40个token就是40倍算力)+ 中间结果写进上下文可复用——所以即使你不看那段过程,答案也会更准,因为过程本身就是计算。⚠️ 但推理链不等于真实推理路径:改变提示暗示会改变答案,而模型写的理由不会提到那个暗示——能提升准确率,但不能当可信解释,在医疗/金融/法务是"说服力强但不可靠"的危险组合。六范式:CoT(2~5×)、Self-Consistency(×N,适合有唯一正确答案+错了代价大)、ReAct(=我写的Agent循环)、Reflexion(只在有客观反馈时有效,自评有正面偏差→生产用独立评估者)、ToT(树搜索,少用)、长思考模型(10~100×,是训出来的不是提示技巧,用可验证奖励做RL)。⭐最容易选错的判断:瓶颈是"缺信息"还是"缺计算"——缺信息就该用ReAct去查,加再多思考也没用;反之给工具也没用。别默认全开,按任务路由。提示层实战已在《智能体工程教程》里。

下一节 👉 10-多模态.md

打卡记录保存在你的浏览器里,首页能看到总进度