📑 本页目录(点开跳转)
09 · 推理范式:让它想清楚再答
⏱ 28 分钟 | ⭐ 概念多但都不难
🎯 一句话
模型是「一个字一个字往外蹦」的(第 2 章),所以不给它思考的空间,它就只能凭直觉答。推理范式做的事就是:用生成的 token 换取思考的深度。
🧠 底层原理:为什么「让它先想」有效
模型每生成一个 token,只做固定量的计算。
直接要答案 → 所有推理必须压缩在最后那几个 token 里 → 做不到
让它先写思考过程 → 每一步推理都有 token 承载
→ 中间结果被写进上下文,后续步骤可以引用
→ 相当于给了它一块"草稿纸"
💡 一句话:思考 = 计算,而 token 是计算的载体。 这也是「测试时扩展(Test-time Scaling)」的理论基础——推理时多花算力,能换到更好的结果。
🧮 一个能算出来的直觉
一个模型有 L 层。生成一个 token = 走完 L 层 = 固定的计算量。
问题:"37 × 48 = ?"
直接答: 1 个 token 的计算量 → 必须"一眼看出"答案 ❌
写推理过程: 37×40=1480, 37×8=296, 1480+296=1776
约 40 个 token → 【40 倍的计算量】✅
而且中间结果 1480、296 被【写进了上下文】,
后面的步骤可以直接读,不用重新推
⭐ 两个收益:更多计算 + 中间结果可复用(相当于外部记忆)
🔑 这解释了一个反直觉的现象: 让模型"把过程写出来",即使那段过程你根本不看,答案也会变准。 因为过程本身就是计算,不是给你看的。
⚠️ 一个重要的边界:推理链不等于真实推理过程
模型写出来的"思考过程",不一定是它【真正】得出答案的路径
→ 有研究显示:改变提示里的暗示,模型会给出不同答案,
但它写的推理过程【不会提到那个暗示】,而是编一套自洽的理由
⚠️ 所以:
· 推理链能【提升准确率】 ✅(因为它确实提供了计算)
· 但不能当作【可信的解释】 ❌
💡 实践含义:别把模型的推理链当作审计证据。 它在高风险场景(医疗、金融、法务)里是说服力很强但不可靠的东西—— 这恰恰是最危险的组合。
🪜 六种范式(从简单到复杂)
① CoT 思维链(Chain-of-Thought)
「请一步一步思考」/ 「Let's think step by step」
→ 模型写出推理过程再给答案
✅ 最简单,数学/逻辑题提升明显
⚠️ 现代模型很多已内建,不必总是手动加
② Self-Consistency 自洽性
同一问题跑 5 次(温度调高)→ 取多数答案
✅ 显著提升准确率
❌ 成本 ×5
👉 适合高价值、有唯一正确答案的任务
③ ReAct(推理 + 行动)⭐
Thought: 我需要查一下今年的销售数据
Action: search_db("2026 sales")
Observation: [返回结果]
Thought: 数据显示 Q2 下滑,我需要看原因
Action: ...
→ 循环直到得出答案
🔗 这就是 Agent 的主循环——本站《智能体工程教程》第 1 章从零写的就是它。ReAct 是它的理论原型。
④ Reflexion 自我反思
做一遍 → 自己批判 → 根据批判重做
✅ 有客观反馈(测试、编译器)时效果好
⚠️ 没有外部反馈时,自我批判容易流于形式
—— 智能体教程第 12 章:**自评有系统性正面偏差**
→ 所以生产上更常用「独立的评估者」而非自我反思
⑤ ToT 思维树(Tree-of-Thought)
不是一条链,而是探索多个分支 + 剪枝
✅ 适合有搜索空间的问题(规划、谜题)
❌ 成本高、实现复杂,实际用得少
⑥ 长思考 / 推理模型(2024+)⭐
不是提示技巧,而是**训练出来的能力**:
模型在给答案前先生成一长段内部推理(可能几千 token)
训练方式:用可验证的奖励(数学答案对错、代码能否通过测试)
做强化学习 → 模型自己学会"慢慢想"
(第 4 章的 GRPO 等)
✅ 数学、代码、复杂推理大幅提升
❌ 慢、贵;简单任务上是浪费
⚖️ 关键权衡:什么时候值得让它「多想」
| 任务类型 | 建议 |
|---|---|
| 事实查询、格式转换、分类 | ⛔ 别加推理,浪费钱和时间 |
| 数学、逻辑、多步推导 | ✅ 值得 |
| 代码调试、架构设计 | ✅ 值得 |
| 创意写作 | 🟡 有时有害(过度分析伤害自然感) |
| 高价值、错了代价大的决策 | ✅ 值得,甚至上 Self-Consistency |
🔑 成本意识:推理 token 也是要付钱的,且长思考可能是答案本身的 10–100 倍。 不要默认全开。 按任务类型路由(智能体教程第 6 章的「路由」工作流)。
📊 六种范式的成本-收益速查
| 范式 | 成本倍数 | 什么时候它是最优解 |
|---|---|---|
| 直接回答 | 1× | 事实查询、格式转换、分类 ⭐ 默认 |
| CoT | 2~5× | 多步逻辑,且模型没内建思考 |
| 长思考模型 | 10~100× | 数学、代码、复杂推理 |
| Self-Consistency | ×N(N 次采样) | 有唯一正确答案 + 错了代价大 ⭐ |
| ReAct | 视轮数 | 需要外部信息/工具(不是"想得更深"能解决的) |
| Reflexion | 2~3× | 有客观反馈(测试能跑、编译器会报错) |
💡 最容易选错的一组: 问题是"信息不够"时,加再多思考也没用——你需要的是 ReAct(去查),不是 CoT(再想想)。 反过来,信息齐全但推理复杂时,给工具也没用。 先判断瓶颈是"缺信息"还是"缺计算",再选范式。 ⭐
🔗 和你已知的关系
左列有的来自日常用 LLM 的经验,有的在站内别的板块讲过——碰上过哪几条就从哪几条接进来,一条没碰过也不影响读这一章。
| 你可能已经知道的 | 这一章的对应 |
|---|---|
| Agent 循环(智能体第 1 章) | ReAct 就是它的理论原型 |
| 生成与评估分离(智能体第 12 章) | Reflexion 的局限正是自评偏差 |
| effort 旋钮(智能体第 2 章) | 「让它多想」的产品化封装 |
| 生成式推荐的测试时扩展(推荐第 14 章) | 同一个概念在另一个领域 |
| 路由工作流(智能体第 6 章) | 用来决定哪些任务开推理 |
📦 深挖的话要学什么
📍 每条后面标了它在哪: 📗 本库有 = 站内已经讲透,点进去就行;📙 半有 = 站内讲了一半,另一半得外找; 📕 要外找 = 站内没有,得去论文或别处。 (这份清单以前只列词不说去哪,指到的坑有些站内根本没挖过,按图索骥会扑空。)
- 提示层:CoT 变体、Self-Consistency 采样策略、ToT/GoT、Least-to-Most、Plan-and-Solve → 📙 半有:CoT、Self-Consistency、ToT 本章的「六种范式」已经讲了(含成本-收益速查表);采样策略这一侧另有 06b · 解码策略——Self-Consistency 要多样的采样才有意义,而 temperature / top-p 到底在动什么、"复读机"是怎么来的,那一章讲的就是这个。GoT / Least-to-Most / Plan-and-Solve 站内没有,要外找(不过本章下面也说了:提示层的技巧变化快、很多已被模型内建,这三个的性价比本来就不高)
- 训练层:推理模型怎么训(可验证奖励、GRPO、过程奖励模型 PRM vs 结果奖励) → 📗 本库有,而且这是本章最值得点开的一条:强化学习基础 12 · RLHF全流程 把 GRPO 展开成了一整节(把 Critic 换成"同组同学的平均分"、KL 为什么改放在损失上、⚠️ 组内标准化让 GRPO 对题目难度分布极敏感——题太简单或太难会出现大量"零梯度组",采样算力全打水漂);PRM vs 结果奖励在 14 · RL在推荐与智能体里(RLVR、过程监督 PRM、拒绝采样/专家迭代,共同点是都在绕开"奖励模型不可靠"和"在线探索太贵"这两个问题)。本章说「长思考是训出来的能力,提示词改不了」,这两章就是"怎么训出来的"
- 测试时扩展:Best-of-N、蒙特卡洛树搜索、验证器引导的搜索、算力-效果曲线 → 📙 半有:Best-of-N 在 强化学习基础 13 · DPO与免RL对齐(作为「拒绝采样 / Best-of-N 蒸馏」讲的——⭐ 简单到几乎不需要新知识,却经常能拿到 RLHF 大部分收益,实践顺序是拒绝采样 → DPO → 最后才 PPO)。MCTS、验证器引导搜索、算力-效果曲线站内没有,要外找
- 评估:推理能力基准(数学/代码/科学)、过程正确性 vs 结果正确性 → 📙 半有:基准怎么读、盲区在哪,智能体工程 14 · 评测Evals 的「公开基准都在测什么(以及测不到什么)」讲了(⭐ 看到「SWE-bench」先问是哪一版——不同版本分数不可直接比);11 · 评测体系 讲四个陷阱。但数学/科学推理基准(AIME、GPQA 一类)具体怎么造题、过程正确性怎么量,站内没有,要外找
- 成本工程:什么时候开推理、推理长度控制、路由策略 → 📗 本库有:智能体工程 02 · 模型与 effort 选对大脑——「模型大小」和「effort 高低」是两个旋钮,别拧混,外加三个反直觉的成本事实(大模型可能反而更便宜;小模型干活+大模型把关的顾问策略;长上下文比你以为的贵)。本章的「什么时候值得让它多想」是判断题,那一章是可以每天照着用的诊断口诀
需要的前置:第 4 章(训练/对齐)会让你理解「长思考是怎么训出来的」。
⚖️ 要不要深挖
| 你的情况 | 建议 |
|---|---|
| 做应用 | 🟡 本章内容基本够用——知道有哪些范式、什么时候用 |
| 想优化复杂任务的效果 | ✅ 值得学 Self-Consistency 和路由策略 |
| 想训练推理模型 | ✅ 深挖训练层(并入第 4 章一起学) |
| 做研究 | ✅ 这是当前最热的方向之一 |
🔑 我的判断:这块内容量不足以单独成套,且提示层的技巧变化快(很多已被模型内建)。
✅ 现状更新:提示层的实战部分已经在 《智能体工程教程》第 3 章提示词工程里了; ReAct 循环在第 1 章;生成-评估分离在第 12 章。 训练层(长思考怎么训出来)看本导论第 4 章即可。
✅ 检查点
- 为什么「让模型先想再答」有效?用第 2 章的知识解释,并说出两个收益。
- 为什么说"即使你不看那段推理过程,答案也会更准"?
- 推理链能当作可信的解释吗?这在什么场景下特别危险?
- ReAct 和 Agent 的主循环是什么关系?
- Reflexion 的局限是什么?生产上更常用什么替代?
- 长思考模型是提示技巧还是训练出来的能力?
- 「瓶颈是缺信息还是缺计算」——这个判断决定了什么?
- 什么任务不该开推理?
👀 答案
- 模型每生成一个 token 只做固定量计算,直接要答案等于把所有推理压缩在最后几个 token 里。两个收益:①更多计算(40 个 token 就是 40 倍计算量)②中间结果被写进上下文可复用(相当于外部记忆)。
- 因为过程本身就是计算,不是给你看的。token 是计算的载体,写出来就等于分配了更多算力。
- 不能。研究显示改变提示里的暗示会改变模型答案,但它写的推理过程不会提到那个暗示,而是编一套自洽的理由。在医疗/金融/法务等高风险场景特别危险——因为它"说服力很强但不可靠",这是最糟的组合。
- ReAct(Thought→Action→Observation 循环)就是 Agent 循环的理论原型,你写的那 60 行就是它的实现。
- 没有外部客观反馈时,自我批判容易流于形式——自评有系统性正面偏差。生产上用独立上下文的评估者替代。
- 训练出来的能力。用可验证奖励(数学对错、代码能否通过测试)做强化学习训出来的。
- 决定选哪种范式。缺信息 → ReAct(去查),加再多思考也没用;缺计算 → CoT/长思考,给工具也没用。这是最容易选错的一组。
- 事实查询、格式转换、分类等简单任务——浪费 token 和时间。创意写作有时也有害(过度分析伤害自然感)。
🛑 可以停在这里
⚡ 走神救援
原理:思考=计算,token是载体,不给空间就只能凭直觉答。⭐两个收益:更多计算(写40个token就是40倍算力)+ 中间结果写进上下文可复用——所以即使你不看那段过程,答案也会更准,因为过程本身就是计算。⚠️ 但推理链不等于真实推理路径:改变提示暗示会改变答案,而模型写的理由不会提到那个暗示——能提升准确率,但不能当可信解释,在医疗/金融/法务是"说服力强但不可靠"的危险组合。六范式:CoT(2~5×)、Self-Consistency(×N,适合有唯一正确答案+错了代价大)、ReAct(=我写的Agent循环)、Reflexion(只在有客观反馈时有效,自评有正面偏差→生产用独立评估者)、ToT(树搜索,少用)、长思考模型(10~100×,是训出来的不是提示技巧,用可验证奖励做RL)。⭐最容易选错的判断:瓶颈是"缺信息"还是"缺计算"——缺信息就该用ReAct去查,加再多思考也没用;反之给工具也没用。别默认全开,按任务路由。提示层实战已在《智能体工程教程》里。
下一节 👉 10-多模态.md