🏠 总目录📚 本教程 01 · 全景地图
📑 本页目录(点开跳转)

01 · 一张图看懂大模型全景

20 分钟 | ⭐⭐ 看完这章,你就有了整个领域的坐标系


🎯 一句话

大模型领域可以拆成一条产线:数据 → 训练出模型 → 压缩部署 → 接上外部知识和工具 → 变成产品 → 度量与约束。每个环节都是一个专业方向。


🏭 全景产线图

① 原料:数据 互联网文本 / 代码 / 书籍 → 清洗、去重、配比 ② 造模型(第 2、4 章) Transformer 架构 预训练:学「下一个词是什么」 ← 烧钱最多的一步(几千万美元起) SFT:学「怎么当个助手」 对齐:学「什么回答人类更喜欢」(RLHF / DPO) ✅ 一个能用的基础模型 ③ 改造成你的(第 5 章) 微调 LoRA / QLoRA 注入领域知识和风格 ④ 跑起来(第 6、7 章) 量化压缩(16 → 4 bit) vLLM 高吞吐服务 投机解码加速 ⑤ 用起来(应用层) 提示词 上下文工程 工具 / MCP Agent 循环 ↑ 这一整层 = 本站《智能体工程教程》讲的范围 + RAG 接外部知识(第 8 章) + 推理范式 CoT / ReAct(第 9 章) + 多模态 图像 / 语音(第 10 章) ⑥ 管起来(第 11–14 章) 评测 benchmark | 对齐与安全 | LLMOps 运维 | 合规
一条产线六个环节:数据 → 造模型 → 改造成你的 / 跑起来 → 用起来 → 管起来。每个环节都是一个专业方向,也对应本书的一章。

🧩 三句话理解整条产线

① 预训练造的是「知识和语感」,不是「助手」。 一个刚预训练完的模型,你问它问题,它可能接着给你编更多问题——因为它只学过「续写」。SFT 和对齐才把它变成会回答的助手。

② 模型一旦训完,权重就冻结了。 之后所有的「让它更懂我的业务」有两条路: - 改权重 → 微调(第 5 章) - 改输入 → 提示词 / RAG / 工具(本站《智能体工程教程》讲的就是这条路)

🔑 90% 的场景应该先试第二条路——不用训练、立刻生效、随时可改。微调是最后手段。

③ 部署阶段的核心矛盾是「显存和速度」。 一个 70B 模型用 FP16 要 140GB 显存,量化到 4bit 只要 35GB——这就是第 6 章存在的理由。


💰 顺着产线看一遍成本,你会更懂这个领域

   ① 预训练      几千万 ~ 上亿美元      ← 全世界只有十几家在做
   ② SFT + 对齐  几十万 ~ 几百万美元    ← 几十家在做
   ③ 微调 LoRA   几十 ~ 几千元          ← 任何团队都能做 ⭐
   ④ 部署        一张卡的租金           ← 有需求就能做
   ⑤ 应用层      几乎为零               ← 你在这里,绝大多数人在这里 ⭐

🔑 这张成本表解释了整个行业的分工越往上游,玩家越少、门槛越高;越往下游,创造价值的空间反而越大。

💡 对你的实际含义别一上来就想往 ①② 走。 ③④⑤ 这三层的实用价值和可及性都高得多, 而理解 ①② 的价值在于让你在 ③④⑤ 做得更好,不在于自己去做。


⏳ 三个时间尺度(帮你判断什么值得学)

   变化最快(几个月就过时)
   · 具体模型名、性能榜单、"哪个库最好用"
   · 提示词技巧(很多已被模型内建)

   变化中等(1~3 年)
   · 工程实践:RAG 的链路、推理优化的手段、评测方法
   · 架构变体:MoE、GQA、状态空间模型

   ⭐ 变化最慢(长期有效,最值得学)
   · Transformer 的核心机制(注意力、自回归、KV Cache)
   · 底层约束:n² 复杂度、显存带宽瓶颈、上下文腐烂
   · 方法论:先简单再复杂、先测量再优化、私有评测集

💡 一条选学习内容的实用规则优先学那些"解释为什么"的东西——它们的保质期长得多。 「Prefix Caching 能省钱」会过时,「Decode 卡在显存带宽」不会。


📊 12 个方向的定位与关系

方向 解决的核心问题 谁需要
底层 02 Transformer 原理 模型内部到底在算什么 所有人(理解上限)
03 Tokenizer 与上下文 文字怎么变数字、为什么中文更贵 所有人
04 训练三阶段 模型怎么从「续写机」变「助手」 想懂原理 / 训模型
05 微调 LoRA 怎么用少量数据改造模型 有专有数据的团队
中层 06 推理优化 怎么跑得快、跑得便宜 工程 / 自建
07 本地部署与生态 怎么在自己机器上跑起来 隐私敏感 / 省钱
上层 08 RAG 深水区 怎么让它用上你的私有知识 ⭐ 落地最多
09 推理范式 怎么让它「想清楚再答」 做复杂任务
10 多模态 图像/语音/视频怎么处理 做非文本应用
外围 11 评测体系 怎么知道模型/系统好不好 所有人
12 对齐与安全 怎么防它做坏事、怎么理解它 研究 / 高风险场景
13 LLMOps 怎么当软件一样运维 上生产
14 合规伦理 法律边界在哪 企业 / To B
地基 15 数学 看懂公式所需的最小集 想深入前两层

🔗 这张图上的每一块,站里都有对应的板块

这份导论是索引,不是孤岛。 上面那条产线的每一环,站内都有一个板块把它讲深:

   ⑤ 应用层(+ 大部分 ⑥)   → 《智能体工程教程》
   ⑧ RAG 的检索那一半       → 《推荐算法》(工业级搜索/排序系统)
   ② 造模型的前置           → 《机器学习与深度学习基础》(CNN/RNN/注意力起源)
   「为什么这些方法能 work」 → 《机器学习的数学原理》
   评测与调优的手艺          → 《Kaggle 竞赛方法论》

📍 读过哪些,就从哪里接上;一个都没读过也能直接往下看。 这份导论不假定你读过站里任何别的板块——它只假定你用过 ChatGPT / Claude 这类产品。

🧭 从哪个背景过来,哪几章会格外快

那种「一看就通」的感觉,多半来自你原来的背景。⭐ 对号入座就行,一条都没对上也不影响读

如果你做过 / 学过 那么这几章会格外快
推荐 / 搜索系统 第 8 章 RAG 的迁移量最大——召回→排序漏斗、向量检索、Recall@K/NDCG 至少一半能直接复用;连「维度灾难」都现成解释了 RAG 为什么必须配 BM25 和重排(本站《推荐算法》讲的就是这一套)
训练过模型 / 打过比赛 第 4、11、13 章——训练、评测、A/B 实验的方法论同源
神经网络基础(反向传播、注意力的来历) 第 2 章不再是黑箱
写过 LLM 应用 / Agent ⑤ 应用层那一整排(提示词、上下文、工具、Agent 循环)已经是熟地,可以直接跳到第 8、9 章
后端 / 运维 第 6、7、13 章——服务化、显存账、可观测性都是熟悉的形状
以上都没有 ✅ 从这里开始完全没问题。缺的前置第 0 章列了补法,卡住时再回头补那一个点

🧭 一张对照表:这份导论的每一章,站里在哪儿讲得更深

本导论章节 站内深挖的地方
02 Transformer ML 基础 13-14 章(注意力怎么来的)
04 训练三阶段 ML 基础 08-10 章(反向传播/优化器/正则化)
05 微调 ML 基础 17 章(迁移学习:冻结 vs 全微调)
08 RAG 推荐算法全套(召回/排序/向量检索/评估)—— 覆盖度最高
09 推理范式 智能体工程(Agent 循环 = ReAct)
11 评测 智能体工程 14 章 + Kaggle 全套 + ML 基础 05 章
13 LLMOps 智能体工程(tracing/循环工程/上线清单)
15 数学 数学原理(深得多的版本)

💡 一个让人松口气的事实:这份导论要用到的前置,站内至少有一半已经写好了。 卡在哪一块,就去上表对应的地方补那一块,不必回头从零学一遍。


⚖️ 一个关键的判断:你真的需要往下走吗?

诚实地说,大多数做应用的人,把应用层那一套拿下就够用了——提示词、上下文工程、工具调用、Agent 循环(本站《智能体工程教程》讲的正是这一层)。往下走的理由只有这几个:

你的情况 该往哪走
只做应用,调 API 就行 ⛔ 可能不需要往下。把 08 RAG 学深即可
想理解「为什么会这样」,不想只背结论 👉 02、03、04
有专有数据,想让模型更懂业务 👉 05 微调(但先试 RAG!)
成本压力大 / 数据不能出内网 👉 06、07
想做研究或进模型团队 👉 02、04、12 全套
要做图像/语音应用 👉 10

第 16 章有一个打分表,帮你把这个判断量化。


✅ 检查点

  1. 预训练、SFT、对齐三步各解决什么问题?
  2. 让模型「更懂你的业务」有哪两条路?该先试哪条?为什么?
  3. 部署阶段的核心矛盾是什么?
  4. 顺着产线看成本,从预训练到应用层差多少个量级?这对你的实际含义是什么?
  5. 哪类知识"保质期"最长?举两个例子。
  6. 做过推荐/搜索的人,迁移量最大的是哪一章?迁移过来的具体是哪几样东西?
👀 答案
  1. 预训练学知识和语感(会续写);SFT 学怎么当助手(会回答);对齐学人类偏好(回答得好且安全)。
  2. 改权重(微调)改输入(提示词/RAG/工具)先试改输入——不用训练、立刻生效、随时可改(可逆)
  3. 显存和速度:大模型权重占显存巨大(70B FP16 要 140GB),量化和推理优化就是为解决这个。
  4. 预训练几千万~上亿美元,应用层几乎为零——差六七个量级。含义:越往上游玩家越少门槛越高,越往下游创造价值的空间越大。所以别一上来就想做 ①②,理解它们的价值在于让你在 ③④⑤ 做得更好
  5. "解释为什么"的东西:Transformer 的核心机制(注意力、自回归、KV Cache)、底层约束(n² 复杂度、显存带宽瓶颈)、方法论(先简单再复杂、先测量再优化)。例子:「Prefix Caching 能省钱」会过时,「Decode 卡在显存带宽」不会。
  6. 第 8 章 RAG 迁移量最大。具体是:召回→排序漏斗(RAG 是同一个漏斗)、向量检索/Embedding(基础设施完全相同)、Recall@K / NDCG(检索侧评估直接用)、维度灾难(解释了 RAG 为什么必须配 BM25 和重排)——至少一半能直接复用。其他背景各有各的近路:训练/比赛背景对应第 4、11、13 章,神经网络基础让第 2 章不再是黑箱,后端/运维背景对应第 6、7、13 章。

🛑 可以停在这里

走神救援

全景=一条产线:数据→预训练(学续写)→SFT(学当助手)→对齐(学人类偏好)→微调/量化部署→应用层(提示词/RAG/Agent)→评测安全运维。权重训完冻结,让它懂业务两条路:改权重(微调)或改输入(RAG/提示词),先试后者(不用训练、立刻生效、可逆)。⭐顺着产线看成本:预训练几千万美元 → 应用层几乎为零,差六七个量级——越往上游玩家越少,越往下游创造价值的空间越大;理解上游的价值在于让你在下游做得更好,不在于自己去做。⭐三个时间尺度:模型名和榜单几个月过时,工程实践1~3年,而"解释为什么"的东西长期有效——「Prefix Caching省钱」会过时,「Decode卡在显存带宽」不会。⭐这份导论不假定你读过站里别的板块,但产线每一环站内都有对应板块:《智能体工程教程》对应应用层和评测运维、《推荐算法》对应第8章RAG的检索那一半、《ML基础》对应第2章的前置——读过哪些就从哪里接上,一个都没读过也能直接往下看。迁移是有条件的:做过推荐/搜索的人第8章最省力(召回→排序漏斗、向量检索、Recall@K 至少一半直接复用),训练/比赛背景对应第4、11、13章,后端/运维背景对应第6、7、13章。

下一节 👉 02-Transformer原理.md

打卡记录保存在你的浏览器里,首页能看到总进度