📑 本页目录(点开跳转)
01 · 一张图看懂大模型全景
⏱ 20 分钟 | ⭐⭐ 看完这章,你就有了整个领域的坐标系
🎯 一句话
大模型领域可以拆成一条产线:数据 → 训练出模型 → 压缩部署 → 接上外部知识和工具 → 变成产品 → 度量与约束。每个环节都是一个专业方向。
🏭 全景产线图
🧩 三句话理解整条产线
① 预训练造的是「知识和语感」,不是「助手」。 一个刚预训练完的模型,你问它问题,它可能接着给你编更多问题——因为它只学过「续写」。SFT 和对齐才把它变成会回答的助手。
② 模型一旦训完,权重就冻结了。 之后所有的「让它更懂我的业务」有两条路: - 改权重 → 微调(第 5 章) - 改输入 → 提示词 / RAG / 工具(本站《智能体工程教程》讲的就是这条路)
🔑 90% 的场景应该先试第二条路——不用训练、立刻生效、随时可改。微调是最后手段。
③ 部署阶段的核心矛盾是「显存和速度」。 一个 70B 模型用 FP16 要 140GB 显存,量化到 4bit 只要 35GB——这就是第 6 章存在的理由。
💰 顺着产线看一遍成本,你会更懂这个领域
① 预训练 几千万 ~ 上亿美元 ← 全世界只有十几家在做
② SFT + 对齐 几十万 ~ 几百万美元 ← 几十家在做
③ 微调 LoRA 几十 ~ 几千元 ← 任何团队都能做 ⭐
④ 部署 一张卡的租金 ← 有需求就能做
⑤ 应用层 几乎为零 ← 你在这里,绝大多数人在这里 ⭐
🔑 这张成本表解释了整个行业的分工: 越往上游,玩家越少、门槛越高;越往下游,创造价值的空间反而越大。
💡 对你的实际含义:别一上来就想往 ①② 走。 ③④⑤ 这三层的实用价值和可及性都高得多, 而理解 ①② 的价值在于让你在 ③④⑤ 做得更好,不在于自己去做。
⏳ 三个时间尺度(帮你判断什么值得学)
变化最快(几个月就过时)
· 具体模型名、性能榜单、"哪个库最好用"
· 提示词技巧(很多已被模型内建)
变化中等(1~3 年)
· 工程实践:RAG 的链路、推理优化的手段、评测方法
· 架构变体:MoE、GQA、状态空间模型
⭐ 变化最慢(长期有效,最值得学)
· Transformer 的核心机制(注意力、自回归、KV Cache)
· 底层约束:n² 复杂度、显存带宽瓶颈、上下文腐烂
· 方法论:先简单再复杂、先测量再优化、私有评测集
💡 一条选学习内容的实用规则: 优先学那些"解释为什么"的东西——它们的保质期长得多。 「Prefix Caching 能省钱」会过时,「Decode 卡在显存带宽」不会。
📊 12 个方向的定位与关系
| 层 | 章 | 方向 | 解决的核心问题 | 谁需要 |
|---|---|---|---|---|
| 底层 | 02 | Transformer 原理 | 模型内部到底在算什么 | 所有人(理解上限) |
| 03 | Tokenizer 与上下文 | 文字怎么变数字、为什么中文更贵 | 所有人 | |
| 04 | 训练三阶段 | 模型怎么从「续写机」变「助手」 | 想懂原理 / 训模型 | |
| 05 | 微调 LoRA | 怎么用少量数据改造模型 | 有专有数据的团队 | |
| 中层 | 06 | 推理优化 | 怎么跑得快、跑得便宜 | 工程 / 自建 |
| 07 | 本地部署与生态 | 怎么在自己机器上跑起来 | 隐私敏感 / 省钱 | |
| 上层 | 08 | RAG 深水区 | 怎么让它用上你的私有知识 | ⭐ 落地最多 |
| 09 | 推理范式 | 怎么让它「想清楚再答」 | 做复杂任务 | |
| 10 | 多模态 | 图像/语音/视频怎么处理 | 做非文本应用 | |
| 外围 | 11 | 评测体系 | 怎么知道模型/系统好不好 | 所有人 |
| 12 | 对齐与安全 | 怎么防它做坏事、怎么理解它 | 研究 / 高风险场景 | |
| 13 | LLMOps | 怎么当软件一样运维 | 上生产 | |
| 14 | 合规伦理 | 法律边界在哪 | 企业 / To B | |
| 地基 | 15 | 数学 | 看懂公式所需的最小集 | 想深入前两层 |
🔗 这张图上的每一块,站里都有对应的板块
这份导论是索引,不是孤岛。 上面那条产线的每一环,站内都有一个板块把它讲深:
⑤ 应用层(+ 大部分 ⑥) → 《智能体工程教程》
⑧ RAG 的检索那一半 → 《推荐算法》(工业级搜索/排序系统)
② 造模型的前置 → 《机器学习与深度学习基础》(CNN/RNN/注意力起源)
「为什么这些方法能 work」 → 《机器学习的数学原理》
评测与调优的手艺 → 《Kaggle 竞赛方法论》
📍 读过哪些,就从哪里接上;一个都没读过也能直接往下看。 这份导论不假定你读过站里任何别的板块——它只假定你用过 ChatGPT / Claude 这类产品。
🧭 从哪个背景过来,哪几章会格外快
那种「一看就通」的感觉,多半来自你原来的背景。⭐ 对号入座就行,一条都没对上也不影响读:
| 如果你做过 / 学过 | 那么这几章会格外快 |
|---|---|
| 推荐 / 搜索系统 ⭐ | 第 8 章 RAG 的迁移量最大——召回→排序漏斗、向量检索、Recall@K/NDCG 至少一半能直接复用;连「维度灾难」都现成解释了 RAG 为什么必须配 BM25 和重排(本站《推荐算法》讲的就是这一套) |
| 训练过模型 / 打过比赛 | 第 4、11、13 章——训练、评测、A/B 实验的方法论同源 |
| 神经网络基础(反向传播、注意力的来历) | 第 2 章不再是黑箱 |
| 写过 LLM 应用 / Agent | ⑤ 应用层那一整排(提示词、上下文、工具、Agent 循环)已经是熟地,可以直接跳到第 8、9 章 |
| 后端 / 运维 | 第 6、7、13 章——服务化、显存账、可观测性都是熟悉的形状 |
| 以上都没有 | ✅ 从这里开始完全没问题。缺的前置第 0 章列了补法,卡住时再回头补那一个点 |
🧭 一张对照表:这份导论的每一章,站里在哪儿讲得更深
| 本导论章节 | 站内深挖的地方 |
|---|---|
| 02 Transformer | ML 基础 13-14 章(注意力怎么来的) |
| 04 训练三阶段 | ML 基础 08-10 章(反向传播/优化器/正则化) |
| 05 微调 | ML 基础 17 章(迁移学习:冻结 vs 全微调) |
| 08 RAG ⭐ | 推荐算法全套(召回/排序/向量检索/评估)—— 覆盖度最高 |
| 09 推理范式 | 智能体工程(Agent 循环 = ReAct) |
| 11 评测 | 智能体工程 14 章 + Kaggle 全套 + ML 基础 05 章 |
| 13 LLMOps | 智能体工程(tracing/循环工程/上线清单) |
| 15 数学 | 数学原理(深得多的版本) |
💡 一个让人松口气的事实:这份导论要用到的前置,站内至少有一半已经写好了。 卡在哪一块,就去上表对应的地方补那一块,不必回头从零学一遍。
⚖️ 一个关键的判断:你真的需要往下走吗?
诚实地说,大多数做应用的人,把应用层那一套拿下就够用了——提示词、上下文工程、工具调用、Agent 循环(本站《智能体工程教程》讲的正是这一层)。往下走的理由只有这几个:
| 你的情况 | 该往哪走 |
|---|---|
| 只做应用,调 API 就行 | ⛔ 可能不需要往下。把 08 RAG 学深即可 |
| 想理解「为什么会这样」,不想只背结论 | 👉 02、03、04 |
| 有专有数据,想让模型更懂业务 | 👉 05 微调(但先试 RAG!) |
| 成本压力大 / 数据不能出内网 | 👉 06、07 |
| 想做研究或进模型团队 | 👉 02、04、12 全套 |
| 要做图像/语音应用 | 👉 10 |
第 16 章有一个打分表,帮你把这个判断量化。
✅ 检查点
- 预训练、SFT、对齐三步各解决什么问题?
- 让模型「更懂你的业务」有哪两条路?该先试哪条?为什么?
- 部署阶段的核心矛盾是什么?
- 顺着产线看成本,从预训练到应用层差多少个量级?这对你的实际含义是什么?
- 哪类知识"保质期"最长?举两个例子。
- 做过推荐/搜索的人,迁移量最大的是哪一章?迁移过来的具体是哪几样东西?
👀 答案
- 预训练学知识和语感(会续写);SFT 学怎么当助手(会回答);对齐学人类偏好(回答得好且安全)。
- 改权重(微调) 或 改输入(提示词/RAG/工具)。先试改输入——不用训练、立刻生效、随时可改(可逆)。
- 显存和速度:大模型权重占显存巨大(70B FP16 要 140GB),量化和推理优化就是为解决这个。
- 预训练几千万~上亿美元,应用层几乎为零——差六七个量级。含义:越往上游玩家越少门槛越高,越往下游创造价值的空间越大。所以别一上来就想做 ①②,理解它们的价值在于让你在 ③④⑤ 做得更好。
- "解释为什么"的东西:Transformer 的核心机制(注意力、自回归、KV Cache)、底层约束(n² 复杂度、显存带宽瓶颈)、方法论(先简单再复杂、先测量再优化)。例子:「Prefix Caching 能省钱」会过时,「Decode 卡在显存带宽」不会。
- 第 8 章 RAG 迁移量最大。具体是:召回→排序漏斗(RAG 是同一个漏斗)、向量检索/Embedding(基础设施完全相同)、Recall@K / NDCG(检索侧评估直接用)、维度灾难(解释了 RAG 为什么必须配 BM25 和重排)——至少一半能直接复用。其他背景各有各的近路:训练/比赛背景对应第 4、11、13 章,神经网络基础让第 2 章不再是黑箱,后端/运维背景对应第 6、7、13 章。
🛑 可以停在这里
⚡ 走神救援
全景=一条产线:数据→预训练(学续写)→SFT(学当助手)→对齐(学人类偏好)→微调/量化部署→应用层(提示词/RAG/Agent)→评测安全运维。权重训完冻结,让它懂业务两条路:改权重(微调)或改输入(RAG/提示词),先试后者(不用训练、立刻生效、可逆)。⭐顺着产线看成本:预训练几千万美元 → 应用层几乎为零,差六七个量级——越往上游玩家越少,越往下游创造价值的空间越大;理解上游的价值在于让你在下游做得更好,不在于自己去做。⭐三个时间尺度:模型名和榜单几个月过时,工程实践1~3年,而"解释为什么"的东西长期有效——「Prefix Caching省钱」会过时,「Decode卡在显存带宽」不会。⭐这份导论不假定你读过站里别的板块,但产线每一环站内都有对应板块:《智能体工程教程》对应应用层和评测运维、《推荐算法》对应第8章RAG的检索那一半、《ML基础》对应第2章的前置——读过哪些就从哪里接上,一个都没读过也能直接往下看。迁移是有条件的:做过推荐/搜索的人第8章最省力(召回→排序漏斗、向量检索、Recall@K 至少一半直接复用),训练/比赛背景对应第4、11、13章,后端/运维背景对应第6、7、13章。
下一节 👉 02-Transformer原理.md