📑 本页目录(点开跳转)
00 · 怎么用这份教程
⏱ 20 分钟
🎯 一句话
其他教程教你模型算什么,这一套教你怎么让它真的算出来、算得快、算得起。 它是"你会调 API / 会写训练脚本"和"你能负责一个集群"之间的那一层。
🧱 它填的是哪个洞
model.fit()✅ 能跑- Transformer 结构 ✅ 看得懂
- 调 OpenAI/Claude API ✅ 会用
- 为什么 A100 只跑出 30% 的算力?
- 为什么 batch 一大就 OOM?
- 70B 模型怎么塞进 8 张卡?
- 为什么推理比训练还贵?
- 显存带宽是真正的瓶颈,不是算力
- MFU 告诉你还剩多少提升空间
- 并行策略是在【通信量和显存】之间做交易
- 推理的瓶颈和训练【完全相反】
👥 这份教程适合谁
| 你的情况 | 建议 |
|---|---|
| 想搞懂"为什么慢" | ✅ 正中靶心,从第 3、4 章开始 |
| 要部署/自建推理服务 | ✅ 直接看 15–20 章 |
| 要训练/微调大模型 | ✅ 看 06–14 章 |
| 面试要问到这块 | ✅ 全部,重点 03/04/08/11/16 |
| 只调 API,不管底层 | 🟡 看 01、15、20 就够——至少要知道钱花在哪 |
| 想写 CUDA kernel | ⚠️ 这套教程不教这个,但会告诉你什么时候需要写 |
⚠️ 三条阅读规则
① 数字比概念重要 ⭐
这个领域最大的特点:【所有判断都能算】
❌ "FlashAttention 更快"
✅ "标准 attention 要搬 O(n²) 的数据,FlashAttention 是 O(n²/M),
在 n=4096、M=192KB 时省了约 20 倍的 HBM 读写"
⭐ 每章都会给你【具体的数字和量级】。
记不住公式没关系,但要记住【量级】——
显存带宽 3TB/s、NVLink 900GB/s、跨机 400Gb/s,
这三个数字的差距就决定了一半的架构选择。
② 每个优化都是一笔交易
这个领域没有"免费的优化",只有交易:
梯度检查点 → 省显存,多算一遍前向(+30% 时间)
张量并行 → 省显存,加通信(必须 NVLink)
量化 → 省显存和带宽,掉一点精度
连续批处理 → 提吞吐,单请求延迟变差
投机解码 → 降延迟,多烧算力
⭐ 看到任何"银弹",先问:它拿什么换的?
③ 先测,再优化
⚠️ 这个领域最常见的错误:凭直觉优化
正确顺序:
① 测出当前 MFU / 显存占用 / 各阶段耗时
② 找到瓶颈是【算力 / 带宽 / 通信 / 还是根本没喂饱】
③ 只优化瓶颈
④ 再测一次,确认真的变快了
⭐ 第 4 章会教你怎么做第 ①②步。在那之前的所有优化都是赌博。
🧩 每章的固定结构
🎯 一句话 ← 30 秒读完这章的核心
正文(现象 → 原因 → 数字 → 怎么办)
📐 折叠推导 ← 想看再点,不点不影响
⚠️ 坑表 / 💥 真实事故
🔗 和站内其他章的关系
✅ 检查点 ← 答案折叠着,先自己想
🛑 可以停在这里
⚡ 走神救援 ← 整章浓缩,回来时先读这个 ⭐
⭐ 「走神救援」的用法:中断之后回来,不要从头读 —— 直接读上一章的走神救援,30 秒接回上下文。
🧮 需要的前置知识(比你以为的少)
✅ 需要:
· 知道神经网络前向/反向大概在干什么 (ML 基础第 8 章)
· 会看 Transformer 的结构图 (全景导论第 2 章)
· 知道矩阵乘法的形状怎么对 (中学水平够了)
· 会用 Python,看得懂 PyTorch 代码
❌ 不需要:
· CUDA 编程
· 计算机体系结构课程
· 分布式系统理论
· 会推导 attention 的梯度
💡 一个真相:这套教程里最难的不是数学,是建立"数据在哪、要搬多远"的空间感。 一旦有了这个感觉,大部分优化技术都会变成"当然应该这么做"。
🗺️ 教程结构(26 章 + 附录)
【起步】 00 怎么用 01 在解决什么问题 ⭐
【硬件与瓶颈】 02 GPU是什么 ⭐ 03 显存与带宽墙 ⭐⭐
04 Roofline与MFU ⭐⭐ 05 互联与拓扑 ⭐
【单卡榨干】 06 混合精度 ⭐ 07 算子融合与编译
08 FlashAttention ⭐⭐ 09 显存优化 ⭐
【分布式训练】 10 数据并行 ⭐ 11 ZeRO与FSDP ⭐⭐
12 张量并行 ⭐ 13 流水线并行 ⭐
14 并行策略怎么组合 ⭐⭐
【推理与服务】 15 推理≠训练 ⭐⭐ 16 KV Cache ⭐⭐
17 连续批处理 ⭐⭐ 18 量化 ⭐
18b 知识蒸馏 ⭐ 18c 剪枝与稀疏化 ⭐⭐
19 投机解码 20 推理服务化 ⭐
【稳定与成本】 21 稳定性与容错 ⭐ 22 数据管线
23 可观测性与成本 ⭐
【动手】 24 实战与挑战项目 ⭐
【随时查】 附录A 速查
⏱️ 五种读法
| 你的情况 | 路线 | 时间 |
|---|---|---|
| 只想知道钱花在哪 | 01 → 15 → 20 → 23 | 1.5 小时 |
| 要部署推理服务 ⭐ | 03 → 04 → 15 → 16 → 17 → 18 → 18b → 18c → 20 | 5.5 小时 |
| 要训练/微调大模型 | 03 → 04 → 06 → 09 → 10 → 11 → 14 | 5 小时 |
| 面试速通 | 03 → 04 → 08 → 11 → 16 → 17 | 3 小时 |
| 完整打牢 | 全部顺读 + 做项目 | 2–3 周 |
💡 如果只有一小时:读 03 显存与带宽墙 和 04 Roofline与MFU。 这两章是"钥匙" —— 后面十几章的技术,本质上都是这两章的推论。
🔗 这份教程在整个学习地图里的位置
《机器学习与深度学习基础》 ← 模型怎么训(先有这个)
《大模型全景导论》 ← Transformer 是什么
│
▼
《AI 基础设施》 ← 你在这里:怎么把它真的跑起来
│
├──→ 训练侧:能独立搞定多机多卡
└──→ 推理侧:能算清楚每 1000 token 的成本
具体到章 —— 别的板块讲过的东西,到了这里会变成什么(⭐ 没读过那些板块也不影响,这张表是给读过的人对位用的):
| 别的教程讲的 | 到这里变成什么 |
|---|---|
| 《机器学习与深度学习基础》08 反向传播 | 反向要用到前向存下来的中间值 —— 那些中间值就是第 3 章显存四大块里的"激活值" ⭐ |
| 《机器学习与深度学习基础》09 优化器与学习率 | Adam 的一阶/二阶动量,在这里是每个参数多出的 8 字节 —— 第 11 章 ZeRO 要切的就是它 ⭐ |
| 《大模型全景导论》02 Transformer 原理 | 那边讲 attention 算什么,这里只关心它要搬多少数据(第 8、16 章) |
| 《大模型全景导论》06 推理优化 | 那边是"有哪些武器"的一页纸目录,15–20 章是每件武器的原理、数字和坑 |
| 《模型上线之后》18 成本与容量 | 本教程算到"每百万 token 多少钱"为止;再往下的容量规划、排队雪崩、降级在那边 |
| 《强化学习基础》12 RLHF 全流程 | PPO 要同时装下四个模型、显存是 SFT 的 4 倍以上 —— 09/11/14 章最狠的应用场景 |
✅ 检查点
- 这份教程和其他教程的分工是什么?
- 三条阅读规则分别是什么?
- 为什么说"每个优化都是一笔交易"?举两个例子。
- 优化的正确顺序是什么?为什么不能凭直觉?
- 只有一小时该读哪两章?为什么?
👀 答案
- 其他教程讲算什么(模型结构、算法),这套讲怎么算得出来、算得快、算得起(显存、并行、推理成本)。
- ①数字比概念重要(记量级:显存带宽 3TB/s、NVLink 900GB/s、跨机 400Gb/s)②每个优化都是一笔交易(看到"银弹"先问它拿什么换的)③先测再优化。
- 因为这个领域没有免费的优化。例:梯度检查点省显存但多算一遍前向(+30% 时间);连续批处理提吞吐但单请求延迟变差。
- ①测 MFU/显存/各阶段耗时 ②判断瓶颈是算力/带宽/通信/还是没喂饱 ③只优化瓶颈 ④再测确认。凭直觉优化是赌博——你可能在优化一个根本不是瓶颈的东西。
- 03 显存与带宽墙 + 04 Roofline与MFU。因为后面十几章的技术(FlashAttention、量化、KV Cache、并行策略)本质上都是这两章的推论。
🛑 开始
⚡ 走神救援
这套教程补的是「模型算什么」和「怎么让它真跑起来」之间的那一层——回答:为什么 A100 只跑出 30% 算力、为什么 batch 一大就 OOM、70B 怎么塞进 8 张卡、为什么推理比训练还贵。三条规则:①⭐数字比概念重要,记住量级(显存带宽 3TB/s、NVLink 900GB/s、跨机 400Gb/s,这三个数字的差距决定一半的架构选择)②⭐每个优化都是交易(梯度检查点=省显存换 30% 时间、张量并行=省显存换通信、量化=省带宽换精度、连续批处理=换单请求延迟、投机解码=换算力)——看到银弹先问它拿什么换的 ③⭐先测再优化(测 MFU → 判断瓶颈是算力/带宽/通信/没喂饱 → 只优化瓶颈 → 再测;在会算 MFU 之前所有优化都是赌博)。26 章,⭐只有一小时就读 03 显存与带宽墙 + 04 Roofline与MFU——后面十几章的技术本质上都是这两章的推论。不需要会 CUDA;最难的不是数学,是建立"数据在哪、要搬多远"的空间感。