🏠 总目录📚 本教程 怎么用 →
📑 本页目录(点开跳转)

00 · 怎么用这份教程

⏱ 20 分钟


🎯 一句话

其他教程教你模型算什么,这一套教你怎么让它真的算出来、算得快、算得起。 它是"你会调 API / 会写训练脚本"和"你能负责一个集群"之间的那一层。


🧱 它填的是哪个洞

这一层之前(假设你会的)
  • model.fit() ✅ 能跑
  • Transformer 结构 ✅ 看得懂
  • 调 OpenAI/Claude API ✅ 会用
↓ 但是……
  • 为什么 A100 只跑出 30% 的算力?
  • 为什么 batch 一大就 OOM?
  • 70B 模型怎么塞进 8 张卡?
  • 为什么推理比训练还贵?
《AI 基础设施》← 你在这里
  • 显存带宽是真正的瓶颈,不是算力
  • MFU 告诉你还剩多少提升空间
  • 并行策略是在【通信量和显存】之间做交易
  • 推理的瓶颈和训练【完全相反】
💡 上面那四个问题,答案都在这一层 —— 它们不是"调参没调好",是硬件约束算出来的结果。

👥 这份教程适合谁

你的情况 建议
想搞懂"为什么慢" ✅ 正中靶心,从第 3、4 章开始
要部署/自建推理服务 ✅ 直接看 15–20 章
要训练/微调大模型 ✅ 看 06–14 章
面试要问到这块 ✅ 全部,重点 03/04/08/11/16
只调 API,不管底层 🟡 看 01、15、20 就够——至少要知道钱花在哪
想写 CUDA kernel ⚠️ 这套教程不教这个,但会告诉你什么时候需要写

⚠️ 三条阅读规则

① 数字比概念重要

算一算

这个领域最大的特点:【所有判断都能算】

❌ "FlashAttention 更快"

✅ "标准 attention 要搬 O(n²) 的数据,FlashAttention 是 O(n²/M),

在 n=4096、M=192KB 时省了约 20 倍的 HBM 读写"

⭐ 每章都会给你【具体的数字和量级】。

记不住公式没关系,但要记住【量级】——

显存带宽 3TB/s、NVLink 900GB/s、跨机 400Gb/s,

这三个数字的差距就决定了一半的架构选择。

② 每个优化都是一笔交易

信息关系

这个领域没有"免费的优化",只有交易:
梯度检查点→省显存,多算一遍前向(+30% 时间)
张量并行→省显存,加通信(必须 NVLink)
量化→省显存和带宽,掉一点精度
连续批处理→提吞吐,单请求延迟变差
投机解码→降延迟,多烧算力
⭐ 看到任何"银弹",先问:它拿什么换的?

③ 先测,再优化

操作步骤

  1. ⚠️ 这个领域最常见的错误:凭直觉优化
  2. 正确顺序:
  3. 测出当前 MFU / 显存占用 / 各阶段耗时
  4. 找到瓶颈是【算力 / 带宽 / 通信 / 还是根本没喂饱】
  5. 只优化瓶颈
  6. 再测一次,确认真的变快了
  7. ⭐ 第 4 章会教你怎么做第 ①②步。在那之前的所有优化都是赌博。

🧩 每章的固定结构

结果对照

🎯 一句话 ← 30 秒读完这章的核心
正文(现象→原因→数字→怎么办)
📐 折叠推导 ← 想看再点,不点不影响
⚠️ 坑表 / 💥 真实事故
🔗 和站内其他章的关系
✅ 检查点 ← 答案折叠着,先自己想
🛑 可以停在这里
⚡ 走神救援 ← 整章浓缩,回来时先读这个 ⭐

⭐ 「走神救援」的用法:中断之后回来,不要从头读 —— 直接读上一章的走神救援,30 秒接回上下文。


🧮 需要的前置知识(比你以为的少)

对照

✅ 需要:

· 知道神经网络前向/反向大概在干什么 (ML 基础第 8 章)

· 会看 Transformer 的结构图 (全景导论主线 2)

· 知道矩阵乘法的形状怎么对 (中学水平够了)

· 会用 Python,看得懂 PyTorch 代码

❌ 不需要:

· CUDA 编程

· 计算机体系结构课程

· 分布式系统理论

· 会推导 attention 的梯度

💡 一个真相:这套教程里最难的不是数学,是建立"数据在哪、要搬多远"的空间感。 一旦有了这个感觉,大部分优化技术都会变成"当然应该这么做"。


🗺️ 教程结构(26 章 + 附录)

起步

  • 00 怎么用 01 在解决什么问题 ⭐

硬件与瓶颈

  • 02 GPU是什么 ⭐ 03 显存与带宽墙 ⭐
  • 04 Roofline与MFU ⭐ 05 互联与拓扑 ⭐

单卡榨干

  • 06 混合精度 ⭐ 07 算子融合与编译
  • 08 FlashAttention ⭐ 09 显存优化 ⭐

分布式训练

  • 10 数据并行 ⭐ 11 ZeRO与FSDP ⭐
  • 12 张量并行 ⭐ 13 流水线并行 ⭐
  • 14 并行策略怎么组合 ⭐

推理与服务

  • 15 推理≠训练 ⭐ 16 KV Cache ⭐
  • 17 连续批处理 ⭐ 18 量化 ⭐
  • 18b 知识蒸馏 ⭐ 18c 剪枝与稀疏化 ⭐
  • 19 投机解码 20 推理服务化 ⭐

稳定与成本

  • 21 稳定性与容错 ⭐ 22 数据管线
  • 23 可观测性与成本 ⭐

动手

  • 24 实战与挑战项目 ⭐

随时查

  • 附录A 速查

⏱️ 五种读法

你的情况 路线 时间
只想知道钱花在哪 01 → 15 → 20 → 23 2 小时
要部署推理服务 ⭐ 03 → 04 → 15 → 16 → 17 → 18 → 18b → 18c → 20 5.5 小时
要训练/微调大模型 03 → 04 → 06 → 09 → 10 → 11 → 14 3 小时
面试速通 03 → 04 → 08 → 11 → 16 → 17 3 小时
完整打牢 全部顺读 + 做项目 2–3 周

💡 如果只有一小时:读 03 显存与带宽墙 和 04 Roofline与MFU。 这两章是"钥匙" —— 后面十几章的技术,本质上都是这两章的推论。


🔗 这份教程在整个学习地图里的位置

关键信息

具体到章 —— 别的板块讲过的东西,到了这里会变成什么(⭐ 没读过那些板块也不影响,这张表是给读过的人对位用的):

别的教程讲的 到这里变成什么
《机器学习与深度学习基础》08 反向传播 反向要用到前向存下来的中间值 —— 那些中间值就是第 3 章显存四大块里的"激活值" ⭐
《机器学习与深度学习基础》09 优化器与学习率 Adam 的一阶/二阶动量,在这里是每个参数多出的 8 字节 —— 第 11 章 ZeRO 要切的就是它 ⭐
《大模型全景导论》主线 2 · 模型怎样看懂一句话 那边讲 attention 算什么,这里只关心它要搬多少数据(第 8、16 章)
《大模型全景导论》06 推理优化 那边是"有哪些武器"的一页纸目录,15–20 章是每件武器的原理、数字和坑
《模型上线之后》18 成本与容量 本教程算到"每百万 token 多少钱"为止;再往下的容量规划、排队雪崩、降级在那边
《强化学习基础》12 RLHF 全流程 PPO 要同时装下四个模型、显存是 SFT 的 4 倍以上 —— 09/11/14 章最狠的应用场景

✅ 检查点

  1. 这份教程和其他教程的分工是什么?
  2. 三条阅读规则分别是什么?
  3. 为什么说"每个优化都是一笔交易"?举两个例子。
  4. 优化的正确顺序是什么?为什么不能凭直觉?
  5. 只有一小时该读哪两章?为什么?
👀 答案
  1. 其他教程讲算什么(模型结构、算法),这套讲怎么算得出来、算得快、算得起(显存、并行、推理成本)。
  2. ①数字比概念重要(记量级:显存带宽 3TB/s、NVLink 900GB/s、跨机 400Gb/s)②每个优化都是一笔交易(看到"银弹"先问它拿什么换的)③先测再优化。
  3. 因为这个领域没有免费的优化。例:梯度检查点省显存但多算一遍前向(+30% 时间);连续批处理提吞吐但单请求延迟变差。
  4. ①测 MFU/显存/各阶段耗时 ②判断瓶颈是算力/带宽/通信/还是没喂饱 ③只优化瓶颈 ④再测确认。凭直觉优化是赌博——你可能在优化一个根本不是瓶颈的东西。
  5. 03 显存与带宽墙 + 04 Roofline与MFU。因为后面十几章的技术(FlashAttention、量化、KV Cache、并行策略)本质上都是这两章的推论。

🛑 开始

⚡ 走神救援

先记住这几件事

👉 01-AI-Infra在解决什么问题.md

打卡记录保存在你的浏览器里,首页能看到总进度