AI 基础设施
模型是「算什么」,Infra 是「怎么把它算出来、算得起」。
这套教程回答三个问题:为什么你的 GPU 只跑出了 30% 的算力、 一张卡装不下的模型怎么切、以及为什么推理成本会吃掉你全部的预算。 不需要你会写 CUDA,但会让你看懂 profiler 里的每一个数字。
⚡ 从「在解决什么问题」开始 📐 直接看最重要的一章0%
你的进度(在每章末尾点「打卡」,保存在本浏览器里)
🧭 它和其他教程的关系
其他几套教程讲的是算什么,这一套讲的是怎么算得出来:
ML 基础 / 数学原理
反向传播的公式
「为什么它吃这么多显存」
大模型全景导论
Transformer 的结构
「70B 模型怎么塞进 8 张卡」
智能体工程
怎么调 API
「API 背后那台机器在干什么」
⬇
这一层就是本教程要补的
- GPU 与显存层次
- Roofline 与 MFU
- 混合精度
- FlashAttention
- 数据/张量/流水线并行
- ZeRO 与 FSDP
- KV Cache
- 连续批处理
- 量化与投机解码
- 成本与可观测性
⭐ 三章别跳
第 3 章 · 显存与带宽墙
理解这一章之后,你会发现大部分「性能优化」其实都是同一件事: 少搬点数据。它是后面 FlashAttention、量化、KV Cache 的共同前提。
理解这一章之后,你会发现大部分「性能优化」其实都是同一件事: 少搬点数据。它是后面 FlashAttention、量化、KV Cache 的共同前提。
第 4 章 · Roofline 与 MFU
唯一能回答「我还有多少提升空间」的工具。 不会算 MFU,你的所有优化都是盲调。
唯一能回答「我还有多少提升空间」的工具。 不会算 MFU,你的所有优化都是盲调。
第 15 章 · 推理≠训练
把训练的经验直接套到推理上是最常见的昂贵错误。 这一章讲清楚为什么它们的瓶颈完全相反。
把训练的经验直接套到推理上是最常见的昂贵错误。 这一章讲清楚为什么它们的瓶颈完全相反。
⚠️ 三条使用规则(ADHD 版)
允许跳过。
标 🎁 的是加餐,标 ⭐ 的是核心。时间不够只看 ⭐。跳过不是失败,是策略。
标 🎁 的是加餐,标 ⭐ 的是核心。时间不够只看 ⭐。跳过不是失败,是策略。
别连看两节以上。
每节结尾都有 🛑 断点。看完起来走一圈,硬撑只会让你明天不想打开。
每节结尾都有 🛑 断点。看完起来走一圈,硬撑只会让你明天不想打开。
走神了别重头看。
每节结尾有 ⚡走神救援,几行话恢复状态。进度条会记住你学到哪。
每节结尾有 ⚡走神救援,几行话恢复状态。进度条会记住你学到哪。