🏠 总目录 AI 基础设施 · 把模型真正跑起来、跑得快、跑得起

AI 基础设施

模型是「算什么」,Infra 是「怎么把它算出来、算得起」。

这套教程回答三个问题:为什么你的 GPU 只跑出了 30% 的算力、 一张卡装不下的模型怎么切、以及为什么推理成本会吃掉你全部的预算。 不需要你会写 CUDA,但会让你看懂 profiler 里的每一个数字。

⚡ 从「在解决什么问题」开始 📐 直接看最重要的一章
0%
你的进度(在每章末尾点「打卡」,保存在本浏览器里)

🧭 它和其他教程的关系

其他几套教程讲的是算什么,这一套讲的是怎么算得出来

ML 基础 / 数学原理
反向传播的公式
「为什么它吃这么多显存」
大模型全景导论
Transformer 的结构
「70B 模型怎么塞进 8 张卡」
智能体工程
怎么调 API
「API 背后那台机器在干什么」
这一层就是本教程要补的
  • GPU 与显存层次
  • Roofline 与 MFU
  • 混合精度
  • FlashAttention
  • 数据/张量/流水线并行
  • ZeRO 与 FSDP
  • KV Cache
  • 连续批处理
  • 量化与投机解码
  • 成本与可观测性

⭐ 三章别跳

第 3 章 · 显存与带宽墙
理解这一章之后,你会发现大部分「性能优化」其实都是同一件事: 少搬点数据。它是后面 FlashAttention、量化、KV Cache 的共同前提。
第 4 章 · Roofline 与 MFU
唯一能回答「我还有多少提升空间」的工具。 不会算 MFU,你的所有优化都是盲调
第 15 章 · 推理≠训练
把训练的经验直接套到推理上是最常见的昂贵错误。 这一章讲清楚为什么它们的瓶颈完全相反

⚠️ 三条使用规则(ADHD 版)

允许跳过。
标 🎁 的是加餐,标 ⭐ 的是核心。时间不够只看 ⭐。跳过不是失败,是策略。
别连看两节以上。
每节结尾都有 🛑 断点。看完起来走一圈,硬撑只会让你明天不想打开。
走神了别重头看。
每节结尾有 ⚡走神救援,几行话恢复状态。进度条会记住你学到哪。

🕸️ 分布式训练一张卡装不下的时候

🔨 动手不做就等于没学

🔩 硬件与瓶颈所有优化的物理边界都在这里

🚀 推理与服务训练是一次性的,推理是每天的钱

🛠️ 稳定与成本让它别崩,让它别那么贵

📌 随时查不用通读

⚡ 单卡榨干在买第二张卡之前应该做的事

🚪 起步先搞清楚这个领域在解决什么