🏠 总目录📚 本教程 00 · 怎么用这份教程 →
📑 本页目录(点开跳转)

00 · 怎么用这份教程

⏱ 20 分钟 | ⭐ 站点自己写下「整块要外找」的那一块,就在这里补上


🎯 一句话

这套教程只回答一个问题:从一团纯随机的噪声里,怎么可能长出一张具体的图。 它不教提示词、不横评产品、不教任何 WebUI —— 它讲这套东西为什么能工作,以及它的代价。


🕳️ 一、它填的是哪个洞

站内《大模型全景导论》有一页 14 分钟的 10b · 图像生成。那一页末尾的「📦 深挖的话要学什么」清单,对整个图像生成方向给出的标注是:

📕 整块要外找。全站搜 DDPM / DDIM / Latent Diffusion / ControlNet,唯一的命中就是上面这一行清单本身。

被标成「要外找」的那一行列的是:扩散过程的数学、DDPM→DDIM 采样加速、Latent Diffusion、DiT、ControlNet、风格 LoRA 训练、图生图/局部重绘、评估(FID/CLIP Score)。⭐ 那正是本板块的目录。

⭐ 立项理由不是「扩散很火」——那对任何主题都成立、等于没有理由;理由是站点自己声明了这个缺口,还指名了它的边界。同一段还写着:站内能帮你的只有前置数学(KL 散度、ELBO)。⭐ 地基铺好了、楼没盖 —— 这就是那栋楼。


🚧 二、和站内别的板块的分界

那边 这里 分界
全景导论 10b:14 分钟,U-Net/VAE/CFG/ControlNet 一人一行 那一行行的展开:各自解决什么问题、代价是什么、什么时候失效 索引 vs 深挖(那页自己标了「整块要外找」)
全景导论主线 2:注意力+残差+FFN,一个词一个词往下写 从纯噪声开始,所有像素同时变清晰 两种范式。⚠️ 不是替代:07 章的 DiT 用回的正是它
数学原理 01b 讲 KL、13 讲 ELBO 直接拿来用:训练目标是一串 KL,简化后塌成一行均方误差 前置数学 vs 用法,这里不重讲 KL 是什么
ML 基础 12 · CNN:卷积、感受野、池化、残差 U-Net 怎么在这些零件上加跳跃连接和上采样 零件 vs 装配。⚠️ 上采样站内没有,归 07 章

⛔ 三、它不讲什么

❌ 提示词怎么写、各种咒语 ❌ 横评哪个模型/服务更好 ❌ 某个 WebUI 的按钮在哪 ❌ 视频与 3D 生成的完整方案(09 章只提一句共同骨架)。

⭐ 判断标准只有一条:换个产品就得重写的不写,换个产品照样成立的才写。 所以 06 章不讲怎么拖 CFG 那个滑块,只讲它在数学上到底在调什么。


🗺️ 四、章节地图(连本章共 11 页)

章 它回答的问题
01 第一天:从噪声里捞出一张图 ⭐ 几十行 PyTorch、CPU 十几秒,亲眼看见纯噪声变回原来的分布
02 加噪与去噪 前向为什么能一步到位,反向为什么必须一步步走
03 训练目标为什么是「预测噪声」 变分下界怎么塌成一行均方误差
04 DDIM 与采样加速 50 步和 1000 步差在哪,确定性采样换来了什么
05 Latent Diffusion 省的到底是哪部分开销,VAE 又带来什么损失
06 条件控制:文本与 CFG 提示词塞在哪一层,CFG 的两次前向各算什么
07 去噪主干:U-Net 与 DiT 为什么去噪偏爱 U 形,换成 Transformer 得到了什么
08 ControlNet 与风格 LoRA 「照这个骨架画」和「照这个画风画」是两件事
09 怎么评估:FID / CLIP Score 这两个数字各自看不见什么
附录A 速查 公式、符号、调参项、常见报错

⭐ 01 → 03 是一条链(03 的推导要用 02 的记号);04 之后每章都能单独读。

你今天想解决哪件事?从这里开始想先看见它动01 第一天CPU 十几秒训一个出来想能自己推出来02 → 03加噪去噪 + 变分下界想搞懂手上的参数04 → 06步数 / 种子 / CFG scale⭐ 三条路互不依赖,走完任意一条都能停 —— 不必按顺序读完全部 11 页
按**你现在的问题**选一条,不必按顺序读。⭐ 三条路互不依赖 —— 只想调参的人不需要先啃完变分下界。

🚦 五、三条读法

① 想先看见它动(第一次接触推荐这条) 👉 01 → 02 → 05。01 让你跑出一个真的扩散模型,02 解释你刚跑的那些行,05 说清从玩具到真实图片还差哪一步。

② 想搞懂数学、能自己推 👉 02 → 03 → 04。一条推导链:加噪的闭式解 → 下界怎么塌成均方误差 → 放松「必须一步步走」会怎样。⚠️ 卡住就回 数学原理 01b 和 13。

③ 只想搞明白手上那些参数和插件 👉 06 → 08 → 04,需要时补 09。前面五章都不是硬前置,06 会把记号重新交代一遍。


🧰 六、你需要准备什么


🔗 这一章连到哪里

相关的地方 为什么
全景导论 10b · 图像生成 ⭐ 立项证据就在那一页:它把这一整块标成「📕 整块要外找」。想先要个 14 分钟的鸟瞰就先看它
全景导论主线 2 · 模型怎样看懂一句话 另一种生成范式。⭐ 那张「注意力 → 残差 → FFN」的信息路径图,正是 07 章 DiT 的骨架
数学原理 01b · KL 散度 那一章讲了前向 KL 逼你盖住所有峰、反向 KL 允许只蹲一个峰,这个区别 03 章会直接用
数学原理 13 · EM 与高斯混合 ELBO 的正式出处:E 步把下界顶到贴着似然、M 步抬高下界。扩散的变分下界是同一套换了场景
ML 基础 12 · CNN 处理图像 U-Net 的零件全在那儿:卷积、感受野、池化、⭐ 残差连接
全景导论 15 · 数学地基 它的清单里「马尔可夫链 / 变分推断」备注写着「只有挖图像生成才需要」—— 你正在挖的就是它

✅ 检查点

  1. 这个板块的立项理由是什么?为什么「扩散模型很火」不能当理由?
  2. 全景导论 10b 和本板块是不是重复?分界在哪?
  3. 本板块不讲哪四类东西?判断标准是哪一句?
  4. 扩散和自回归是两种范式,它们在本板块里有交汇的地方吗?在第几章?
  5. KL 散度和 ELBO 归哪个板块?本板块拿它们做什么?
  6. 跑本板块的代码需要 GPU 吗?代价是什么?
👀 答案
  1. 理由是站点自己声明了这个缺口:全景导论 10b 的深挖清单把整个图像生成方向标成「📕 整块要外找」,还列出了具体条目。「很火」对任何主题都成立、等于没有理由;「站内某一页白纸黑字说这里缺一块」是能被核对的。
  2. 不重复。索引 vs 深挖:10b 只有 14 分钟,把 U-Net/VAE/CFG/ControlNet 一人一行列完;本板块展开每一行的「解决什么问题、代价、什么时候失效」。
  3. ① 提示词 ② 横评模型/服务 ③ WebUI 操作 ④ 视频/3D 的完整方案。标准:换个产品就得重写的不写,换个产品照样成立的才写。
  4. 有 —— 07 章的 DiT:去噪主干换成 Transformer,用的正是自回归那套里的同一种结构。两者不是替代关系。
  5. 归 《机器学习的数学原理》:01b 讲 KL(含前向/反向 KL 的行为差异),13 讲 ELBO(E 步顶下界、M 步抬下界)。本板块直接拿来用:训练目标是一串 KL,简化后塌成一行均方误差。
  6. 不需要,所有能跑的代码 CPU 上跑得完,最长一段十几秒。代价是 01 章用二维玩具数据而不是真图片 —— 机制是同一套。

🛑 可以停在这里

读到这里你已经知道这个板块干什么、不干什么,以及自己该从哪一章进去。下一章就开始动手,不用再准备任何东西。 ⚠️ 如果后面觉得「这些符号完全跟不上」,回来看第六节 —— 大概率是缺了 KL 或训练循环那一块,回站内对应章补比硬啃快得多。

⚡ 走神救援

⭐ 这个板块只回答一个问题:从一团纯噪声里怎么可能长出一张具体的图。 讲为什么能工作、代价是什么,不讲提示词、不横评产品、不教 WebUI —— 标准是「换个产品就得重写的不写,换个产品照样成立的才写」。

🕳️ 立项理由是站点自己写下的:《大模型全景导论》10b 图像生成那一页的深挖清单标着「📕 整块要外找,全站搜 DDPM / DDIM / Latent Diffusion / ControlNet,唯一的命中就是上面这一行清单本身」,而那一行列的正是本板块目录。⭐ 前置数学站里齐全(KL、ELBO),地基铺好了、楼没盖 —— 这就是那栋楼。

🚧 四条分界:10b 是索引、这里是深挖;自回归和扩散是两种范式而非替代(07 章 DiT 用回 Transformer);KL 与 ELBO 归《数学原理》01b 和 13,这里只拿来用;卷积/感受野/池化/残差归《ML 基础》12,上采样和跳跃连接站内没有、归 07 章。

🗺️ 11 页:01 动手 → 02 加噪去噪 → 03 训练目标 → 04 DDIM 跳步 → 05 潜空间 → 06 条件与 CFG → 07 U-Net 与 DiT → 08 ControlNet 与 LoRA → 09 评估 → 附录A。⭐ 01→03 是一条链,04 之后每章能单独读。三条读法:想看见它动 01→02→05;想能自己推 02→03→04;只想搞懂手上的参数 06→08→04。

🧰 准备:CPU 版 PyTorch 就够,不需要 GPU、不需要下载权重,最长一段十几秒;代价是 01 章用二维玩具数据而非真图片。不假设你读过站内别的板块。

下一节 👉 01-第一天-从噪声里捞出一张图.md

打卡记录保存在你的浏览器里,首页能看到总进度