📑 本页目录(点开跳转)
专题 A · 现代模型为什么更容易训稳
⏱ 8 分钟 | 可选专题 | 建议完成主线后再看
🎯 一句话
早期 Transformer 的核心骨架没有变;现代 LLaMA 式模型主要是在修四类工程问题:深层不好训练、归一化有冗余、FFN 不够会筛选、位置距离不够灵活。 这一页先讲前两类。
旧结构与新结构,差别在哪
Pre-LN:让很深的模型还能学
训练深模型时,学习信号要从最后一层一路传回第一层。早期 Post-LN 把归一化放在残差相加之后,深到几十层、上百层时,信号更容易被反复缩放得不稳定。
Pre-LN 把归一化搬到注意力和 FFN 之前。可以把残差主干想成一条更直的高速路:新计算在支路上变化,原来的信息与训练信号仍能比较顺地走下去。它不是让模型更聪明,而是让大模型更容易被稳定训练。
RMSNorm:只做够用的整理
LayerNorm 会把一组数字“居中”并控制大小;RMSNorm 少做了居中那一步,只控制整体大小。实务上的结论很朴素:这一小步通常不损失效果,却少了一点计算和数值麻烦。
你在模型配置里看到 RMSNorm,不必把它当新架构。它仍然是“控制每层数字尺度”的零件,只是更轻量。
✅ 检查点
- Pre-LN 解决的是:模型堆得很深后,训练信号不稳定。
- RMSNorm 解决的是:用更少的操作做足够的数值整理。
- 二者都没有改变“注意力 + FFN + 残差”的主骨架。
点开核对
Pre-LN 通过把归一化放到分支前,让深层训练信号更稳;RMSNorm 是更轻量的数字尺度整理。它们是训练工程优化,不是新模型种类。
🔗 想再深一层,去哪一套
| 去哪 | 为什么 |
|---|---|
| ML 基础 10 · 正则化全家桶 | 第六件武器就是 BatchNorm / LayerNorm:为什么 Transformer 用 LayerNorm、CNN 用 BatchNorm |
| ML 基础 09 · 优化器与学习率 | 「深了不好训」还有另一半答案在学习率上 —— 那一章讲 warmup 为什么是大模型必备 |
| AI 基础设施 21 · 训练稳定性与故障恢复 | ⭐ 训不稳在几百张卡上是什么样:loss 尖峰怎么认、怎么救 |
🛑 可以停在这里
除非你要读模型源码或训练模型,不需要手算均值、方差或梯度。知道它们分别在解决什么问题就够了。
⚡ 走神救援
现代架构没有推翻 Transformer,只是把归一化挪到更利于训练的位置,并把它做得更轻。下一专题看 FFN 怎样更会挑信息。