🏠 总目录📚 本教程 专题 A · 训练为什么更稳 ← →
📑 本页目录(点开跳转)

专题 A · 现代模型为什么更容易训稳

⏱ 8 分钟 | 可选专题 | 建议完成主线后再看


🎯 一句话

早期 Transformer 的核心骨架没有变;现代 LLaMA 式模型主要是在修四类工程问题:深层不好训练、归一化有冗余、FFN 不够会筛选、位置距离不够灵活。 这一页先讲前两类。

旧结构与新结构,差别在哪

早期:Post-LN现代:Pre-LN注意力 + 残差LayerNorm 在后FFN + 残差RMSNorm 在前注意力 + 残差RMSNorm 在前移动的是“归一化”所在位置;注意力、FFN、残差这条主骨架仍然相同。
看位置,不必背名字:现代模型先把分支整理好,再让它处理信息,主干更容易把梯度传回去。

Pre-LN:让很深的模型还能学

训练深模型时,学习信号要从最后一层一路传回第一层。早期 Post-LN 把归一化放在残差相加之后,深到几十层、上百层时,信号更容易被反复缩放得不稳定。

Pre-LN 把归一化搬到注意力和 FFN 之前。可以把残差主干想成一条更直的高速路:新计算在支路上变化,原来的信息与训练信号仍能比较顺地走下去。它不是让模型更聪明,而是让大模型更容易被稳定训练。

RMSNorm:只做够用的整理

LayerNorm 会把一组数字“居中”并控制大小;RMSNorm 少做了居中那一步,只控制整体大小。实务上的结论很朴素:这一小步通常不损失效果,却少了一点计算和数值麻烦。

你在模型配置里看到 RMSNorm,不必把它当新架构。它仍然是“控制每层数字尺度”的零件,只是更轻量。

✅ 检查点

点开核对

Pre-LN 通过把归一化放到分支前,让深层训练信号更稳;RMSNorm 是更轻量的数字尺度整理。它们是训练工程优化,不是新模型种类。

🔗 想再深一层,去哪一套

去哪 为什么
ML 基础 10 · 正则化全家桶 第六件武器就是 BatchNorm / LayerNorm:为什么 Transformer 用 LayerNorm、CNN 用 BatchNorm
ML 基础 09 · 优化器与学习率 「深了不好训」还有另一半答案在学习率上 —— 那一章讲 warmup 为什么是大模型必备
AI 基础设施 21 · 训练稳定性与故障恢复 ⭐ 训不稳在几百张卡上是什么样:loss 尖峰怎么认、怎么救

🛑 可以停在这里

除非你要读模型源码或训练模型,不需要手算均值、方差或梯度。知道它们分别在解决什么问题就够了。

⚡ 走神救援

现代架构没有推翻 Transformer,只是把归一化挪到更利于训练的位置,并把它做得更轻。下一专题看 FFN 怎样更会挑信息。

👉 02e-SwiGLU与RoPE.md

打卡记录保存在你的浏览器里,首页能看到总进度