📑 本页目录(点开跳转)
主线 4 · 它怎样从续写机变成助手
⏱ 11 分钟 | ⭐ 主线第四站
🎯 一句话
模型不是被一次训练“造完”的。常见路线分三步:预训练给它广泛能力,SFT 教它按任务回答,对齐教它在多个回答里偏向更合适的那个。
第一步:预训练,学的是世界里的模式
预训练数据是海量的网页、书籍、代码和多语言文本。模型反复做“遮住末尾,猜下一个 token”。为了把这个任务做好,它不得不学到语言模式、知识关联、代码结构和常见问题的回答方式。
模型的基础知识和大部分能力,主要来自预训练,而不是后来几千条微调样本。
这里最容易误会的一点是:预训练不是“把互联网背下来”。模型压缩的是统计规律——哪些说法常一起出现、代码通常怎样收尾、某种问题可能有哪些解法。参数越多、数据越干净且覆盖越广、训练算力越够,这种压缩能力通常越强;但它依旧可能记错、过时或在没把握时编出看似合理的答案。
数据质量也不是配角。重复、垃圾网页、矛盾信息和版权风险都会进入训练信号;因此大模型公司会做清洗、去重、过滤和数据配比。模型能力并不只取决于“多少参数”,还取决于“拿什么数据、训练了多久”。
第二步:SFT,学的是“怎么当助手”
SFT(监督微调)给模型看成对的示例:用户怎么问,理想回答长什么样。它特别擅长改变格式、语气、任务流程,例如“先给结论再解释”“输出 JSON”“按客服口吻回复”。
关键边界:SFT 可以教表达方式,不能用很少的数据重写一个模型的大量基础知识。想让回答依据私有且会变的资料,通常应使用 RAG,而不是硬塞进微调数据。
这不是说 SFT 没有价值。一个基础模型可能会续写,却不知道用户的问题在哪里结束、答案应该怎样组织;SFT 用相对少但高质量的“问题 → 理想回答”示范,把通用续写能力接到具体任务接口上。它像教一个知识很广的人采用某个团队的工作方式,而不是让他一夜读完一座图书馆。
第三步:对齐,学的是偏好与边界
同一问题常有多个“并非完全错误”的回答:一个太啰嗦,一个不安全,一个实用但没说清限制。对齐训练让模型学会偏向人更愿意接受的回答。
你会看到 RLHF、DPO、GRPO 这些名词。现在只需知道:它们都是利用偏好信号,让模型在多种续写方式里选得更合适的方法;区别在于训练过程怎样实现。
对齐也有代价。模型被要求更谨慎时,可能变得更爱拒绝、回答更长,或者在边界模糊的问题上过度保守;这常被叫作“对齐税”。它不表示安全训练毫无意义,而是提醒你:安全、帮助性、简洁、创造性之间需要真实评测和取舍,不能只看一个榜单分数。
RLHF、DPO、GRPO 的最小区别
RLHF 常先训练一个“奖励模型”模拟人类偏好,再用强化学习优化语言模型;DPO 直接用“这个回答比那个回答好”的成对数据来优化,流程更短;GRPO 让同一道题的多个答案在组内比较,常用于数学、代码等较容易判断对错的推理任务。三者共同点都是:只靠“下一个词像不像原文”不够,还要加入“哪个回答更好”的信号。
把问题放回三阶段
| 你观察到的问题 | 优先怀疑哪一层 | 常见处理方向 |
|---|---|---|
| 不知道新资料、事实过时 | 预训练外 | RAG、搜索、换模型 |
| 总不按格式答、语气不稳定 | SFT / 提示词 | few-shot、微调 |
| 太爱拒绝、太爱免责声明 | 对齐 | 提示词、模型选择、评测 |
✅ 检查点
- 预训练:让模型拥有广泛的续写能力。
- SFT:让模型更会按任务和格式回答。
- 对齐:让模型在多个可行回答中更偏向人类希望的方式。
点开核对
预训练给能力,SFT 给任务表达方式,对齐给偏好与边界。资料会变不是微调的主要用武之地,优先考虑 RAG。
🔗 想再深一层,去哪一套
| 去哪 | 为什么 |
|---|---|
| 强化学习基础 12 · RLHF 全流程 | ⭐ 第三步「对齐」的完整版:奖励模型怎么训、PPO 到底在优化什么 |
| 强化学习基础 13 · DPO 与免 RL 对齐 | 同一步的短路径:不训奖励模型、不跑 RL 也能对齐,代价是什么 |
| AI 基础设施 14 · 并行策略怎么组合 | 第一步「预训练」在几百张卡上怎么跑起来:数据 / 张量 / 流水线并行怎么搭 |
| 数据这一关 13 · 评测集也是数据 | 三个阶段都靠评测判断有没有变好,而评测集本身会坏 |
🛑 可以停在这里
先把“三种数据塑造三种能力”记住。Scaling Law、奖励模型、强化学习推导,等你真要训练或评估模型时再学。
⚡ 走神救援
预训练让它有能力,SFT 让它会办事,对齐让它更像可用的助手。下一页看:如果你有自己的任务和数据,应该何时、怎样改造它。