🏠 总目录📚 本教程 主线 4 · 它怎样从续写机变助手 ← →
📑 本页目录(点开跳转)

主线 4 · 它怎样从续写机变成助手

⏱ 11 分钟 | ⭐ 主线第四站


🎯 一句话

模型不是被一次训练“造完”的。常见路线分三步:预训练给它广泛能力,SFT 教它按任务回答,对齐教它在多个回答里偏向更合适的那个。

① 预训练读海量文本与代码练:下一个 token 是什么② SFT看高质量问答示例学:怎样按指令回答③ 对齐比较多个回答的偏好学:何时更有帮助、稳妥三种不同的数据,在塑造三种不同能力。
看箭头即可:前一步造出“能续写”的底座,后一步才把它调成聊天助手。

第一步:预训练,学的是世界里的模式

预训练数据是海量的网页、书籍、代码和多语言文本。模型反复做“遮住末尾,猜下一个 token”。为了把这个任务做好,它不得不学到语言模式、知识关联、代码结构和常见问题的回答方式。

模型的基础知识和大部分能力,主要来自预训练,而不是后来几千条微调样本。

这里最容易误会的一点是:预训练不是“把互联网背下来”。模型压缩的是统计规律——哪些说法常一起出现、代码通常怎样收尾、某种问题可能有哪些解法。参数越多、数据越干净且覆盖越广、训练算力越够,这种压缩能力通常越强;但它依旧可能记错、过时或在没把握时编出看似合理的答案。

数据质量也不是配角。重复、垃圾网页、矛盾信息和版权风险都会进入训练信号;因此大模型公司会做清洗、去重、过滤和数据配比。模型能力并不只取决于“多少参数”,还取决于“拿什么数据、训练了多久”。

第二步:SFT,学的是“怎么当助手”

SFT(监督微调)给模型看成对的示例:用户怎么问,理想回答长什么样。它特别擅长改变格式、语气、任务流程,例如“先给结论再解释”“输出 JSON”“按客服口吻回复”。

关键边界:SFT 可以教表达方式,不能用很少的数据重写一个模型的大量基础知识。想让回答依据私有且会变的资料,通常应使用 RAG,而不是硬塞进微调数据。

这不是说 SFT 没有价值。一个基础模型可能会续写,却不知道用户的问题在哪里结束、答案应该怎样组织;SFT 用相对少但高质量的“问题 → 理想回答”示范,把通用续写能力接到具体任务接口上。它像教一个知识很广的人采用某个团队的工作方式,而不是让他一夜读完一座图书馆。

第三步:对齐,学的是偏好与边界

同一问题常有多个“并非完全错误”的回答:一个太啰嗦,一个不安全,一个实用但没说清限制。对齐训练让模型学会偏向人更愿意接受的回答。

你会看到 RLHF、DPO、GRPO 这些名词。现在只需知道:它们都是利用偏好信号,让模型在多种续写方式里选得更合适的方法;区别在于训练过程怎样实现。

对齐也有代价。模型被要求更谨慎时,可能变得更爱拒绝、回答更长,或者在边界模糊的问题上过度保守;这常被叫作“对齐税”。它不表示安全训练毫无意义,而是提醒你:安全、帮助性、简洁、创造性之间需要真实评测和取舍,不能只看一个榜单分数。

RLHF、DPO、GRPO 的最小区别

RLHF 常先训练一个“奖励模型”模拟人类偏好,再用强化学习优化语言模型;DPO 直接用“这个回答比那个回答好”的成对数据来优化,流程更短;GRPO 让同一道题的多个答案在组内比较,常用于数学、代码等较容易判断对错的推理任务。三者共同点都是:只靠“下一个词像不像原文”不够,还要加入“哪个回答更好”的信号。

把问题放回三阶段

你观察到的问题 优先怀疑哪一层 常见处理方向
不知道新资料、事实过时 预训练外 RAG、搜索、换模型
总不按格式答、语气不稳定 SFT / 提示词 few-shot、微调
太爱拒绝、太爱免责声明 对齐 提示词、模型选择、评测

✅ 检查点

点开核对

预训练给能力,SFT 给任务表达方式,对齐给偏好与边界。资料会变不是微调的主要用武之地,优先考虑 RAG。

🔗 想再深一层,去哪一套

去哪 为什么
强化学习基础 12 · RLHF 全流程 ⭐ 第三步「对齐」的完整版:奖励模型怎么训、PPO 到底在优化什么
强化学习基础 13 · DPO 与免 RL 对齐 同一步的短路径:不训奖励模型、不跑 RL 也能对齐,代价是什么
AI 基础设施 14 · 并行策略怎么组合 第一步「预训练」在几百张卡上怎么跑起来:数据 / 张量 / 流水线并行怎么搭
数据这一关 13 · 评测集也是数据 三个阶段都靠评测判断有没有变好,而评测集本身会坏

🛑 可以停在这里

先把“三种数据塑造三种能力”记住。Scaling Law、奖励模型、强化学习推导,等你真要训练或评估模型时再学。

⚡ 走神救援

预训练让它有能力,SFT 让它会办事,对齐让它更像可用的助手。下一页看:如果你有自己的任务和数据,应该何时、怎样改造它。

👉 05-微调与LoRA.md

打卡记录保存在你的浏览器里,首页能看到总进度