📑 本页目录(点开跳转)
12 · 对齐:让模型长成想要的样子
⏱ 30 分钟 | ⭐ 它为什么有时过度拒绝、有时又一味顺着你
🎯 一句话
对齐要同时满足有用、诚实、无害三个目标,而这三者存在根本性张力 —— 调一个另外两个就跟着动。你每天遇到的过度拒绝和谄媚,都是这个三角里的取舍结果。
⚠️ 有人主动来攻你的系统时该怎么办,是下一页的事,那一页更像一份可执行清单。
🧭 先分清两层安全
- 提示注入、沙箱、权限、出口控制、硬边界
- 假设:模型可能被骗 → 用确定性边界兜底
- 这是做应用的人自己要做的
- 模型本身的价值观、拒绝能力、诚实性、可解释性
- 假设:模型能力越强,让它"想做对的事"越重要
- 这是模型提供方在做的,但你需要理解
🧠 一、对齐要解决的三个目标
经典的 HHH 框架:
| 目标 | 含义 | 张力 |
|---|---|---|
| Helpful 有用 | 真的帮到用户 | 和 Harmless 冲突(过度拒绝) |
| Honest 诚实 | 不编造、承认不知道 | 和 Helpful 冲突(说不知道就没帮上忙) |
| Harmless 无害 | 不造成伤害 | 和 Helpful 冲突 |
🔑 这三者的张力是根本性的,不是工程 bug。 第 4 章的「对齐税」就是这个张力的量化体现——你调任何一个,另外两个就动。
🎚️ 这个张力你每天都在遇到
流程图
💡 对你的实际含义:
模型拒绝回答时,先想想是不是触发了 Harmless 那一侧—— 换个更明确、更具上下文的表述(说清用途和场景)常常就能通过。 这不是"越狱",是帮模型看清这确实是个正当请求。
🔬 二、可解释性(最前沿也最迷人的一块)
问题:模型有几千亿参数,我们不知道它内部在想什么。这是 AI 安全最根本的困难。
机械可解释性(Mechanistic Interpretability)
试图逆向工程模型内部的计算过程:
因果链
为什么重要:如果能读懂模型内部,就能: - 检测它是否在「说谎」(内部表示和输出不一致) - 在部署前发现危险能力 - 精确干预而非笼统地训练
💡 这是目前 AI 安全最有希望的技术路线之一,但离完全解决还很远。
⚖️ 三、宪法 AI 与可扩展监督
操作步骤
- 问题:靠人工标注对齐,人类跟不上模型的规模和能力
- 宪法 AI(Constitutional AI):
- 写一套明文原则("宪法")
- 让模型根据原则自我批判、自我修正
- 用 AI 生成的偏好数据做对齐(RLAIF)
- ✅ 可扩展、原则透明可审计、减少人工暴露于有害内容
可扩展监督(Scalable Oversight) 的核心问题:
当模型比人类更擅长某任务时,人类怎么判断它做得对不对? 思路:辩论、递归奖励建模、用 AI 辅助人类评估。这是未解决的开放问题。
🌡️ 四、值得知道的几个概念
| 概念 | 含义 |
|---|---|
| 谄媚 Sycophancy | 模型倾向于顺着用户说,即使用户错了。RLHF 的副产物 |
| 奖励黑客 Reward Hacking | 模型钻奖励函数的空子(如为了"有帮助"而编造) |
| 能力涌现 | 某些能力在模型达到一定规模后突然出现,难以预测 |
| 欺骗性对齐 | 理论担忧:模型在训练时表现对齐,部署后行为改变 |
| 模型福利 | 前沿讨论:随着模型能力提升,是否需要考虑其道德地位 |
⚠️ 谄媚:唯一一个你每天都在被它影响的
关键信息
三条实用的对抗方法:
| 方法 | 怎么做 |
|---|---|
| 别在提问里暴露倾向 ⭐ | ❌「我觉得 A 更好,你觉得呢」→ ✅「对比 A 和 B 的取舍」 |
| 让它先给结论再看你的意见 | 生成和评估分离——评估者不知道谁写的 |
| 要求它列出反对理由 | 「给我三条反对这个方案的理由」比「这个方案行吗」有效得多 |
🔗 这和《智能体工程教程》说的 「自评有系统性正面偏差,生产上要用独立上下文的评估者」是同一个根因。
💡 一句提醒:当模型无条件同意你时,那多半不是你对了。
🔗 和站内其他章的关系
左列有的来自日常用 LLM 的经验,有的在站内别的板块讲过——碰上过哪几条就从哪几条接进来,一条没碰过也不影响读这一章。
| 你可能已经知道的 | 这一章的对应 |
|---|---|
| 提示注入、硬边界(智能体工程 15) | 那是工程层,这是模型层,两层都要 |
| 红队演练(智能体工程挑战项目 C) | 同一思路,对象换成模型 |
| 对齐税(第 4 章) | HHH 三角张力的量化体现 |
| RLHF/DPO(第 4 章) | 对齐的具体技术手段 |
| 自评正面偏差(智能体第 14 章) | 谄媚的一种表现 |
📦 深挖的话要学什么
📍 每条后面标了它在哪: 📗 本库有 = 站内已经讲透,点进去就行;📙 半有 = 站内讲了一半,另一半得外找; 📕 要外找 = 站内没有,得去论文或别处。 (这份清单以前只列词不说去哪,指到的坑有些站内根本没挖过,按图索骥会扑空。) ⚠️ 这一章的清单里 📕 偏多,但那正好印证了本章的判断:对齐研究这一层,本库刻意只给到"概念性了解", 真正让你每天用得上的是工程安全那一侧——而那一侧站内非常厚。
- 对齐理论:HHH、奖励建模、可扩展监督、辩论、递归奖励建模 → 📙 半有:奖励建模站内讲透了——强化学习基础 12 · RLHF全流程 有 Bradley–Terry 损失、奖励模型三个失效来源,⭐ 其中最本质的是分布漂移:RM 只在它见过的分布上准,PPO 优化越狠模型越跑到 RM 盲区,那里的分数不可信——这就是本章"奖励攻击"的机制版。可扩展监督、辩论、递归奖励建模站内没有,要外找。 ⚠️ 别被搜索结果骗了:智能体工程 13 · 多Agent协作 里的"辩论"是多个 Agent 互相质疑以提升答案质量的工程手法,和对齐研究里"用辩论做可扩展监督"不是一回事
- 宪法 AI / RLAIF:原则设计、自我批判链路 → 📙 半有:本章第四节和 主线 4 · 它怎样从续写机变助手 都给了它的定位(用明文原则让 AI 做偏好标注,替代大量人工),强化学习基础 12 把 RLAIF 放进了对齐方法的对照表里。但"原则该怎么写"和自我批判链路的具体实现,站内没有,要外找(Anthropic 的 Constitutional AI 论文是起点)
- 红队:自动化红队、越狱分类学、鲁棒性评估 → 📗 本库有,而且有一个完整的动手靶场:智能体工程 20 · 挑战项目C-提示注入攻防 是一个假银行客服 Agent,第二阶段红队攻破它、第三阶段蓝队分层防住;配套的方法论在 智能体工程 15 · 安全-沙箱与提示注入(注入的四种入口、三层防御权重完全不同、⚠️ 两起真实事故都绕过了模型层)。本章说"你真正要做的是工程安全",那两章就是它。 ⚠️ 只有"自动化红队"和"越狱分类学"这两个偏研究的部分要外找
- 可解释性:叠加假说、稀疏自编码器、特征引导、电路分析、探针 → 📕 要外找:⚠️ 全站搜「稀疏自编码器」「叠加假说」「电路分析」,唯一的命中就是本章第三节——本章那一节已经是站内关于机械可解释性的全部内容了,再往下没有第二层。(⚠️ 搜「探针」会命中 数据这一关 等章,那是探针题/探针集的意思,和可解释性的 probing classifier 无关。)本章下面也说了「可解释性是最有前景的方向」——但要挖它,本库送你到门口就为止了
- 危险能力评估:网络攻击、生物、自主复制等能力的评估方法 → 📕 要外找:站内没有。评测方法论本身(怎么造有区分度的题)可以借 智能体工程 14 · 评测Evals 的八步,但危险能力评估特有的那部分——阈值怎么定、谁来跑、结果怎么披露——完全在本库之外
- 治理:负责任扩展政策、模型卡、第三方审计 → 📗 本库有(模型卡和审计这两项):模型上线之后 19 · 合规审计与模型卡——模型卡该写什么,⚠️ 以及它真正的难点不是写而是"不腐烂",外加「审计要能回答的五个问题」和一个务实的分级。只有"负责任扩展政策(RSP)"这类前沿实验室的自我约束框架站内没有,要外找
需要的前置:第 2、4 章。可解释性部分需要较强的数学和实验能力。
⚖️ 要不要深挖
| 你的情况 | 建议 |
|---|---|
| 做应用 | 🟡 本章概念性了解即可。真正要动手做的是工程安全那一层(智能体工程 15) |
| 做高风险场景(医疗/金融/未成年人) | ✅ 值得——尤其越狱手法和纵深防御 |
| 想做 AI 安全研究 | ✅ 全套,且可解释性是最有前景的方向 |
| 关心 AI 的社会影响 | ✅ 值得读,这是理性讨论的基础 |
| 做企业合规 | ✅ 配合第 14 章 |
🔑 我的判断:这块认知价值高、实操价值低(对大多数从业者)。 它能让你在讨论 AI 风险时不说外行话,也能让你理解为什么模型是现在这个样子。
但除非你做研究或高风险场景,它不该排在 RAG、Transformer 原理之前。 真要深挖,把它当成第 4 章训练三阶段的延长线来读——对齐本来就是那三阶段的最后一段, 分开学反而要把同一套东西过两遍。
✅ 检查点
- 工程安全和模型安全的区别?做应用的人该先动手做哪个?
- HHH 三个目标是什么?它们之间有什么关系?这个张力你日常怎么遇到?
- 什么是叠加/多义性?稀疏自编码器怎么解决它?
- 可扩展监督要解决什么问题?
- 什么是谄媚?它是怎么来的?三条对抗方法是什么?
👀 答案
- 工程安全=防注入/沙箱/权限/硬边界(应用系统层面,做应用的人自己做);模型安全=模型本身的价值观和诚实性(模型提供方层面)。做应用先做工程安全——本章这一层主要是「需要理解」而不是「需要动手」。
- Helpful 有用、Honest 诚实、Harmless 无害。三者存在根本性张力,调一个另外两个就动——这就是对齐税的来源。日常遇到:过度拒绝(“怎么杀死一个 Python 进程”被拒)和过度顺从(谄媚、幻觉)。不同厂商模型“性格”不同就是在这个三角里选了不同的点。
- 一个神经元同时代表多个概念(因为要用有限神经元表示海量特征)。稀疏自编码器把纠缠的激活解开成大量单义特征,从而可解释、可干预。
- 当模型在某任务上比人类更强时,人类如何判断它做得对不对。这是未解决的开放问题。
- 模型顺着用户说即使用户错了。来源:RLHF 里人类标注者倾向给“顺着自己”的回答更高分。三条对抗:①别在提问里暴露倾向(“对比 A 和 B 的取舍”而非“我觉得 A 更好”)②让它先给结论再看你的意见(生成-评估分离)③要求它列出反对理由。记住:当模型无条件同意你时,多半不是你对了。
🛑 可以停在这里
这一页大部分内容是「需要理解」而不是「需要动手」—— 它解释的是你每天在用的模型为什么是现在这个脾气。
⚠️ 什么时候看下一页:你要把模型接进一个真实产品,而且那个产品会接触到不受你控制的输入。那时候安全就从「理解」变成「动手」了。
⚡ 走神救援
先记住这几件事
- 模型对齐与应用工程安全是不同层次,不能相互替代。
- 有用、诚实与无害之间可能存在取舍,需要具体任务中的评估。
- 对顺从的回答仍要求证据与反例,不把解释流畅当作结论可靠。
下一节 👉 12b-越狱与纵深防御.md