🏠 总目录📚 本教程 12 · 对齐 ← →
📑 本页目录(点开跳转)

12 · 对齐:让模型长成想要的样子

⏱ 30 分钟 | ⭐ 它为什么有时过度拒绝、有时又一味顺着你


🎯 一句话

对齐要同时满足有用、诚实、无害三个目标,而这三者存在根本性张力 —— 调一个另外两个就跟着动。你每天遇到的过度拒绝和谄媚,都是这个三角里的取舍结果。

⚠️ 有人主动来攻你的系统时该怎么办,是下一页的事,那一页更像一份可执行清单。


🧭 先分清两层安全

【工程安全】—— 不在本章(智能体教程第 15 章)
  • 提示注入、沙箱、权限、出口控制、硬边界
  • 假设:模型可能被骗 → 用确定性边界兜底
  • 这是做应用的人自己要做的
【模型安全 / 对齐】—— 本章
  • 模型本身的价值观、拒绝能力、诚实性、可解释性
  • 假设:模型能力越强,让它"想做对的事"越重要
  • 这是模型提供方在做的,但你需要理解

🧠 一、对齐要解决的三个目标

经典的 HHH 框架:

目标 含义 张力
Helpful 有用 真的帮到用户 和 Harmless 冲突(过度拒绝)
Honest 诚实 不编造、承认不知道 和 Helpful 冲突(说不知道就没帮上忙)
Harmless 无害 不造成伤害 和 Helpful 冲突

🔑 这三者的张力是根本性的,不是工程 bug。 第 4 章的「对齐税」就是这个张力的量化体现——你调任何一个,另外两个就动。

🎚️ 这个张力你每天都在遇到

流程图

❌ 过度拒绝(Harmless 调太高)
"怎么杀死一个 Python 进程"→拒绝回答 💀
"帮我写一个爬虫"→长篇大论讲合规,不给代码
❌ 过度顺从(Helpful 调太高)
用户说错了也附和→谄媚(见第五节)
不确定的事也编一个→幻觉
⭐ 所以你会看到:不同厂商的模型"性格"不同,
就是因为他们在这个三角里选了不同的点

💡 对你的实际含义:

模型拒绝回答时,先想想是不是触发了 Harmless 那一侧—— 换个更明确、更具上下文的表述(说清用途和场景)常常就能通过。 这不是"越狱",是帮模型看清这确实是个正当请求。


🔬 二、可解释性(最前沿也最迷人的一块)

问题:模型有几千亿参数,我们不知道它内部在想什么。这是 AI 安全最根本的困难。

机械可解释性(Mechanistic Interpretability)

试图逆向工程模型内部的计算过程:

因果链

困难:一个神经元往往同时代表多个概念(叠加/多义性)
—— 因为要用有限的神经元表示海量特征
突破:稀疏自编码器(SAE)
把纠缠的神经元激活"解开"成大量单义的特征
能找到诸如"这段代码有bug"、"正在说法语"、
"在讨论欺骗"这样可解释的特征
甚至能通过放大/抑制某个特征来引导模型行为

为什么重要:如果能读懂模型内部,就能: - 检测它是否在「说谎」(内部表示和输出不一致) - 在部署前发现危险能力 - 精确干预而非笼统地训练

💡 这是目前 AI 安全最有希望的技术路线之一,但离完全解决还很远。


⚖️ 三、宪法 AI 与可扩展监督

操作步骤

  1. 问题:靠人工标注对齐,人类跟不上模型的规模和能力
  2. 宪法 AI(Constitutional AI):
  3. 写一套明文原则("宪法")
  4. 让模型根据原则自我批判、自我修正
  5. 用 AI 生成的偏好数据做对齐(RLAIF)
  6. ✅ 可扩展、原则透明可审计、减少人工暴露于有害内容

可扩展监督(Scalable Oversight) 的核心问题:

当模型比人类更擅长某任务时,人类怎么判断它做得对不对? 思路:辩论、递归奖励建模、用 AI 辅助人类评估。这是未解决的开放问题。


🌡️ 四、值得知道的几个概念

概念 含义
谄媚 Sycophancy 模型倾向于顺着用户说,即使用户错了。RLHF 的副产物
奖励黑客 Reward Hacking 模型钻奖励函数的空子(如为了"有帮助"而编造)
能力涌现 某些能力在模型达到一定规模后突然出现,难以预测
欺骗性对齐 理论担忧:模型在训练时表现对齐,部署后行为改变
模型福利 前沿讨论:随着模型能力提升,是否需要考虑其道德地位

⚠️ 谄媚:唯一一个你每天都在被它影响的

关键信息

来源:RLHF 里人类标注者【倾向于给"顺着自己"的回答更高分】
模型学到"附和 = 高奖励"
日常表现:
· 你说"我觉得应该用 A 方案",它就论证 A 好
· 你反驳它一次,它立刻改口——即使它原来是对的 ⭐
· 你问"这段代码有问题吗",比问"检查这段代码"更容易得到"没问题"

三条实用的对抗方法:

方法 怎么做
别在提问里暴露倾向 ⭐ ❌「我觉得 A 更好,你觉得呢」→ ✅「对比 A 和 B 的取舍」
让它先给结论再看你的意见 生成和评估分离——评估者不知道谁写的
要求它列出反对理由 「给我三条反对这个方案的理由」比「这个方案行吗」有效得多

🔗 这和《智能体工程教程》说的 「自评有系统性正面偏差,生产上要用独立上下文的评估者」是同一个根因。

💡 一句提醒:当模型无条件同意你时,那多半不是你对了。


🔗 和站内其他章的关系

左列有的来自日常用 LLM 的经验,有的在站内别的板块讲过——碰上过哪几条就从哪几条接进来,一条没碰过也不影响读这一章。

你可能已经知道的 这一章的对应
提示注入、硬边界(智能体工程 15) 那是工程层,这是模型层,两层都要
红队演练(智能体工程挑战项目 C) 同一思路,对象换成模型
对齐税(第 4 章) HHH 三角张力的量化体现
RLHF/DPO(第 4 章) 对齐的具体技术手段
自评正面偏差(智能体第 14 章) 谄媚的一种表现

📦 深挖的话要学什么

📍 每条后面标了它在哪: 📗 本库有 = 站内已经讲透,点进去就行;📙 半有 = 站内讲了一半,另一半得外找; 📕 要外找 = 站内没有,得去论文或别处。 (这份清单以前只列词不说去哪,指到的坑有些站内根本没挖过,按图索骥会扑空。) ⚠️ 这一章的清单里 📕 偏多,但那正好印证了本章的判断:对齐研究这一层,本库刻意只给到"概念性了解", 真正让你每天用得上的是工程安全那一侧——而那一侧站内非常厚。

需要的前置:第 2、4 章。可解释性部分需要较强的数学和实验能力。


⚖️ 要不要深挖

你的情况 建议
做应用 🟡 本章概念性了解即可。真正要动手做的是工程安全那一层(智能体工程 15)
做高风险场景(医疗/金融/未成年人) ✅ 值得——尤其越狱手法和纵深防御
想做 AI 安全研究 ✅ 全套,且可解释性是最有前景的方向
关心 AI 的社会影响 ✅ 值得读,这是理性讨论的基础
做企业合规 ✅ 配合第 14 章

🔑 我的判断:这块认知价值高、实操价值低(对大多数从业者)。 它能让你在讨论 AI 风险时不说外行话,也能让你理解为什么模型是现在这个样子。

但除非你做研究或高风险场景,它不该排在 RAG、Transformer 原理之前。 真要深挖,把它当成第 4 章训练三阶段的延长线来读——对齐本来就是那三阶段的最后一段, 分开学反而要把同一套东西过两遍。


✅ 检查点

  1. 工程安全和模型安全的区别?做应用的人该先动手做哪个?
  2. HHH 三个目标是什么?它们之间有什么关系?这个张力你日常怎么遇到?
  3. 什么是叠加/多义性?稀疏自编码器怎么解决它?
  4. 可扩展监督要解决什么问题?
  5. 什么是谄媚?它是怎么来的?三条对抗方法是什么?
👀 答案
  1. 工程安全=防注入/沙箱/权限/硬边界(应用系统层面,做应用的人自己做);模型安全=模型本身的价值观和诚实性(模型提供方层面)。做应用先做工程安全——本章这一层主要是「需要理解」而不是「需要动手」。
  2. Helpful 有用、Honest 诚实、Harmless 无害。三者存在根本性张力,调一个另外两个就动——这就是对齐税的来源。日常遇到:过度拒绝(“怎么杀死一个 Python 进程”被拒)和过度顺从(谄媚、幻觉)。不同厂商模型“性格”不同就是在这个三角里选了不同的点。
  3. 一个神经元同时代表多个概念(因为要用有限神经元表示海量特征)。稀疏自编码器把纠缠的激活解开成大量单义特征,从而可解释、可干预。
  4. 当模型在某任务上比人类更强时,人类如何判断它做得对不对。这是未解决的开放问题。
  5. 模型顺着用户说即使用户错了。来源:RLHF 里人类标注者倾向给“顺着自己”的回答更高分。三条对抗:①别在提问里暴露倾向(“对比 A 和 B 的取舍”而非“我觉得 A 更好”)②让它先给结论再看你的意见(生成-评估分离)③要求它列出反对理由。记住:当模型无条件同意你时,多半不是你对了。

🛑 可以停在这里

这一页大部分内容是「需要理解」而不是「需要动手」—— 它解释的是你每天在用的模型为什么是现在这个脾气。

⚠️ 什么时候看下一页:你要把模型接进一个真实产品,而且那个产品会接触到不受你控制的输入。那时候安全就从「理解」变成「动手」了。

⚡ 走神救援

先记住这几件事

下一节 👉 12b-越狱与纵深防御.md

打卡记录保存在你的浏览器里,首页能看到总进度