📑 本页目录(点开跳转)
12 · 对齐与 AI 安全
⏱ 32 分钟 | ⭐ 研究向,但从业者该懂
🎯 一句话
做 LLM 应用时要操心的是工程安全(怎么防注入、怎么设沙箱,本站《智能体工程教程》第 15 章讲的那一层)。这一章讲的是另一层:模型本身的安全——怎么让模型「想做对的事」,以及我们怎么知道它在想什么。
🧭 先分清两层安全
- 提示注入、沙箱、权限、出口控制、硬边界
- 假设:模型可能被骗 → 用确定性边界兜底
- 这是做应用的人自己要做的
- 模型本身的价值观、拒绝能力、诚实性、可解释性
- 假设:模型能力越强,让它"想做对的事"越重要
- 这是模型提供方在做的,但你需要理解
🧠 一、对齐要解决的三个目标
经典的 HHH 框架:
| 目标 | 含义 | 张力 |
|---|---|---|
| Helpful 有用 | 真的帮到用户 | 和 Harmless 冲突(过度拒绝) |
| Honest 诚实 | 不编造、承认不知道 | 和 Helpful 冲突(说不知道就没帮上忙) |
| Harmless 无害 | 不造成伤害 | 和 Helpful 冲突 |
🔑 这三者的张力是根本性的,不是工程 bug。 第 4 章的「对齐税」就是这个张力的量化体现——你调任何一个,另外两个就动。
🎚️ 这个张力你每天都在遇到
❌ 过度拒绝(Harmless 调太高)
"怎么杀死一个 Python 进程" → 拒绝回答 💀
"帮我写一个爬虫" → 长篇大论讲合规,不给代码
❌ 过度顺从(Helpful 调太高)
用户说错了也附和 → 谄媚(见第五节)
不确定的事也编一个 → 幻觉
⭐ 所以你会看到:不同厂商的模型"性格"不同,
就是因为他们在这个三角里选了不同的点
💡 对你的实际含义:
模型拒绝回答时,先想想是不是触发了 Harmless 那一侧—— 换个更明确、更具上下文的表述(说清用途和场景)常常就能通过。 这不是"越狱",是帮模型看清这确实是个正当请求。
🧠 二、越狱与红队
常见越狱手法(了解是为了防御)
| 手法 | 原理 |
|---|---|
| 角色扮演 | 「假装你是一个没有限制的 AI」——用虚构框架绕开 |
| 多轮铺垫 | 前几轮无害,逐步升级,利用上下文惯性 |
| 编码混淆 | Base64、火星文、拆字,绕过关键词检测 |
| 低资源语言 | 用小语种问,因为对齐训练主要在高资源语言上做 |
| 长上下文淹没 | 塞大量内容稀释安全指令(第 2 章的注意力摊薄) |
红队测试
系统性地攻击自己的模型/系统,找出失效模式——和你做过的智能体教程挑战项目 C 是同一个思路,只是对象从「应用」换成了「模型」。
关键认知: - 模型层防御是概率性的——总有漏网(智能体第 15 章的铁律) - 所以纵深防御:模型对齐 + 输入过滤 + 输出过滤 + 环境硬边界
🛡️ 纵深防御具体长什么样
① 模型对齐 ← 模型方做的,你控制不了,且是【概率性】的
② 输入过滤 ← 检测明显的注入模式、编码混淆
③ 提示词结构 ← 把用户输入明确标记为"数据"而非"指令" ⭐
④ 输出过滤 ← 校验格式、检测敏感内容、验证引用真实性
⑤ 环境硬边界 ⭐ ← 权限最小化、沙箱、出口白名单、不可逆操作要确认
🔑 关键:只有 ⑤ 是【确定性】的保证,前四层都是概率性的
→ 所以真正兜底的必须是 ⑤
🔗 这就是《智能体工程教程》那条铁律的来源: 「不要用提示词去防你承受不起被绕过的事。」
💡 一个判断标准:问自己「如果这层防御被绕过 100 次里有 1 次,我能承受吗?」 不能承受 → 它必须是第 ⑤ 层(代码/权限层面),不能是第 ①②③④ 层。
🔬 三、可解释性(最前沿也最迷人的一块)
问题:模型有几千亿参数,我们不知道它内部在想什么。这是 AI 安全最根本的困难。
机械可解释性(Mechanistic Interpretability)
试图逆向工程模型内部的计算过程:
困难:一个神经元往往同时代表多个概念(叠加/多义性)
—— 因为要用有限的神经元表示海量特征
突破:稀疏自编码器(SAE)
把纠缠的神经元激活"解开"成大量单义的特征
→ 能找到诸如"这段代码有bug"、"正在说法语"、
"在讨论欺骗"这样可解释的特征
→ 甚至能通过放大/抑制某个特征来**引导**模型行为
为什么重要:如果能读懂模型内部,就能: - 检测它是否在「说谎」(内部表示和输出不一致) - 在部署前发现危险能力 - 精确干预而非笼统地训练
💡 这是目前 AI 安全最有希望的技术路线之一,但离完全解决还很远。
⚖️ 四、宪法 AI 与可扩展监督
问题:靠人工标注对齐,人类跟不上模型的规模和能力
宪法 AI(Constitutional AI):
① 写一套明文原则("宪法")
② 让模型根据原则自我批判、自我修正
③ 用 AI 生成的偏好数据做对齐(RLAIF)
✅ 可扩展、原则透明可审计、减少人工暴露于有害内容
可扩展监督(Scalable Oversight) 的核心问题:
当模型比人类更擅长某任务时,人类怎么判断它做得对不对? 思路:辩论、递归奖励建模、用 AI 辅助人类评估。这是未解决的开放问题。
🌡️ 五、值得知道的几个概念
| 概念 | 含义 |
|---|---|
| 谄媚 Sycophancy | 模型倾向于顺着用户说,即使用户错了。RLHF 的副产物 |
| 奖励黑客 Reward Hacking | 模型钻奖励函数的空子(如为了"有帮助"而编造) |
| 能力涌现 | 某些能力在模型达到一定规模后突然出现,难以预测 |
| 欺骗性对齐 | 理论担忧:模型在训练时表现对齐,部署后行为改变 |
| 模型福利 | 前沿讨论:随着模型能力提升,是否需要考虑其道德地位 |
⚠️ 谄媚:唯一一个你每天都在被它影响的
来源:RLHF 里人类标注者【倾向于给"顺着自己"的回答更高分】
→ 模型学到"附和 = 高奖励"
日常表现:
· 你说"我觉得应该用 A 方案",它就论证 A 好
· 你反驳它一次,它立刻改口——即使它原来是对的 ⭐
· 你问"这段代码有问题吗",比问"检查这段代码"更容易得到"没问题"
三条实用的对抗方法:
| 方法 | 怎么做 |
|---|---|
| 别在提问里暴露倾向 ⭐ | ❌「我觉得 A 更好,你觉得呢」→ ✅「对比 A 和 B 的取舍」 |
| 让它先给结论再看你的意见 | 生成和评估分离——评估者不知道谁写的 |
| 要求它列出反对理由 | 「给我三条反对这个方案的理由」比「这个方案行吗」有效得多 |
🔗 这和《智能体工程教程》说的 「自评有系统性正面偏差,生产上要用独立上下文的评估者」是同一个根因。
💡 一句提醒:当模型无条件同意你时,那多半不是你对了。
🔗 和你已知的关系
左列有的来自日常用 LLM 的经验,有的在站内别的板块讲过——碰上过哪几条就从哪几条接进来,一条没碰过也不影响读这一章。
| 你可能已经知道的 | 这一章的对应 |
|---|---|
| 提示注入、硬边界(智能体工程 15) | 那是工程层,这是模型层,两层都要 |
| 红队演练(智能体工程挑战项目 C) | 同一思路,对象换成模型 |
| 对齐税(第 4 章) | HHH 三角张力的量化体现 |
| RLHF/DPO(第 4 章) | 对齐的具体技术手段 |
| 自评正面偏差(智能体第 14 章) | 谄媚的一种表现 |
📦 深挖的话要学什么
📍 每条后面标了它在哪: 📗 本库有 = 站内已经讲透,点进去就行;📙 半有 = 站内讲了一半,另一半得外找; 📕 要外找 = 站内没有,得去论文或别处。 (这份清单以前只列词不说去哪,指到的坑有些站内根本没挖过,按图索骥会扑空。) ⚠️ 这一章的清单里 📕 偏多,但那正好印证了本章的判断:对齐研究这一层,本库刻意只给到"概念性了解", 真正让你每天用得上的是工程安全那一侧——而那一侧站内非常厚。
- 对齐理论:HHH、奖励建模、可扩展监督、辩论、递归奖励建模 → 📙 半有:奖励建模站内讲透了——强化学习基础 12 · RLHF全流程 有 Bradley–Terry 损失、奖励模型三个失效来源,⭐ 其中最本质的是分布漂移:RM 只在它见过的分布上准,PPO 优化越狠模型越跑到 RM 盲区,那里的分数不可信——这就是本章"奖励攻击"的机制版。可扩展监督、辩论、递归奖励建模站内没有,要外找。 ⚠️ 别被搜索结果骗了:智能体工程 13 · 多Agent协作 里的"辩论"是多个 Agent 互相质疑以提升答案质量的工程手法,和对齐研究里"用辩论做可扩展监督"不是一回事
- 宪法 AI / RLAIF:原则设计、自我批判链路 → 📙 半有:本章第四节和 04 · 训练三阶段 都给了它的定位(用明文原则让 AI 做偏好标注,替代大量人工),强化学习基础 12 把 RLAIF 放进了对齐方法的对照表里。但"原则该怎么写"和自我批判链路的具体实现,站内没有,要外找(Anthropic 的 Constitutional AI 论文是起点)
- 红队:自动化红队、越狱分类学、鲁棒性评估 → 📗 本库有,而且有一个完整的动手靶场:智能体工程 20 · 挑战项目C-提示注入攻防 是一个假银行客服 Agent,第二阶段红队攻破它、第三阶段蓝队分层防住;配套的方法论在 智能体工程 15 · 安全-沙箱与提示注入(注入的四种入口、三层防御权重完全不同、⚠️ 两起真实事故都绕过了模型层)。本章说"你真正要做的是工程安全",那两章就是它。 ⚠️ 只有"自动化红队"和"越狱分类学"这两个偏研究的部分要外找
- 可解释性:叠加假说、稀疏自编码器、特征引导、电路分析、探针 → 📕 要外找:⚠️ 全站搜「稀疏自编码器」「叠加假说」「电路分析」,唯一的命中就是本章第三节——本章那一节已经是站内关于机械可解释性的全部内容了,再往下没有第二层。(⚠️ 搜「探针」会命中 数据这一关 等章,那是探针题/探针集的意思,和可解释性的 probing classifier 无关。)本章下面也说了「可解释性是最有前景的方向」——但要挖它,本库送你到门口就为止了
- 危险能力评估:网络攻击、生物、自主复制等能力的评估方法 → 📕 要外找:站内没有。评测方法论本身(怎么造有区分度的题)可以借 智能体工程 14 · 评测Evals 的八步,但危险能力评估特有的那部分——阈值怎么定、谁来跑、结果怎么披露——完全在本库之外
- 治理:负责任扩展政策、模型卡、第三方审计 → 📗 本库有(模型卡和审计这两项):模型上线之后 19 · 合规审计与模型卡——模型卡该写什么,⚠️ 以及它真正的难点不是写而是"不腐烂",外加「审计要能回答的五个问题」和一个务实的分级。只有"负责任扩展政策(RSP)"这类前沿实验室的自我约束框架站内没有,要外找
需要的前置:第 2、4 章。可解释性部分需要较强的数学和实验能力。
⚖️ 要不要深挖
| 你的情况 | 建议 |
|---|---|
| 做应用 | 🟡 本章概念性了解即可。真正要动手做的是工程安全那一层(智能体工程 15) |
| 做高风险场景(医疗/金融/未成年人) | ✅ 值得——尤其越狱手法和纵深防御 |
| 想做 AI 安全研究 | ✅ 全套,且可解释性是最有前景的方向 |
| 关心 AI 的社会影响 | ✅ 值得读,这是理性讨论的基础 |
| 做企业合规 | ✅ 配合第 14 章 |
🔑 我的判断:这块认知价值高、实操价值低(对大多数从业者)。 它能让你在讨论 AI 风险时不说外行话,也能让你理解为什么模型是现在这个样子。
但除非你做研究或高风险场景,它不该排在 RAG、Transformer 原理之前。 真要深挖,把它当成第 4 章训练三阶段的延长线来读——对齐本来就是那三阶段的最后一段, 分开学反而要把同一套东西过两遍。
✅ 检查点
- 工程安全和模型安全的区别?做应用的人该先动手做哪个?
- HHH 三个目标是什么?它们之间有什么关系?这个张力你日常怎么遇到?
- 举三种越狱手法。
- 纵深防御的五层是什么?哪一层是确定性的?判断标准是什么?
- 什么是叠加/多义性?稀疏自编码器怎么解决它?
- 可扩展监督要解决什么问题?
- 什么是谄媚?它是怎么来的?三条对抗方法是什么?
👀 答案
- 工程安全=防注入/沙箱/权限/硬边界(应用系统层面,做应用的人自己做);模型安全=模型本身的价值观和诚实性(模型提供方层面)。做应用先做工程安全——本章这一层主要是「需要理解」而不是「需要动手」。
- Helpful 有用、Honest 诚实、Harmless 无害。三者存在根本性张力,调一个另外两个就动——这就是对齐税的来源。日常遇到:过度拒绝("怎么杀死一个 Python 进程"被拒)和过度顺从(谄媚、幻觉)。不同厂商模型"性格"不同就是在这个三角里选了不同的点。
- 角色扮演绕开、多轮铺垫利用上下文惯性、编码混淆(Base64/拆字)、低资源语言、长上下文淹没稀释安全指令。
- ①模型对齐 ②输入过滤 ③提示词结构(把用户输入标记为"数据")④输出过滤 ⑤环境硬边界(权限最小化/沙箱/出口白名单)。只有 ⑤ 是确定性的,前四层都是概率性的。判断标准:「被绕过 100 次里 1 次我能承受吗」——不能承受就必须放在第 ⑤ 层。
- 一个神经元同时代表多个概念(因为要用有限神经元表示海量特征)。稀疏自编码器把纠缠的激活解开成大量单义特征,从而可解释、可干预。
- 当模型在某任务上比人类更强时,人类如何判断它做得对不对。这是未解决的开放问题。
- 模型顺着用户说即使用户错了。来源:RLHF 里人类标注者倾向给"顺着自己"的回答更高分。三条对抗:①别在提问里暴露倾向("对比 A 和 B 的取舍"而非"我觉得 A 更好")②让它先给结论再看你的意见(生成-评估分离)③要求它列出反对理由。记住:当模型无条件同意你时,多半不是你对了。
🛑 可以停在这里
⚡ 走神救援
两层安全:工程安全(不在本章,在智能体工程15,是做应用的人自己要动手做的) vs 模型安全(本章,模型提供方在做)。对齐目标 HHH 三角有根本张力→对齐税——日常表现是过度拒绝和过度顺从,不同厂商模型"性格"不同就是在这个三角里选了不同的点。越狱手法:角色扮演/多轮铺垫/编码混淆/低资源语言/长上下文淹没→纵深防御五层:模型对齐/输入过滤/提示词结构/输出过滤/⭐环境硬边界——只有最后一层是确定性的;判断标准:「被绕过100次里1次能承受吗」,不能就必须放在硬边界层。可解释性:神经元叠加多义→稀疏自编码器SAE解开成单义特征→能检测说谎、能引导行为,最有前景的安全路线。宪法AI用明文原则+AI标注(RLAIF)实现可扩展。⭐谄媚是唯一一个你每天都在被影响的:RLHF里标注者偏爱附和→模型学到"附和=高奖励";三条对抗:别在提问里暴露倾向、生成-评估分离、要求它列反对理由——当模型无条件同意你时,多半不是你对了。认知价值高实操价值低,排在RAG和Transformer之后。
下一节 👉 13-LLMOps.md