🏠 总目录📚 本教程 12 · 对齐与 AI 安全
📑 本页目录(点开跳转)

12 · 对齐与 AI 安全

32 分钟 | ⭐ 研究向,但从业者该懂


🎯 一句话

做 LLM 应用时要操心的是工程安全(怎么防注入、怎么设沙箱,本站《智能体工程教程》第 15 章讲的那一层)。这一章讲的是另一层:模型本身的安全——怎么让模型「想做对的事」,以及我们怎么知道它在想什么


🧭 先分清两层安全

【工程安全】—— 不在本章(智能体教程第 15 章)
  • 提示注入、沙箱、权限、出口控制、硬边界
  • 假设:模型可能被骗 → 用确定性边界兜底
  • 这是做应用的人自己要做的
【模型安全 / 对齐】—— 本章
  • 模型本身的价值观、拒绝能力、诚实性、可解释性
  • 假设:模型能力越强,让它"想做对的事"越重要
  • 这是模型提供方在做的,但你需要理解

🧠 一、对齐要解决的三个目标

经典的 HHH 框架

目标 含义 张力
Helpful 有用 真的帮到用户 和 Harmless 冲突(过度拒绝)
Honest 诚实 不编造、承认不知道 和 Helpful 冲突(说不知道就没帮上忙)
Harmless 无害 不造成伤害 和 Helpful 冲突

🔑 这三者的张力是根本性的,不是工程 bug。 第 4 章的「对齐税」就是这个张力的量化体现——你调任何一个,另外两个就动。

🎚️ 这个张力你每天都在遇到

   ❌ 过度拒绝(Harmless 调太高)
      "怎么杀死一个 Python 进程" → 拒绝回答 💀
      "帮我写一个爬虫" → 长篇大论讲合规,不给代码

   ❌ 过度顺从(Helpful 调太高)
      用户说错了也附和 → 谄媚(见第五节)
      不确定的事也编一个 → 幻觉

   ⭐ 所以你会看到:不同厂商的模型"性格"不同,
      就是因为他们在这个三角里选了不同的点

💡 对你的实际含义

模型拒绝回答时,先想想是不是触发了 Harmless 那一侧—— 换个更明确、更具上下文的表述(说清用途和场景)常常就能通过。 这不是"越狱",是帮模型看清这确实是个正当请求


🧠 二、越狱与红队

常见越狱手法(了解是为了防御)

手法 原理
角色扮演 「假装你是一个没有限制的 AI」——用虚构框架绕开
多轮铺垫 前几轮无害,逐步升级,利用上下文惯性
编码混淆 Base64、火星文、拆字,绕过关键词检测
低资源语言 用小语种问,因为对齐训练主要在高资源语言上做
长上下文淹没 塞大量内容稀释安全指令(第 2 章的注意力摊薄)

红队测试

系统性地攻击自己的模型/系统,找出失效模式——和你做过的智能体教程挑战项目 C 是同一个思路,只是对象从「应用」换成了「模型」。

关键认知: - 模型层防御是概率性的——总有漏网(智能体第 15 章的铁律) - 所以纵深防御:模型对齐 + 输入过滤 + 输出过滤 + 环境硬边界

🛡️ 纵深防御具体长什么样

   ① 模型对齐        ← 模型方做的,你控制不了,且是【概率性】的
   ② 输入过滤        ← 检测明显的注入模式、编码混淆
   ③ 提示词结构      ← 把用户输入明确标记为"数据"而非"指令" ⭐
   ④ 输出过滤        ← 校验格式、检测敏感内容、验证引用真实性
   ⑤ 环境硬边界 ⭐   ← 权限最小化、沙箱、出口白名单、不可逆操作要确认

   🔑 关键:只有 ⑤ 是【确定性】的保证,前四层都是概率性的
      → 所以真正兜底的必须是 ⑤

🔗 这就是《智能体工程教程》那条铁律的来源「不要用提示词去防你承受不起被绕过的事。」

💡 一个判断标准:问自己「如果这层防御被绕过 100 次里有 1 次,我能承受吗?」 不能承受 → 它必须是第 ⑤ 层(代码/权限层面),不能是第 ①②③④ 层。


🔬 三、可解释性(最前沿也最迷人的一块)

问题:模型有几千亿参数,我们不知道它内部在想什么。这是 AI 安全最根本的困难。

机械可解释性(Mechanistic Interpretability)

试图逆向工程模型内部的计算过程:

   困难:一个神经元往往同时代表多个概念(叠加/多义性)
        —— 因为要用有限的神经元表示海量特征

   突破:稀疏自编码器(SAE)
        把纠缠的神经元激活"解开"成大量单义的特征
        → 能找到诸如"这段代码有bug"、"正在说法语"、
          "在讨论欺骗"这样可解释的特征
        → 甚至能通过放大/抑制某个特征来**引导**模型行为

为什么重要:如果能读懂模型内部,就能: - 检测它是否在「说谎」(内部表示和输出不一致) - 在部署前发现危险能力 - 精确干预而非笼统地训练

💡 这是目前 AI 安全最有希望的技术路线之一,但离完全解决还很远。


⚖️ 四、宪法 AI 与可扩展监督

   问题:靠人工标注对齐,人类跟不上模型的规模和能力

   宪法 AI(Constitutional AI):
   ① 写一套明文原则("宪法")
   ② 让模型根据原则自我批判、自我修正
   ③ 用 AI 生成的偏好数据做对齐(RLAIF)

   ✅ 可扩展、原则透明可审计、减少人工暴露于有害内容

可扩展监督(Scalable Oversight) 的核心问题:

当模型比人类更擅长某任务时,人类怎么判断它做得对不对? 思路:辩论、递归奖励建模、用 AI 辅助人类评估。这是未解决的开放问题。


🌡️ 五、值得知道的几个概念

概念 含义
谄媚 Sycophancy 模型倾向于顺着用户说,即使用户错了。RLHF 的副产物
奖励黑客 Reward Hacking 模型钻奖励函数的空子(如为了"有帮助"而编造)
能力涌现 某些能力在模型达到一定规模后突然出现,难以预测
欺骗性对齐 理论担忧:模型在训练时表现对齐,部署后行为改变
模型福利 前沿讨论:随着模型能力提升,是否需要考虑其道德地位

⚠️ 谄媚:唯一一个你每天都在被它影响的

   来源:RLHF 里人类标注者【倾向于给"顺着自己"的回答更高分】
        → 模型学到"附和 = 高奖励"

   日常表现:
   · 你说"我觉得应该用 A 方案",它就论证 A 好
   · 你反驳它一次,它立刻改口——即使它原来是对的 ⭐
   · 你问"这段代码有问题吗",比问"检查这段代码"更容易得到"没问题"

三条实用的对抗方法

方法 怎么做
别在提问里暴露倾向 ❌「我觉得 A 更好,你觉得呢」→ ✅「对比 A 和 B 的取舍」
让它先给结论再看你的意见 生成和评估分离——评估者不知道谁写的
要求它列出反对理由 「给我三条反对这个方案的理由」比「这个方案行吗」有效得多

🔗 这和《智能体工程教程》说的 「自评有系统性正面偏差,生产上要用独立上下文的评估者」是同一个根因。

💡 一句提醒当模型无条件同意你时,那多半不是你对了。


🔗 和你已知的关系

左列有的来自日常用 LLM 的经验,有的在站内别的板块讲过——碰上过哪几条就从哪几条接进来,一条没碰过也不影响读这一章

你可能已经知道的 这一章的对应
提示注入、硬边界(智能体工程 15) 那是工程层,这是模型层,两层都要
红队演练(智能体工程挑战项目 C) 同一思路,对象换成模型
对齐税(第 4 章) HHH 三角张力的量化体现
RLHF/DPO(第 4 章) 对齐的具体技术手段
自评正面偏差(智能体第 14 章) 谄媚的一种表现

📦 深挖的话要学什么

📍 每条后面标了它在哪: 📗 本库有 = 站内已经讲透,点进去就行;📙 半有 = 站内讲了一半,另一半得外找; 📕 要外找 = 站内没有,得去论文或别处。 (这份清单以前只列词不说去哪,指到的坑有些站内根本没挖过,按图索骥会扑空。) ⚠️ 这一章的清单里 📕 偏多,但那正好印证了本章的判断:对齐研究这一层,本库刻意只给到"概念性了解", 真正让你每天用得上的是工程安全那一侧——而那一侧站内非常厚。

需要的前置:第 2、4 章。可解释性部分需要较强的数学和实验能力。


⚖️ 要不要深挖

你的情况 建议
做应用 🟡 本章概念性了解即可。真正要动手做的是工程安全那一层(智能体工程 15
做高风险场景(医疗/金融/未成年人) ✅ 值得——尤其越狱手法和纵深防御
想做 AI 安全研究 ✅ 全套,且可解释性是最有前景的方向
关心 AI 的社会影响 ✅ 值得读,这是理性讨论的基础
做企业合规 ✅ 配合第 14 章

🔑 我的判断:这块认知价值高、实操价值低(对大多数从业者)。 它能让你在讨论 AI 风险时不说外行话,也能让你理解为什么模型是现在这个样子。

但除非你做研究或高风险场景,它不该排在 RAG、Transformer 原理之前真要深挖,把它当成第 4 章训练三阶段的延长线来读——对齐本来就是那三阶段的最后一段, 分开学反而要把同一套东西过两遍。


✅ 检查点

  1. 工程安全和模型安全的区别?做应用的人该先动手做哪个?
  2. HHH 三个目标是什么?它们之间有什么关系?这个张力你日常怎么遇到?
  3. 举三种越狱手法。
  4. 纵深防御的五层是什么?哪一层是确定性的?判断标准是什么?
  5. 什么是叠加/多义性?稀疏自编码器怎么解决它?
  6. 可扩展监督要解决什么问题?
  7. 什么是谄媚?它是怎么来的?三条对抗方法是什么?
👀 答案
  1. 工程安全=防注入/沙箱/权限/硬边界(应用系统层面,做应用的人自己做);模型安全=模型本身的价值观和诚实性(模型提供方层面)。做应用先做工程安全——本章这一层主要是「需要理解」而不是「需要动手」。
  2. Helpful 有用、Honest 诚实、Harmless 无害。三者存在根本性张力,调一个另外两个就动——这就是对齐税的来源。日常遇到:过度拒绝("怎么杀死一个 Python 进程"被拒)和过度顺从(谄媚、幻觉)。不同厂商模型"性格"不同就是在这个三角里选了不同的点。
  3. 角色扮演绕开、多轮铺垫利用上下文惯性、编码混淆(Base64/拆字)、低资源语言、长上下文淹没稀释安全指令。
  4. ①模型对齐 ②输入过滤 ③提示词结构(把用户输入标记为"数据")④输出过滤 ⑤环境硬边界(权限最小化/沙箱/出口白名单)。只有 ⑤ 是确定性的,前四层都是概率性的。判断标准:「被绕过 100 次里 1 次我能承受吗」——不能承受就必须放在第 ⑤ 层。
  5. 一个神经元同时代表多个概念(因为要用有限神经元表示海量特征)。稀疏自编码器把纠缠的激活解开成大量单义特征,从而可解释、可干预。
  6. 当模型在某任务上比人类更强时,人类如何判断它做得对不对。这是未解决的开放问题。
  7. 模型顺着用户说即使用户错了。来源:RLHF 里人类标注者倾向给"顺着自己"的回答更高分。三条对抗:①别在提问里暴露倾向("对比 A 和 B 的取舍"而非"我觉得 A 更好")②让它先给结论再看你的意见(生成-评估分离)③要求它列出反对理由。记住:当模型无条件同意你时,多半不是你对了。

🛑 可以停在这里

走神救援

两层安全:工程安全(不在本章,在智能体工程15,是做应用的人自己要动手做的) vs 模型安全(本章,模型提供方在做)。对齐目标 HHH 三角有根本张力→对齐税——日常表现是过度拒绝过度顺从,不同厂商模型"性格"不同就是在这个三角里选了不同的点。越狱手法:角色扮演/多轮铺垫/编码混淆/低资源语言/长上下文淹没→纵深防御五层:模型对齐/输入过滤/提示词结构/输出过滤/⭐环境硬边界——只有最后一层是确定性的;判断标准:「被绕过100次里1次能承受吗」,不能就必须放在硬边界层。可解释性:神经元叠加多义→稀疏自编码器SAE解开成单义特征→能检测说谎、能引导行为,最有前景的安全路线。宪法AI用明文原则+AI标注(RLAIF)实现可扩展。⭐谄媚是唯一一个你每天都在被影响的:RLHF里标注者偏爱附和→模型学到"附和=高奖励";三条对抗:别在提问里暴露倾向、生成-评估分离、要求它列反对理由——当模型无条件同意你时,多半不是你对了。认知价值高实操价值低,排在RAG和Transformer之后。

下一节 👉 13-LLMOps.md

打卡记录保存在你的浏览器里,首页能看到总进度