Zero Trust for AI Agents(AI Agent 的零信任架构)
📄 来自 Claude 官方博客
- 原文标题
- Zero Trust for AI Agents(AI Agent 的零信任架构)
- 原文链接
- https://claude.com/blog/zero-trust-for-ai-agents
- 作者
- Anthropic(Claude Security 团队)
- 发布日期
- 2026-05-27
⚠️ 本页是原文的中文结构化整理笔记(保留架构、数据、案例、结论),并非逐字翻译。具体参数与功能名更新很快,落地前请点击上方链接核对原文。
🎯 一句话
零信任的核心假设是「边界内部同样不可信」。用在 Agent 上就是:不要因为它是你自己部署的,就默认它的每个请求都合法——因为它的行为可以被输入里的文字改写。
前沿 AI 同时加速攻防两端,部署自主 Agent 的组织面临前所未有的安全挑战。传统访问控制不够用——Agent 可能自主滥用合法权限。解法是把零信任架构(「什么都不信、一切都验证、假设已被攻破」)适配到 Agent 系统:加密身份、按任务限权、抗投毒记忆、AI 速度的防御运营。
加速问题
从漏洞发现到被利用的时间线急剧压缩——AI 模型现在能找出人类审查者多年未发现的严重漏洞。这种双刃剑效应同时作用于基础设施和 Agent 本身。
Agent 特有的风险
- 工具访问 + 自主决策
- 上下文持久化漏洞
- 多 Agent 协调风险
五大攻击向量
- 提示词注入(Prompt injection)
- 工具投毒(Tool poisoning)
- 身份与特权滥用
- 记忆投毒(Memory poisoning)
- 供应链攻击
零信任四原则(Agent 版)
- 加密身份根: Agent 需要可验证的、有加密锚定的身份
- 按任务最小特权: 权限狭窄地限定到具体操作
- 假设已被攻破: 架构从一开始就按「攻陷终会发生」设计
- 速度对等: 防御自动化必须匹配自主攻击的速度
三级成熟度框架
- 基础层(Foundation): 安全基本功
- 进阶层(Advanced): 增强控制
- 优化层(Optimized): AI 速度的防御运营
实施要点
- 八阶段实施流程:身份验证、访问限定、沙箱化、输入/输出控制、记忆保护等
- Agentic SOAR: 防御运营必须匹配 AI 加速的攻击者速度,需要规模化自动化
- 面向受监管行业(医疗、金融、政府)的合规对齐指引
结论
最适合部署 Agent 的组织,是那些在部署前就有扎实安全基本功以减少漏洞、并且从一开始就采用「假设被攻破」架构的组织。该框架为安全负责人构建企业级 Agent 系统提供了实用路径。
✅ 检查点
- 零信任的核心假设是什么?用在 Agent 上意味着什么?
- 为什么 Agent 特别需要零信任,而传统程序不那么需要?
- 最小权限原则在 Agent 场景该怎么落地?
👀 答案
- 核心假设是「网络边界内部同样不可信」,每个请求都要独立验证身份和权限。用在 Agent 上:不能因为 Agent 是自己部署的就信任它发出的每个调用,要像对待外部用户一样逐次鉴权。
- 因为传统程序的行为由代码决定,是固定的;而 Agent 的行为由它读到的内容决定——一封邮件、一个网页、一份文档里的文字,都可能改写它接下来要做什么(提示注入)。⭐ 「代码是可信的,数据是不可信的」这条传统假设,在 Agent 上失效了——因为对 Agent 来说,数据就是指令。
- ①按任务而不是按 Agent 授权——同一个 Agent 做不同任务时权限不同;②凭证短时效,用完即失效;③写操作和读操作分离,写操作走单独的审批或确认;④所有工具调用留审计日志,且日志里要能还原「它当时读到了什么」——否则事后无法判断是不是被注入了。
🛑 可以停在这里
⚡ 走神救援
⭐零信任 = 边界内部同样不可信,每个请求独立鉴权。用在 Agent 上:别因为是自己部署的就信任它的每个调用。⭐⭐Agent 特别需要它的原因:传统程序行为由代码决定(固定),而 Agent 的行为由它读到的内容决定——邮件/网页/文档里的文字都能改写它的下一步。「代码可信、数据不可信」这条传统假设在 Agent 上失效了,因为对 Agent 来说数据就是指令。最小权限落地四条:按任务而非按 Agent 授权、凭证短时效、读写分离(写操作单独确认)、审计日志要能还原「它当时读到了什么」(否则事后无法判断是否被注入)。