🏠 总目录 📚 资料库智能体安全

Zero Trust for AI Agents(AI Agent 的零信任架构)

📄 来自 Claude 官方博客
原文标题
Zero Trust for AI Agents(AI Agent 的零信任架构)
原文链接
https://claude.com/blog/zero-trust-for-ai-agents
作者
Anthropic(Claude Security 团队)
发布日期
2026-05-27
⚠️ 本页是原文的中文结构化整理笔记(保留架构、数据、案例、结论),并非逐字翻译。具体参数与功能名更新很快,落地前请点击上方链接核对原文。

10 分钟 | 🔐 把 Agent 当成不可信的内部用户

🎯 一句话

零信任的核心假设是「边界内部同样不可信」。用在 Agent 上就是:不要因为它是你自己部署的,就默认它的每个请求都合法——因为它的行为可以被输入里的文字改写。

📑 本页目录

前沿 AI 同时加速攻防两端,部署自主 Agent 的组织面临前所未有的安全挑战。传统访问控制不够用——Agent 可能自主滥用合法权限。解法是把零信任架构(「什么都不信、一切都验证、假设已被攻破」)适配到 Agent 系统:加密身份、按任务限权、抗投毒记忆、AI 速度的防御运营。

加速问题

从漏洞发现到被利用的时间线急剧压缩——AI 模型现在能找出人类审查者多年未发现的严重漏洞。这种双刃剑效应同时作用于基础设施和 Agent 本身。

Agent 特有的风险

五大攻击向量

  1. 提示词注入(Prompt injection)
  2. 工具投毒(Tool poisoning)
  3. 身份与特权滥用
  4. 记忆投毒(Memory poisoning)
  5. 供应链攻击

零信任四原则(Agent 版)

  1. 加密身份根: Agent 需要可验证的、有加密锚定的身份
  2. 按任务最小特权: 权限狭窄地限定到具体操作
  3. 假设已被攻破: 架构从一开始就按「攻陷终会发生」设计
  4. 速度对等: 防御自动化必须匹配自主攻击的速度

三级成熟度框架

  1. 基础层(Foundation): 安全基本功
  2. 进阶层(Advanced): 增强控制
  3. 优化层(Optimized): AI 速度的防御运营

实施要点

结论

最适合部署 Agent 的组织,是那些在部署前就有扎实安全基本功以减少漏洞、并且从一开始就采用「假设被攻破」架构的组织。该框架为安全负责人构建企业级 Agent 系统提供了实用路径。


✅ 检查点

  1. 零信任的核心假设是什么?用在 Agent 上意味着什么?
  2. 为什么 Agent 特别需要零信任,而传统程序不那么需要?
  3. 最小权限原则在 Agent 场景该怎么落地?
👀 答案
  1. 核心假设是「网络边界内部同样不可信」,每个请求都要独立验证身份和权限。用在 Agent 上:不能因为 Agent 是自己部署的就信任它发出的每个调用,要像对待外部用户一样逐次鉴权。
  2. 因为传统程序的行为由代码决定,是固定的;而 Agent 的行为由它读到的内容决定——一封邮件、一个网页、一份文档里的文字,都可能改写它接下来要做什么(提示注入)。⭐ 「代码是可信的,数据是不可信的」这条传统假设,在 Agent 上失效了——因为对 Agent 来说,数据就是指令。
  3. 按任务而不是按 Agent 授权——同一个 Agent 做不同任务时权限不同;②凭证短时效,用完即失效;③写操作和读操作分离,写操作走单独的审批或确认;④所有工具调用留审计日志,且日志里要能还原「它当时读到了什么」——否则事后无法判断是不是被注入了。

🛑 可以停在这里

走神救援
零信任 = 边界内部同样不可信,每个请求独立鉴权。用在 Agent 上:别因为是自己部署的就信任它的每个调用。⭐⭐Agent 特别需要它的原因:传统程序行为由代码决定(固定),而 Agent 的行为由它读到的内容决定——邮件/网页/文档里的文字都能改写它的下一步。「代码可信、数据不可信」这条传统假设在 Agent 上失效了,因为对 Agent 来说数据就是指令。最小权限落地四条:按任务而非按 Agent 授权、凭证短时效、读写分离(写操作单独确认)审计日志要能还原「它当时读到了什么」(否则事后无法判断是否被注入)。