附录 A · 术语速查卡
📌 用法:看到不懂的词
Ctrl+F搜。不要通读。
🧱 基础概念
| 术语 | 英文 | 人话 |
|---|---|---|
| Agent | Agent | 模型 + 工具 + 循环。决策权在模型,这是它和普通程序的区别 |
| 工作流 | Workflow | 路径预先写死在代码里,模型只填空。可预测、便宜 |
| 循环 | Agent Loop | 发历史→模型决定→执行工具→回填→再发。Agent 的心跳 |
| 上下文 | Context | 每轮发给模型的全部文字。模型的整个世界 |
| 上下文窗口 | Context Window | 上下文的容量上限。是上限不是工作区 |
| token | token | 模型处理文本的最小单位,约等于 0.75 个英文词 / 1 个汉字多 |
| 系统提示词 | System Prompt | Agent 的宪法:角色、环境、流程、硬规则 |
| effort | effort | 投入的彻底程度(读多少、验证多少),和模型能力是两个独立旋钮 |
🧠 上下文工程
| 术语 | 英文 | 人话 |
|---|---|---|
| 上下文腐烂 | Context Rot | token 越多,模型用其中信息的能力越差。渐进式劣化,不是到上限才发生 ⭐ |
| 注意力预算 | Attention Budget | 把上下文当有限的注意力资源,不是硬盘 |
| 压缩 | Compaction | 历史对话总结成摘要,腾出空间。摘要必须保留关键事实 |
| 渐进式披露 | Progressive Disclosure | 不预载,需要时才取。全领域最重要的模式 ⭐ |
| 即时检索 | Just-in-Time Retrieval | 用时再查,而不是先把资料全塞进去 |
| 外置记忆 | External Memory | 状态写文件(JSON 比 MD 更不容易被模型改坏) |
| 提示缓存 | Prompt Caching | 稳定内容放前面可被缓存复用,省钱省延迟。中途换模型会失效 |
🗃️ 记忆
📌 这一组全部出自 04b · Agent 记忆——分不清是哪一层,就会用错技术。
| 术语 | 英文 | 人话 |
|---|---|---|
| 短期记忆 | Short-term Memory | 当前会话的 messages 数组本身。免费自动,不需要你设计,你只需控制它的体积 |
| 工作记忆 | Working Memory | 当前任务的中间状态(做到哪了、试过什么不行),存在上下文之外的 progress.json / todo.json。⭐ 最常被跳过的一层——很多人直奔长期记忆,做出一个记得住用户是左撇子、却记不住自己十分钟前试过什么的 Agent。任务结束就该归档,不该混进长期记忆 |
| 长期记忆 | Long-term Memory | 跨会话的稳定事实与偏好,三类:关于用户 / 关于世界 / ⭐ 关于自己(Agent 踩出来的操作经验)。坏掉的样子:把一次性的东西记成永久偏好(说了一次「这次简短点」,从此半年惜字如金) |
| 情景记忆 | Episodic Memory | 带时间戳的事件日志,只追加不可改写。⭐ 和长期记忆的分工:情景记忆记「发生过什么」,长期记忆记「现在成立什么」;情景是原料,长期是从原料提炼的结论 |
| Memory vs RAG | — | ⭐ 检索技术可以完全一样,治理规则完全不一样。 RAG 是别人写的只读语料,一条错了只错这一次;Memory 是 Agent 自己在交互中写的可写状态,一条错了会错到你手动删掉为止。真正的新问题全在写入侧 |
| 写入判据 | — | 一条内容够不够格进长期记忆的三条门槛(要同时满足)。⚠️ 从工具返回和网页内容里学到的东西不该有资格直接写进去——否则一次提示注入会变成持久化后门(第 15 章) |
| 遗忘 / 冲突裁决 | Forgetting / Conflict Resolution | 长上下文能让 Agent「不忘」,不能让它「忘掉该忘的」。⭐ 记忆系统的价值有一半在删除权。新旧矛盾时谁赢、过期怎么判,是 Memory 的 CRUD 里最难的那部分(Update) |
🔧 工具与接口
| 术语 | 英文 | 人话 |
|---|---|---|
| 工具 | Tool | 模型能调用的函数 + 一段给它看的说明书 |
| ACI | Agent-Computer Interface | 给模型用的界面。像做 UI 一样认真做 ⭐ |
| 工具调用 | Tool Use / Function Calling | 模型输出结构化的「调用 X,参数 Y」 |
| 防呆 | Poka-yoke | 让错误用法在结构上不可能(强制绝对路径、枚举参数) |
| 命名空间 | Namespacing | 相关工具统一前缀(jira_*)帮模型划边界 |
| MCP | Model Context Protocol | Agent 世界的 USB,解 M×N 集成爆炸 |
| 三层协议 | — | ⭐ Function Calling 是「怎么说」,MCP 是「怎么接」,A2A 是「怎么托付」。三者叠加不是替代——一次 MCP 工具调用底下走的仍然是 Function Calling(第 8 章第二节) |
| Host(宿主) | Host | 用户面对的那个应用(IDE、聊天客户端、你的 Agent 服务)。⭐ 信任边界在这里——「这个 Server 只读」「这个工具要人工确认」唯一的实现位置就是 Host,Server 是别人写的、Client 只是一根管子 |
| Client(客户端) | Client | Host 内部为每个 Server 开的一条连接,一对一维护会话、协商能力 |
| MCP Server | — | 提供工具的一方,暴露 Tools / Resources / Prompts |
| Transport | stdio / HTTP | MCP 的两种连法。口诀:Server 和用户在同一台机器上 → stdio;不在 → HTTP。⚠️ stdio 没有租户概念,别拿它做多用户共享;⚠️ 谁拉起 stdio 进程谁就给了它全部权限 |
| A2A | Agent-to-Agent | Agent 和 Agent 之间的协作协议,解决「两个自主系统怎么互相托付任务」。没有它就只能把对方当成一个工具来调 |
| Tool Search | — | 工具定义延迟加载,先只给搜索工具。省 85% token 且提准确率 ⭐ |
| 程序化调用 | Programmatic Tool Calling | 模型写代码编排工具,中间数据不过上下文 |
| 代码执行 MCP | Code Execution with MCP | 工具变成沙箱里的代码 API,官方案例省 98.7% token |
📦 组织机制
| 术语 | 人话 |
|---|---|
| Skill | 装着「怎么做某类事」的文件夹。三层披露:YAML头→正文→附件 |
| CLAUDE.md | 项目常驻知识。当索引,不是垃圾桶,控制在 200 行内 |
| Rules | 横切约束,用 paths: 限定只在相关文件加载 |
| Hooks | 事件触发的确定性动作。「每次都要 X」该用它,不是写进提示词 ⭐ |
| 子 Agent | 独立上下文跑支线任务,只回摘要。用完即弃 |
| Agent 团队 | 持久化的多个工作者,跨任务累积状态 |
🏗️ Harness 与架构
| 术语 | 英文 | 人话 |
|---|---|---|
| Harness | Harness | 把模型智能变成可用 Agent 的那一整套:循环+工具+上下文管理+护栏 ⭐ |
| 死重 | Dead Weight | 为旧模型缺陷加的变通,模型进步后变成纯累赘。要定期删 |
| 护栏 | Guardrails | max_steps / 超时 / 预算 / 权限。最低限度的安全网 |
| 编排器-工作者 | Orchestrator-Workers | 主 Agent 动态拆分派发再综合。多 Agent 的默认起点 |
| 生成器-验证器 | Generator-Verifier | 产出与评估分离。因为自评有系统性正面偏差 ⭐ |
| 消息总线 | Message Bus | 发布/订阅事件,流程由事件涌现 |
| 共享状态 | Shared State | 多 Agent 读写同一存储,无中央协调 |
| Supervisor | Supervisor / Hierarchical / Manager | ⭐ 就是「编排器-子 Agent」的行业叫法。框架文档和面试里最常听到的一个词,听不出来是同一件事会白吃亏(第 13 章第三节有整张对照表) |
| Swarm | Swarm / Group Chat / P2P | 消息总线的行业叫法:去中心、谁该说话谁说话 |
| Blackboard | Blackboard / Shared Scratchpad | 共享状态的行业叫法。⭐ 黑板架构是 1970 年代就有的老概念,不是新东西 |
| Handoff | Handoff | ⚠️ 不是一种架构,是一个动作:A 把控制权连同对话一起交给 B,之后由 B 直接和用户对话。它回答「怎么交接」,不是「谁指挥谁」——可以发生在消息总线里,也可以发生在编排器里 |
| ReAct | Reason + Act | 走一步看一步,不做计划。就是第 1 章那个循环。⚠️ 两个实际问题:每步的完整观察都塞回上下文(腐烂)、没有全局视野(容易在两个工具间打转) |
| Plan-and-Execute | — | 模型开头一次性出完整计划再逐步执行。换来全局视野 + 便宜的执行(执行阶段不用最贵的模型)。⚠️ 结构性弱点:计划是在信息最少的那一刻做出来的,所以必须配重规划触发条件(某步连续失败 N 次 / 观察到与前提矛盾 / 预算过半完成度不足 / 冒出计划外的新子目标) |
| ReWOO | Reasoning WithOut Observation | 再往前一步:工具返回的内容不回模型,执行器按占位符回填,最后只让模型看一次汇总。⭐ 规划 1 次 + 汇总 1 次,省的是往返次数和上下文体积——和第 8 章「代码执行 + MCP」是同一个思想。⚠️ 代价:不能根据观察改路线 |
| 彩虹部署 | Rainbow Deployment | 新旧版本并存、流量渐进切换。Agent 没有发布窗口时用 |
| 上下文焦虑 | Context Anxiety | 模型感知接近 token 上限时草草收尾 |
| 目标漂移 | Goal Drift | 跑多轮后做的事偏离最初目标 |
📏 评测
| 术语 | 人话 |
|---|---|
| 评分器 | 判对错的东西。三类:代码(快准客观)/ 模型(灵活但需校准)/ 人工(金标准) |
| rubric | 结构化打分标准,把「好不好」变成可回答的分维度问题 ⭐ |
| pass@k | k 次至少成功一次。适合「一次成功就够」的工具 |
| pass^k | k 次全部成功。适合要求稳定的面向用户 Agent ⭐ |
| 转录 | Transcript。完整的执行过程记录。不读转录你不知道评分器在不在工作 |
| 饱和 | Saturation。评测被做满分,失去区分度,该「毕业」进回归套件 |
| 基础设施噪声 | 资源配置差异造成的分数波动。可达 6 个百分点,常大于模型间差距 ⭐ |
| 评测驱动开发 | 先建评测再优化。没有评测的优化是玄学 |
🛡️ 安全
| 术语 | 英文 | 人话 |
|---|---|---|
| 提示注入 | Prompt Injection | 把指令藏进 Agent 会读的外部内容里。Agent 时代的 SQL 注入 ⭐ |
| 间接注入 | Indirect Injection | 通过网页/邮件/文件等 Agent 读取的内容注入,不直接对话 |
| 环境层防御 | Environment-level | 沙箱、VM、出口控制。确定性——不管模型怎么被忽悠都成立 ⭐ |
| 模型层防御 | Model-level | 系统提示、分类器、训练。概率性——必有漏网 |
| 硬边界 | Hard Boundary | 代码里的 if,模型碰不到。写在提示词里的不算硬边界 ⭐ |
| 沙箱 | Sandbox | 隔离的执行环境。文件系统 + 网络双边界缺一不可 |
| 出口控制 | Egress Control | 限制能往哪发数据。注意:白名单域名的每个功能都是攻击面 |
| 审批疲劳 | Approval Fatigue | 用户批准约 93% 的弹窗,且注意力递减。监督本身可能反作用 ⭐ |
| 最小权限 | Least Privilege | 能写代码 ≠ 能部署。能力与权限分离 |
| 零信任 | Zero Trust | 默认不信任任何组件,每次访问都验证 |
| 影子模式 | Shadow Mode | 新 Agent 只观察不生效,攒够信任再上 |
🚀 落地
| 术语 | 人话 |
|---|---|
| 降级测试 | 从单次调用往上爬,用成功率数据证明复杂度必要 ⭐ |
| 循环工程 | Loop Engineering。修产出代码的那个流程,不是逐个修产出 ⭐ |
| 规则手册 | 大规模迁移里前置的翻译政策。发现模式就更新它,而不是改单个文件 |
| 验证循环 | Agent 做→跑检查→读结果→迭代到通过。编码 Agent 的核心机制 ⭐ |
| Managed Agents | Session / Harness / Sandbox 三者解耦的架构 |
| 顾问策略 | 小模型执行 + 大模型把关。约 63% 成本拿 90%+ 效果 |
👉 回到首页