🏠 总目录📚 本教程 附录A · 术语速查
📑 本页目录(点开跳转)

附录 A · 术语速查卡

📌 用法:看到不懂的词 Ctrl+F 搜。不要通读。


🧱 基础概念

术语 英文 人话
Agent Agent 模型 + 工具 + 循环。决策权在模型,这是它和普通程序的区别
工作流 Workflow 路径预先写死在代码里,模型只填空。可预测、便宜
循环 Agent Loop 发历史→模型决定→执行工具→回填→再发。Agent 的心跳
上下文 Context 每轮发给模型的全部文字。模型的整个世界
上下文窗口 Context Window 上下文的容量上限。是上限不是工作区
token token 模型处理文本的最小单位,约等于 0.75 个英文词 / 1 个汉字多
系统提示词 System Prompt Agent 的宪法:角色、环境、流程、硬规则
effort effort 投入的彻底程度(读多少、验证多少),和模型能力是两个独立旋钮

🧠 上下文工程

术语 英文 人话
上下文腐烂 Context Rot token 越多,模型用其中信息的能力越差。渐进式劣化,不是到上限才发生 ⭐
注意力预算 Attention Budget 把上下文当有限的注意力资源,不是硬盘
压缩 Compaction 历史对话总结成摘要,腾出空间。摘要必须保留关键事实
渐进式披露 Progressive Disclosure 不预载,需要时才取。全领域最重要的模式 ⭐
即时检索 Just-in-Time Retrieval 用时再查,而不是先把资料全塞进去
外置记忆 External Memory 状态写文件(JSON 比 MD 更不容易被模型改坏)
提示缓存 Prompt Caching 稳定内容放前面可被缓存复用,省钱省延迟。中途换模型会失效

🗃️ 记忆

📌 这一组全部出自 04b · Agent 记忆——分不清是哪一层,就会用错技术

术语 英文 人话
短期记忆 Short-term Memory 当前会话的 messages 数组本身。免费自动,不需要你设计,你只需控制它的体积
工作记忆 Working Memory 当前任务的中间状态(做到哪了、试过什么不行),存在上下文之外的 progress.json / todo.json。⭐ 最常被跳过的一层——很多人直奔长期记忆,做出一个记得住用户是左撇子、却记不住自己十分钟前试过什么的 Agent。任务结束就该归档,不该混进长期记忆
长期记忆 Long-term Memory 跨会话的稳定事实与偏好,三类:关于用户 / 关于世界 / ⭐ 关于自己(Agent 踩出来的操作经验)。坏掉的样子:把一次性的东西记成永久偏好(说了一次「这次简短点」,从此半年惜字如金)
情景记忆 Episodic Memory 带时间戳的事件日志,只追加不可改写。⭐ 和长期记忆的分工:情景记忆记「发生过什么」,长期记忆记「现在成立什么」;情景是原料,长期是从原料提炼的结论
Memory vs RAG 检索技术可以完全一样,治理规则完全不一样。 RAG 是别人写的只读语料,一条错了只错这一次;Memory 是 Agent 自己在交互中写的可写状态,一条错了会错到你手动删掉为止真正的新问题全在写入侧
写入判据 一条内容够不够格进长期记忆的三条门槛(要同时满足)。⚠️ 从工具返回和网页内容里学到的东西不该有资格直接写进去——否则一次提示注入会变成持久化后门(第 15 章
遗忘 / 冲突裁决 Forgetting / Conflict Resolution 长上下文能让 Agent「不忘」,不能让它「忘掉该忘的」。⭐ 记忆系统的价值有一半在删除权。新旧矛盾时谁赢、过期怎么判,是 Memory 的 CRUD 里最难的那部分(Update)

🔧 工具与接口

术语 英文 人话
工具 Tool 模型能调用的函数 + 一段给它看的说明书
ACI Agent-Computer Interface 给模型用的界面。像做 UI 一样认真做 ⭐
工具调用 Tool Use / Function Calling 模型输出结构化的「调用 X,参数 Y」
防呆 Poka-yoke 让错误用法在结构上不可能(强制绝对路径、枚举参数)
命名空间 Namespacing 相关工具统一前缀(jira_*)帮模型划边界
MCP Model Context Protocol Agent 世界的 USB,解 M×N 集成爆炸
三层协议 Function Calling 是「怎么说」,MCP 是「怎么接」,A2A 是「怎么托付」。三者叠加不是替代——一次 MCP 工具调用底下走的仍然是 Function Calling(第 8 章第二节)
Host(宿主) Host 用户面对的那个应用(IDE、聊天客户端、你的 Agent 服务)。⭐ 信任边界在这里——「这个 Server 只读」「这个工具要人工确认」唯一的实现位置就是 Host,Server 是别人写的、Client 只是一根管子
Client(客户端) Client Host 内部为每个 Server 开的一条连接,一对一维护会话、协商能力
MCP Server 提供工具的一方,暴露 Tools / Resources / Prompts
Transport stdio / HTTP MCP 的两种连法。口诀:Server 和用户在同一台机器上 → stdio;不在 → HTTP。⚠️ stdio 没有租户概念,别拿它做多用户共享;⚠️ 谁拉起 stdio 进程谁就给了它全部权限
A2A Agent-to-Agent Agent 和 Agent 之间的协作协议,解决「两个自主系统怎么互相托付任务」。没有它就只能把对方当成一个工具来调
Tool Search 工具定义延迟加载,先只给搜索工具。省 85% token 且提准确率 ⭐
程序化调用 Programmatic Tool Calling 模型写代码编排工具,中间数据不过上下文
代码执行 MCP Code Execution with MCP 工具变成沙箱里的代码 API,官方案例省 98.7% token

📦 组织机制

术语 人话
Skill 装着「怎么做某类事」的文件夹。三层披露:YAML头→正文→附件
CLAUDE.md 项目常驻知识。当索引,不是垃圾桶,控制在 200 行内
Rules 横切约束,用 paths: 限定只在相关文件加载
Hooks 事件触发的确定性动作。「每次都要 X」该用它,不是写进提示词 ⭐
子 Agent 独立上下文跑支线任务,只回摘要。用完即弃
Agent 团队 持久化的多个工作者,跨任务累积状态

🏗️ Harness 与架构

术语 英文 人话
Harness Harness 把模型智能变成可用 Agent 的那一整套:循环+工具+上下文管理+护栏 ⭐
死重 Dead Weight 为旧模型缺陷加的变通,模型进步后变成纯累赘。要定期删
护栏 Guardrails max_steps / 超时 / 预算 / 权限。最低限度的安全网
编排器-工作者 Orchestrator-Workers 主 Agent 动态拆分派发再综合。多 Agent 的默认起点
生成器-验证器 Generator-Verifier 产出与评估分离。因为自评有系统性正面偏差
消息总线 Message Bus 发布/订阅事件,流程由事件涌现
共享状态 Shared State 多 Agent 读写同一存储,无中央协调
Supervisor Supervisor / Hierarchical / Manager 就是「编排器-子 Agent」的行业叫法。框架文档和面试里最常听到的一个词,听不出来是同一件事会白吃亏(第 13 章第三节有整张对照表)
Swarm Swarm / Group Chat / P2P 消息总线的行业叫法:去中心、谁该说话谁说话
Blackboard Blackboard / Shared Scratchpad 共享状态的行业叫法。⭐ 黑板架构是 1970 年代就有的老概念,不是新东西
Handoff Handoff ⚠️ 不是一种架构,是一个动作:A 把控制权连同对话一起交给 B,之后由 B 直接和用户对话。它回答「怎么交接」,不是「谁指挥谁」——可以发生在消息总线里,也可以发生在编排器里
ReAct Reason + Act 走一步看一步,不做计划。就是第 1 章那个循环。⚠️ 两个实际问题:每步的完整观察都塞回上下文(腐烂)、没有全局视野(容易在两个工具间打转)
Plan-and-Execute 模型开头一次性出完整计划再逐步执行。换来全局视野 + 便宜的执行(执行阶段不用最贵的模型)。⚠️ 结构性弱点:计划是在信息最少的那一刻做出来的,所以必须配重规划触发条件(某步连续失败 N 次 / 观察到与前提矛盾 / 预算过半完成度不足 / 冒出计划外的新子目标)
ReWOO Reasoning WithOut Observation 再往前一步:工具返回的内容不回模型,执行器按占位符回填,最后只让模型看一次汇总。⭐ 规划 1 次 + 汇总 1 次,省的是往返次数和上下文体积——和第 8 章「代码执行 + MCP」是同一个思想。⚠️ 代价:不能根据观察改路线
彩虹部署 Rainbow Deployment 新旧版本并存、流量渐进切换。Agent 没有发布窗口时用
上下文焦虑 Context Anxiety 模型感知接近 token 上限时草草收尾
目标漂移 Goal Drift 跑多轮后做的事偏离最初目标

📏 评测

术语 人话
评分器 判对错的东西。三类:代码(快准客观)/ 模型(灵活但需校准)/ 人工(金标准)
rubric 结构化打分标准,把「好不好」变成可回答的分维度问题 ⭐
pass@k k 次至少成功一次。适合「一次成功就够」的工具
pass^k k 次全部成功。适合要求稳定的面向用户 Agent ⭐
转录 Transcript。完整的执行过程记录。不读转录你不知道评分器在不在工作
饱和 Saturation。评测被做满分,失去区分度,该「毕业」进回归套件
基础设施噪声 资源配置差异造成的分数波动。可达 6 个百分点,常大于模型间差距 ⭐
评测驱动开发 先建评测再优化。没有评测的优化是玄学

🛡️ 安全

术语 英文 人话
提示注入 Prompt Injection 把指令藏进 Agent 会读的外部内容里。Agent 时代的 SQL 注入
间接注入 Indirect Injection 通过网页/邮件/文件等 Agent 读取的内容注入,不直接对话
环境层防御 Environment-level 沙箱、VM、出口控制。确定性——不管模型怎么被忽悠都成立 ⭐
模型层防御 Model-level 系统提示、分类器、训练。概率性——必有漏网
硬边界 Hard Boundary 代码里的 if,模型碰不到。写在提示词里的不算硬边界
沙箱 Sandbox 隔离的执行环境。文件系统 + 网络双边界缺一不可
出口控制 Egress Control 限制能往哪发数据。注意:白名单域名的每个功能都是攻击面
审批疲劳 Approval Fatigue 用户批准约 93% 的弹窗,且注意力递减。监督本身可能反作用
最小权限 Least Privilege 能写代码 ≠ 能部署。能力与权限分离
零信任 Zero Trust 默认不信任任何组件,每次访问都验证
影子模式 Shadow Mode 新 Agent 只观察不生效,攒够信任再上

🚀 落地

术语 人话
降级测试 从单次调用往上爬,用成功率数据证明复杂度必要 ⭐
循环工程 Loop Engineering。修产出代码的那个流程,不是逐个修产出
规则手册 大规模迁移里前置的翻译政策。发现模式就更新它,而不是改单个文件
验证循环 Agent 做→跑检查→读结果→迭代到通过。编码 Agent 的核心机制 ⭐
Managed Agents Session / Harness / Sandbox 三者解耦的架构
顾问策略 小模型执行 + 大模型把关。约 63% 成本拿 90%+ 效果

👉 回到首页

打卡记录保存在你的浏览器里,首页能看到总进度