🏠 总目录📚 本教程 16 · 企业落地 ← →
📑 本页目录(点开跳转)

16 · 企业落地与生产化

⏱ 22 分钟 | ⭐ 想把 Agent 变成产品/推进到公司里的必看


🎯 一句话

Demo 到生产之间隔着五件事:选对场景、算清成本、架构解耦、组织接受、合规过关。 这一章全是从公开的生产实践里抠出来的数字和教训。


🗺️ 一、选场景:什么任务值得上 Agent

四条筛选标准

标准 好例子 坏例子
工作可并行 迁移数千个独立文件 单体强耦合的重构
规格明确 原代码库就是参考规格 「把产品做得更好用」
验证客观 ⭐ 测试套件给出通过/失败 靠人主观评审
失败可恢复 单文件失败重跑即可 一步错全盘崩

🔑 最佳落地场景的共同点:工作队列能自动生成。 编译错误、测试失败、bug 单自动变成待办——人不再挑活儿,只管修「失败的模式」。

🎯 一个实用的筛选打分表

给候选场景打分(每项 0–2 分,总分 ≥ 6 才值得做):

算一算

□ 可并行度 0=完全串行 1=部分 2=天然可并行

□ 规格明确度 0=靠感觉 1=有文档 2=有可执行的规格(测试/原代码)

□ 验证客观性 0=人主观 1=半自动 2=全自动通过/失败

□ 失败可恢复 0=全盘崩 1=手动回滚 2=自动重试

□ 价值密度 0=省几分钟 1=省几小时 2=省几人周


💰 二、算清成本:真实世界的量级感

来自公开披露的真实数字(当量级参考,不是报价):

案例 规模 成本
百万行代码语言迁移 59 亿输入 token,两周 约 $165,000
16 个并行 Agent 写 C 编译器 2000 会话,10 万行代码 略低于 $20,000
三 Agent harness 做完整 App 6 小时 约 $200(单 Agent $9 但产物不可用)
多 Agent 研究系统 相对单 Agent 15 倍 token 换 +90% 效果

🧮 算账的三条口诀

结果对照

① 和【人力成本】比,不是和 API 单价比
$165K 迁移百万行 vs 一个团队干一年
② 多 Agent 的 15 倍溢价只配高价值任务(第 13 章)
③ harness 的 20 倍成本差($9→$200)买的是
「能用 vs 不能用」,不是「好 vs 更好」 ⭐

💡 最容易被低估的成本:人。 搭建、调试、维护 Agent 系统的工程师时间,往往远超 API 账单。 算 ROI 时把它算进去。


🏗️ 三、架构:大脑与双手解耦

Session(只追加的事件日志)

为什么要这么拆 —— 第 12 章的命题在架构层的回响: harness 会编码过时的假设,所以架构必须能容纳「尚未被发明的 harness」。

实际收益(公开数据):

收益 说明
会话状态外置 harness 可重启恢复,状态错误不再复利
凭据不进沙箱 ⭐ 提示注入偷不到密钥(第 15 章的硬边界)
容器按需配置 首 token 延迟 p50 降约 60%、p95 降超 90%

🚀 四、生产运维三件套

问题 解法
状态错误会复利(小故障级联成大异常) 从出错点恢复而非从头重跑;把工具失败明确告知 Agent 让它自适应
非确定性没法调试(同提示词每次路径不同) 全量追踪 + 高层可观测性(只监控决策模式不看对话内容,兼顾隐私)
Agent 持续运行,没有发布窗口 彩虹部署:新旧版本并存,流量渐进切换

📊 必须监控的六个指标

操作步骤

  1. 每任务 token 消耗(分位数,不是平均值)⭐ 长尾是成本黑洞
  2. 任务完成率 / 中途放弃率
  3. 平均轮数(突然上升 = 模型在打转)
  4. 工具调用失败率(按工具分)
  5. 人工介入率(该降但降不下去 = 系统不成熟)
  6. 端到端延迟 p50/p95

💡 看分位数不看平均值:Agent 的成本分布是重尾的—— 90% 的任务花 $0.05,10% 的任务花 $5,平均值会骗你。


🏢 五、组织级实践参考

来自一个约 80% 合入代码由 AI 撰写、工程师季度发布量 8 倍的组织:

做法 说明
多 Agent 分域审查 每个审查 Agent 只盯一个窄面(安全/性能/风格)。分离防共享盲区
人工审查改为风险加权抽样 ⭐ 不再全面把关,人力留给杠杆最高的节点。效果:收到实质性审查意见的 PR 从 16% → 54%
权限分离 事故响应 Agent 能读日志、能发报告,不能自主部署修复(写代码的能力与部署的权限分开)
把 Agent 当内部威胁对待 所有动作过 SIEM 审计,偏离预期即告警
影子模式 新 Agent 先只观察不生效,攒够信任再上
循环工程 ⭐ 修产出代码的那个流程,不是逐个修产出

🔁 循环工程(值得单独理解)

结果对照

❌ 逐个修产出:
1000 个文件迁移,200 个有问题→一个一个手动修→修完发现新一批又出同样问题
✅ 修流程:
发现模式→更新规则手册→让队列重跑→200 个问题一起消失 ⭐
💡 人的注意力要放在【失败的模式】上,不是【单个失败】上

🔑 这是大规模 Agent 落地和小打小闹的分水岭。


⚖️ 六、合规与风险(To B 必须过的关)

议题 最低要求
数据去向 搞清供应商是否用你的数据训练、存哪个地域、存多久
PII 脱敏 ⭐ 发送前自动识别替换身份证/手机/银行卡。最常见事故是整条数据库记录拼进提示词
告知义务 多数法域要求告知用户在和 AI 交互
高风险决策 招聘/信贷/医疗等场景必须有人工介入,不能 AI 单独决定
可追溯 保留审计日志,能回答「这个决策是怎么来的」
内容责任 商用生成内容做相似度检查;代码生成注意开源许可证

⚠️ 这些不会让你的 Agent 更聪明,但会决定它能不能上线、能不能签单。


📋 七、上生产检查单

要点

【场景】

☐ 过了四条筛选标准,打分 ≥ 6

☐ 工作队列能自动生成

【架构】

☐ 做过降级测试,有数据证明复杂度必要(第 6 章)

☐ 多 Agent 的 15 倍溢价对得起价值(第 13 章)

☐ 状态外置,可从出错点恢复

【质量】

☐ 有评测套件,读过转录(第 14 章)

☐ 有环境层硬边界,做过威胁建模(第 15 章)

☐ 高危动作权限分离(能写≠能部署)

【运维】

☐ 六个指标都在监控,且看分位数

☐ 有降级方案(模型挂了怎么办)

☐ 部署不打断运行中的 Agent

【合规】

☐ 数据去向清楚,PII 已脱敏

☐ 用户知道在和 AI 交互

☐ 高风险决策有人工介入

【长期】

☐ 日历上有「模型升级后重审 harness」的提醒

☐ 定期问:我可以停止做什么?


🕳️ 八、五个常见坑

坑 症状 修
只算 API 成本 ROI 算错,项目中途叫停 把工程师时间算进去
看平均 token 不看分位数 长尾任务偷偷烧钱 监控 p95/p99
逐个修产出 永远修不完 循环工程:修流程
人工审查想全覆盖 人力瓶颈,反而没人认真看 风险加权抽样
合规最后才想 做完了上不了线 立项时就把合规要求写进需求

📚 延伸阅读


✅ 检查点

  1. 选场景的四条标准是什么?共同点是什么?
  2. 算成本时最容易被低估的是什么?
  3. 「大脑与双手解耦」拆的是哪三样?为什么要拆?
  4. 为什么监控 token 要看分位数不看平均值?
  5. 「循环工程」是什么意思?它为什么是分水岭?
  6. 「能写代码但不能部署」体现了什么原则?
  7. 人工审查为什么要改成"风险加权抽样"?效果如何?
👀 答案
  1. 可并行、规格明确、验证客观、失败可恢复。共同点:工作队列能自动生成(错误/失败自动变待办)。
  2. 人力成本——搭建、调试、维护 Agent 系统的工程师时间往往远超 API 账单。
  3. Session(事件日志)/ Harness(控制循环)/ Sandbox(执行环境)。因为 harness 编码的假设会过时,架构要能整体替换 harness 而不丢状态;且凭据不进沙箱可防注入窃取。
  4. Agent 成本分布是重尾的——90% 任务花 $0.05,10% 花 $5,平均值会掩盖长尾这个成本黑洞。
  5. 修产出代码的那个流程,而不是逐个修产出。发现模式→更新规则→重跑队列,200 个问题一起消失。它是大规模落地和小打小闹的分水岭。
  6. 权限分离/最小权限——能力与权限解耦,被攻陷的 Agent 也造不成最大伤害。
  7. 想全面把关会造成人力瓶颈,结果反而没人认真看。抽样后人力集中在高杠杆节点,效果:收到实质性审查意见的 PR 从 16% 升到 54%。

🛑 可以停在这里

⚡ 走神救援

Demo 到生产隔着五件事:选场景、算成本、架构解耦、组织接受、合规过关。

⭐ 选场景四标准是可并行、规格明确、验证客观、失败可恢复;⭐⭐ 它们的共同点是「工作队列能自动生成」——错误、失败、bug 单自动变成待办,人只管修「失败的模式」。

⭐⭐ 算成本的判据只有一条:和人力成本比,不和 API 单价比。 一次大规模迁移的账单看着吓人,而它对标的是一个团队干一年。⭐ 而同一件事上二十倍的差价买的是「能用」和「不能用」(便宜那版产物根本不可用)。⚠️ 最容易低估的成本是人——工程师的时间远超 API 账单。

架构上三层解耦,⭐ 状态外置的价值是让状态错误不再复利;⚠️ 凭据不进沙箱。

六个指标里两条要点:⭐ 看分位数不看平均——💀 成本是重尾的,绝大多数任务很便宜、少数几个贵两个数量级,平均值会骗你;⭐ 平均轮数突然升高等于「它在打转」;而人工介入率降不下去,就说明还不成熟。

⭐⭐ 组织那一段最值钱的是两条:人工审查要改成风险加权抽样——实质性审查意见的比例能翻好几倍;以及 ⭐ 「循环工程」:修的是产出代码的那个流程,不是逐个修产出——上千个文件里两百个有问题时,发现模式、改规则、重跑队列,两百个一起消失。⭐ 这是大规模落地的分水岭。

⚠️ 合规不会让 Agent 更聪明,但它决定能不能签单;⭐ 其中最常见的事故是整条数据库记录被原样拼进提示词。

下一节 👉 16b-框架这层皮.md

打卡记录保存在你的浏览器里,首页能看到总进度