🏠 总目录📚 本教程 16 · 企业落地
📑 本页目录(点开跳转)

16 · 企业落地与生产化

22 分钟 | ⭐ 想把 Agent 变成产品/推进到公司里的必看


🎯 一句话

Demo 到生产之间隔着五件事:选对场景、算清成本、架构解耦、组织接受、合规过关。 这一章全是从公开的生产实践里抠出来的数字和教训。


🗺️ 一、选场景:什么任务值得上 Agent

四条筛选标准

标准 好例子 坏例子
工作可并行 迁移数千个独立文件 单体强耦合的重构
规格明确 原代码库就是参考规格 「把产品做得更好用」
验证客观 测试套件给出通过/失败 靠人主观评审
失败可恢复 单文件失败重跑即可 一步错全盘崩

🔑 最佳落地场景的共同点:工作队列能自动生成。 编译错误、测试失败、bug 单自动变成待办——人不再挑活儿,只管修「失败的模式」。

🎯 一个实用的筛选打分表

给候选场景打分(每项 0–2 分,总分 ≥ 6 才值得做):

   □ 可并行度       0=完全串行  1=部分  2=天然可并行
   □ 规格明确度     0=靠感觉    1=有文档 2=有可执行的规格(测试/原代码)
   □ 验证客观性     0=人主观    1=半自动 2=全自动通过/失败
   □ 失败可恢复     0=全盘崩    1=手动回滚 2=自动重试
   □ 价值密度       0=省几分钟  1=省几小时 2=省几人周

💰 二、算清成本:真实世界的量级感

来自公开披露的真实数字(当量级参考,不是报价):

案例 规模 成本
百万行代码语言迁移 59 亿输入 token,两周 $165,000
16 个并行 Agent 写 C 编译器 2000 会话,10 万行代码 略低于 $20,000
三 Agent harness 做完整 App 6 小时 $200(单 Agent $9 但产物不可用)
多 Agent 研究系统 相对单 Agent 15 倍 token 换 +90% 效果

🧮 算账的三条口诀

 ① 和【人力成本】比,不是和 API 单价比
    $165K 迁移百万行  vs  一个团队干一年

 ② 多 Agent 的 15 倍溢价只配高价值任务(第 13 章)

 ③ harness 的 20 倍成本差($9 → $200)买的是
    「能用 vs 不能用」,不是「好 vs 更好」  ⭐

💡 最容易被低估的成本:人。 搭建、调试、维护 Agent 系统的工程师时间,往往远超 API 账单。 算 ROI 时把它算进去。


🏗️ 三、架构:大脑与双手解耦

Session(只追加的事件日志)

为什么要这么拆 —— 第 12 章的命题在架构层的回响: harness 会编码过时的假设,所以架构必须能容纳「尚未被发明的 harness」

实际收益(公开数据):

收益 说明
会话状态外置 harness 可重启恢复,状态错误不再复利
凭据不进沙箱 提示注入偷不到密钥(第 15 章的硬边界)
容器按需配置 首 token 延迟 p50 降约 60%、p95 降超 90%

🚀 四、生产运维三件套

问题 解法
状态错误会复利(小故障级联成大异常) 从出错点恢复而非从头重跑;把工具失败明确告知 Agent 让它自适应
非确定性没法调试(同提示词每次路径不同) 全量追踪 + 高层可观测性(只监控决策模式不看对话内容,兼顾隐私)
Agent 持续运行,没有发布窗口 彩虹部署:新旧版本并存,流量渐进切换

📊 必须监控的六个指标

   ① 每任务 token 消耗(分位数,不是平均值)⭐ 长尾是成本黑洞
   ② 任务完成率 / 中途放弃率
   ③ 平均轮数(突然上升 = 模型在打转)
   ④ 工具调用失败率(按工具分)
   ⑤ 人工介入率(该降但降不下去 = 系统不成熟)
   ⑥ 端到端延迟 p50/p95

💡 看分位数不看平均值:Agent 的成本分布是重尾的—— 90% 的任务花 $0.05,10% 的任务花 $5,平均值会骗你。


🏢 五、组织级实践参考

来自一个约 80% 合入代码由 AI 撰写、工程师季度发布量 8 倍的组织:

做法 说明
多 Agent 分域审查 每个审查 Agent 只盯一个窄面(安全/性能/风格)。分离防共享盲区
人工审查改为风险加权抽样 不再全面把关,人力留给杠杆最高的节点。效果:收到实质性审查意见的 PR 从 16% → 54%
权限分离 事故响应 Agent 能读日志、能发报告,不能自主部署修复(写代码的能力与部署的权限分开)
把 Agent 当内部威胁对待 所有动作过 SIEM 审计,偏离预期即告警
影子模式 新 Agent 先只观察不生效,攒够信任再上
循环工程 修产出代码的那个流程,不是逐个修产出

🔁 循环工程(值得单独理解)

   ❌ 逐个修产出:
      1000 个文件迁移,200 个有问题 → 一个一个手动修 → 修完发现新一批又出同样问题

   ✅ 修流程:
      发现模式 → 更新规则手册 → 让队列重跑 → 200 个问题一起消失 ⭐

   💡 人的注意力要放在【失败的模式】上,不是【单个失败】上

🔑 这是大规模 Agent 落地和小打小闹的分水岭。


⚖️ 六、合规与风险(To B 必须过的关)

议题 最低要求
数据去向 搞清供应商是否用你的数据训练、存哪个地域、存多久
PII 脱敏 发送前自动识别替换身份证/手机/银行卡。最常见事故是整条数据库记录拼进提示词
告知义务 多数法域要求告知用户在和 AI 交互
高风险决策 招聘/信贷/医疗等场景必须有人工介入,不能 AI 单独决定
可追溯 保留审计日志,能回答「这个决策是怎么来的」
内容责任 商用生成内容做相似度检查;代码生成注意开源许可证

⚠️ 这些不会让你的 Agent 更聪明,但会决定它能不能上线、能不能签单


📋 七、上生产检查单

【场景】
☐ 过了四条筛选标准,打分 ≥ 6
☐ 工作队列能自动生成

【架构】
☐ 做过降级测试,有数据证明复杂度必要(第 6 章)
☐ 多 Agent 的 15 倍溢价对得起价值(第 13 章)
☐ 状态外置,可从出错点恢复

【质量】
☐ 有评测套件,读过转录(第 14 章)
☐ 有环境层硬边界,做过威胁建模(第 15 章)
☐ 高危动作权限分离(能写≠能部署)

【运维】
☐ 六个指标都在监控,且看分位数
☐ 有降级方案(模型挂了怎么办)
☐ 部署不打断运行中的 Agent

【合规】
☐ 数据去向清楚,PII 已脱敏
☐ 用户知道在和 AI 交互
☐ 高风险决策有人工介入

【长期】
☐ 日历上有「模型升级后重审 harness」的提醒
☐ 定期问:我可以停止做什么?

🕳️ 八、五个常见坑

症状
只算 API 成本 ROI 算错,项目中途叫停 把工程师时间算进去
看平均 token 不看分位数 长尾任务偷偷烧钱 监控 p95/p99
逐个修产出 永远修不完 循环工程:修流程
人工审查想全覆盖 人力瓶颈,反而没人认真看 风险加权抽样
合规最后才想 做完了上不了线 立项时就把合规要求写进需求

📚 延伸阅读


✅ 检查点

  1. 选场景的四条标准是什么?共同点是什么?
  2. 算成本时最容易被低估的是什么?
  3. 「大脑与双手解耦」拆的是哪三样?为什么要拆?
  4. 为什么监控 token 要看分位数不看平均值?
  5. 「循环工程」是什么意思?它为什么是分水岭?
  6. 「能写代码但不能部署」体现了什么原则?
  7. 人工审查为什么要改成"风险加权抽样"?效果如何?
👀 答案
  1. 可并行、规格明确、验证客观、失败可恢复。共同点:工作队列能自动生成(错误/失败自动变待办)。
  2. 人力成本——搭建、调试、维护 Agent 系统的工程师时间往往远超 API 账单。
  3. Session(事件日志)/ Harness(控制循环)/ Sandbox(执行环境)。因为 harness 编码的假设会过时,架构要能整体替换 harness 而不丢状态;且凭据不进沙箱可防注入窃取。
  4. Agent 成本分布是重尾的——90% 任务花 $0.05,10% 花 $5,平均值会掩盖长尾这个成本黑洞。
  5. 修产出代码的那个流程,而不是逐个修产出。发现模式→更新规则→重跑队列,200 个问题一起消失。它是大规模落地和小打小闹的分水岭。
  6. 权限分离/最小权限——能力与权限解耦,被攻陷的 Agent 也造不成最大伤害。
  7. 想全面把关会造成人力瓶颈,结果反而没人认真看。抽样后人力集中在高杠杆节点,效果:收到实质性审查意见的 PR 从 16% 升到 54%。

🛑 可以停在这里

走神救援

Demo到生产隔着:选场景、算成本、架构解耦、组织接受、合规过关。四标准:可并行、规格明确、验证客观、失败可恢复(加价值密度共五项,⭐总分≥6才做);⭐共同点是「工作队列能自动生成」——错误/失败/bug单自动变待办,人只管修「失败的模式」。成本量级:百万行语言迁移=59亿token、两周、$165,000;三Agent harness做完整App=6小时$200(单Agent $9但产物不可用)。⭐和人力成本比,不和API单价比20倍差价买的是「能用vs不能用」;⚠️最易低估的成本是人——工程师时间远超API账单。架构:Session/Harness/Sandbox三层解耦,状态外置让状态错误不再复利;⭐凭据不进沙箱;容器按需配置让首token延迟p50降60%、p95降超90%。运维:从出错点恢复全量追踪彩虹部署。六指标:每任务token(看分位数不看平均)、完成/放弃率、平均轮数(突升=在打转)、按工具的失败率、人工介入率(降不下去=不成熟)、端到端p50/p95;⚠️成本重尾90%任务$0.05,10%花$5,平均值会骗你。组织(约80%合入代码由AI撰写):分域审查防盲区、⭐人工审查改风险加权抽样(实质性审查意见的PR从16%→54%)、能写代码≠能部署、⭐⭐循环工程:修产出代码的那个流程,不是逐个修产出(1000个文件里200个有问题:发现模式→改规则→重跑队列,200个一起消失),这是大规模落地的分水岭。合规:数据去向、PII脱敏(最常见事故是整条数据库记录被拼进提示词)、告知义务、高风险决策人工介入、可追溯——⚠️不会让Agent更聪明,但决定能不能签单

下一节 👉 16b-框架这层皮.md

打卡记录保存在你的浏览器里,首页能看到总进度