📑 本页目录(点开跳转)
16 · 企业落地与生产化
⏱ 22 分钟 | ⭐ 想把 Agent 变成产品/推进到公司里的必看
🎯 一句话
Demo 到生产之间隔着五件事:选对场景、算清成本、架构解耦、组织接受、合规过关。 这一章全是从公开的生产实践里抠出来的数字和教训。
🗺️ 一、选场景:什么任务值得上 Agent
四条筛选标准
| 标准 | 好例子 | 坏例子 |
|---|---|---|
| 工作可并行 | 迁移数千个独立文件 | 单体强耦合的重构 |
| 规格明确 | 原代码库就是参考规格 | 「把产品做得更好用」 |
| 验证客观 ⭐ | 测试套件给出通过/失败 | 靠人主观评审 |
| 失败可恢复 | 单文件失败重跑即可 | 一步错全盘崩 |
🔑 最佳落地场景的共同点:工作队列能自动生成。 编译错误、测试失败、bug 单自动变成待办——人不再挑活儿,只管修「失败的模式」。
🎯 一个实用的筛选打分表
给候选场景打分(每项 0–2 分,总分 ≥ 6 才值得做):
算一算
□ 可并行度 0=完全串行 1=部分 2=天然可并行
□ 规格明确度 0=靠感觉 1=有文档 2=有可执行的规格(测试/原代码)
□ 验证客观性 0=人主观 1=半自动 2=全自动通过/失败
□ 失败可恢复 0=全盘崩 1=手动回滚 2=自动重试
□ 价值密度 0=省几分钟 1=省几小时 2=省几人周
💰 二、算清成本:真实世界的量级感
来自公开披露的真实数字(当量级参考,不是报价):
| 案例 | 规模 | 成本 |
|---|---|---|
| 百万行代码语言迁移 | 59 亿输入 token,两周 | 约 $165,000 |
| 16 个并行 Agent 写 C 编译器 | 2000 会话,10 万行代码 | 略低于 $20,000 |
| 三 Agent harness 做完整 App | 6 小时 | 约 $200(单 Agent $9 但产物不可用) |
| 多 Agent 研究系统 | 相对单 Agent | 15 倍 token 换 +90% 效果 |
🧮 算账的三条口诀
结果对照
💡 最容易被低估的成本:人。 搭建、调试、维护 Agent 系统的工程师时间,往往远超 API 账单。 算 ROI 时把它算进去。
🏗️ 三、架构:大脑与双手解耦
- ↕ 状态外置 → harness 挂了也能恢复
- Harness(控制循环)
- ↕ 可整体替换升级
- Sandbox(执行环境)
- ↕ 容器从"宠物"变"牲畜":挂了就换
为什么要这么拆 —— 第 12 章的命题在架构层的回响: harness 会编码过时的假设,所以架构必须能容纳「尚未被发明的 harness」。
实际收益(公开数据):
| 收益 | 说明 |
|---|---|
| 会话状态外置 | harness 可重启恢复,状态错误不再复利 |
| 凭据不进沙箱 ⭐ | 提示注入偷不到密钥(第 15 章的硬边界) |
| 容器按需配置 | 首 token 延迟 p50 降约 60%、p95 降超 90% |
🚀 四、生产运维三件套
| 问题 | 解法 |
|---|---|
| 状态错误会复利(小故障级联成大异常) | 从出错点恢复而非从头重跑;把工具失败明确告知 Agent 让它自适应 |
| 非确定性没法调试(同提示词每次路径不同) | 全量追踪 + 高层可观测性(只监控决策模式不看对话内容,兼顾隐私) |
| Agent 持续运行,没有发布窗口 | 彩虹部署:新旧版本并存,流量渐进切换 |
📊 必须监控的六个指标
操作步骤
- 每任务 token 消耗(分位数,不是平均值)⭐ 长尾是成本黑洞
- 任务完成率 / 中途放弃率
- 平均轮数(突然上升 = 模型在打转)
- 工具调用失败率(按工具分)
- 人工介入率(该降但降不下去 = 系统不成熟)
- 端到端延迟 p50/p95
💡 看分位数不看平均值:Agent 的成本分布是重尾的—— 90% 的任务花 $0.05,10% 的任务花 $5,平均值会骗你。
🏢 五、组织级实践参考
来自一个约 80% 合入代码由 AI 撰写、工程师季度发布量 8 倍的组织:
| 做法 | 说明 |
|---|---|
| 多 Agent 分域审查 | 每个审查 Agent 只盯一个窄面(安全/性能/风格)。分离防共享盲区 |
| 人工审查改为风险加权抽样 ⭐ | 不再全面把关,人力留给杠杆最高的节点。效果:收到实质性审查意见的 PR 从 16% → 54% |
| 权限分离 | 事故响应 Agent 能读日志、能发报告,不能自主部署修复(写代码的能力与部署的权限分开) |
| 把 Agent 当内部威胁对待 | 所有动作过 SIEM 审计,偏离预期即告警 |
| 影子模式 | 新 Agent 先只观察不生效,攒够信任再上 |
| 循环工程 ⭐ | 修产出代码的那个流程,不是逐个修产出 |
🔁 循环工程(值得单独理解)
结果对照
🔑 这是大规模 Agent 落地和小打小闹的分水岭。
⚖️ 六、合规与风险(To B 必须过的关)
| 议题 | 最低要求 |
|---|---|
| 数据去向 | 搞清供应商是否用你的数据训练、存哪个地域、存多久 |
| PII 脱敏 ⭐ | 发送前自动识别替换身份证/手机/银行卡。最常见事故是整条数据库记录拼进提示词 |
| 告知义务 | 多数法域要求告知用户在和 AI 交互 |
| 高风险决策 | 招聘/信贷/医疗等场景必须有人工介入,不能 AI 单独决定 |
| 可追溯 | 保留审计日志,能回答「这个决策是怎么来的」 |
| 内容责任 | 商用生成内容做相似度检查;代码生成注意开源许可证 |
⚠️ 这些不会让你的 Agent 更聪明,但会决定它能不能上线、能不能签单。
📋 七、上生产检查单
要点
【场景】
☐ 过了四条筛选标准,打分 ≥ 6
☐ 工作队列能自动生成
【架构】
☐ 做过降级测试,有数据证明复杂度必要(第 6 章)
☐ 多 Agent 的 15 倍溢价对得起价值(第 13 章)
☐ 状态外置,可从出错点恢复
【质量】
☐ 有评测套件,读过转录(第 14 章)
☐ 有环境层硬边界,做过威胁建模(第 15 章)
☐ 高危动作权限分离(能写≠能部署)
【运维】
☐ 六个指标都在监控,且看分位数
☐ 有降级方案(模型挂了怎么办)
☐ 部署不打断运行中的 Agent
【合规】
☐ 数据去向清楚,PII 已脱敏
☐ 用户知道在和 AI 交互
☐ 高风险决策有人工介入
【长期】
☐ 日历上有「模型升级后重审 harness」的提醒
☐ 定期问:我可以停止做什么?
🕳️ 八、五个常见坑
| 坑 | 症状 | 修 |
|---|---|---|
| 只算 API 成本 | ROI 算错,项目中途叫停 | 把工程师时间算进去 |
| 看平均 token 不看分位数 | 长尾任务偷偷烧钱 | 监控 p95/p99 |
| 逐个修产出 | 永远修不完 | 循环工程:修流程 |
| 人工审查想全覆盖 | 人力瓶颈,反而没人认真看 | 风险加权抽样 |
| 合规最后才想 | 做完了上不了线 | 立项时就把合规要求写进需求 |
📚 延伸阅读
✅ 检查点
- 选场景的四条标准是什么?共同点是什么?
- 算成本时最容易被低估的是什么?
- 「大脑与双手解耦」拆的是哪三样?为什么要拆?
- 为什么监控 token 要看分位数不看平均值?
- 「循环工程」是什么意思?它为什么是分水岭?
- 「能写代码但不能部署」体现了什么原则?
- 人工审查为什么要改成"风险加权抽样"?效果如何?
👀 答案
- 可并行、规格明确、验证客观、失败可恢复。共同点:工作队列能自动生成(错误/失败自动变待办)。
- 人力成本——搭建、调试、维护 Agent 系统的工程师时间往往远超 API 账单。
- Session(事件日志)/ Harness(控制循环)/ Sandbox(执行环境)。因为 harness 编码的假设会过时,架构要能整体替换 harness 而不丢状态;且凭据不进沙箱可防注入窃取。
- Agent 成本分布是重尾的——90% 任务花 $0.05,10% 花 $5,平均值会掩盖长尾这个成本黑洞。
- 修产出代码的那个流程,而不是逐个修产出。发现模式→更新规则→重跑队列,200 个问题一起消失。它是大规模落地和小打小闹的分水岭。
- 权限分离/最小权限——能力与权限解耦,被攻陷的 Agent 也造不成最大伤害。
- 想全面把关会造成人力瓶颈,结果反而没人认真看。抽样后人力集中在高杠杆节点,效果:收到实质性审查意见的 PR 从 16% 升到 54%。
🛑 可以停在这里
⚡ 走神救援
Demo 到生产隔着五件事:选场景、算成本、架构解耦、组织接受、合规过关。
⭐ 选场景四标准是可并行、规格明确、验证客观、失败可恢复;⭐⭐ 它们的共同点是「工作队列能自动生成」——错误、失败、bug 单自动变成待办,人只管修「失败的模式」。
⭐⭐ 算成本的判据只有一条:和人力成本比,不和 API 单价比。 一次大规模迁移的账单看着吓人,而它对标的是一个团队干一年。⭐ 而同一件事上二十倍的差价买的是「能用」和「不能用」(便宜那版产物根本不可用)。⚠️ 最容易低估的成本是人——工程师的时间远超 API 账单。
架构上三层解耦,⭐ 状态外置的价值是让状态错误不再复利;⚠️ 凭据不进沙箱。
六个指标里两条要点:⭐ 看分位数不看平均——💀 成本是重尾的,绝大多数任务很便宜、少数几个贵两个数量级,平均值会骗你;⭐ 平均轮数突然升高等于「它在打转」;而人工介入率降不下去,就说明还不成熟。
⭐⭐ 组织那一段最值钱的是两条:人工审查要改成风险加权抽样——实质性审查意见的比例能翻好几倍;以及 ⭐ 「循环工程」:修的是产出代码的那个流程,不是逐个修产出——上千个文件里两百个有问题时,发现模式、改规则、重跑队列,两百个一起消失。⭐ 这是大规模落地的分水岭。
⚠️ 合规不会让 Agent 更聪明,但它决定能不能签单;⭐ 其中最常见的事故是整条数据库记录被原样拼进提示词。
下一节 👉 16b-框架这层皮.md