📑 本页目录(点开跳转)
16 · 企业落地与生产化
⏱ 22 分钟 | ⭐ 想把 Agent 变成产品/推进到公司里的必看
🎯 一句话
Demo 到生产之间隔着五件事:选对场景、算清成本、架构解耦、组织接受、合规过关。 这一章全是从公开的生产实践里抠出来的数字和教训。
🗺️ 一、选场景:什么任务值得上 Agent
四条筛选标准
| 标准 | 好例子 | 坏例子 |
|---|---|---|
| 工作可并行 | 迁移数千个独立文件 | 单体强耦合的重构 |
| 规格明确 | 原代码库就是参考规格 | 「把产品做得更好用」 |
| 验证客观 ⭐ | 测试套件给出通过/失败 | 靠人主观评审 |
| 失败可恢复 | 单文件失败重跑即可 | 一步错全盘崩 |
🔑 最佳落地场景的共同点:工作队列能自动生成。 编译错误、测试失败、bug 单自动变成待办——人不再挑活儿,只管修「失败的模式」。
🎯 一个实用的筛选打分表
给候选场景打分(每项 0–2 分,总分 ≥ 6 才值得做):
□ 可并行度 0=完全串行 1=部分 2=天然可并行
□ 规格明确度 0=靠感觉 1=有文档 2=有可执行的规格(测试/原代码)
□ 验证客观性 0=人主观 1=半自动 2=全自动通过/失败
□ 失败可恢复 0=全盘崩 1=手动回滚 2=自动重试
□ 价值密度 0=省几分钟 1=省几小时 2=省几人周
💰 二、算清成本:真实世界的量级感
来自公开披露的真实数字(当量级参考,不是报价):
| 案例 | 规模 | 成本 |
|---|---|---|
| 百万行代码语言迁移 | 59 亿输入 token,两周 | 约 $165,000 |
| 16 个并行 Agent 写 C 编译器 | 2000 会话,10 万行代码 | 略低于 $20,000 |
| 三 Agent harness 做完整 App | 6 小时 | 约 $200(单 Agent $9 但产物不可用) |
| 多 Agent 研究系统 | 相对单 Agent | 15 倍 token 换 +90% 效果 |
🧮 算账的三条口诀
① 和【人力成本】比,不是和 API 单价比
$165K 迁移百万行 vs 一个团队干一年
② 多 Agent 的 15 倍溢价只配高价值任务(第 13 章)
③ harness 的 20 倍成本差($9 → $200)买的是
「能用 vs 不能用」,不是「好 vs 更好」 ⭐
💡 最容易被低估的成本:人。 搭建、调试、维护 Agent 系统的工程师时间,往往远超 API 账单。 算 ROI 时把它算进去。
🏗️ 三、架构:大脑与双手解耦
- ↕ 状态外置 → harness 挂了也能恢复
- Harness(控制循环)
- ↕ 可整体替换升级
- Sandbox(执行环境)
- ↕ 容器从"宠物"变"牲畜":挂了就换
为什么要这么拆 —— 第 12 章的命题在架构层的回响: harness 会编码过时的假设,所以架构必须能容纳「尚未被发明的 harness」。
实际收益(公开数据):
| 收益 | 说明 |
|---|---|
| 会话状态外置 | harness 可重启恢复,状态错误不再复利 |
| 凭据不进沙箱 ⭐ | 提示注入偷不到密钥(第 15 章的硬边界) |
| 容器按需配置 | 首 token 延迟 p50 降约 60%、p95 降超 90% |
🚀 四、生产运维三件套
| 问题 | 解法 |
|---|---|
| 状态错误会复利(小故障级联成大异常) | 从出错点恢复而非从头重跑;把工具失败明确告知 Agent 让它自适应 |
| 非确定性没法调试(同提示词每次路径不同) | 全量追踪 + 高层可观测性(只监控决策模式不看对话内容,兼顾隐私) |
| Agent 持续运行,没有发布窗口 | 彩虹部署:新旧版本并存,流量渐进切换 |
📊 必须监控的六个指标
① 每任务 token 消耗(分位数,不是平均值)⭐ 长尾是成本黑洞
② 任务完成率 / 中途放弃率
③ 平均轮数(突然上升 = 模型在打转)
④ 工具调用失败率(按工具分)
⑤ 人工介入率(该降但降不下去 = 系统不成熟)
⑥ 端到端延迟 p50/p95
💡 看分位数不看平均值:Agent 的成本分布是重尾的—— 90% 的任务花 $0.05,10% 的任务花 $5,平均值会骗你。
🏢 五、组织级实践参考
来自一个约 80% 合入代码由 AI 撰写、工程师季度发布量 8 倍的组织:
| 做法 | 说明 |
|---|---|
| 多 Agent 分域审查 | 每个审查 Agent 只盯一个窄面(安全/性能/风格)。分离防共享盲区 |
| 人工审查改为风险加权抽样 ⭐ | 不再全面把关,人力留给杠杆最高的节点。效果:收到实质性审查意见的 PR 从 16% → 54% |
| 权限分离 | 事故响应 Agent 能读日志、能发报告,不能自主部署修复(写代码的能力与部署的权限分开) |
| 把 Agent 当内部威胁对待 | 所有动作过 SIEM 审计,偏离预期即告警 |
| 影子模式 | 新 Agent 先只观察不生效,攒够信任再上 |
| 循环工程 ⭐ | 修产出代码的那个流程,不是逐个修产出 |
🔁 循环工程(值得单独理解)
❌ 逐个修产出:
1000 个文件迁移,200 个有问题 → 一个一个手动修 → 修完发现新一批又出同样问题
✅ 修流程:
发现模式 → 更新规则手册 → 让队列重跑 → 200 个问题一起消失 ⭐
💡 人的注意力要放在【失败的模式】上,不是【单个失败】上
🔑 这是大规模 Agent 落地和小打小闹的分水岭。
⚖️ 六、合规与风险(To B 必须过的关)
| 议题 | 最低要求 |
|---|---|
| 数据去向 | 搞清供应商是否用你的数据训练、存哪个地域、存多久 |
| PII 脱敏 ⭐ | 发送前自动识别替换身份证/手机/银行卡。最常见事故是整条数据库记录拼进提示词 |
| 告知义务 | 多数法域要求告知用户在和 AI 交互 |
| 高风险决策 | 招聘/信贷/医疗等场景必须有人工介入,不能 AI 单独决定 |
| 可追溯 | 保留审计日志,能回答「这个决策是怎么来的」 |
| 内容责任 | 商用生成内容做相似度检查;代码生成注意开源许可证 |
⚠️ 这些不会让你的 Agent 更聪明,但会决定它能不能上线、能不能签单。
📋 七、上生产检查单
【场景】
☐ 过了四条筛选标准,打分 ≥ 6
☐ 工作队列能自动生成
【架构】
☐ 做过降级测试,有数据证明复杂度必要(第 6 章)
☐ 多 Agent 的 15 倍溢价对得起价值(第 13 章)
☐ 状态外置,可从出错点恢复
【质量】
☐ 有评测套件,读过转录(第 14 章)
☐ 有环境层硬边界,做过威胁建模(第 15 章)
☐ 高危动作权限分离(能写≠能部署)
【运维】
☐ 六个指标都在监控,且看分位数
☐ 有降级方案(模型挂了怎么办)
☐ 部署不打断运行中的 Agent
【合规】
☐ 数据去向清楚,PII 已脱敏
☐ 用户知道在和 AI 交互
☐ 高风险决策有人工介入
【长期】
☐ 日历上有「模型升级后重审 harness」的提醒
☐ 定期问:我可以停止做什么?
🕳️ 八、五个常见坑
| 坑 | 症状 | 修 |
|---|---|---|
| 只算 API 成本 | ROI 算错,项目中途叫停 | 把工程师时间算进去 |
| 看平均 token 不看分位数 | 长尾任务偷偷烧钱 | 监控 p95/p99 |
| 逐个修产出 | 永远修不完 | 循环工程:修流程 |
| 人工审查想全覆盖 | 人力瓶颈,反而没人认真看 | 风险加权抽样 |
| 合规最后才想 | 做完了上不了线 | 立项时就把合规要求写进需求 |
📚 延伸阅读
✅ 检查点
- 选场景的四条标准是什么?共同点是什么?
- 算成本时最容易被低估的是什么?
- 「大脑与双手解耦」拆的是哪三样?为什么要拆?
- 为什么监控 token 要看分位数不看平均值?
- 「循环工程」是什么意思?它为什么是分水岭?
- 「能写代码但不能部署」体现了什么原则?
- 人工审查为什么要改成"风险加权抽样"?效果如何?
👀 答案
- 可并行、规格明确、验证客观、失败可恢复。共同点:工作队列能自动生成(错误/失败自动变待办)。
- 人力成本——搭建、调试、维护 Agent 系统的工程师时间往往远超 API 账单。
- Session(事件日志)/ Harness(控制循环)/ Sandbox(执行环境)。因为 harness 编码的假设会过时,架构要能整体替换 harness 而不丢状态;且凭据不进沙箱可防注入窃取。
- Agent 成本分布是重尾的——90% 任务花 $0.05,10% 花 $5,平均值会掩盖长尾这个成本黑洞。
- 修产出代码的那个流程,而不是逐个修产出。发现模式→更新规则→重跑队列,200 个问题一起消失。它是大规模落地和小打小闹的分水岭。
- 权限分离/最小权限——能力与权限解耦,被攻陷的 Agent 也造不成最大伤害。
- 想全面把关会造成人力瓶颈,结果反而没人认真看。抽样后人力集中在高杠杆节点,效果:收到实质性审查意见的 PR 从 16% 升到 54%。
🛑 可以停在这里
⚡ 走神救援
Demo到生产隔着:选场景、算成本、架构解耦、组织接受、合规过关。四标准:可并行、规格明确、验证客观、失败可恢复(加价值密度共五项,⭐总分≥6才做);⭐共同点是「工作队列能自动生成」——错误/失败/bug单自动变待办,人只管修「失败的模式」。成本量级:百万行语言迁移=59亿token、两周、$165,000;三Agent harness做完整App=6小时$200(单Agent $9但产物不可用)。⭐和人力成本比,不和API单价比;20倍差价买的是「能用vs不能用」;⚠️最易低估的成本是人——工程师时间远超API账单。架构:Session/Harness/Sandbox三层解耦,状态外置让状态错误不再复利;⭐凭据不进沙箱;容器按需配置让首token延迟p50降60%、p95降超90%。运维:从出错点恢复、全量追踪、彩虹部署。六指标:每任务token(看分位数不看平均)、完成/放弃率、平均轮数(突升=在打转)、按工具的失败率、人工介入率(降不下去=不成熟)、端到端p50/p95;⚠️成本重尾:90%任务$0.05,10%花$5,平均值会骗你。组织(约80%合入代码由AI撰写):分域审查防盲区、⭐人工审查改风险加权抽样(实质性审查意见的PR从16%→54%)、能写代码≠能部署、⭐⭐循环工程:修产出代码的那个流程,不是逐个修产出(1000个文件里200个有问题:发现模式→改规则→重跑队列,200个一起消失),这是大规模落地的分水岭。合规:数据去向、PII脱敏(最常见事故是整条数据库记录被拼进提示词)、告知义务、高风险决策人工介入、可追溯——⚠️不会让Agent更聪明,但决定能不能签单。
下一节 👉 16b-框架这层皮.md