Agent 落地的 ROI 账:为什么 60% 计划只落地了 17%
Agent 落地的 ROI 账:为什么 60% 计划只落地了 17%

2026 年 8 月,Gartner 首次发布 Agentic AI 技术的 Hype Cycle 报告,其中两个数字被反复引用:只有 17% 的组织真正部署了 AI Agent,60% 以上计划在未来两年内部署。同一家机构在 2025 年 6 月 25 日的悉尼新闻稿里还说过另一句话:到 2027 年底,超过 40% 的 Agentic AI 项目将被取消。

三组数字放在一起,画面很完整:六成打算上,一成七真的上了,四成要砍掉。

更值得注意的另一个数字:在数千家自称做 Agent 的供应商里,Gartner 估计只有约 130 家提供真正具备自主决策能力的产品——其余是行业里所说的 "Agent Washing",把旧聊天机器人换个标签重新卖。

60% 计划、17% 部署、40% 取消、130/数千,这四个数字背后是一整套非常具体的算账方法。这篇文章要把这套方法完整还原出来——因为能不能算清这笔账,直接决定了你的项目会不会落到那 40% 里。

一、先看 40% 会被砍掉的那批:它们是被什么砍的

Gartner 给的三条取消原因是:成本攀升(cost overruns)、业务价值不清(unclear business value)、风险控制不足(insufficient risk controls)。这三条正好对应账目的三个部分,缺一个都会出事。

取消原因在账上的体现最常见的错误
成本攀升运行成本没上限,按 demo 建模会低估生产成本 3–10 倍用 token 单价 × 预估调用量算账,完全没算重试和失败返工
业务价值不清算的是"省了多少人",算不出"省了多少流程"把演示里省下的时间乘以人数,当作年度收益
风险控制不足没有人工升级机制,错误成本无人兜底没有定义"什么情况下必须转人工"

关于第一条那个 3 到 10 倍,Gartner 的原话是:按简单演示建模的每任务成本,在 Agent 处理真实世界的变化时,会低估生产环境成本的 3 倍到 10 倍。这是整篇账目里最需要提前预留的余量——一个按 demo 价格算出来"一年省 20 万"的流程,到生产很可能变成"一年多花 30 万"。

二、核心公式:有效自动化比例

所有 ROI 测算里最容易出错的一步,是把"调用成功"当成"任务完成"。正确的算法要连乘三个系数:

有效自动化比例 = 自动完成率 A × (1 − 人工修改率 M) × (1 − 错误返工率 R)

代入一组典型的数字看会发生什么:自动完成率 80%,其中 20% 需要人工修改,5% 需要返工。

口径计算结果
汇报口径只报自动完成率80%
真实口径0.8 × (1 − 0.2) × (1 − 0.05) = 0.8 × 0.8 × 0.9560.8%

80% 和 60.8% 之间的 19.2 个百分点,就是"业务价值不清"最典型的来源。一个汇报里说"自动完成率 80%"的 Agent 项目,实际创造的 labour 价值只有它声称的七成六。这不是造假,是口径问题——但它足以让一个 ROI 模型的结论从"值得投"变成"不值得投"。

三、完整的三段式测算:四步算完

把公式落地成一个可执行的测算表。假设一个销售线索整理场景:每月处理 800 个线索,单个线索整理和录入需要 12 分钟,综合时薪 80 元。

步骤计算结果
1. 当前人工成本数量 × 单次耗时 × 综合时薪 = 800 × 0.2 小时 × 8012,800 元 / 月
2. 有效自动化比例A × (1 − M) × (1 − R) = 0.8 × 0.8 × 0.9560.8%
3. 节省人工成本12,800 × 60.8%7,782.4 元 / 月
4. 扣除运行与维护成本每任务推理成本 × 任务数 + 工程维护 + 持续迭代(预留 10%–20%)视模型与部署方式而定

7,782.4 元是毛节省。真正要算净收益,第四步必须扣三块:

  • 推理与基础设施成本——按每任务成本而非每 token 价格算,含 3–10 倍的生产余量
  • 持续迭代费——场景化微调与护栏不是一次性的,预留 10%–20%
  • 风险成本——错误决策的业务代价,这一条最难估但最不能省

算净而不是算毛,是这条账最核心的原则。净节省 = 基线人工处理时间 − Agent 辅助流程中的全部人工投入(包括审查和纠错)。把审查时间排除在外,就会得到一个和 DORA 2025 所说的"验证税"完全相反的结论——而那个结论在现实中会以返工率的形式收回来。

四、真实案例:摩根大通的两年两步走

上面是算式,这是有具体数字的对照样本。摩根大通的路径分两个阶段,每一阶段都有可核查的数据。

阶段做法结果
第一步(2017)上线 COiN 合同智能平台,把律师和信贷员每年 36 万小时的合同审查工作自动化常规错误减少 80%,每年节省约 1.44 亿美元
第二步(2023 起)开放内部 LLM Suite 平台,接 OpenAI + Anthropic 两家模型,每 8 周更新一次60% 员工自采用,DAU 接近 50%,零强制

COiN 的 36 万小时和 1.44 亿美元这两个数字,是"单点深井"模式的标杆。它的特点不是技术先进,而是场景边界极清晰——合同审查是一个输入格式统一、判断标准明确、错了立刻能发现的流程。这正是它能拿到 80% 错误下降和 1.44 亿美元年节省的原因,不是模型变聪明了,是这个任务本身适合自动化。

LLM Suite 那条数据更微妙:60% 自采用、DAU 近 50%、零强制。摩根大通没有把 token 排行榜当 KPI,所以没有人去刷量。这个细节比 60% 这个数字本身更重要——它说明采用率是结果,不是目标;用指标驱动使用率,只会得到指标。

五、反面参照:Salesforce Agentforce 的四个数字

同一个季度,Agentforce 的数据构成了一组非常 instructive 的对照。

指标数值它其实在说什么
Agent 创建数同比 +119%供给侧:建 Agent 的速度翻倍
客服对话中 Agent 主导的比例同比 +22 倍使用侧:Agent 确实在接管对话
Q4 2025 成交转化5000 个成交里 3000 个是付费客户(60%)商业侧:四成是试用或未转化
AI 转人工率从 22% 涨到 32%质量侧:Agent 还撑不住的场景在扩大

转人工率从 22% 涨到 32%,是这一整节最重要的数字。它的含义非常明确:随着 Agent 承接的对话量增长,它撑不住的场景也在同步扩大。这是一个"覆盖率上升但缺口也在上升"的动态——如果只看 +22 倍那个数字,会以为一切顺利;如果把转人工率一起看,就会意识到人工兜底不是可选项,是 Agent 规模化的前提。

这正好对应 Gartner 那三条取消原因里的第三条:风险控制不足。一个没有设计人工升级机制的系统,在对话量放大到某个点后,一定会撞墙。

六、其他场景的回本数据:谁快谁慢

把已公开测量的几个场景按回本速度排一下,能看出很清晰的规律。

场景回本周期关键数据为什么快/慢
销售开发(SDR)中位 3.4 个月单条线索处理成本降 60%–80%;销售行政工作时间从 70% 降至 30%最快:任务高度重复,判断标准明确
客户服务相对较慢「1 换 3」模式,三年回报超 120%中期:靠规模效应摊薄
合同审查即期摩根大通年省 1.44 亿美元,错误降 80%最快:单一深井,边界极清晰
软件研发最不确定PR 合并速度 +35%,新功能交付周期两周→9 天,但初期 20% 的代码需要人工重写最慢且方差最大:受 METR 验证税影响

那 20% 的代码需要人工重写这个数字值得单独看——它和"有效自动化比例"里的 M 项是同一个东西。20% 的返工率直接压在 AI 编程场景的收益上,这也解释了为什么这个场景的回本周期和不确定性都排在最后。

七、8 个月这个数字:企业真实的心理准备期

Salesforce 在 2025 年对 2,025 名 Agentic AI 负责人做的调查给出了一个时间基准:企业平均需要约 8 个月才能达到有意义的 ROI。同一份调查还给出了三个决定这个时间的关键因素:数据质量、明确的 Agent 范围、人工升级机制。

关键因素做得好做不好对应本文哪个指标
数据质量文档统一、版本一致检索到的就是垃圾,RAG 系统直接失效直接决定 R 系数
明确的 Agent 范围先界定 5–8 个核心任务什么都想自动化,成本失控直接决定成本上限
人工升级机制什么情况转人工写清楚无兜底,转人工率一路上升对应 Agentforce 22%→32%

8 个月这个数字的实际含义是:任何承诺"三个月见效"的方案,都应该被质疑。它不是保守估计,是 2,025 名实际负责人的中位体验。

八、怎么用这份信息:五条实践建议

第一,立项时先界定 5–8 个核心任务,不要从"把整个部门 Agent 化"开始。这是 Salesforce 调查里"明确的 Agent 范围"落到实践的形态。Agent 数量越多不等于价值越大,边界清晰的垂直 Agent 更容易证明 ROI——这也是 17% 与 60% 之间那条鸿沟的跨越方式。

第二,用有效自动化比例汇报,不要用自动完成率汇报。A × (1 − M) × (1 − R) 这个公式加上那 19.2 个百分点的差额,是让 CFO 相信你和让 CEO 相信你之间最大的区别。用 80% 汇报的项目,两个月后一定会被追问。

第三,成本模型按生产环境预留 3–10 倍余量,并设三重硬上限。Gartner 给的处方是每任务、每会话、每天三个层级的支出封顶。这条不是财务技巧,是架构约束——Gartner 的 40% 取消预测里,"成本攀升"排在第一位。

第四,把人工升级机制当成第一版功能来设计,不是补丁。Agentforce 转人工率从 22% 涨到 32% 说明了一件事:随着规模扩大,兜底需求只会增加不会减少。在建 Agent 的同一张架构图上画出转人工路径,比事后补要便宜得多。

第五,验收窗口按 8 个月设定,第一个检查点在第 4 个月。如果第 4 个月有效自动化比例达不到 60% 附近,就该停下来复盘范围定义和数据质量,而不是继续投钱。8 个月是 2,025 名负责人的中位数,你的项目没理由比它乐观。

九、结语

把这套数字和这套算式放在一起,Agent 项目在 2026 年的真实图景是这样的:

60% 计划部署,17% 真的部署,40% 会被取消,数千家供应商里只有约 130 家有真东西。这个结构说明市场在快速分化,而不是整体增长。

分化靠什么?靠能不能算清那笔账。能算清的团队在 17% 里面,算不清的落在 40% 里面。而算清这笔账不神秘:三个系数相乘,四步做减法,8 个月看结果。

所以如果只记住一件事:把"自动完成率 80%"换算成"有效自动化比例 60.8%",再把 8 个月写进进度表。这两处改动就能让一个原本会被砍掉的项目活下来——反过来说,一个连这两处都没算的项目,大概率就是那 40% 里的一个。