允许 AI 自主上生产的公司,一个月从 75% 掉到 56%:VB 调查还发现一个更危险的缺口——只有 29% 的企业真在检查 AI 输出的对错
允许 AI 自主上生产的公司,一个月从 75% 掉到 56%:VB 调查还发现一个更危险的缺口——只有 29% 的企业真在检查 AI 输出的对错

过去一年,企业圈最流行的一句话是"要让 AI Agent 自主干活";而 2026 年 8 月的一份专项调查,给这股热情泼了一盆冷水:允许 AI 代理不经人工审核直接执行生产变更(或计划在一年内落地该机制)的企业占比,从 7 月的 75% 骤降到 56%——一个月内掉了 19 个百分点。更扎心的是同口径下的另一组数字:在已经开展部署前评估的企业里,61% 在过去 12 个月遇到过"AI 通过了内部测试、上线却引发面向客户故障"的情况,而这个比例在 7 月还是 53%。

一句话结论:这份由 VentureBeat Intelligence(VB Intelligence)在 2026 年 8 月执行的 Agent 可靠性与评估专项调查,最有价值的不是那个暴跌的 56%,而是它撕开了两道裂缝——其一,内部测试与真实生产之间隔着一个巨大的落差带,测试绿灯≠上线安全;其二,也是更少被提及的:即便放开了自主权限的企业里,也只有 26% 把"实时检查 AI 输出内容对不对"当作主要监控手段,多数企业监控的是"系统跑没跑通",而不是"结果准不准"。形式合规、状态码正常、内容错误的 AI 输出,大概率根本不会触发告警。

一、先钉口径:这是一份小样本、但结构对照严谨的调查

读任何百分比之前,先把样本条件摆清楚,否则很容易被"一个月暴跌 19 点"这种标题带偏。VB Intelligence 这次调查的几个关键限定:(1) 2026 年 8 月共回收 140 份有效回复,7 月做过一次同题对照;(2) 两次样本均为自主报名的行业从业者与小组成员,不能直接推导全企业市场的整体变化;(3) 8 月样本中 53% 是企业 AI 采购的最终决策者,7 月这一群体占比为 44%——样本结构变了,会不会是数据波动的原因?

调查方用了一个聪明的办法排除这个干扰:单独只看"最终决策者"这一核心群体,支持无人工审核生产变更(或计划搭建相关能力)的比例,同样从 7 月的 88% 降到了 61%。也就是说,即便剔掉样本构成变化的影响,收紧的趋势依然成立。这是整份报告可信度最高的一处设计——它没有停留在"总量降了",而是做了分层对照。

还有一条时间线值得注意:这次态度转变发生在 9 月 12 日 Anthropic CEO 达里奥·阿莫迪公开呼吁放缓前沿 AI 开发之前,也早于 OpenAI、Google DeepMind 等高管的类似表态。换句话说,企业收紧自主权限不是被行业大佬的言论带动的,目前也没有明确数据能指向具体的触发事件。趋势是真的,原因未知——这本身就是一个诚实的结论。

二、75% → 56%:一个月的态度急转说明了什么

把当前企业的实际部署规则摊开看,分布是这样的:

企业对 AI 自主生产变更的态度占比
已允许部分低风险场景不经人工验证执行生产变更27%
明确在可预见未来不会放开无审核变更权限35%
计划在 12 个月内搭建支持自主变更的能力20%
尚未部署任何自主 AI 代理16%
未明确表态2%

剔除还没部署自主代理的样本后,另一个对照更能说明转向的速度:"会在可预见未来保留人工审核环节"的企业占 42%,而这个数字在 7 月只有 20%——一个月内翻倍。

怎么理解这种急转弯?我的读法是:75% 那个数字本身就虚高。2025 到 2026 上半年,"Agentic AI 全面自主"是供应商叙事的高峰期,很多企业在问卷里表达的其实是"愿景"而不是"政策"。当第一批真实故障经验沉淀下来(61% 的"测试通过、上线出祸"就是证据),受访者开始区分"我希望它自主"和"我敢让它自主",数字就迅速回落到了更接近现实约束的位置。与其说企业变得保守了,不如说企业第一次认真算这笔授权账。

三、最危险的发现:监控的是"活着",不是"正确"

如果只记这份调查的一个数字,我建议记这个:在部署了自主 AI 代理的企业中,仅 29% 把"实时自动化质量检查"作为主要生产监控手段——也就是真的去校验 AI 输出内容的正确性。其余的企业在监控什么?36% 主要依赖交易追踪日志(记录基础设施状态、token 消耗、输入输出内容供事后调试,但不判断对错),16% 靠 API 网关做基础设施层面的运行追踪,11% 甚至不了解自己公司的监控方式,8% 靠临时人工抽查。

更要命的是下一层:即便是那些已经放开无审核生产变更权限的企业,也只有 26% 把实时输出质量检查当主要监控。这两个数字合在一起,勾勒出的图景相当惊悚:大量企业正在让 AI 自主改动生产系统,而它们对 AI 的监督方式是"看服务有没有挂、状态码是不是 200、token 有没有烧"。一个格式完全正确、接口返回成功、但业务内容错了的输出——比如把价格字段算错、把客户邮件发错对象——在这类监控体系下不会触发任何告警,它会安静地错误着,直到客户投诉或财务对账时才会被发现。

需要补一句公允的限定:问卷只统计"主要监控手段",选了日志追踪的企业可能同时部署了其他自动化校验,只是没被这道题覆盖。但即便如此,"实时质量检查"没能成为主流这一事实仍然成立。

四、反常识细节:摔过跤的企业,反而没变得更谨慎

按直觉推理:经历过"AI 通过测试却搞崩线上"的企业,应该会收紧自主权限吧?数据给了一个相反的答案。经历过同类故障的企业中,59% 已放开特定场景的无审核变更权限或正在搭建相关能力;而未经历过故障的企业中,该比例为 55%。两者不存在统计意义上的明显差距。

这个反差怎么解释?几种可能的读法:其一,故障经历可能被理解为"个别场景翻车",企业的应对是缩小授权范围(只放开低风险场景)而非退出;其二,敢于让 AI 上生产的企业本来就是激进派,一次事故不足以改变其路线;其三,也不能排除幸存者偏差——没出事的企业观望,出过事的企业反而摸清了边界。无论哪种解释成立,它都指向同一个管理启示:真正决定风险姿态的不是"有没有出过事",而是"出事时损失了什么、以及能不能兜住"。把试点范围切在与损失可控性相匹配的地方,比笼统地谈"信任/不信任 AI"更有操作价值。

五、评估工具买得越凶,越暴露没人信它们

企业对自主权限的谨慎,与评估工具投入的攀升形成了一个耐人寻味的剪刀差。OpenAI 原生评估工具的企业使用率从 7 月的 31% 猛升到 8 月的 59%;Confident AI 渗透率 36%、Braintrust 23%、Anthropic 控制台 16%、LangSmith 13%。62% 的受访企业计划在 12 个月内新增、替换或补充评估平台,其中 35% 打算 3 个月内就动手。

但与此同时,仅 9% 的受访者认为现有自动化评估结果"足够可靠、可直接使用"。不信任的理由也很具体:27% 说评估结果匹配不了真实场景的实际表现,24% 抱怨评估过程缺乏可解释性,16% 遇到过评估偏差或结果不一致,13% 顾虑数据泄露风险,12% 觉得工具成熟度不够。

这两组数据放在一起,就把企业 AI 治理的真实矛盾点挑明了:问题已经不是"要不要建自动化评估能力",而是"在无人介入的场景下,你敢给评估结果授予多大范围的操作权限"。企业正在明确区分两件事——用自动化工具"检测"AI 表现,和拿自动化结果当生产变更的"唯一审批依据"。前者大家都在买、都在用;后者几乎没人敢点头。这也解释了为什么人工审核工作流(30%)会成为未来一年投入增长预期最高的方向,略高于生产可观测性工具(26%)和自动化评估流水线(21%)——钱在流向"人还在环里"的环节。

六、给正在规划 Agent 上生产的团队的三条实操建议

把这份调查翻译成工程语言,可以提炼三条落地的动作。

第一条:给你的变更权限画一张"爆炸半径地图",而不是一刀切。数据里活得最清醒的企业,是那些"只放开特定低风险场景"的(剔除未部署样本后 32% 已这么做)。正确的问法不是"这个 Agent 靠不靠谱",而是"它这次改动最坏的后果是什么、回滚要多久、谁承担"。配置一个客服话术模板和改动支付对账逻辑,即便模型相同,授权级别也应该完全不同。

第二条:把监控从"存活探针"升级到"语义探针"。29% 这个数字就是你的行业位置——如果你的监控栈只回答"请求成功了吗",那你和七成以上的企业一样,对"内容错误但格式正确"的输出是盲的。可行的起步方案:对高风险输出接一层独立的小模型或规则引擎做抽样语义校验、对关键字段做前后置一致性断言(金额、收件人、合同条款号)、把"用户投诉-回溯定位到 AI 变更"的链路时长做成北极星指标。

第三条:评估体系要设"可信度预算",别指望一步到位全自动。9% 的信任率说明当前自动化评估只能当"仪表",不能当"自动驾驶"。务实的分层是:低风险变更走自动化门禁+事后抽检;中风险走自动化+人工双签;高风险保持人工主导、AI 只做辅助分析。随着你的评估集与线上表现的相关性被持续验证(这一步必须用自己家的数据,不能借用别人的基准),再逐档把权限下放。

七、FAQ

Q1:一个月内从 75% 跌到 56%,是不是说明 Agent 自主化这波热潮结束了?

不能这么绝对。首先这是 n=140 的自主报名样本,反映的是受访群体的态度边际变化,不是全市场的既成事实;其次,"计划 12 个月内搭建自主变更能力"的企业仍占 20%,方向并没有被否定,被推迟的是"无条件授权"。更准确的说法是:行业从"要不要让 AI 自主"的愿景阶段,进入了"在哪些场景、以什么监控为前提放开自主"的精算阶段。这对基础设施和治理工具反而是利好——权限细化意味着更多的策略引擎、观测与审计需求。

Q2:经历过故障的企业意愿没下降(59% vs 55%),是不是说明失败经验没用?

这说明"失败经验"的作用方式不是吓退,而是划界。数据里没有"经历过故障就整体收紧"的迹象,结合 27% 企业"只放开低风险场景"的现状,更合理的解读是:这些企业把一次故障转化成了场景白名单和风险控制参数,而不是转化成放弃。当然也要警惕另一种可能——愿意承认故障又继续推进的本就是激进群体,样本无法区分这两种成分。

Q3:这份调查和企业高管 9 月公开呼吁放缓 AI,是一回事吗?

时间线上恰好相反:这次 8 月的调查开展早于 9 月 12 日 Anthropic CEO 呼吁放缓的公开发声,也早于 OpenAI、DeepMind 高管的类似表态,所以企业态度的收紧不是跟风大佬言论,目前也没有明确数据指向具体触发因素。两者的"方向"看似一致,但主体完全不同——一个是采购决策者在自家生产环境上的授权选择,一个是模型实验室负责人对行业节奏的公共倡议,不宜混为一谈互相背书。


参考来源:

· VB Intelligence — 2026 年 8 月 Agent 可靠性与评估专项调查(亿邦动力 2026-10-09 编译;n=140 有效回复、53% 为企业 AI 采购最终决策者,含 7 月同题对照与决策者分层数据;自主报名样本,不可外推至全市场)

· VentureBeat — Transform 2026 系列报道(2026-10 前后,Agent 权限执行现状的跟踪调查:"37 家受调查公司中 22 家在实施 AI Agent 权限管控的情况下仍存在 Agent 共享权限问题")

· 站内交叉阅读:本站此前基于 ThinkingBox 评测指出的 Agent"假成功"现象(ID 1663)、New Relic 调查中 94% 好评与 78% 事后放行的断裂(ID 1662)——三份不同机构的数据共同指向"验收与监督机制滞后于部署速度"这一判断,口径各异仅作方向对照,不可相加平均。