一、写这篇的动机

2026 年 8 月 25 日下午,两位 UC Berkeley 在读本科生 Neel Sharma 和 Anay Shukla 在 YC W2026 批次里,把一个所有企业 AI Agent 团队都在撞、却几乎没有产品正式接住的问题,做成了一门生意:他们做了一家叫 Sentrial 的公司,在单一 YC 批次里从零冲到 3 万美元月经常性收入。客户是一家《财富》1000 强,跑 LangChain Agent 跨供应链、HR、营销自动化,部署 Sentrial 一周之内,Agent 错误率从高于 20% 降到 10% 以下。

同一天下午,国内一家做 AI Agent 调度平台(代号 OpenClaw)的工程团队,经历了更典型的另一面:核心服务的 token 消耗在半小时内暴涨 300%,监控大屏上的红色曲线像锯齿一样往上爬,告警邮件和钉钉消息刷爆屏幕。排查到最后,他们没找到"模型坏了"或"流量攻击"——他们找到了三段在后台静默失败的 Cron 定时任务,以及一份被反复错误加载的 MEMORY.md 文档。

同一天下午,Braintrust 的现场 CTO Ameya Bhatawdekar 在 AI Engineer 峰会上抛出一句话:"Your Agent Evolved. Your Evals Didn't."——你的 Agent 演进过了,你的评测体系没有跟上。

这三条线在同一天撞在一起,揭示的是 2026 年下半年企业 AI Agent 落地最贵、最安静、最难被监控系统发现的反模式:静默失败(silent failure)。这个词,指的是 Agent 返回 HTTP 200、Session 干净关闭、token 已计费、APM 一切指标全绿,但用户得到的答案是错的,或者工作流以错误状态完成——而没有任何告警会响起来。

Sentrial 给出的核心数字是:78% 的 AI Agent 故障不会以系统错误的形式浮现。它们是语义层的失败——幻觉、无限循环、跨步骤丢上下文、连续三次错误顺序的工具调用——直到工作流以坏状态结束,监控系统都认为"一切正常"。

过去三年,所有人都把精力放在"模型能不能答对"。2026 年 8 月开始,真正拉开企业差距的,是"答错了你能不能立刻知道"。这篇文章把这个反模式拆到底,并给今天就能落地的 5 层防御。

二、2026 年 8 月那天发生的三件事不是巧合

为什么是 8 月 25 日?因为同一天有三类完全不同的人,各自撞上了同一堵墙。

第一类人,是 Agent 可观测性领域的创业者。Sentrial 的两位创始人 Neel 在 Sense 做 Agentic 优化流水线、Anay 在 Accenture 部署 DevOps Agent。他们看到的是同一个反复出现的故障模式:生产部署按每一个可观察指标看都是绿的,除了实际输出本身。用户拿到错误答案,工作流以错误数据完成,但没有人知道哪些 session 失败了,更不知道为什么会失败。

第二类人,是 生产事故的救火工程师。OpenClaw 团队发现 token 暴涨 300% 的那一天,他们最初的反应是"重启大法好"——但线上服务重启意味着中断。他们只能沿着"监控指标 → 日志分析 → 代码定位"的反向路径硬追。最终的根因不是模型、不是网络、不是任何"明显应该报警"的事,而是三个静默失败的 Cron 定时任务在反复触发,每次触发都把同一份 MEMORY.md 加载进上下文,导致上下文窗口被无效内容塞满,模型被迫用越来越长的输入做越来越短的判断。

第三类人,是 Agent 评测平台的布道者。Braintrust 的 Ameya 在演讲里把 AI 系统分了三代:单 prompt → chain(RAG) → React 循环。每代架构演进,evals 都必须重新设计——但绝大多数团队还在用"最终答案对不对"这种单点评估,完全没跟上 React 循环里"工具调用、跨步骤推理、长上下文"带来的新失败面。

三件事背后的共同主题:企业 AI Agent 已经普遍走出 PoC,但绝大多数团队的监控基础设施,是为"软件要么能跑、要么抛异常"这个世界设计的。确定性系统的世界,在 Agent 开始写文本的那一刻就结束了。 我们还没建出"语义层"的可观测性基础设施。

三、数字:为什么这个反模式"贵得离谱"

把数字摆出来。

78% —— Sentrial 给出的行业基线:78% 的 AI Agent 故障不会以系统错误的形式浮现。它们是语义层失败。

0.4% —— 一个决定性的反直觉数字。在 10% 采样率的传统 APM 监控下,0.4% 的会话级失败模式完全消失——根本不在样本里。这是 Datadog 按主机计费模型制造出的财务激励错配:观察的主机越多账单越贵,所以团队把流量采样下来,而采样对捕获罕见失败是灾难性的。

300% —— OpenClaw 半小时内的 token 暴涨幅度。失败模式是"锯齿状上升":周期性地累积,然后冲高,小幅回落,继续冲高。这种模式暗示某种累积性问题,而非一次性爆发。

800MB → 2GB —— 单个 Pod 在 12 小时内的内存增长曲线。最终问题在达到 Pod OOM 被杀之前,先表现为 Full GC 频率显著增加、响应延迟抬升——但 APM 指标全绿。

20% → 10% —— 那家《财富》1000 强部署 Sentrial 一周内达到的错误率下降。这不是理论数字,这是单一客户的实际部署效果。

5 维 —— 真正可靠的 Agent SLO 必须覆盖的维度:Task Success Rate、Safety / Side Effect、Latency、Cost、Human Intervention Rate。任何一个维度单独"达标"都不能代表 Agent 健康。

7 类 —— Sentrial 内置的故障检测器:hallucinations、bad tool calls、infinite loops、agent forgetfulness(跨多步骤工作流丢上下文)、jailbreaking、unsafe outputs、user frustration signals(从对话模式中提取)。

这些数字叠在一起,指向一个让 CFO 都坐不住的结论:Agent 静默失败不是在烧钱,是在烧钱的同时,业务结果偷偷变差。 而业务结果变差这件事,在大多数企业里,要等到下一个季度的财务报表出来才会被发现。

四、问题:为什么传统的 APM 工具看不懂 Agent

传统 APM 是为确定性系统设计的。Datadog、New Relic、Splunk 这套体系,衡量"软件是否抛了异常、HTTP 是否返回 200、响应延迟是否在阈值内"。它们的整个世界观建立在一个前提上:系统要么正常工作,要么抛出错误。

AI Agent 把这个前提彻底打破了。一个 Agent 完成一次工作流,可能全程没有任何异常抛出,但:

  • Agent 幻觉了一个事实,以"看起来很有道理"的语气输出;
  • Agent 在某个子任务上陷入循环,反复重试同一个工具调用,直到工作流完成但状态错误;
  • Agent 在多步骤推理中丢失上下文,导致最后一步的工具调用基于错误前提;
  • Agent 连续三次以错误顺序调用工具,工作流最终完成,但下游数据是脏的;
  • Agent 因为 prompt injection 被劫持,执行了用户没要求的副作用。

这五种情况下,Agent 都返回 HTTP 200,session 干净关闭,token 正常计费,所有 APM 指标全绿。但用户的实际体验是错的,业务结果是错的。这种"看不见的失败",是 2026 年下半年企业 AI Agent 落地最危险的盲区。

更深一层:传统的"日志 + 指标 + 追踪"三件套,在 Agent 语义层面前信息密度不够。 一条 LLM 调用日志只告诉你"模型在某个时间点被调用,输入是 X,输出是 Y"。它不告诉你 Y 是不是真的对、X 是不是被 prompt injection 污染过、Y 跟用户预期之间的语义距离有多远。要回答这些问题,你需要的是对每一条 session 做语义层的判定,而不是对每一次 API 调用做基础设施层的指标聚合。

这就是为什么 LangSmith、Langfuse、Weights & Biases 这类"前生产期"工具解决不了这个问题——它们是为离线评测和模型改进设计的,不是为生产行为监控设计的。离线评测跑的是固定测试集,生产监控要面对的是真实用户行为的开放式分布。一个 Agent 在 200 个精心设计的测试用例上表现优秀,仍然可能在第 201 个真实查询上幻觉——只要那个查询稍微超出评测分布。测试集不会告诉你这件事,生产遥测会。

五、范式:从"基础设施层可观测"到"语义层可观测"

这是过去三年 AI 工程领域发生的最重要的一次范式转移。可观测性从"基础设施层"上移到"语义层",成为企业 AI Agent 落地的硬约束。

范式转移前:监控 = HTTP 状态码 + 响应延迟 + 错误率 + 资源利用率。这是 2015 年到 2023 年的标准做法,完全够用——因为那时候跑在生产里的"AI"主要是推荐系统、风控模型、欺诈检测,都是离线评分 + 在线调用,没有"边推理边决策边执行工作流"的语义组件。

范式转移后:监控 = 基础设施层指标 + 语义层判定。前者告诉你"服务在跑、没崩、没超时",后者告诉你"输出的内容是不是对的、决策链是不是合理的、有没有静默失败的征兆"。

这个转移带来三个具体变化。

第一,计费单位从"主机 / Token"变成"Session"。 Sentrial 直接挑战 Datadog 的按主机计费模型——因为后者制造了采样激励,采样对捕获罕见失败是灾难性的。按 session 计费把激励对齐:你观察越多 session,账单越高,但同时你捕获的失败也越多,客户的实际价值也越大。这种"激励对齐"是范式转移的财务基础。

第二,数据保留从"采样后保留"变成"全量保留"。 一个 0.4% 的失败在 10% 采样下消失,但如果你能保留所有 session 的全量日志,0.4% 的失败就变成可观察、可定位、可修复的事件。Sentrial 的架构决策就是显式地"不做采样"——Datadog 模型会自然诱使你采样,他们模型不会。OpenTelemetry 兼容性让全量遥测可以路由到企业现有的可观测性栈里,不强制 rip-and-replace。

第三,定位粒度从"session 失败"细化到"step 失败"。 一个多步骤 Agent 工作流可能跑了几分钟才到达失败点。如果你只能定位到"session 失败",工程师要花一小时重跑工作流才能复现失败。如果你能在 session 内定位到具体哪一步、哪个工具调用、哪个输出触发了失败,工程师可以在分钟级调试。这就是 Sentrial 的 replay-and-fork 功能——从失败点分支执行,不需要从头重跑整个工作流。这个功能目前没有任何竞品已经发货,是真正的工程差异化。

六、路径:今天能落地的 5 层防御

承认了问题,企业今天能做什么?不是等下一代工具,而是沿着 5 层防御把当前架构加固。

第一层:HTTP 200 不等于任务成功——分离 Transport Outcome 和 Task Outcome。 这是 2026 年下半年企业 AI Agent 工程链路里最重要的一个概念分离。每个 Agent Run 必须有独立于 HTTP 状态码的 TaskOutcome 状态机:SUCCESS、PARTIAL_SUCCESS、BUSINESS_FAILURE、SAFETY_BLOCKED、USER_CANCELED、SYSTEM_FAILURE、UNKNOWN。特别要保留 UNKNOWN 状态——例如 Tool 副作用结果无法确认时,不要硬算成 Success 或 Failure。然后所有指标、告警、SLA 都基于 Task Outcome,而不是 HTTP 200。

第二层:多维 SLO 取代单维可用率。 Agent 的 SLO 至少要同时覆盖 Task Success Rate、Safety / Side Effect、Latency、Cost、Human Intervention Rate 这 5 个维度。这五个维度之间存在冲突——为了提高 Task Success,可以增加 Replan 和 Tool Call;为了降低延迟,可以减少 Judge;为了降低成本,可以切便宜模型;为了提高安全,可以增加审批。这意味着 Agent 可靠性真正需要的是 多维 SLO + Error Budget + Burn Rate + Release Policy 的组合,而不是一个 99.9% 可用率的简单承诺。

第三层:全量 session 录制,不做任何采样。 这个决策在 Agent 监控里是反直觉但绝对必要的。Datadog 时代的采样假设是"故障足够频繁,采样仍能捕获",但 Agent 静默失败的特性就是罕见+语义性,采样对它是灾难性的。0.4% 的失败在 10% 采样下完全消失——也就是说,你 99.6% 的"系统正常"信号,实际上是 99.4% 的"没观测到"。技术实现上,OpenTelemetry Collector 作为 sidecar 吸收突发流量,Postgres 16 + S3 冷热分层,30 天热数据保留支持 replay。

第四层:语义层分类器,而不是通用 LLM-as-Judge。 用一个通用 LLM 评审判定"这个 Agent 输出是不是幻觉"会产生两个错误:把领域内正确的输出误判为幻觉(领域适应不足),以及把领域内的真幻觉放过去(缺乏领域校准)。生产可用的方案是在每个客户的流量模式上后训练(post-train)专门的分类器——同一个 fintech Agent 在监管问题上的输出,在通用 judge 看来"很可疑",在领域校准过的分类器看来完全正常。Per-customer fine-tuning 关闭了这个差距,同时也让分类器效果随客户数据积累而改进——这是数据飞轮。

第五层:从失败点分支 replay,而不是从头重跑。 这是工程效率的硬杠杆。一个多步骤 Agent 工作流跑了几分钟才到达失败点,如果工程师每次调试都要重跑整个工作流,反馈周期以小时计,会极大拖慢修复速度。Replay-and-fork 功能允许工程师从 session 内任意一个 step 分支执行,只重跑从分支点到结束的步骤。配合 session-level 步骤级日志(input/output/latency/token cost),工程师可以在分钟级定位和修复问题。这个能力目前没有任何主流 APM 厂商提供,但会很快变成标配。

七、对企业 Agent 团队意味着什么

把这五层防御叠在一起看,有几个对 Agent 团队组织层和管理层的具体含义。

第一,"测试集覆盖率"已经不够了。 传统的 QA 思维是"我有多少测试用例覆盖了多少场景",但 Agent 的失败模式在生产里才会暴露,测试集是开放式分布的一个小子集。真正的覆盖率指标是"生产 session 的语义层监控覆盖率"——你能不能对每一条 session 做语义判定,而不是只对 10% 的采样做基础设施层监控。这是一次从"测试驱动开发"到"生产反馈驱动开发"的范式转移。

第二,Agent 团队需要一个新的角色:语义层 SRE。 传统 SRE 关心的是服务可用率、错误预算、on-call 响应时间。Agent 团队的 SRE 必须升级——他需要懂 LLM 推理、懂 prompt engineering、懂语义层判定、懂 replay-and-fork 工具链。这是 Datadog 时代不会有的新角色,但 2026 年下半年开始,任何严肃的 Agent 团队都需要至少一名"语义层 SRE"。

第三,预算结构要重新设计。 当 Agent 静默失败在生产里持续发生,企业实际承担的成本不只是 GPU 和 token 消耗,还有"错误决策的下游业务损失"。这部分的成本在传统 BI 报表里几乎不可见,但它真实存在。把 Agent 监控工具的预算从"基础设施成本"挪到"业务风险控制预算",更接近它的真实价值。一个能在生产里把 Agent 错误率从 20% 降到 10% 的工具,它的 ROI 计算不应该只看它替代了多少 Datadog 席位。

八、给采购方的 5 个问题清单

如果你正在评估 Agent 可观测性工具,不要只问"它能不能接 LangChain"。问这五个问题:

  1. 它做不做全量 session 录制? 还是默认采样?如果是采样,采样率多少?它有没有激励对齐(比如按 session 计费而不是按 host 计费)?
  2. 它有没有 replay-and-fork 能力? 你能不能从 session 内任意一个 step 分支执行,而不是必须从头重跑?
  3. 它的语义层分类器是通用 LLM-as-Judge 还是在每个客户数据上后训练的? 后训练模型的领域校准能力,对 fintech、healthcare、legal 这种强领域场景是必需的。
  4. 它能把 Transport Outcome 和 Task Outcome 分开建模吗? 它支不支持自定义的 TaskOutcome 状态机?它的告警是基于 HTTP 状态码还是基于 Task Outcome?
  5. 它能不能在生产失败和评测集之间建立反馈回路? 一个新发现的失败模式,要多久能进你们的评测集?这个反馈循环的长度,直接决定你能多快跟上 Agent 架构的演进。

如果一个工具这五个问题答不上来,那它大概率还在用 2023 年的思路做 2026 年的问题。

九、结尾:从今天起,把"看不见的失败"放进预算

2026 年 8 月 25 日那三件事,给企业 AI Agent 落地行业画了一条新的起跑线。

Sentrial 的两位 UC Berkeley 本科生在 YC 批次内冲到 3 万美元 MRR,不是因为他们找到了新模型,而是因为他们接住了一个所有企业都在撞、所有大厂 APM 都没接住的问题。

OpenClaw 的 token 暴涨 300% 事故,不是因为他们工程师能力差,而是因为他们的监控系统是为确定性世界设计的。

Braintrust 的 Ameya 在演讲里反复强调的那句话——"Your Agent Evolved. Your Evals Didn't."——本质上是在说:Agent 演进了,你的可观测性栈没有;Agent 演进了,你的评测集没有;Agent 演进了,你的监控激励模型没有。

美辰在过去几个月跟客户做 Agent 落地时,反复撞到同一类问题:Agent 跑起来了,业务也说有用,但没人敢把核心流程全交给它,因为没人能回答"它今天到底错了多少"。这个"看不见的失败"的盲区,正在成为 2026 年下半年企业 AI Agent 落地最深的一条分水岭。

能跨过这条分水岭的企业,会在接下来的 12 个月里把 Agent 从"PPT 预算"真正变成"业务生产力"。跨不过的,会继续在"模型答得对但流程隐性失败"的陷阱里烧钱。

5 层防御今天就可以开始建。问题不是"我们有没有资源",而是"我们愿不愿意承认传统 APM 在 Agent 面前已经不够用"。

参考资料(2026 年 8 月 25 日前后)

  • Sentrial 创始人 Neel Sharma + Anay Shukla,Y Combinator W2026 批次,$500K 种子(2026 年 1 月),月经常性收入 3 万美元(单一 YC 批次内)
  • StartupHub.ai 平台追踪 145 家 AI Agent 监控与可观测性公司,绝大多数处于 pre-Series A 阶段
  • 标杆客户案例:《财富》1000 强 LangChain Agent(供应链 / HR / 营销自动化),错误率从 20% 降至 10%,部署一周内
  • Braintrust 现场 CTO Ameya Bhatawdekar 在 AI Engineer Summit 2026 演讲《Your Agent Evolved. Your Evals Didn't.》
  • 生产级 Agent 第 20 篇:多维 SLO + Error Budget + Burn Rate + Release Policy 体系
  • OpenClaw 内部 Agent 调度平台生产事故复盘:token 半小时暴涨 300%,Pod 内存 12 小时从 800MB 增长至 2GB