SmaugBrain
← 返回新闻
news 焦点文章

AI Agent SLO:真正衡量可靠性的生产指标

2026年7月26日 smaugbrain 9 分钟阅读 WordPress 文章

一个 AI 代理可能处于在线状态,但仍会辜负用户。它可能会返回流畅但不正确的答案,调用错误的工具,超出成本限制,或者需要人工介入来挽救看似自动化的工作流。这就是为什么生产团队需要衡量成功结果而非仅仅是基础设施运行时间的 AI 代理服务等级目标(SLO)。

本指南解释了哪些 AI 代理指标至关重要,如何将其转化为服务等级指示器(SLI),如何设定实际目标,以及如何将可观测性与发布决策联系起来。目标是建立一个紧凑的操作模型,供产品、工程、安全和业务团队共同使用。

为什么仅靠运行时间不足以衡量 AI 代理

传统的服务监控询问的是请求是否返回、耗时多久以及服务器是否产生错误。这些问题仍然重要,但代理增加了一个语义执行层。技术上成功的 HTTP 响应可能包含不受支持的声明。工具调用可能返回 200 状态码,却更改了错误的记录。工作流可能在经过多次重试后完成,但其成本和延迟已不再具有商业意义。

OpenTelemetry 将可靠性定义为服务是否满足用户期望,而不仅仅是是否可用。它还区分了追踪(traces)、指标(metrics)和日志(logs)等遥测信号。对于代理而言,这一原则意味着每次运行都需要操作证据和结果证据。一个有用的追踪应将用户请求、模型决策、检索步骤、工具调用、策略检查、重试、最终输出、成本和评估结果连接在一个关联 ID 下。

因此,实际问题不是“代理是否在线?”,而是“符合条件的任务是否正确、安全、快速且预算内地完成?”这句话构成了代理 SLO 的基础。

生产中至关重要的五个 SLI 家族

五个生产 AI 代理 SLI 家族:正确性、延迟、工具成功、监督和成本
五个 SLI 家族将用户结果与操作证据联系起来。

一组少量的指标比包含所有可用指标的仪表板更有用。Google 的站点可靠性工程(SRE)指南建议根据用户关心的内容选择少量代表性指标,并警告平均值可能会掩盖尾部行为。对于生产 AI 代理,从五个家族开始。

1. 正确完成率

正确完成率是满足明确验收规则的符合条件任务的百分比。分母必须排除取消的请求、测试流量以及在执行前被策略阻止的任务。分子应要求实现预期的业务结果,而不仅仅是生成答案。

对于结构化工作,验收可以是确定性的:文件存在、记录具有预期值、模式验证通过或公共页面返回所需状态。对于依赖判断的工作,结合规则检查、审查过的评估集和校准的人工抽样。跟踪失败原因,以便“不正确”、“不完整”、“不安全”和“无法验证”不会合并为一个不透明的数字。

2. 端到端延迟

从接受请求到验证结果进行测量。包括排队时间、模型推理、检索、工具执行、重试、审批等待和后动作验证。报告 p50、p95 和 p99 等百分位数,而不仅仅是平均值。合理的目标可能因任务类别而异:交互式支持响应和夜间研究工作流程不应共享同一个延迟目标。

3. 工具执行可靠性

工具成功不仅仅意味着传输响应成功。记录调用成功、语义成功、重试次数、超时率、幂等性保护和验证成功。对于写操作,区分“API 接受了请求”和“读取回显后可见预期状态”。这种区别可以防止在计划和多步工作流中出现虚假成功。

4. 人工干预率

人工审查并不自动意味着失败。它可能是高风险工作的故意控制。有用的指标是未计划的干预:需要在设计好的审批路径之外进行救援、更正或手动重播的运行百分比。按原因对其进行细分。上升的比率可能揭示了指令薄弱、集成脆弱、权限问题或尚不完全自主的任务。

5. 每次成功结果的成本

仅计算每次请求的令牌是不够的,因为失败的运行和重试仍会消耗资金。计算总模型、检索、工具和基础设施成本除以验证后的成功结果。还要跟踪分布并强制执行每次运行的上限。如果较低的任务成功率导致更多的重试、升级和返工,那么更便宜的模型在经济上也是不划算的。有关更深入的控制框架,请参阅 SmaugBrain 关于 AI 代理预算、令牌限制和工具配额 的指南。

SLI 家族示例定义支持的决策
正确完成验证成功的符合条件运行数 / 符合条件运行总数发布或回滚
端到端延迟从接受到验证结果的 p95 时间容量和工作流设计
工具可靠性验证的工具结果 / 尝试的工具操作集成加固
人工干预未计划救援 / 自主运行自主边界
成功结果成本总运行成本 / 验证的成功次数模型和路由策略

如何定义 AI 代理 SLO

SLI 是对服务行为的定量度量。SLO 为该指标附加目标和测量窗口。完整的陈述应识别总体、成功条件、阈值、窗口、排除项、数据源和负责人。

例如:“在滚动 28 天的窗口期内,至少 97% 的符合条件的发票提取运行必须生成模式有效的记录,其抽样字段与源文档匹配,且 p95 端到端延迟低于 90 秒,无策略绕过。”这比“代理应该准确且快速”更强,因为团队可以实施、审计并采取行动。

不要盲目复制该阈值。在代表性流量上建立基线,确定失败的后果,并设定有价值但可实现的目标。当风险或时间期望不同时,分离工作负载类别。保持定义稳定以进行趋势分析,但在验收逻辑更改时对其进行版本控制。

构建从请求到结果的观测路径

当每次运行都可以在不暴露敏感内容的情况下重建时,代理的可观测性才有效。为运行分配唯一标识符,并在模型调用、检索、工具、审批事件和验证之间传播它。发出带有时间戳、组件名称、模型和提示词版本标识符、工具名称、尝试次数、策略决策、延迟、标准化错误类、令牌使用量和成本的结构化事件。

使用日志记录详细事件,使用指标记录聚合健康状况,使用分布式追踪记录端到端路径。OpenTelemetry 将追踪描述为请求在分布式系统中经过的路径,将跨度(span)描述为该路径内的工作单元。这自然地映射到代理执行:运行是追踪;规划、检索、模型调用、工具调用、审批和验证是跨度。

将遥测数据作为生产数据进行保护。在发出之前删除凭据和个人数据的敏感信息,应用基于角色的访问,定义保留期,并避免默认存储完整提示词或工具负载。当哈希、引用、分类或采样的脱敏内容提供足够的诊断价值时,请存储它们。

将 SLO 转化为发布和事故决策

从健康操作到监控、冻结和恢复的错误预算发布路径
错误预算状态将可靠性测量转化为发布决策。

SLO 只有在改变行动时才重要。定义错误预算:在窗口期内允许的不合格或偏离目标的工作量。97% 的正确完成目标允许 3% 的符合条件运行偏离目标。跟踪消耗率并将其用作控制信号。

  1. 健康:预算正在缓慢消耗。继续正常的发布和实验。
  2. 监控:燃烧率升高或领先指标恶化。增加抽样,比较队列,并暂停高风险扩展。
  3. 冻结:预算很可能在窗口期内耗尽。停止自主权增加和非必要发布。
  4. 响应:安全事件、破坏性工具错误或严重的正确性回归触发立即遏制,无论总体预算如何。
  5. 恢复:部署经过验证的修复程序,仅重播幂等或明确批准的工作,并要求 SLI 稳定后再恢复流量。

同时使用滞后指标和领先指标。正确完成通常是在评估或用户反馈之后才知道的。工具超时、检索遗漏率、重试增长、上下文窗口压力、策略拒绝和异常成本可以更早发出警告。警报应指定负责人和响应手册;否则它们将成为噪音。

实用的实施序列

  1. 定义用户结果。用一句话描述成功的运行改变了什么或交付了什么。
  2. 指定资格。说明哪些请求进入分母,以及适用哪些有效排除项。
  3. 创建验收检查。优先使用确定性验证;在不可避免的判断处添加校准评估和人工抽样。
  4. 对运行进行仪器化。将模型、检索、工具、审批和验证跨度与结构化元数据相关联。
  5. 按队列建立基线。在选择目标之前,测量任务类型、模型路由、工具、租户、风险层级和版本。
  6. 设定少量 SLO。从正确完成率、p95 延迟、工具验证、未计划干预和每次成功成本开始。
  7. 定义错误预算策略。在发生违规之前,编写发布、升级、回滚和恢复操作。
  8. 测试监控器。注入受控故障,确认仪表板、警报、追踪和负责人按设计运行。
  9. 变更后审查。当任务、验收标准、模型、工具权限或用户群体发生变化时,重新评估阈值。

将此操作模型与部署前的回归评估相结合。SmaugBrain 的 AI 代理评估指南 解释了测试集、指标和验收方法如何支持这一关卡。

要避免的常见错误

仅使用模型指标。令牌计数、模型延迟和答案分数并不能显示工作流是否安全地更改了正确的系统。测量整个结果。

报告平均值而不报告分布。平均延迟和成本可能看起来稳定,但一小部分重要的队列可能遭受极端的延迟或支出。使用百分位数和队列视图。

将策略阻止与执行失败混合。正确阻止的请求可能表明控制措施有效。将其与接受后失败的符合条件运行分开报告。

悄悄更改评估者。新的评分标准或裁判模型可能会移动指标,即使生产行为没有变化。对评估逻辑进行版本控制,并使用稳定的参考集对其进行回溯测试。

默认收集敏感遥测数据。可观测性应降低运营风险,而不是创建一个包含秘密和个人信息的新数据存储。在扩大收集规模之前,设计脱敏和访问控制。

常见问题解答

最重要的 AI 代理指标是什么?

对于大多数生产工作流来说,它是符合条件任务的验证正确完成率。它将系统行为直接连接到用户结果。延迟、工具可靠性、干预、安全性和成本解释了该结果是否可持续。

AI 代理 SLO 与 SLA 有何不同?

SLO 是内部或发布的可靠性目标。SLA 是一项协议,规定了未能履行承诺时的后果。即使没有合同 SLA,团队也可以使用 SLO。

幻觉率应该是 SLI 吗?

它可以是一个诊断指标,但基于结果的准确性通常更强。“幻觉”的定义可能不一致,而验收规则可以指定声明是否有支持、字段是否与证据匹配或最终操作是否正确。

SLO 应该多久审查一次?

持续审查性能,并在任务、模型、工具、权限、评估者或用户发生重大变化后审查定义。对于稳定的生产工作流,定期季度审查是一个有用的最低限度。

一个 SLO 能涵盖每个代理工作流吗?

不能。交互式、批处理、只读和高危写工作流有不同的期望。使用共享的指标模板,但按工作负载和风险类别定义目标和响应策略。

小团队应该首先实施什么?

从运行 ID、结构化的工具和模型事件、确定性结果验证、正确完成率、p95 延迟和每次验证成功的成本开始。在这些基础可靠之后,再添加错误预算警报和更丰富的队列。

以可衡量的信心运营 AI 代理

生产 AI 代理需要超越运行时间仪表板的东西。紧凑的 SLO 系统将用户结果、系统证据、风险控制和经济限制对齐。它为团队提供了三个问题的共同答案:代理是否在工作?扩展是否安全?下一步应该修复什么?

SmaugBrain 帮助团队运行具有可观测执行、受控工具访问、可重复自动化和验证的云 AI 代理工作流。探索 SmaugBrain,设计一个可以从请求到验证结果衡量成功率的代理工作流。

来源