SmaugBrain
← 返回新闻
news 焦点文章

AI 智能体成本控制:预算、Token 限制、工具配额与支出监控

2026年7月26日 smaugbrain 10 分钟阅读 WordPress 文章

AI 智能体成本控制:预算、Token 限制、工具配额与支出监控

AI 智能体的成本控制不仅仅是选择更便宜的模型。智能体会规划、调用工具、检索文档、重试失败的步骤、委派任务,并在用户离开对话后继续运行。每种能力都能提升结果,但同时也为成本增长提供了更多路径。因此,实际目标不是“减少 Token 使用量”,而是为每个工作流建立明确的经济契约:它最多可以花费多少、必须产生什么价值、何时应优雅降级,以及何时必须停止。

可靠的成本控制体系结合了四个层级:每次请求的限制、每个工具的配额、工作流级别的预算以及团队级别的监控。这些控制措施应与质量和安全控制一起设计,而不是在出现令人惊讶的账单后才添加。本指南解释了如何为云 AI 智能体构建该系统,包括生产环境所需的指标、阈值、回退策略和审查流程。

为什么 AI 智能体的成本比聊天机器人更难预测

聊天机器人通常只有一个输入和一个模型响应。而智能体有一个循环:它可能检查上下文、规划、调用搜索服务、阅读页面、修订、调用另一个模型并重试失败的操作。因此,一个任务结合了多个相互依赖的决策,而不仅仅是一次 API 请求。

  • 上下文增长:对话历史、检索到的文档、工具结果和中间推理可能在每一步都扩展。
  • 工具使用的可变性:浏览器自动化、代码执行、图像生成、数据库和第三方 API 有不同的计费模式。
  • 重试和恢复:如果没有边界的重试策略,临时故障可能会导致模型和工具调用的倍增。
  • 委派:子智能体可以通过并行工作降低延迟,但同时增加总消耗量。
  • 长期执行:计划和后台任务可以在没有用户观察每个决策的情况下累积支出。

这种可变性需要一个受控的系统。OpenTelemetry 生成式 AI 语义规范提供了一个有用的方向:一致地捕获模型操作、Token 使用情况、工具调用、延迟、错误和跟踪关系。NIST AI 风险管理框架增加了治理层面:风险应在整个生命周期中进行映射、测量、管理和审查。不受控制的资源使用可能会成为运营和业务风险。

构建四层预算模型

用于请求、工具、工作流和团队的四层 AI 智能体预算护栏
四层预算可防止局部超支演变为团队范围的意外。

最强的控制是分层级的。单一的月度上限为时已晚:它只告诉你账户花费过多,但不能解释是哪个任务、用户、工具或循环导致了问题。单独的 Token 限制也不完整,因为一次廉价的模型调用可能会触发昂贵的外部操作。使用四个相互强化的范围。

1. 请求预算

为单次模型请求设置最大输入 Token、输出 Token、延迟和估计货币成本。选择能保留当前决策所需证据的最小上下文。摘要、结构化状态和检索过滤器通常比反复发送整个转录文本更有效。有关实用的上下文缩减模式,请参阅 AI 智能体记忆管理指南

2. 工具调用预算

为每个工具设置调用次数、时间限制和成本分类。只读元数据查找可能便宜且低风险;而浏览器自动化、图像生成或付费数据提供商可能需要严格的配额。计算成功和失败的尝试次数。否则,失败的依赖项可能会消耗预算却无法产生任何可用输出。

3. 工作流预算

定义单个业务成果的最大总支出、步骤数、重试次数、墙钟持续时间(经过的时间)和委派任务。智能体应在每次昂贵操作之前评估剩余预算。当剩余预算无法支持下一步时,它必须选择更便宜的路径、请求批准、返回部分结果或带着明确的原因停止。

4. 团队和周期预算

按工作区、项目、客户、工作流类型、环境和天或月聚合使用情况。这一层支持预测和问责。它还应保护关键工作负载免受嘈杂实验的影响。分离生产、开发和评估预算,以便测试运行不会耗尽客户-facing 自动化所需的容量。

控制范围主要限制超出时的最佳响应
模型请求输入、输出、延迟、估计成本修剪上下文或使用较小的模型
工具调用次数、持续时间、付费单位、重试使用缓存、替代源或停止工具
工作流总支出、步骤、经过时间、子智能体降级、请求批准或返回部分结果
团队或周期每日/每月支出及变化率限制非关键工作负载并通知负责人

设置每次请求的预算:测量、修剪和执行限制

请求预算是最细粒度的控制。每次模型调用之前,都应测量当前上下文大小并估算预期输出。如果预计成本超过此类请求允许的预算,智能体应在调用发生前拒绝提示、修剪上下文或路由到较小的模型 before the call is made.

上下文预算

智能体工作流程中浪费的最大单一来源是上下文增长而没有相应的质量提升。策略:1) 使用最近消息的滑动窗口而不是完整历史,2) 将旧上下文总结为简洁的状态对象,3) 应用检索过滤器以确保仅包含相关文档,4) 将工具输出修剪为相关片段。记忆管理指南涵盖了每种技术及其具体的规模比较。

输出限制

在每个模型调用上设置明确的 max_tokens 参数。要求输出为结构化格式(JSON、代码块或简短摘要),而不是开放式响应。对于确定性任务,使用简洁的输出指令,例如仅要求工具调用或符合模式的对象,而不附加额外解释。在广泛采用更改之前,在代表性测试集上衡量其效果。

模型路由

将简单的查找和格式化任务路由到快速、廉价的模型。将更强的模型保留给确实需要更深层次推理、规划或代码生成的工作。针对固定的质量测试集评估路由决策,并在更改生产默认值之前比较完成质量和总工作流成本。

工具调用预算:配额、缓存和成本分类

工具通常是模型调用之后的第二大成本驱动因素,并且更难控制,因为它们涉及外部服务。每次调用成本为一分的工具单独来看微不足道,但一个任务中调用它 50 次的循环则不然。独立地为每个工具设定预算。

成本分类

将每个工具分类为廉价、中等或昂贵。廉价工具(只读数据库查询、本地文件读取、算术)不需要批准。中等工具(网络搜索、图像生成、代码执行)应在每次调用前检查剩余的工作流预算。昂贵工具(付费 API 调用、长时间运行的浏览器自动化、批量数据导出)应在工作流内要求明确批准。

缓存策略

缓存确定性结果。如果一个工具在一次工作流期间多次读取相同的客户记录或相同的网页,它应在第一次调用后返回缓存的结果。缓存期应足够短以反映实时数据,但又足够长以节省同一任务内的重复调用。有关避免冗余工具调用的重试策略,请参阅 重试策略指南

重试预算

每次重试都会消耗预算。配置一个独立于成功调用预算的重试预算:每个工具调用最多 N 次重试,重试的最大总时间,以及预算耗尽时的回退路径。临时基础设施故障应重试一两次;持久的逻辑错误不应重试。 重试策略指南 解释了可重试和不可重试故障之间的区别。

工作流预算:优雅降级和审批关卡

从监控到审批的 AI 智能体预算响应路径
成本响应路径应从监控升级到限制、降级和审批。

工作流预算是用户与智能体之间的经济契约。在工作流开始之前,用户或系统定义任务最多可以花费多少。智能体在每次昂贵步骤之前检查剩余预算。当预算几乎耗尽时,智能体有三个选项:降级、请求批准或返回部分结果。

降级路径

当预算用完时,智能体不应失败,而应尝试执行同一任务的更便宜版本。使用成本较低的模型、使用较短的上下文、跳过可选工具或生成摘要而不是完整报告。降级路径应在工作流规范中定义,以便智能体可以自动切换。

审批关卡

对于超过定义成本阈值的工作流,暂停并请求批准后再继续。这类似于权限管理中使用的批准模式。 审批工作流指南 描述了如何实施由成本和风险标准触发的关卡,并在智能体继续之前向审批者提供证据。

团队监控:仪表板、警报和成本分配

第四层是监控。如果没有人审查聚合数据,单独的预算无法防止成本问题。监控系统应将用于运营决策的实时仪表板与用于战略规划的定期报告相结合。

要跟踪的指标

  1. 每个工作流、每个环境和每个工作区的总支出。这是主要的分配指标。
  2. 每种操作类型的成本:模型调用、工具、检索、生成和委派。
  3. 每个决策结果的成本:成功任务、失败任务、放弃任务和重试循环。
  4. 每个用户的成本:汇总由同一用户、团队或系统账户启动的所有工作流的成本。
  5. 变化率:每日、每周和每月的成本增长,以便在成为意外之前检测趋势。

警报阈值

设置三个严重程度的警报。信息性:每周支出超过月度预算的 70%。警告:每日支出超过月度预算的 10%。严重:任何单个工作流超过其个别预算,或者新工作流类型在没有预算的情况下运行。严重警报应阻止工作流,直到预算获得批准。

成本分配

使用工作流 ID、工作区 ID、环境和用户 ID 标记每个 API 调用、工具调用和委派。此标签集可实现准确的成本分配和分摊。它还使得能够比较同一工作流在不同版本之间的成本,并检测漂移,即模型升级或代码更改使工作流成本增加但未提高质量。

AI 智能体成本控制中的常见陷阱

在生产环境中反复出现几种模式。通过适当的控制措施,每种模式都是可以避免的。

  • 陷阱:无限重试循环。卡在失败工具调用上的智能体可以无限重试。通过重试预算和熔断器进行阻止。
  • 陷阱:无声的上下文扩展。每一步都将前一步的输出添加到历史记录中。限制上下文窗口并总结旧内容。
  • 陷阱:没有预算的委派。子智能体不从父级继承预算。将剩余预算传递给每个子智能体。
  • 陷阱:忽略的工具故障。工具返回错误,但智能体重试并消耗更多预算。区分临时错误和永久错误。
  • 陷阱:没有监控的后台任务。在开发中表现良好的计划任务,在使用真实数据的生产环境中可能会花费更多。对后台和前台任务强制执行相同的控制措施。

关于 AI 智能体成本控制的常见问题

我应该何时使用 Token 限制而不是货币预算?

两者都用。Token 限制对于模型调用更精确,但货币预算更容易与业务期望保持一致。在工作流开始时将 Token 限制转换为货币估算,并在每次昂贵步骤之前检查货币预算。

成本控制会降低质量吗?

是的,如果控制措施过于严格。分层方法最大限度地降低了这种风险:仅降级超出预算的范围,而不是削减所有内容。模型路由层也保留了需要昂贵模型的任务的质量。

我该如何处理需要使用昂贵工具的用户?

单独预算该用户的工作流。如果用户持续超过标准预算,则将工作流移至具有明确批准的高成本层级。来自 审批工作流指南 的审批关卡模式非常适合这种情况。

我应该对所有事情使用一个模型以保持成本简单吗?

不。将不同任务路由到不同的模型可以在不降低质量的情况下降低成本。路由层是一项小的工程投资,其回报足以抵消成本。

我应该多久审查一次成本指标?

每天审查仪表板以获取运营警报,每月审查以进行预算预测。变化率指标是最具信息量的单一数字:突然的激增比几周来稳定的高绝对值更具可操作性。

测试新工作流最便宜的方法是什么?

使用具有严格每次请求预算的开发环境,使用能完成任务的最小模型,并限制步骤数量。在移至生产之前,测量 10 次成功运行的成本并将其乘以预期产量。这可以防止第一张生产账单成为意外。

我可以在没有人工监督的情况下自动化成本控制吗?

您可以自动化执行层(预算检查、模型路由、上下文修剪、工具缓存),但升级层——审批关卡、预算增加和降级路径选择——应涉及人工审查员。自动化系统执行政策;人类做出例外处理。

使用 SmaugBrain 成本控制开始行动

使用 SmaugBrain 将此框架转化为明确的工作流契约:在未执行之前定义预算、允许的工具、重试上限、审批点和验证证据。从一个狭窄、可衡量的用例开始,并在每次测试运行后连同质量一起审查成本。探索云 AI 智能体工作流请访问 https://www.smaugbrain.com/