SmaugBrain
← 返回新闻
新闻 焦点文章

AI Agent 记忆管理:减少 Token 浪费、提升响应质量的实用策略

2026年7月20日 smaugbrain 7 分钟阅读 WordPress 文章

AI Agent 记忆管理:减少 Token 浪费、提升响应质量的实用策略

每次 AI Agent 调用都会消耗 Token。送入上下文窗口却无助于 Agent 做出更好决策的每一个 Token,都是在为噪音付费。月账单是 $50 还是 $500,往往不在于你运行了多少任务,而在于你如何管理 Agent 在两次调用之间的记忆。

这些在不牺牲准确性的前提下降低 Token 消耗的实用策略,适用于任何云 AI Agent 平台,包括 SmaugBrain,其记忆配置作为直接设置暴露,而非隐藏在抽象层之后。

为什么记忆管理比模型选择更重要

你选择的模型设定了质量上限,而记忆管理决定了你能触及多少这个上限。一个强大的模型如果喂入塞满无关历史的臃肿上下文窗口,其表现会不如一个使用干净、聚焦输入的普通模型。

当记忆未被妥善管理时,会出现三个问题。上下文窗口溢出意味着当达到 Token 限制时,模型会丢弃较早的信息,通常会静默地丢掉你最需要的细节。Token 成本递增发生在每次保留的对话轮次、每个缓存的工具输出、每个存储的文件引用都在增加单次请求成本,即使它们与当前任务无关。延迟恶化会随着提示词在一周内从 2,000 个 Token 增长到 12,000 个 Token 而发生,响应时间可能翻倍甚至翻三倍。

这些并非理论风险。它们是运行生产环境 AI Agent 超过一个月的团队所报告的前三大支持案例。

理解 AI Agent 记忆的三层架构

AI Agent 的记忆并非单一概念。它在三个不同的层级上运作,每个层级的成本和保留特性各不相同。

三本堆叠的笔记本,分别标有临时上下文、持久记忆和外部知识,放置在自然光下的桌面上
AI Agent 记忆的三层架构:临时上下文、持久记忆和外部知识

第一层:临时上下文(当前对话)

这是 Agent 的工作记忆。它包括当前提示词、活跃会话内的对话历史、最近的工具输出,以及当前任务期间加载的任何文件或数据。临时记忆不会在会话之间持久保存。它是每个 Token 成本最高的,因为每次请求都会发送它。

第二层:持久记忆(Agent 记住的事实)

持久记忆跨会话存储持久性事实。在 SmaugBrain 中,这是存储用户偏好、环境详情、工具特性和稳定惯例的记忆系统。Agent 会显式地向其中写入内容,并在每次启动时读取。结构良好的持久记忆可以减少在每个提示词中重复相同上下文的需求。

第三层:外部知识(技能、文件和工具)

技能是可复用的流程,Agent 会在需要时按需加载。文件、文档和知识库存储在外部,仅在相关时被检索。这一层的成本效益最高,因为在实际需要使用之前,没有任何内容会被加载到上下文中。

五种降低 Token 消耗的策略

从最简单的开始,逐步深入。以下按从快速见效到对长期运行 Agent 影响最大的顺序排列。

1. 将对话历史裁剪为最近 N 个有意义的轮次

大多数 Agent 默认保留完整的对话历史。这很浪费。经过十轮对话后,Agent 很少会引用第一次交互。一个简单的规则是:除非当前任务明确需要更早的上下文,否则只保留最近 5–8 轮。SmaugBrain 允许通过会话历史记录限制设置进行配置。

2. 将配置和偏好存储在持久记忆中,而不是放在提示词里

一个常见的错误是在每条提示词中重复指令:“你是一个偏好简洁回复的助手。使用英式英语。始终先检查凭证文件。”这些指令应放在持久记忆中,而不是临时上下文中。写一次,Agent 就会自动加载。这通常可以在每次请求中节省 150–400 个 Token。

3. 使用技能处理可复用工作流,而非内联指令

当 Agent 反复执行相同的多步骤流程时,将其打包为技能可以将该流程从上下文窗口移至外部参考。技能仅在被触发时加载。一个用 50 个 Token 的触发调用替换 800 个 Token 内联指令的技能,每次运行时都能节省 750 个 Token。

4. 用摘要替代保留原始历史

对于长时间运行的会话,定期摘要比保留完整记录更节省 Token。与其保留 20 轮对话(约 4,000–6,000 个 Token),不如每 10 轮生成一个 200 Token 的摘要,然后丢弃原始历史。Agent 会丢失逐字细节,但能保留核心上下文。这是大多数生产环境 AI Agent 部署所使用的策略。

5. 固定关键事实,裁剪其余部分

并非所有记忆条目都同等重要。固定功能允许 Agent 将某个事实标记为持久项,并将其排除在自动修剪之外。未固定的条目可以在可配置的时间窗口后过期。这种混合方法可以防止记忆库无限增长,同时确保真正重要的事实始终可用。

记忆策略对比:每 100 个任务的 Token 成本

策略 每次请求 Token 数 100 个任务 Token 数 准确性影响 设置工作量
完整历史保留 4,000 400,000 基线
裁剪至最近 8 轮 2,200 220,000 无明显损失 5 分钟
持久记忆存储偏好 1,800 180,000 提升一致性 10 分钟
工作流使用技能 1,200 120,000 提升可靠性 30 分钟
每 10 轮摘要 900 90,000 少量细节丢失 20 分钟
固定+裁剪记忆 700 70,000 无明显损失 15 分钟

每种策略都会叠加一层节省效果。一个每天运行 100 个任务的团队,通过组合使用这五种方法,可以将 Token 消耗从 400,000 降至 70,000。按典型的 API 定价计算,这意味着每天的费用从 $8 降至 $1.40。

如何审计当前的记忆使用情况

在做出任何更改之前,先测量当前的基线。大多数 AI Agent 平台(包括 SmaugBrain)都会在日志或仪表盘中显示每次请求的 Token 数量。收集这些数据一周,以了解你的实际使用模式。

一只手在剪贴板上书写,旁边是记忆审计清单,笔记本电脑上显示数据仪表盘
审计当前的记忆使用情况是迈向优化的第一步
  1. 导出最近 100 个 Agent 请求及其 Token 计数。
  2. 计算平均、中位数和第 95 百分位 Token 使用情况。
  3. 找出 Token 计数最高的请求,并检查其上下文内容。
  4. 寻找规律:某些技能或任务是否持续产生高 Token 消耗?
  5. 首先对上述策略应用于 Token 消耗最高的前 20% 请求。最大的节省空间就在这里。

常见错误及规避方法

过度裁剪 Agent 仍需要的上下文

激进的裁剪可能会移除 Agent 准确响应所需的信息。解决方法是用具有代表性的任务样本进行测试。先用完整历史运行同一组任务,再用裁剪后的历史运行,然后比较结果。只有在准确性没有明显下降时才部署裁剪方案。

将所有内容存入持久记忆

持久记忆不是垃圾桶。每个条目都会在启动时加载,因此过大的记忆库会将成本从单次请求转移到每次会话。一个好的规则是:保持持久记忆在 50 个条目以内。固定关键条目,过期其余条目。

编写过于宽泛的技能

试图处理太多场景的技能会变成独立的小型程序。技能文档会膨胀,加载时间会增加,Agent 还会浪费 Token 去解析技能指令以找到相关部分。保持每个技能专注于一个特定任务。如果技能文档超过 200 行,请拆分它。

常见问题

实际上能节省多少 Token 成本?

大多数团队在应用前三项策略后,Token 消耗可降低 40–60%。完整的一套五项策略通常可实现相比默认配置 70–80% 的降幅。

裁剪上下文会影响结果质量吗?

这取决于你裁剪了什么。移除问候语、确认提示和已完成的工具输出不会产生可测量的影响。移除原始任务规范或关键用户指令则会降低质量。关键在于有选择性:保留与决策相关的上下文,丢弃流程性噪音。

SmaugBrain 支持持久记忆吗?

支持。SmaugBrain 拥有内置记忆系统,可跨会话存储持久性事实。你可以一次性将配置、偏好和环境详情写入记忆,Agent 会在每次会话开始时自动加载。记忆条目可以被固定、过期或替换。

技能如何帮助降低 Token 使用量?

技能将可复用的流程从提示词中移出,转为外部参考。技能按需加载,而非每次请求都加载。这意味着一个通常需要给每条提示词增加 600 个 Token 的 50 行工作流,只有在技能实际被触发时才会增加 600 个 Token。

单任务 Agent 的最佳记忆策略是什么?

对于每个会话只运行一个任务且没有对话历史的 Agent,用于配置管理的持久记忆和技能化工作流就足够了。不需要裁剪对话历史,因为没有历史可裁剪。

应该多久审计一次记忆使用情况?

已稳定的 Agent 每月一次。部署后的第一个月每周一次,因为此时使用模式仍在趋于稳定。最常见的发现是,开发阶段积累的记忆条目在生产使用前从未被清理。

我可以自动化记忆清理吗?

可以。SmaugBrain 支持定时任务来运行记忆维护例程。你可以配置每周清理任务,使超过 30 天的未固定条目过期,摘要冗长的历史,并报告当前的 Token 使用统计信息。

从一个改动开始并衡量效果

团队最常犯的错误是一次性尝试应用全部五种策略。他们改变了太多变量,无法判断哪个改动产生了效果,一旦出现问题就会回滚所有内容。

先从一项策略开始。测量实施前后的效果。如果结果积极,再添加下一项。一个月后,你将拥有一个量身定制的记忆配置,而不是一个适合所有人的通用模板。

如果你想看记忆管理在实际中如何运作,试试 SmaugBrain,并根据你的具体任务模式配置记忆设置。仪表盘会显示实时 Token 使用情况,让你立即看到每项改动的影响。