AI Agent 需要多少“内存”,答案并不是一个固定的 GB 数字,也不是简单地把更多历史对话塞进上下文窗口。IBM Research 于 2026 年 8 月 18 日发布的评估显示,Agent 记忆的关键在于记忆内容如何提炼、注入以及与模型能力匹配。

这项研究使用 ALTK-Evolve,让 Agent 从过去的成功和失败轨迹中提炼可复用的行为指南,再在推理阶段重新注入。它改变的是 Agent 能够获得的指导信息,而不是模型权重,因此不需要重新训练模型,也不依赖人工标注。
研究人员在 AppWorld 基准上评估了 8 个模型。结果显示,Agent 记忆大致呈现出三种模式:
- 有能力余量的强模型:通常可以吸收完整的指南集合,包括低频但重要的边界情况。DeepSeek-V3.2 在注入完整指南后,任务完成率提升 9.5 个百分点;Claude Opus 4.6 和 GPT-5.5 也分别提升 4.1 和 2.9 个百分点。
- 较弱或较小的模型:一次性注入大量指南可能造成信息过载。对 gpt-oss-120b,使用固定的高置信度核心指南,再结合按任务检索的少量内容,任务完成率提升 16.1 个百分点,效果优于完整指南集合。
- 接近饱和的模型:如果模型在目标任务上已经接近能力上限,增加记忆可能没有可测收益。研究中的 GLM-5 就属于这一模式,但研究人员强调,这只是观测结果,并不能直接证明具体原因。
这意味着,Agent 的记忆容量不能只按模型参数量决定。模型在基准任务上的剩余提升空间、上下文窗口大小、模型架构、指南质量以及任务分布,都可能影响最佳记忆策略。所谓“需要多少内存”,在工程上更接近于“每一步推理应该注入多少有用信息”。
成本数据也支持这种分层设计。对 gpt-oss-120b,完整指南集合会让每个任务的输入 Token 数量较基线增加约 51%,而精选检索策略的额外开销约为 5%。这套精选策略同时带来了更高的任务完成率,说明更少的记忆并不等于更弱的效果。
对于强模型,完整指南可能仍然有价值,但反复注入静态内容会增加输入成本。研究指出,提示词缓存可以降低这部分开销,前提是让跨推理步骤保持不变的指南内容形成稳定前缀。对生产环境而言,记忆系统的设计重点因此包括内容压缩、相关性检索、缓存布局和失败样本的持续评估。
值得注意的是,这项结论目前主要来自 AppWorld,一个包含日历、消息、支付等模拟应用的多步骤 Agent 基准。研究团队也表示,当前的检索主要依赖余弦相似度排序,这并不能完美预测哪些指南真正有帮助;面向更弱模型的教师蒸馏记忆,以及在更多真实场景中验证记忆策略,仍是后续工作。
对开发者来说,更稳妥的设计不是建立一个无限增长的“经验仓库”,而是先将历史轨迹转化为结构化指南,再根据模型能力和任务类型决定注入剂量:较弱模型使用少量高置信度规则与任务相关记忆,强模型保留更完整的经验集合,已经饱和的模型则应先定位剩余失败模式,再决定是否增加上下文。