Skip to content

Agentic Context Management:Agent记忆与成本的系统化工程

tags: #Context-Management #Agent-Memory #Token-Cost #Lifecycle #Production-Agent source: arXiv 2607.21503 | AI论文速递2026-07-28 score: 技术深度9/10 | 实用价值9/10 | 时效性9/10 | 领域匹配9/10 | 综合 9.0/10

核心概念

Agentic Context Management (ACM) 提出一个关键洞察:生产环境Agent的失败,很少是因为推理能力不足,更多是因为无法管理推理上下文中的内容——对话历史膨胀、大型prompt、大量工具定义、工具输出爆炸,Agent被自己的积累历史"淹死",同时每轮Token成本持续增长。ACM将这个问题的框架从"存储-检索"重新定义为"生命周期与架构"问题。

设计原理

当前主流方法的问题

现有方案将Agent记忆视为存储-检索问题(存进向量库,需要时检索),但ACM指出这过于狭隘:

  • 存储-检索忽略了"该记住什么、怎么结构化、用什么存储、何时合并/遗忘、预估接下来需要什么、在预算内压缩上下文"这一完整生命周期
  • 生产环境中不是面对单个用户,而是组织级作用域层级——不同团队、不同项目有各自的记忆空间和权限边界

五原语操作模型(Five Primitives)

ACM将Agent上下文管理分解为五个原语操作:

  1. Architecting(架构设计):决定数据结构——什么存为向量、什么存为图谱、什么存为KV缓存。不同数据类型需要不同的存储后端
  2. Ingesting(摄入):从对话和工具结果中提取并结构化关键信息,而非全量存储。类似知识库的"采集→提炼"流程
  3. Scoping(作用域管理):判断当前任务需要哪些记忆、权限边界在哪。多租户场景下尤为关键
  4. Anticipating(预判):主动预估接下来可能需要的上下文,提前加载。从"被动检索"升级为"主动预加载"
  5. Compacting & Consolidation(压缩与合并):在Token预算内压缩上下文,同时保留关键信息(出处、因果关系),合并重复记忆

Token成本经济学:为什么简单方案不够用

ACM给出了清晰的成本分析:

  • 朴素上下文累积:Token成本随对话长度二次增长(每轮都传完整历史)
  • 粗糙摘要:成本降为线性,但存在"准确率悬崖"——摘要到某个压缩率后,关键信息突然丢失
  • 经过验证的压缩(Validated Compaction):只有这种方案能在保持保真度的前提下实现线性成本

这解释了为什么生产环境的Agent需要系统化的上下文管理,而不能依赖简单的"全量检索+摘要"。

参考实现:Maximem Synap

论文作者实现了一个参考系统Maximem Synap,实现五原语的多租户服务:

  • LongMemEval:92% 准确率
  • LoCoMo:93.2% 准确率

这两个基准测试的分别是长期记忆保持和长对话连贯性,验证了ACM方法的有效性。

关键实现

ACM vs 传统记忆方案对比

维度 传统方案(RAG记忆) ACM方案
问题定义 存储-检索 生命周期-架构
记忆操作 写入→检索 架构→摄入→作用域→预判→压缩
成本模型 线性(向量检索) 二次→线性(需验证压缩)
多租户支持 简单隔离 组织级作用域层级
预判能力 无(被动检索) 有(主动预加载)
遗忘机制 时间衰减 合并+保留溯源+预算压缩

架构图(概念)

用户请求
    │
    ▼
┌──────────────────────────────┐
│   Scoping(作用域)          │  ← 决定权限边界
└──────────┬───────────────────┘
           ▼
┌──────────────────────────────┐
│   Anticipating(预判)       │  ← 预估需要的上下文
└──────────┬───────────────────┘
           ▼
┌──────────────────────────────┐
│   Retrieval(检索相关记忆)   │
└──────────┬───────────────────┘
           ▼
┌──────────────────────────────┐
│   Compaction & Consolidation │  ← 压缩到Token预算内
└──────────┬───────────────────┘
           ▼
       LLM调用
           │
           ▼
┌──────────────────────────────┐
│   Ingesting(摄入新信息)     │  ← 提取结构化记忆
└──────────┬───────────────────┘
           ▼
┌──────────────────────────────┐
│   Architecting(更新结构)    │  ← 决定存储方式
└──────────────────────────────┘

关联分析

  • AI-Memory-Systems — ACM从"生命周期"角度补充了记忆系统的工程实践维度,特别是有五原语操作和Token成本模型
  • Context-Engineering — ACM关注"管理Agent脑中有什么",Context Engineering关注"如何设计输入",两者构成完整闭环
  • Memory-Management — 记忆管理的概念基础,ACM提供了系统化的工程框架
  • STALE-Memory-Staleness — ACM的Compaction & Consolidation原语直接解决记忆过期问题
  • Delta-Mem — Delta更新是ACM Ingesting原语的一种具体实现策略

可执行建议

  1. 用ACM五原语审视你的知识库架构:当前你的知识库已经在实践Ingesting(采集→提炼)、Architecting(wiki分类)、Compaction(提炼压缩),但Scoping(作用域管理)和Anticipating(预判)尚未覆盖——这两个维度是生产级Agent的关键差异
  2. 关注Token成本模型:ACM的"朴素累积→粗糙摘要→验证压缩"三级成本分析可直接用于评估你Agent系统的上下文管理策略
  3. Scoping是区分"原型"和"生产"的分水岭:多租户、多项目场景下,记忆隔离是刚需。如果你未来的Agent产品涉及多用户,ACM的作用域层级设计值得参考
  4. Anticipating是竞争力:从被动检索到主动预判,是让Agent显得"聪明"的核心能力——但实现复杂度最高,建议先做好前三个原语再考虑

自评

维度 分数 权重 加权
摘要质量 9 0.25 2.25
技术深度 9 0.25 2.25
相关性 9 0.20 1.80
原创性 7 0.15 1.05
格式规范 9 0.15 1.35
加权总分 8.70