Files
2026-07-10 18:01:44 +08:00

7.0 KiB
Raw Permalink Blame History

Agent Memory 证据矩阵

怎么使用这张表

这不是论文排行榜。每篇只承担一个认知角色:定义问题、提出机制、给出反例或补上治理边界。数字按论文原文记录,尚未由本项目独立复现。

认知角色 论文 核心主张 主要证据 不能推出什么
总体框架 Memory for Autonomous LLM Agents Memory 是 write-manage-read loop;应同时看时间范围、表示基底和控制策略 汇总 2022 至 2026 年初机制与 benchmark,提出 utility、efficiency、adaptivity、faithfulness、governance 五类目标 综述中的跨论文数字不是统一协议下的直接比较
通用反例 EvoMemBench Memory 价值依赖任务范围与内容类型,没有通用最优形态 在统一协议下比较 15 种 memory 方法和长上下文 baseline;长上下文仍有竞争力,知识任务偏 retrieval,执行任务偏 procedural/long-term memory 不能据此认为 memory 无价值;它在上下文不足和困难任务中更有帮助
决策理论 Remember the Decision, Not the Description 应保留影响决策的历史差异,而不是追求描述保真 在 LoCoMo 子集上,描述相似度对 evidence compatibility 的 Spearman 相关仅 0.103;相同预算下 DeMem 的 gold evidence recall 为 83%,描述检索为 66% 理论主要在 contextual bandit 与有限 memory state 设定下建立,不等于所有 Agent 控制问题已被形式化
行为编译 Compiled Memory 经验可以被验证后编译进指令,使 memory 直接改变行为 CUAD token F1 +8.7ppHotpotQA joint F1 +3.16pp;同一 evolved prompt 在 Claude Sonnet 4.5 上 +2.31pp evolved prompt 更长,缺少等长度通用内容 control;只会改善训练信号明确覆盖的目标
跨场景诊断 Exploring Cross-Scenario Generality / AutoMEM 结构化索引可能在写入时丢失未来问题需要的谓词;Agent 主动读取更通用 比较 8 个系统和一个 harness、覆盖 5 类场景;AutoMEM 在 LoCoMo 为 67.3,对 long context 的 61.5ALFWorld 中 golden procedure 71.7、最好 memory 43.3、GRPO actor 86.7 主动 harness 并非总是最便宜;动态任务的上限可能来自 actor policy,而不是 memory 结构
执行状态 MAGE 长任务需要 root-to-current execution state 和错误分支隔离,而非相似记录集合 MemoryArena 上平均 success rate 相对 baseline +7.8 至 +20.4pp;相对长上下文 token -55.1% 结果集中在 interdependent long-horizon task,不能直接外推到事实问答与个性化记忆
可维护事实 Infini Memory Topic documents、周期巩固与多步读取可以共同改善长期记忆 MemoryAgentBench overall 64.7LongMemEval 上 summary-only 41.7、summary+BM25 76.0、agentic 79.3;去掉 split/merge 后从 76.0 降到 69.3 多跳 selective forgetting 仍明显困难;agentic retrieval 增加调用和维护成本
组织与读取分工 HORMA 高层组织和低层检索应分开优化;文件层级可作为可操作 workspace ALFWorld strict context 下达到 56.7/73.9 SRLoCoMo 和 LongMemEval 上优于列出的 baselines;小型 RL retriever 有跨域迁移 论文依赖高能力模型进行 memory construction;组织错误无法被更强检索完全修复
写入可靠性 TrustMem 应在每次 memory transition 检查 coverage、preservation、faithfulness MemoryAgentBench 相对最强 baseline +6.5HaluMem extraction +12.14 F1;遗漏、破坏、幻觉分别减少 40.1%、79.1%、50.0% verifier 是冻结 LLM,仍可能有偏差;提高 transition 可靠性不等于来源可信或有行动权限
经验价值归因 MemQ Memory 的长期价值应沿 provenance DAG 反向归因 六个 benchmark 上领先或并列;相对单步 MemRL,在深链任务最高 +5.7pp,单步任务差距可低至 0.77pp 假设 memory 单调增长,尚未处理 consolidation/deletionDAG 和 BFS 带来持续开销
公平成本控制 Are Online Skill and Memory Modules Always Worth Their Tokens? Memory/skill 的收益必须与把相同预算交给 actor 的 baseline 比较 WebArena 三域三模型中 Vanilla-IB 平均 SR 均领先三个 augmentation 方法,通常 token 更少;WorkArena-L1 仍在 Pareto frontier 结论针对 online augmentation;离线编译并重复摊销的 memory 需要不同成本模型
来源与执行权限 MemLineage 内容签名不够,派生链中的不可信来源也应阻止敏感行动 自定义确定性 harness 中,三类攻击只有 lineage 方案全部达到 0 ASR;报告亚毫秒级单操作开销 harness 为机制隔离而非完整公共 benchmarkheadline 未覆盖完整 adaptive attack,并假设模型与推理路径可信

跨论文一致结论

下面这些判断至少得到两类不同证据支持:

相似度不是 memory 的统一目标

  • DeMem 从决策损失说明描述相似不等于行为兼容。
  • AutoMEM 显示 schema 和 passive retrieval 会丢失动作、时序与因果信息。
  • MAGE 显示长任务需要保持执行路径,而不是拼接相似片段。

Memory construction 不能被当作低价值预处理

  • Infini Memory 的维护消融下降大于 agentic retrieval 的增益。
  • HORMA 显示弱 manager 组织出的 workspace 无法由强 retriever 修复。
  • TrustMem 显示一次错误 transition 会成为长期状态污染。

Memory 的收益必须带着成本与 baseline 阅读

  • EvoMemBench 显示长上下文 baseline 仍然强。
  • 在线预算研究显示,额外 actor steps 能吃掉 augmentation 的表面收益。
  • HORMA、Infini Memory 和 AutoMEM 都显示多步 agentic retrieval 存在质量与调用成本交换。

自我进化受限于反馈质量和 actor 能力

  • Compiled Memory 明确表现出 training-signal constraint。
  • MemQ 需要 provenance 才能处理多步 credit assignment。
  • AutoMEM 的 ALFWorld 诊断显示文本 memory 无法替代 state-dependent policy learning。

当前仍不确定

  • 在同一强模型、同一成本预算和同一任务集下,topic documents、execution tree、compiled instruction 的最优组合是什么。
  • memory update verifier 是否能在真实长周期运行中抵抗 verifier 自身漂移和系统性偏差。
  • 主动检索的收益何时足以覆盖额外模型调用;是否可由小模型或确定性工具稳定替代大模型步骤。
  • 来源 lineage、语义正确性和真实权限系统如何以较低复杂度组合。
  • 当模型能力持续提升时,哪些 memory scaffolding 会失去价值,哪些仍然是系统层必需能力。