58 lines
7.0 KiB
Markdown
58 lines
7.0 KiB
Markdown
# Agent Memory 证据矩阵
|
||
|
||
## 怎么使用这张表
|
||
|
||
这不是论文排行榜。每篇只承担一个认知角色:定义问题、提出机制、给出反例或补上治理边界。数字按论文原文记录,尚未由本项目独立复现。
|
||
|
||
| 认知角色 | 论文 | 核心主张 | 主要证据 | 不能推出什么 |
|
||
| --- | --- | --- | --- | --- |
|
||
| 总体框架 | [Memory for Autonomous LLM Agents](https://arxiv.org/abs/2603.07670) | Memory 是 write-manage-read loop;应同时看时间范围、表示基底和控制策略 | 汇总 2022 至 2026 年初机制与 benchmark,提出 utility、efficiency、adaptivity、faithfulness、governance 五类目标 | 综述中的跨论文数字不是统一协议下的直接比较 |
|
||
| 通用反例 | [EvoMemBench](https://arxiv.org/abs/2605.18421) | Memory 价值依赖任务范围与内容类型,没有通用最优形态 | 在统一协议下比较 15 种 memory 方法和长上下文 baseline;长上下文仍有竞争力,知识任务偏 retrieval,执行任务偏 procedural/long-term memory | 不能据此认为 memory 无价值;它在上下文不足和困难任务中更有帮助 |
|
||
| 决策理论 | [Remember the Decision, Not the Description](https://arxiv.org/abs/2605.10870) | 应保留影响决策的历史差异,而不是追求描述保真 | 在 LoCoMo 子集上,描述相似度对 evidence compatibility 的 Spearman 相关仅 0.103;相同预算下 DeMem 的 gold evidence recall 为 83%,描述检索为 66% | 理论主要在 contextual bandit 与有限 memory state 设定下建立,不等于所有 Agent 控制问题已被形式化 |
|
||
| 行为编译 | [Compiled Memory](https://arxiv.org/abs/2603.15666) | 经验可以被验证后编译进指令,使 memory 直接改变行为 | CUAD token F1 +8.7pp;HotpotQA joint F1 +3.16pp;同一 evolved prompt 在 Claude Sonnet 4.5 上 +2.31pp | evolved prompt 更长,缺少等长度通用内容 control;只会改善训练信号明确覆盖的目标 |
|
||
| 跨场景诊断 | [Exploring Cross-Scenario Generality / AutoMEM](https://arxiv.org/abs/2606.04315) | 结构化索引可能在写入时丢失未来问题需要的谓词;Agent 主动读取更通用 | 比较 8 个系统和一个 harness、覆盖 5 类场景;AutoMEM 在 LoCoMo 为 67.3,对 long context 的 61.5;ALFWorld 中 golden procedure 71.7、最好 memory 43.3、GRPO actor 86.7 | 主动 harness 并非总是最便宜;动态任务的上限可能来自 actor policy,而不是 memory 结构 |
|
||
| 执行状态 | [MAGE](https://arxiv.org/abs/2606.06090) | 长任务需要 root-to-current execution state 和错误分支隔离,而非相似记录集合 | MemoryArena 上平均 success rate 相对 baseline +7.8 至 +20.4pp;相对长上下文 token -55.1% | 结果集中在 interdependent long-horizon task,不能直接外推到事实问答与个性化记忆 |
|
||
| 可维护事实 | [Infini Memory](https://arxiv.org/abs/2606.10677) | Topic documents、周期巩固与多步读取可以共同改善长期记忆 | MemoryAgentBench overall 64.7;LongMemEval 上 summary-only 41.7、summary+BM25 76.0、agentic 79.3;去掉 split/merge 后从 76.0 降到 69.3 | 多跳 selective forgetting 仍明显困难;agentic retrieval 增加调用和维护成本 |
|
||
| 组织与读取分工 | [HORMA](https://arxiv.org/abs/2606.11680) | 高层组织和低层检索应分开优化;文件层级可作为可操作 workspace | ALFWorld strict context 下达到 56.7/73.9 SR;LoCoMo 和 LongMemEval 上优于列出的 baselines;小型 RL retriever 有跨域迁移 | 论文依赖高能力模型进行 memory construction;组织错误无法被更强检索完全修复 |
|
||
| 写入可靠性 | [TrustMem](https://arxiv.org/abs/2606.25161) | 应在每次 memory transition 检查 coverage、preservation、faithfulness | MemoryAgentBench 相对最强 baseline +6.5;HaluMem extraction +12.14 F1;遗漏、破坏、幻觉分别减少 40.1%、79.1%、50.0% | verifier 是冻结 LLM,仍可能有偏差;提高 transition 可靠性不等于来源可信或有行动权限 |
|
||
| 经验价值归因 | [MemQ](https://arxiv.org/abs/2605.08374) | Memory 的长期价值应沿 provenance DAG 反向归因 | 六个 benchmark 上领先或并列;相对单步 MemRL,在深链任务最高 +5.7pp,单步任务差距可低至 0.77pp | 假设 memory 单调增长,尚未处理 consolidation/deletion;DAG 和 BFS 带来持续开销 |
|
||
| 公平成本控制 | [Are Online Skill and Memory Modules Always Worth Their Tokens?](https://arxiv.org/abs/2606.15017) | Memory/skill 的收益必须与把相同预算交给 actor 的 baseline 比较 | WebArena 三域三模型中 Vanilla-IB 平均 SR 均领先三个 augmentation 方法,通常 token 更少;WorkArena-L1 仍在 Pareto frontier | 结论针对 online augmentation;离线编译并重复摊销的 memory 需要不同成本模型 |
|
||
| 来源与执行权限 | [MemLineage](https://arxiv.org/abs/2605.14421) | 内容签名不够,派生链中的不可信来源也应阻止敏感行动 | 自定义确定性 harness 中,三类攻击只有 lineage 方案全部达到 0 ASR;报告亚毫秒级单操作开销 | harness 为机制隔离而非完整公共 benchmark;headline 未覆盖完整 adaptive attack,并假设模型与推理路径可信 |
|
||
|
||
## 跨论文一致结论
|
||
|
||
下面这些判断至少得到两类不同证据支持:
|
||
|
||
### 相似度不是 memory 的统一目标
|
||
|
||
- DeMem 从决策损失说明描述相似不等于行为兼容。
|
||
- AutoMEM 显示 schema 和 passive retrieval 会丢失动作、时序与因果信息。
|
||
- MAGE 显示长任务需要保持执行路径,而不是拼接相似片段。
|
||
|
||
### Memory construction 不能被当作低价值预处理
|
||
|
||
- Infini Memory 的维护消融下降大于 agentic retrieval 的增益。
|
||
- HORMA 显示弱 manager 组织出的 workspace 无法由强 retriever 修复。
|
||
- TrustMem 显示一次错误 transition 会成为长期状态污染。
|
||
|
||
### Memory 的收益必须带着成本与 baseline 阅读
|
||
|
||
- EvoMemBench 显示长上下文 baseline 仍然强。
|
||
- 在线预算研究显示,额外 actor steps 能吃掉 augmentation 的表面收益。
|
||
- HORMA、Infini Memory 和 AutoMEM 都显示多步 agentic retrieval 存在质量与调用成本交换。
|
||
|
||
### 自我进化受限于反馈质量和 actor 能力
|
||
|
||
- Compiled Memory 明确表现出 training-signal constraint。
|
||
- MemQ 需要 provenance 才能处理多步 credit assignment。
|
||
- AutoMEM 的 ALFWorld 诊断显示文本 memory 无法替代 state-dependent policy learning。
|
||
|
||
## 当前仍不确定
|
||
|
||
- 在同一强模型、同一成本预算和同一任务集下,topic documents、execution tree、compiled instruction 的最优组合是什么。
|
||
- memory update verifier 是否能在真实长周期运行中抵抗 verifier 自身漂移和系统性偏差。
|
||
- 主动检索的收益何时足以覆盖额外模型调用;是否可由小模型或确定性工具稳定替代大模型步骤。
|
||
- 来源 lineage、语义正确性和真实权限系统如何以较低复杂度组合。
|
||
- 当模型能力持续提升时,哪些 memory scaffolding 会失去价值,哪些仍然是系统层必需能力。
|
||
|