Audit recent Agent memory research
This commit is contained in:
@@ -0,0 +1,8 @@
|
||||
# Research
|
||||
|
||||
这里保存跨论文、带时间对照和证据边界的研究结果。单篇资料仍归档在 `papers/`,研究结论不能只依赖摘要或论文标题。
|
||||
|
||||
## Current audits
|
||||
|
||||
- [Memory findings](memory/findings.md): 最近六个月哪些问题真的有进展,哪些仍未解决。
|
||||
- [Memory evidence ledger](memory/evidence-ledger.md): 全文实验、反例、成本和不能外推的范围。
|
||||
@@ -0,0 +1,37 @@
|
||||
# 证据账本
|
||||
|
||||
`full` 表示核过实验表、关键消融或 limitation;`context` 表示全文已转文本并做章节定位,但不承担本轮核心结论。
|
||||
|
||||
| Date | Paper | Depth | 可支持的判断 | 不能外推的部分 |
|
||||
| --- | --- | --- | --- | --- |
|
||||
| 2025-01 | [Zep, 2501.13956](https://arxiv.org/abs/2501.13956) | full | 长对话静态 QA 可用时间图谱大幅缩短上下文和延迟,并提升部分题型 | DMR 已饱和;single-session-assistant 反而下降;不是行动任务 |
|
||||
| 2025-02 | [A-MEM, 2502.12110](https://arxiv.org/abs/2502.12110) | full | 动态 linked-note 组织在 LoCoMo 上能优于若干早期 memory baseline | 方法、模型和 token 配置并非严格单变量控制 |
|
||||
| 2025-05 | [Experience-Following, 2505.16067](https://arxiv.org/abs/2505.16067) | full | 经验会影响后续相似任务,错误和错配经验会传播 | 不能证明某种通用写入或删除策略最优 |
|
||||
| 2025-07 | [MemoryAgentBench, 2507.05257](https://arxiv.org/abs/2507.05257) | full | retrieval、TTL、LRU、forgetting 是不同能力;复杂更新和全局综合仍弱 | 数据集转换和统一 prompt 不能覆盖真实 agent loop |
|
||||
| 2026-02 | [MemoryArena, 2602.16313](https://arxiv.org/abs/2602.16313) | full | 通用 memory/RAG 在相互依赖的多 session 行动任务上成功率低,额外 memory 延迟更高 | benchmark 本身很难,失败同时含 policy/reasoning 问题 |
|
||||
| 2026-03 | [Retrieval vs Utilization, 2603.02473](https://arxiv.org/abs/2603.02473) | full | LoCoMo 上 retrieval 方法差异大于 write strategy,raw RAG 是强 baseline | 单模型、单 benchmark、固定 top-k=5 |
|
||||
| 2026-05 | [Cross-Component Interference, 2605.05716](https://arxiv.org/abs/2605.05716) | full | memory 与其他 scaffold 的边际作用可为负,必须做 subset ablation | 只有 HotpotQA/GSM8K;tool 组件含协议因素 |
|
||||
| 2026-05 | [EvoMemBench, 2605.18421](https://arxiv.org/abs/2605.18421) | full | 15 种方法间不存在跨能力通用最优 memory form | 统一 benchmark 仍不能消除所有实现质量差异 |
|
||||
| 2026-05 | [DeMem, 2605.10870](https://arxiv.org/abs/2605.10870) | full | 决策充分状态比描述相似性更适合行动记忆;LoCoMo 描述相似性相关很弱 | 主要是自定义决策任务和理论建模 |
|
||||
| 2026-05 | [MemQ, 2605.08374](https://arxiv.org/abs/2605.08374) | full | provenance DAG credit assignment 在多步任务有增益,单步接近无增益 | 没有处理删除和长期错误积累 |
|
||||
| 2026-06 | [AutoMEM, 2606.04315](https://arxiv.org/abs/2606.04315) | full | 跨场景无通用赢家;索引会产生 schema loss,passive retrieval 会产生 retrieval loss | 新增 DCI harness 与已有系统的工程成熟度不同 |
|
||||
| 2026-06 | [MAGE, 2606.06090](https://arxiv.org/abs/2606.06090) | full | MemoryArena 同设置下,active execution-state tree 同时提高 SR 并减少 token | 单团队结果;绝对成功率在 Travel 仍只有 0.1519 |
|
||||
| 2026-06 | [Infini Memory, 2606.10677](https://arxiv.org/abs/2606.10677) | full | topic document 的 maintenance 对结果贡献明显,memory 维护不应被当后台清理 | 系统组件较多,维护和检索仍依赖 LLM |
|
||||
| 2026-06 | [HORMA, 2606.11680](https://arxiv.org/abs/2606.11680) | full | organize 与 retrieve 可拆分;高能力 manager 比大 retriever 更关键 | 结论依赖其层级 memory 和任务设置 |
|
||||
| 2026-06 | [Online Budget Study, 2606.15017](https://arxiv.org/abs/2606.15017) | full | budget-matched 时,vanilla agent 在 WebArena 多模型汇总上可胜 online skill/memory | 只研究 online augmentation,不覆盖离线学习 |
|
||||
| 2026-06 | [TrustMem, 2606.25161](https://arxiv.org/abs/2606.25161) | full | transition-level verifier 和排名训练可降低 omission/corruption/hallucination | verifier 仍是模型;训练、judge 和跨域泛化需要独立核验 |
|
||||
| 2026-06 | [Supersede, 2606.27472](https://arxiv.org/abs/2606.27472) | full | 当前值维护是独立瓶颈,更强模型和更大 memory 不足;训练信号能推动它 | 训练只有 Qwen2.5-3B 单次运行,16.7% 远非解决 |
|
||||
| 2026-06 | [MemDelta, 2606.29914](https://arxiv.org/abs/2606.29914) | full | embedding、model behavior 和 write cost 足以翻转架构结论 | Mem0 只在 88 题、2/6 题型上做 matched comparison |
|
||||
| 2026-06 | [ATMem, 2606.31612](https://arxiv.org/abs/2606.31612) | full | GUI agent 的主动任务状态和选择性调用能提高结果 | 128xH20 训练;更难 DataScope 仍接近失败 |
|
||||
| 2026-06 | [GovMem, 2607.02579](https://arxiv.org/abs/2607.02579) | full | 自动写入必须检查独立证据、反例、scope 和 provenance;真实轨迹暴露 false promotion | 外部 133 条是 stress slice,安全自动覆盖率为 0 |
|
||||
| 2026-07 | [A-TMA, 2607.01935](https://arxiv.org/abs/2607.01935) | full | current/historical/transition 角色能缓解 ghost memory | 收益 host-dependent,LoCoMo 部分指标不一致 |
|
||||
| 2026-07 | [AgenticSTS, 2607.02255](https://arxiv.org/abs/2607.02255) | full | typed memory contract 让技能/episode 可消融和复现 | 3/10 到 6/10 不显著;缺 same-code accumulating-context baseline |
|
||||
| 2026-07 | [FARMA, 2607.05029](https://arxiv.org/abs/2607.05029) | full | 伪造推理记录是不同于事实投毒的写入攻击面 | 50-trial 自定义攻击;0% ASR 防御不等于开放环境稳健 |
|
||||
|
||||
## 全文池
|
||||
|
||||
本轮全文池共 32 篇:
|
||||
|
||||
`2501.13956`, `2502.12110`, `2505.16067`, `2507.02259`, `2507.05257`, `2507.07957`, `2511.20857`, `2512.18746`, `2601.01885`, `2602.16313`, `2602.19320`, `2603.02473`, `2603.07670`, `2603.15666`, `2605.05716`, `2605.08374`, `2605.10870`, `2605.14421`, `2605.18421`, `2606.04315`, `2606.06090`, `2606.10677`, `2606.11680`, `2606.15017`, `2606.25161`, `2606.27472`, `2606.29914`, `2606.31612`, `2607.01935`, `2607.02255`, `2607.02579`, `2607.05029`。
|
||||
|
||||
其中没有进入上表核心论证的 9 篇暂标为 `context`,不把“下载过 PDF”写成“已得到结论”。
|
||||
@@ -0,0 +1,105 @@
|
||||
# 先说结论
|
||||
|
||||
截至 2026-07-10,这轮可复核的材料是:5 组分页 arXiv 查询得到 516 篇候选;其中 379 篇是标题含 memory/remember/forget 等词、正文处于 LLM Agent 语境的词法上界;最近六个月有 292 篇,前六个月只有 61 篇。论文数量增加了约 4.8 倍,但这不能解释成能力增加了 4.8 倍。
|
||||
|
||||
本轮下载并转成可检索文本的全文是 32 篇。下面的判断主要依靠其中 23 篇的实验表、消融和限制章节,不用标题和摘要投票。
|
||||
|
||||
能站住的判断只有四条:
|
||||
|
||||
1. **真正进步最大的是诊断和评测,不是通用记忆能力。** 研究开始把写入、检索、使用、当前状态、行动结果和成本拆开测,也开始暴露 embedding、基础模型、上下文长度和额外 LLM 调用造成的假增益。
|
||||
2. **静态对话事实召回已经是可用工程问题,但没有证据证明复杂 memory 普遍优于强 RAG 或完整上下文。** 在一个 3x3 控制实验中,换检索方法造成 14-23 个准确率点差异,换写入方法只有 3-8 个点;原始文本 RAG 还击败了两种有损写入。
|
||||
3. **最近半年唯一比较像“能力进步”的,是把长任务记忆从资料库改成执行状态。** MAGE 在同一篇论文、同一 backbone、同一 MemoryArena 协议下,平均比长上下文高 7.8 个成功率点,同时少用 32.9%-71.4% token。它证明了任务状态表示是有效方向,但还只是一个基准上的单篇结果。
|
||||
4. **更新、遗忘、经验复用和自动写入仍未解决。** 更强模型和更大 memory 都不能稳定消除旧事实污染;经验可能传播错误;保守写入可以降低错误晋升,却把代价转成大量人工复核。
|
||||
|
||||
## 具体问题有没有变好
|
||||
|
||||
| 问题 | 六个月前能做到什么 | 最近证据 | 判断 |
|
||||
| --- | --- | --- | --- |
|
||||
| 静态事实召回 | 图、note、摘要等结构在 LoCoMo/LongMemEval 上可以优于较弱 baseline;Zep 用约 1.6k 上下文替代 115k,LongMemEval 从 55.4% 到 63.8% 或 60.2% 到 71.2% | 控制实验表明检索器比复杂写入更重要;MemDelta 中 verbatim RAG 47.2% 与 full context 49.8% 无显著差异 | 工程上部分成熟;“新结构更聪明”没有普遍证据 |
|
||||
| 长范围综合和 test-time learning | top-k retrieval 经常拿不到全局信息;长上下文在预算够时领先 | compute-matched 结果显示 book summarization 只有拿到接近完整信息后才明显上升,架构差异次要 | 没解决,瓶颈是信息覆盖阈值 |
|
||||
| 当前值、更新和选择性遗忘 | MemoryAgentBench 的复杂多跳更新普遍很低,简单 overwrite prompt 无法修复 | Supersede 中 bounded memory 相对 full context 分别为 63% vs 82%、64% vs 91%、77% vs 92%;历史增长 24 倍后 68% 跌到 28%,memory 同比扩大仍是 28% | 没解决;现在只是把问题隔离得更清楚 |
|
||||
| 长任务执行状态 | 通用 memory/RAG 在 MemoryArena 上平均成功率约 0.12-0.15/0.17-0.23,Group Travel 几乎全为 0 | MAGE 把 memory 变成可 Grow/Compress/Maintain/Revise 的状态树,平均 +7.8pp SR;GUI 的 ATMem 也显示主动任务状态有效 | 有真实但任务特定的进展,需要独立复现 |
|
||||
| 经验和技能复用 | 相似任务会复用相似经验,但错误经验也会让输出沿相同方向出错 | 32k+ full-factorial 评测中 memory 对 HotpotQA 为负、对 GSM8K 略正;AgenticSTS 的技能层 3/10 到 6/10,Fisher p 约 0.37 | 没有通用增益,强依赖任务、模型和 scaffold |
|
||||
| 自动写入和压缩 | 主要优化“写得短、写得结构化” | TrustMem 开始监督每次 transition;GovMem 把写入改成证据治理,但内部 direct recall 降到 0.448、review burden 升到 0.692,外部 133 条高影响候选中安全自动晋升为 0 | 研究方向变对了,自动写入仍不可靠 |
|
||||
| 安全和来源 | 主要研究检索语料投毒 | 新工作覆盖持久污染、伪造推理、共享 memory 传播、provenance 和 false promotion | 威胁模型进步明显;防御多为自定义攻击上的单篇结果 |
|
||||
| 评测可信度 | 常见做法是端到端比一个总分,模型、embedding、token 和写入成本都不同 | MemDelta 只换 embedding 就 +6.2pp,并把 Mem0 相对 RAG 的 +11pp 变成 -1.2pp;相近效果下写入成本约 50 倍 | 这是最近半年最确定的进步 |
|
||||
|
||||
## 这些论文实际上在做什么
|
||||
|
||||
最近六个月 292 篇“标题中心”候选中,按标题声明的贡献做多标签统计:
|
||||
|
||||
| 方向 | 篇数 | 实际工作 |
|
||||
| --- | ---: | --- |
|
||||
| retrieval / representation | 65 | 图、层级、索引、rerank、topic document、typed memory |
|
||||
| experience / skill / learned policy | 65 | 经验提炼、技能库、RL 写入/检索/遗忘策略、自演化 |
|
||||
| execution / multimodal | 58 | GUI、embodied、video、spatial、long-horizon task state |
|
||||
| benchmark / diagnosis | 56 | 新 benchmark、stage-wise probe、跨场景和受控 baseline |
|
||||
| systems / efficiency | 37 | token、延迟、预算、压缩、端侧和 serving |
|
||||
| security / governance | 32 | poisoning、privacy、provenance、写入 gate、审计 |
|
||||
| personalization / shared memory | 27 | 用户长期状态、多 Agent 共享和协作 memory |
|
||||
| update / forgetting 明示在标题 | 22 | 冲突、时序、过期、遗忘、写入和生命周期 |
|
||||
|
||||
这些数字可重叠,而且只是研究议程,不是成果计数。数量暴涨主要表示大家把“memory”扩展成了八九个不同问题;不是 292 个方法都在共同推进同一个分数。
|
||||
|
||||
## 哪些结果最值得信
|
||||
|
||||
### 1. 静态 QA 先做强 retrieval,不要先发明 memory 架构
|
||||
|
||||
[Diagnosing Retrieval vs. Utilization](https://arxiv.org/abs/2603.02473) 在 LoCoMo 1540 题上固定 answer model 和 prompt,交叉三种写法与三种检索法。Basic RAG 在 cosine/hybrid 下为 77.9%/81.1%,fact extraction 为 72.2%/77.3%,episode summary 为 70.1%/73.3%;retrieval precision 与最终准确率相关系数为 0.98。这个结论只适用于静态对话 QA 和固定 top-k=5,但它足以否定“复杂写入天然更好”。
|
||||
|
||||
[MemDelta](https://arxiv.org/abs/2606.29914) 更进一步:500 题上 cloud embedding RAG 为 53.4%,MiniLM RAG 为 47.2%,完整上下文为 49.8%。在可做 matched comparison 的 88 题上,Mem0 72.7%,cloud RAG 73.9%,p=1.0 且置信区间很宽;Mem0 需要 1000+ LLM 调用、约 120 分钟和 $0.50+ 写入成本,RAG 是 0 次 LLM 调用、约 60 秒和 $0.01。它没有证明 memory 无用,只证明当前很多“架构增益”无法归因。
|
||||
|
||||
### 2. 更新问题不是检索一个最新 chunk 那么简单
|
||||
|
||||
[MemoryAgentBench](https://arxiv.org/abs/2507.05257) 把能力拆成准确检索、test-time learning、长范围理解和选择性遗忘。GPT-4.1-mini 的默认 single-hop/multi-hop 更新为 36%/5%;强制总选最新后为 40%/4%,保守 overwrite 为 28%/4%。prompt 没有传播多跳依赖上的更新。
|
||||
|
||||
[Supersede](https://arxiv.org/abs/2606.27472) 把 full context 与 bounded self-maintained memory 配对比较,证明维护过程本身丢失当前值。其 GRPO 训练把 Qwen2.5-3B 从 9.0% 提到 16.7%,但只有一次训练、绝对结果仍很低。合理表述是“这个失败可被训练信号推动”,不是“已经补上差距”。
|
||||
|
||||
[A-TMA](https://arxiv.org/abs/2607.01935) 用 current/historical/transition 角色缓解 ghost memory:Graphiti/Zep 的冲突准确率从 0.480 到 0.720,LoCoMo temporal F1 从 0.0295 到 0.1705;作者也报告 host-dependent 和非一致增益。它支持显式状态角色,不支持通用解决方案。
|
||||
|
||||
### 3. 行动任务需要的是最小充分状态,不是相似历史
|
||||
|
||||
[MemoryArena](https://arxiv.org/abs/2602.16313) 把 memory 放回 agent-environment loop。通用 memory 系统在 Bundled Shopping 全部 0 成功,在 Group Travel 全部 0;RAG 的总体平均成功率最高也只有 0.23。作者观察到 representation mismatch、training mismatch 和额外延迟。
|
||||
|
||||
[MAGE](https://arxiv.org/abs/2606.06090) 是目前最值得继续追的正结果。它在同一 Qwen3.6-27B 设置中,Shopping 0.3333 到 0.3933,Travel 0.0519 到 0.1519,Web Search 0.4842 到 0.5656;移除 Compress/Maintain/Revise 都会下降。还缺跨团队复现、更多模型和更难任务上的绝对成功率。
|
||||
|
||||
[ATMem](https://arxiv.org/abs/2606.31612) 在 AndroidWorld 8B 上从基础 47.6,经 SFT/GRPO/结构奖励到 76.6,但训练用了 128 张 H20;在更难的 DataScope 分层任务上绝对成功率仍只有 6.2/6.2/3.1。它证明 active state 有价值,也同时说明代价和剩余差距巨大。
|
||||
|
||||
### 4. 写入的本质正在从总结变成决策和治理
|
||||
|
||||
[GovMem](https://arxiv.org/abs/2607.02579) 的内部 synthetic 结果把 false promotion 从 0.597 降到 0.040、recall 保持 0.960;但真实项目子集依靠 0.692 review burden,外部 133 条高影响 coding-agent 候选最终没有一条可安全自动晋升。这个负结果比一个漂亮总分更有用:重复出现、测试日志和 Agent 自己的叙述都不能单独构成可复用知识证据。
|
||||
|
||||
[Cross-Component Interference](https://arxiv.org/abs/2605.05716) 在 32 个组件子集、32k+ 次评测中发现,HotpotQA 上 tool-only F1 0.233,高于 all-in 的 0.177;最优 proper subset 在所有测试设置中匹配或超过 all-in。它要求每个 memory 设计都必须做 no-memory 和组件组合消融。
|
||||
|
||||
## 怎么证明一个 memory 设计不是画图
|
||||
|
||||
一份能说服人的实验至少要同时满足:
|
||||
|
||||
1. 先说工作负载:信息是否超窗、是否会更新、是否跨任务、是否影响行动、错误写入会不会传播。
|
||||
2. 指定瓶颈阶段:write preservation、retrieval recall、state resolution、utilization、action outcome 只能选清楚,不能只报端到端总分。
|
||||
3. 必须有 full context、verbatim RAG、no memory 三个 baseline;做技能复用时还要有 raw trajectory replay。
|
||||
4. actor model、embedding、chunking、top-k、prompt、可见信息和 token/调用预算固定,只改一个组件。
|
||||
5. 报预处理时间、LLM 调用、推理 token、延迟和存储;不能只报“检索后上下文更短”。
|
||||
6. 做 harmful-memory、stale-memory 和 no-memory 消融;memory 可能是负贡献。
|
||||
7. 至少跨两个任务类型、两个模型、多个 seed;否则结论只能写成“在该 harness 中有效”。
|
||||
|
||||
可以把论证压成一句话:**在工作负载 W 中,阶段 B 的失败占主要误差;固定其余变量后,机制 C 把结果从 X 提到 Y,额外成本是 Z,且在边界 Q 外不成立。** 架构图只能解释 C,不能替代 W、B、X、Y、Z 和 Q。
|
||||
|
||||
## 对我们自己的直接影响
|
||||
|
||||
现在不应该先做一个“统一 Agent Memory 知识图谱”。更合理的最小系统是四个彼此独立、都保留原始证据的平面:
|
||||
|
||||
- `archive`:原始论文、对话、轨迹和版本,只追加,不让摘要覆盖证据。
|
||||
- `current state`:明确哪些事实和任务状态当前有效,保留 supersession 链。
|
||||
- `skills`:只保存有任务结果和适用范围支撑的程序性经验,允许回滚。
|
||||
- `governance`:记录来源、反例、写入决定、评测结果和人工复核。
|
||||
|
||||
检索先从 raw archive + 强 baseline 做起。只有在确定是 retrieval、state resolution、execution state 或 skill transfer 的哪一种失败后,才增加对应结构。否则我们很容易复现这半年论文里最常见的问题:系统越来越复杂,但不知道增益来自哪里。
|
||||
|
||||
## 材料边界
|
||||
|
||||
- 516 是 5 组 arXiv 查询的并集,不是人工确认的 516 篇核心论文。
|
||||
- 379 和 292 是保守词法筛选后的上界,仍可能有误收;标题主题统计可重叠。
|
||||
- 32 篇做了全文下载和章节定位,23 篇进入证据账本;其余论文目前只用于背景和冲突检索。
|
||||
- 大多数 2026 工作仍是 arXiv preprint,独立复现很少。这里把“同论文内受控增益”和“跨论文已建立共识”严格分开。
|
||||
- 跨 benchmark 的绝对分数不能直接排名;这里只比较同协议内结果,或明确写出不可比原因。
|
||||
Reference in New Issue
Block a user