Files
agent/research/memory/findings.md
T
2026-07-10 18:52:00 +08:00

12 KiB
Raw Blame History

先说结论

截至 2026-07-10,这轮可复核的材料是:5 组分页 arXiv 查询得到 516 篇候选;其中 379 篇是标题含 memory/remember/forget 等词、正文处于 LLM Agent 语境的词法上界;最近六个月有 292 篇,前六个月只有 61 篇。论文数量增加了约 4.8 倍,但这不能解释成能力增加了 4.8 倍。

本轮下载并转成可检索文本的全文是 32 篇。下面的判断主要依靠其中 23 篇的实验表、消融和限制章节,不用标题和摘要投票。

能站住的判断只有四条:

  1. 真正进步最大的是诊断和评测,不是通用记忆能力。 研究开始把写入、检索、使用、当前状态、行动结果和成本拆开测,也开始暴露 embedding、基础模型、上下文长度和额外 LLM 调用造成的假增益。
  2. 静态对话事实召回已经是可用工程问题,但没有证据证明复杂 memory 普遍优于强 RAG 或完整上下文。 在一个 3x3 控制实验中,换检索方法造成 14-23 个准确率点差异,换写入方法只有 3-8 个点;原始文本 RAG 还击败了两种有损写入。
  3. 最近半年唯一比较像“能力进步”的,是把长任务记忆从资料库改成执行状态。 MAGE 在同一篇论文、同一 backbone、同一 MemoryArena 协议下,平均比长上下文高 7.8 个成功率点,同时少用 32.9%-71.4% token。它证明了任务状态表示是有效方向,但还只是一个基准上的单篇结果。
  4. 更新、遗忘、经验复用和自动写入仍未解决。 更强模型和更大 memory 都不能稳定消除旧事实污染;经验可能传播错误;保守写入可以降低错误晋升,却把代价转成大量人工复核。

具体问题有没有变好

问题 六个月前能做到什么 最近证据 判断
静态事实召回 图、note、摘要等结构在 LoCoMo/LongMemEval 上可以优于较弱 baselineZep 用约 1.6k 上下文替代 115kLongMemEval 从 55.4% 到 63.8% 或 60.2% 到 71.2% 控制实验表明检索器比复杂写入更重要;MemDelta 中 verbatim RAG 47.2% 与 full context 49.8% 无显著差异 工程上部分成熟;“新结构更聪明”没有普遍证据
长范围综合和 test-time learning top-k retrieval 经常拿不到全局信息;长上下文在预算够时领先 compute-matched 结果显示 book summarization 只有拿到接近完整信息后才明显上升,架构差异次要 没解决,瓶颈是信息覆盖阈值
当前值、更新和选择性遗忘 MemoryAgentBench 的复杂多跳更新普遍很低,简单 overwrite prompt 无法修复 Supersede 中 bounded memory 相对 full context 分别为 63% vs 82%、64% vs 91%、77% vs 92%;历史增长 24 倍后 68% 跌到 28%memory 同比扩大仍是 28% 没解决;现在只是把问题隔离得更清楚
长任务执行状态 通用 memory/RAG 在 MemoryArena 上平均成功率约 0.12-0.15/0.17-0.23Group Travel 几乎全为 0 MAGE 把 memory 变成可 Grow/Compress/Maintain/Revise 的状态树,平均 +7.8pp SRGUI 的 ATMem 也显示主动任务状态有效 有真实但任务特定的进展,需要独立复现
经验和技能复用 相似任务会复用相似经验,但错误经验也会让输出沿相同方向出错 32k+ full-factorial 评测中 memory 对 HotpotQA 为负、对 GSM8K 略正;AgenticSTS 的技能层 3/10 到 6/10Fisher p 约 0.37 没有通用增益,强依赖任务、模型和 scaffold
自动写入和压缩 主要优化“写得短、写得结构化” TrustMem 开始监督每次 transition;GovMem 把写入改成证据治理,但内部 direct recall 降到 0.448、review burden 升到 0.692,外部 133 条高影响候选中安全自动晋升为 0 研究方向变对了,自动写入仍不可靠
安全和来源 主要研究检索语料投毒 新工作覆盖持久污染、伪造推理、共享 memory 传播、provenance 和 false promotion 威胁模型进步明显;防御多为自定义攻击上的单篇结果
评测可信度 常见做法是端到端比一个总分,模型、embedding、token 和写入成本都不同 MemDelta 只换 embedding 就 +6.2pp,并把 Mem0 相对 RAG 的 +11pp 变成 -1.2pp;相近效果下写入成本约 50 倍 这是最近半年最确定的进步

这些论文实际上在做什么

最近六个月 292 篇“标题中心”候选中,按标题声明的贡献做多标签统计:

方向 篇数 实际工作
retrieval / representation 65 图、层级、索引、rerank、topic document、typed memory
experience / skill / learned policy 65 经验提炼、技能库、RL 写入/检索/遗忘策略、自演化
execution / multimodal 58 GUI、embodied、video、spatial、long-horizon task state
benchmark / diagnosis 56 新 benchmark、stage-wise probe、跨场景和受控 baseline
systems / efficiency 37 token、延迟、预算、压缩、端侧和 serving
security / governance 32 poisoning、privacy、provenance、写入 gate、审计
personalization / shared memory 27 用户长期状态、多 Agent 共享和协作 memory
update / forgetting 明示在标题 22 冲突、时序、过期、遗忘、写入和生命周期

这些数字可重叠,而且只是研究议程,不是成果计数。数量暴涨主要表示大家把“memory”扩展成了八九个不同问题;不是 292 个方法都在共同推进同一个分数。

哪些结果最值得信

1. 静态 QA 先做强 retrieval,不要先发明 memory 架构

Diagnosing Retrieval vs. Utilization 在 LoCoMo 1540 题上固定 answer model 和 prompt,交叉三种写法与三种检索法。Basic RAG 在 cosine/hybrid 下为 77.9%/81.1%fact extraction 为 72.2%/77.3%episode summary 为 70.1%/73.3%retrieval precision 与最终准确率相关系数为 0.98。这个结论只适用于静态对话 QA 和固定 top-k=5,但它足以否定“复杂写入天然更好”。

MemDelta 更进一步:500 题上 cloud embedding RAG 为 53.4%MiniLM RAG 为 47.2%,完整上下文为 49.8%。在可做 matched comparison 的 88 题上,Mem0 72.7%cloud RAG 73.9%p=1.0 且置信区间很宽;Mem0 需要 1000+ LLM 调用、约 120 分钟和 $0.50+ 写入成本,RAG 是 0 次 LLM 调用、约 60 秒和 $0.01。它没有证明 memory 无用,只证明当前很多“架构增益”无法归因。

2. 更新问题不是检索一个最新 chunk 那么简单

MemoryAgentBench 把能力拆成准确检索、test-time learning、长范围理解和选择性遗忘。GPT-4.1-mini 的默认 single-hop/multi-hop 更新为 36%/5%;强制总选最新后为 40%/4%,保守 overwrite 为 28%/4%。prompt 没有传播多跳依赖上的更新。

Supersede 把 full context 与 bounded self-maintained memory 配对比较,证明维护过程本身丢失当前值。其 GRPO 训练把 Qwen2.5-3B 从 9.0% 提到 16.7%,但只有一次训练、绝对结果仍很低。合理表述是“这个失败可被训练信号推动”,不是“已经补上差距”。

A-TMA 用 current/historical/transition 角色缓解 ghost memoryGraphiti/Zep 的冲突准确率从 0.480 到 0.720LoCoMo temporal F1 从 0.0295 到 0.1705;作者也报告 host-dependent 和非一致增益。它支持显式状态角色,不支持通用解决方案。

3. 行动任务需要的是最小充分状态,不是相似历史

MemoryArena 把 memory 放回 agent-environment loop。通用 memory 系统在 Bundled Shopping 全部 0 成功,在 Group Travel 全部 0;RAG 的总体平均成功率最高也只有 0.23。作者观察到 representation mismatch、training mismatch 和额外延迟。

MAGE 是目前最值得继续追的正结果。它在同一 Qwen3.6-27B 设置中,Shopping 0.3333 到 0.3933Travel 0.0519 到 0.1519Web Search 0.4842 到 0.5656;移除 Compress/Maintain/Revise 都会下降。还缺跨团队复现、更多模型和更难任务上的绝对成功率。

ATMem 在 AndroidWorld 8B 上从基础 47.6,经 SFT/GRPO/结构奖励到 76.6,但训练用了 128 张 H20;在更难的 DataScope 分层任务上绝对成功率仍只有 6.2/6.2/3.1。它证明 active state 有价值,也同时说明代价和剩余差距巨大。

4. 写入的本质正在从总结变成决策和治理

GovMem 的内部 synthetic 结果把 false promotion 从 0.597 降到 0.040、recall 保持 0.960;但真实项目子集依靠 0.692 review burden,外部 133 条高影响 coding-agent 候选最终没有一条可安全自动晋升。这个负结果比一个漂亮总分更有用:重复出现、测试日志和 Agent 自己的叙述都不能单独构成可复用知识证据。

Cross-Component Interference 在 32 个组件子集、32k+ 次评测中发现,HotpotQA 上 tool-only F1 0.233,高于 all-in 的 0.177;最优 proper subset 在所有测试设置中匹配或超过 all-in。它要求每个 memory 设计都必须做 no-memory 和组件组合消融。

怎么证明一个 memory 设计不是画图

一份能说服人的实验至少要同时满足:

  1. 先说工作负载:信息是否超窗、是否会更新、是否跨任务、是否影响行动、错误写入会不会传播。
  2. 指定瓶颈阶段:write preservation、retrieval recall、state resolution、utilization、action outcome 只能选清楚,不能只报端到端总分。
  3. 必须有 full context、verbatim RAG、no memory 三个 baseline;做技能复用时还要有 raw trajectory replay。
  4. actor model、embedding、chunking、top-k、prompt、可见信息和 token/调用预算固定,只改一个组件。
  5. 报预处理时间、LLM 调用、推理 token、延迟和存储;不能只报“检索后上下文更短”。
  6. 做 harmful-memory、stale-memory 和 no-memory 消融;memory 可能是负贡献。
  7. 至少跨两个任务类型、两个模型、多个 seed;否则结论只能写成“在该 harness 中有效”。

可以把论证压成一句话:在工作负载 W 中,阶段 B 的失败占主要误差;固定其余变量后,机制 C 把结果从 X 提到 Y,额外成本是 Z,且在边界 Q 外不成立。 架构图只能解释 C,不能替代 W、B、X、Y、Z 和 Q。

对我们自己的直接影响

现在不应该先做一个“统一 Agent Memory 知识图谱”。更合理的最小系统是四个彼此独立、都保留原始证据的平面:

  • archive:原始论文、对话、轨迹和版本,只追加,不让摘要覆盖证据。
  • current state:明确哪些事实和任务状态当前有效,保留 supersession 链。
  • skills:只保存有任务结果和适用范围支撑的程序性经验,允许回滚。
  • governance:记录来源、反例、写入决定、评测结果和人工复核。

检索先从 raw archive + 强 baseline 做起。只有在确定是 retrieval、state resolution、execution state 或 skill transfer 的哪一种失败后,才增加对应结构。否则我们很容易复现这半年论文里最常见的问题:系统越来越复杂,但不知道增益来自哪里。

材料边界

  • 516 是 5 组 arXiv 查询的并集,不是人工确认的 516 篇核心论文。
  • 379 和 292 是保守词法筛选后的上界,仍可能有误收;标题主题统计可重叠。
  • 32 篇做了全文下载和章节定位,23 篇进入证据账本;其余论文目前只用于背景和冲突检索。
  • 大多数 2026 工作仍是 arXiv preprint,独立复现很少。这里把“同论文内受控增益”和“跨论文已建立共识”严格分开。
  • 跨 benchmark 的绝对分数不能直接排名;这里只比较同协议内结果,或明确写出不可比原因。