12 KiB
先说结论
截至 2026-07-10,这轮可复核的材料是:5 组分页 arXiv 查询得到 516 篇候选;其中 379 篇是标题含 memory/remember/forget 等词、正文处于 LLM Agent 语境的词法上界;最近六个月有 292 篇,前六个月只有 61 篇。论文数量增加了约 4.8 倍,但这不能解释成能力增加了 4.8 倍。
本轮下载并转成可检索文本的全文是 32 篇。下面的判断主要依靠其中 23 篇的实验表、消融和限制章节,不用标题和摘要投票。
能站住的判断只有四条:
- 真正进步最大的是诊断和评测,不是通用记忆能力。 研究开始把写入、检索、使用、当前状态、行动结果和成本拆开测,也开始暴露 embedding、基础模型、上下文长度和额外 LLM 调用造成的假增益。
- 静态对话事实召回已经是可用工程问题,但没有证据证明复杂 memory 普遍优于强 RAG 或完整上下文。 在一个 3x3 控制实验中,换检索方法造成 14-23 个准确率点差异,换写入方法只有 3-8 个点;原始文本 RAG 还击败了两种有损写入。
- 最近半年唯一比较像“能力进步”的,是把长任务记忆从资料库改成执行状态。 MAGE 在同一篇论文、同一 backbone、同一 MemoryArena 协议下,平均比长上下文高 7.8 个成功率点,同时少用 32.9%-71.4% token。它证明了任务状态表示是有效方向,但还只是一个基准上的单篇结果。
- 更新、遗忘、经验复用和自动写入仍未解决。 更强模型和更大 memory 都不能稳定消除旧事实污染;经验可能传播错误;保守写入可以降低错误晋升,却把代价转成大量人工复核。
具体问题有没有变好
| 问题 | 六个月前能做到什么 | 最近证据 | 判断 |
|---|---|---|---|
| 静态事实召回 | 图、note、摘要等结构在 LoCoMo/LongMemEval 上可以优于较弱 baseline;Zep 用约 1.6k 上下文替代 115k,LongMemEval 从 55.4% 到 63.8% 或 60.2% 到 71.2% | 控制实验表明检索器比复杂写入更重要;MemDelta 中 verbatim RAG 47.2% 与 full context 49.8% 无显著差异 | 工程上部分成熟;“新结构更聪明”没有普遍证据 |
| 长范围综合和 test-time learning | top-k retrieval 经常拿不到全局信息;长上下文在预算够时领先 | compute-matched 结果显示 book summarization 只有拿到接近完整信息后才明显上升,架构差异次要 | 没解决,瓶颈是信息覆盖阈值 |
| 当前值、更新和选择性遗忘 | MemoryAgentBench 的复杂多跳更新普遍很低,简单 overwrite prompt 无法修复 | Supersede 中 bounded memory 相对 full context 分别为 63% vs 82%、64% vs 91%、77% vs 92%;历史增长 24 倍后 68% 跌到 28%,memory 同比扩大仍是 28% | 没解决;现在只是把问题隔离得更清楚 |
| 长任务执行状态 | 通用 memory/RAG 在 MemoryArena 上平均成功率约 0.12-0.15/0.17-0.23,Group Travel 几乎全为 0 | MAGE 把 memory 变成可 Grow/Compress/Maintain/Revise 的状态树,平均 +7.8pp SR;GUI 的 ATMem 也显示主动任务状态有效 | 有真实但任务特定的进展,需要独立复现 |
| 经验和技能复用 | 相似任务会复用相似经验,但错误经验也会让输出沿相同方向出错 | 32k+ full-factorial 评测中 memory 对 HotpotQA 为负、对 GSM8K 略正;AgenticSTS 的技能层 3/10 到 6/10,Fisher p 约 0.37 | 没有通用增益,强依赖任务、模型和 scaffold |
| 自动写入和压缩 | 主要优化“写得短、写得结构化” | TrustMem 开始监督每次 transition;GovMem 把写入改成证据治理,但内部 direct recall 降到 0.448、review burden 升到 0.692,外部 133 条高影响候选中安全自动晋升为 0 | 研究方向变对了,自动写入仍不可靠 |
| 安全和来源 | 主要研究检索语料投毒 | 新工作覆盖持久污染、伪造推理、共享 memory 传播、provenance 和 false promotion | 威胁模型进步明显;防御多为自定义攻击上的单篇结果 |
| 评测可信度 | 常见做法是端到端比一个总分,模型、embedding、token 和写入成本都不同 | MemDelta 只换 embedding 就 +6.2pp,并把 Mem0 相对 RAG 的 +11pp 变成 -1.2pp;相近效果下写入成本约 50 倍 | 这是最近半年最确定的进步 |
这些论文实际上在做什么
最近六个月 292 篇“标题中心”候选中,按标题声明的贡献做多标签统计:
| 方向 | 篇数 | 实际工作 |
|---|---|---|
| retrieval / representation | 65 | 图、层级、索引、rerank、topic document、typed memory |
| experience / skill / learned policy | 65 | 经验提炼、技能库、RL 写入/检索/遗忘策略、自演化 |
| execution / multimodal | 58 | GUI、embodied、video、spatial、long-horizon task state |
| benchmark / diagnosis | 56 | 新 benchmark、stage-wise probe、跨场景和受控 baseline |
| systems / efficiency | 37 | token、延迟、预算、压缩、端侧和 serving |
| security / governance | 32 | poisoning、privacy、provenance、写入 gate、审计 |
| personalization / shared memory | 27 | 用户长期状态、多 Agent 共享和协作 memory |
| update / forgetting 明示在标题 | 22 | 冲突、时序、过期、遗忘、写入和生命周期 |
这些数字可重叠,而且只是研究议程,不是成果计数。数量暴涨主要表示大家把“memory”扩展成了八九个不同问题;不是 292 个方法都在共同推进同一个分数。
哪些结果最值得信
1. 静态 QA 先做强 retrieval,不要先发明 memory 架构
Diagnosing Retrieval vs. Utilization 在 LoCoMo 1540 题上固定 answer model 和 prompt,交叉三种写法与三种检索法。Basic RAG 在 cosine/hybrid 下为 77.9%/81.1%,fact extraction 为 72.2%/77.3%,episode summary 为 70.1%/73.3%;retrieval precision 与最终准确率相关系数为 0.98。这个结论只适用于静态对话 QA 和固定 top-k=5,但它足以否定“复杂写入天然更好”。
MemDelta 更进一步:500 题上 cloud embedding RAG 为 53.4%,MiniLM RAG 为 47.2%,完整上下文为 49.8%。在可做 matched comparison 的 88 题上,Mem0 72.7%,cloud RAG 73.9%,p=1.0 且置信区间很宽;Mem0 需要 1000+ LLM 调用、约 120 分钟和 $0.50+ 写入成本,RAG 是 0 次 LLM 调用、约 60 秒和 $0.01。它没有证明 memory 无用,只证明当前很多“架构增益”无法归因。
2. 更新问题不是检索一个最新 chunk 那么简单
MemoryAgentBench 把能力拆成准确检索、test-time learning、长范围理解和选择性遗忘。GPT-4.1-mini 的默认 single-hop/multi-hop 更新为 36%/5%;强制总选最新后为 40%/4%,保守 overwrite 为 28%/4%。prompt 没有传播多跳依赖上的更新。
Supersede 把 full context 与 bounded self-maintained memory 配对比较,证明维护过程本身丢失当前值。其 GRPO 训练把 Qwen2.5-3B 从 9.0% 提到 16.7%,但只有一次训练、绝对结果仍很低。合理表述是“这个失败可被训练信号推动”,不是“已经补上差距”。
A-TMA 用 current/historical/transition 角色缓解 ghost memory:Graphiti/Zep 的冲突准确率从 0.480 到 0.720,LoCoMo temporal F1 从 0.0295 到 0.1705;作者也报告 host-dependent 和非一致增益。它支持显式状态角色,不支持通用解决方案。
3. 行动任务需要的是最小充分状态,不是相似历史
MemoryArena 把 memory 放回 agent-environment loop。通用 memory 系统在 Bundled Shopping 全部 0 成功,在 Group Travel 全部 0;RAG 的总体平均成功率最高也只有 0.23。作者观察到 representation mismatch、training mismatch 和额外延迟。
MAGE 是目前最值得继续追的正结果。它在同一 Qwen3.6-27B 设置中,Shopping 0.3333 到 0.3933,Travel 0.0519 到 0.1519,Web Search 0.4842 到 0.5656;移除 Compress/Maintain/Revise 都会下降。还缺跨团队复现、更多模型和更难任务上的绝对成功率。
ATMem 在 AndroidWorld 8B 上从基础 47.6,经 SFT/GRPO/结构奖励到 76.6,但训练用了 128 张 H20;在更难的 DataScope 分层任务上绝对成功率仍只有 6.2/6.2/3.1。它证明 active state 有价值,也同时说明代价和剩余差距巨大。
4. 写入的本质正在从总结变成决策和治理
GovMem 的内部 synthetic 结果把 false promotion 从 0.597 降到 0.040、recall 保持 0.960;但真实项目子集依靠 0.692 review burden,外部 133 条高影响 coding-agent 候选最终没有一条可安全自动晋升。这个负结果比一个漂亮总分更有用:重复出现、测试日志和 Agent 自己的叙述都不能单独构成可复用知识证据。
Cross-Component Interference 在 32 个组件子集、32k+ 次评测中发现,HotpotQA 上 tool-only F1 0.233,高于 all-in 的 0.177;最优 proper subset 在所有测试设置中匹配或超过 all-in。它要求每个 memory 设计都必须做 no-memory 和组件组合消融。
怎么证明一个 memory 设计不是画图
一份能说服人的实验至少要同时满足:
- 先说工作负载:信息是否超窗、是否会更新、是否跨任务、是否影响行动、错误写入会不会传播。
- 指定瓶颈阶段:write preservation、retrieval recall、state resolution、utilization、action outcome 只能选清楚,不能只报端到端总分。
- 必须有 full context、verbatim RAG、no memory 三个 baseline;做技能复用时还要有 raw trajectory replay。
- actor model、embedding、chunking、top-k、prompt、可见信息和 token/调用预算固定,只改一个组件。
- 报预处理时间、LLM 调用、推理 token、延迟和存储;不能只报“检索后上下文更短”。
- 做 harmful-memory、stale-memory 和 no-memory 消融;memory 可能是负贡献。
- 至少跨两个任务类型、两个模型、多个 seed;否则结论只能写成“在该 harness 中有效”。
可以把论证压成一句话:在工作负载 W 中,阶段 B 的失败占主要误差;固定其余变量后,机制 C 把结果从 X 提到 Y,额外成本是 Z,且在边界 Q 外不成立。 架构图只能解释 C,不能替代 W、B、X、Y、Z 和 Q。
对我们自己的直接影响
现在不应该先做一个“统一 Agent Memory 知识图谱”。更合理的最小系统是四个彼此独立、都保留原始证据的平面:
archive:原始论文、对话、轨迹和版本,只追加,不让摘要覆盖证据。current state:明确哪些事实和任务状态当前有效,保留 supersession 链。skills:只保存有任务结果和适用范围支撑的程序性经验,允许回滚。governance:记录来源、反例、写入决定、评测结果和人工复核。
检索先从 raw archive + 强 baseline 做起。只有在确定是 retrieval、state resolution、execution state 或 skill transfer 的哪一种失败后,才增加对应结构。否则我们很容易复现这半年论文里最常见的问题:系统越来越复杂,但不知道增益来自哪里。
材料边界
- 516 是 5 组 arXiv 查询的并集,不是人工确认的 516 篇核心论文。
- 379 和 292 是保守词法筛选后的上界,仍可能有误收;标题主题统计可重叠。
- 32 篇做了全文下载和章节定位,23 篇进入证据账本;其余论文目前只用于背景和冲突检索。
- 大多数 2026 工作仍是 arXiv preprint,独立复现很少。这里把“同论文内受控增益”和“跨论文已建立共识”严格分开。
- 跨 benchmark 的绝对分数不能直接排名;这里只比较同协议内结果,或明确写出不可比原因。