# 先说结论 截至 2026-07-10,这轮可复核的材料是:5 组分页 arXiv 查询得到 516 篇候选;其中 379 篇是标题含 memory/remember/forget 等词、正文处于 LLM Agent 语境的词法上界;最近六个月有 292 篇,前六个月只有 61 篇。论文数量增加了约 4.8 倍,但这不能解释成能力增加了 4.8 倍。 本轮下载并转成可检索文本的全文是 32 篇。下面的判断主要依靠其中 23 篇的实验表、消融和限制章节,不用标题和摘要投票。 能站住的判断只有四条: 1. **真正进步最大的是诊断和评测,不是通用记忆能力。** 研究开始把写入、检索、使用、当前状态、行动结果和成本拆开测,也开始暴露 embedding、基础模型、上下文长度和额外 LLM 调用造成的假增益。 2. **静态对话事实召回已经是可用工程问题,但没有证据证明复杂 memory 普遍优于强 RAG 或完整上下文。** 在一个 3x3 控制实验中,换检索方法造成 14-23 个准确率点差异,换写入方法只有 3-8 个点;原始文本 RAG 还击败了两种有损写入。 3. **最近半年唯一比较像“能力进步”的,是把长任务记忆从资料库改成执行状态。** MAGE 在同一篇论文、同一 backbone、同一 MemoryArena 协议下,平均比长上下文高 7.8 个成功率点,同时少用 32.9%-71.4% token。它证明了任务状态表示是有效方向,但还只是一个基准上的单篇结果。 4. **更新、遗忘、经验复用和自动写入仍未解决。** 更强模型和更大 memory 都不能稳定消除旧事实污染;经验可能传播错误;保守写入可以降低错误晋升,却把代价转成大量人工复核。 ## 具体问题有没有变好 | 问题 | 六个月前能做到什么 | 最近证据 | 判断 | | --- | --- | --- | --- | | 静态事实召回 | 图、note、摘要等结构在 LoCoMo/LongMemEval 上可以优于较弱 baseline;Zep 用约 1.6k 上下文替代 115k,LongMemEval 从 55.4% 到 63.8% 或 60.2% 到 71.2% | 控制实验表明检索器比复杂写入更重要;MemDelta 中 verbatim RAG 47.2% 与 full context 49.8% 无显著差异 | 工程上部分成熟;“新结构更聪明”没有普遍证据 | | 长范围综合和 test-time learning | top-k retrieval 经常拿不到全局信息;长上下文在预算够时领先 | compute-matched 结果显示 book summarization 只有拿到接近完整信息后才明显上升,架构差异次要 | 没解决,瓶颈是信息覆盖阈值 | | 当前值、更新和选择性遗忘 | MemoryAgentBench 的复杂多跳更新普遍很低,简单 overwrite prompt 无法修复 | Supersede 中 bounded memory 相对 full context 分别为 63% vs 82%、64% vs 91%、77% vs 92%;历史增长 24 倍后 68% 跌到 28%,memory 同比扩大仍是 28% | 没解决;现在只是把问题隔离得更清楚 | | 长任务执行状态 | 通用 memory/RAG 在 MemoryArena 上平均成功率约 0.12-0.15/0.17-0.23,Group Travel 几乎全为 0 | MAGE 把 memory 变成可 Grow/Compress/Maintain/Revise 的状态树,平均 +7.8pp SR;GUI 的 ATMem 也显示主动任务状态有效 | 有真实但任务特定的进展,需要独立复现 | | 经验和技能复用 | 相似任务会复用相似经验,但错误经验也会让输出沿相同方向出错 | 32k+ full-factorial 评测中 memory 对 HotpotQA 为负、对 GSM8K 略正;AgenticSTS 的技能层 3/10 到 6/10,Fisher p 约 0.37 | 没有通用增益,强依赖任务、模型和 scaffold | | 自动写入和压缩 | 主要优化“写得短、写得结构化” | TrustMem 开始监督每次 transition;GovMem 把写入改成证据治理,但内部 direct recall 降到 0.448、review burden 升到 0.692,外部 133 条高影响候选中安全自动晋升为 0 | 研究方向变对了,自动写入仍不可靠 | | 安全和来源 | 主要研究检索语料投毒 | 新工作覆盖持久污染、伪造推理、共享 memory 传播、provenance 和 false promotion | 威胁模型进步明显;防御多为自定义攻击上的单篇结果 | | 评测可信度 | 常见做法是端到端比一个总分,模型、embedding、token 和写入成本都不同 | MemDelta 只换 embedding 就 +6.2pp,并把 Mem0 相对 RAG 的 +11pp 变成 -1.2pp;相近效果下写入成本约 50 倍 | 这是最近半年最确定的进步 | ## 这些论文实际上在做什么 最近六个月 292 篇“标题中心”候选中,按标题声明的贡献做多标签统计: | 方向 | 篇数 | 实际工作 | | --- | ---: | --- | | retrieval / representation | 65 | 图、层级、索引、rerank、topic document、typed memory | | experience / skill / learned policy | 65 | 经验提炼、技能库、RL 写入/检索/遗忘策略、自演化 | | execution / multimodal | 58 | GUI、embodied、video、spatial、long-horizon task state | | benchmark / diagnosis | 56 | 新 benchmark、stage-wise probe、跨场景和受控 baseline | | systems / efficiency | 37 | token、延迟、预算、压缩、端侧和 serving | | security / governance | 32 | poisoning、privacy、provenance、写入 gate、审计 | | personalization / shared memory | 27 | 用户长期状态、多 Agent 共享和协作 memory | | update / forgetting 明示在标题 | 22 | 冲突、时序、过期、遗忘、写入和生命周期 | 这些数字可重叠,而且只是研究议程,不是成果计数。数量暴涨主要表示大家把“memory”扩展成了八九个不同问题;不是 292 个方法都在共同推进同一个分数。 ## 哪些结果最值得信 ### 1. 静态 QA 先做强 retrieval,不要先发明 memory 架构 [Diagnosing Retrieval vs. Utilization](https://arxiv.org/abs/2603.02473) 在 LoCoMo 1540 题上固定 answer model 和 prompt,交叉三种写法与三种检索法。Basic RAG 在 cosine/hybrid 下为 77.9%/81.1%,fact extraction 为 72.2%/77.3%,episode summary 为 70.1%/73.3%;retrieval precision 与最终准确率相关系数为 0.98。这个结论只适用于静态对话 QA 和固定 top-k=5,但它足以否定“复杂写入天然更好”。 [MemDelta](https://arxiv.org/abs/2606.29914) 更进一步:500 题上 cloud embedding RAG 为 53.4%,MiniLM RAG 为 47.2%,完整上下文为 49.8%。在可做 matched comparison 的 88 题上,Mem0 72.7%,cloud RAG 73.9%,p=1.0 且置信区间很宽;Mem0 需要 1000+ LLM 调用、约 120 分钟和 $0.50+ 写入成本,RAG 是 0 次 LLM 调用、约 60 秒和 $0.01。它没有证明 memory 无用,只证明当前很多“架构增益”无法归因。 ### 2. 更新问题不是检索一个最新 chunk 那么简单 [MemoryAgentBench](https://arxiv.org/abs/2507.05257) 把能力拆成准确检索、test-time learning、长范围理解和选择性遗忘。GPT-4.1-mini 的默认 single-hop/multi-hop 更新为 36%/5%;强制总选最新后为 40%/4%,保守 overwrite 为 28%/4%。prompt 没有传播多跳依赖上的更新。 [Supersede](https://arxiv.org/abs/2606.27472) 把 full context 与 bounded self-maintained memory 配对比较,证明维护过程本身丢失当前值。其 GRPO 训练把 Qwen2.5-3B 从 9.0% 提到 16.7%,但只有一次训练、绝对结果仍很低。合理表述是“这个失败可被训练信号推动”,不是“已经补上差距”。 [A-TMA](https://arxiv.org/abs/2607.01935) 用 current/historical/transition 角色缓解 ghost memory:Graphiti/Zep 的冲突准确率从 0.480 到 0.720,LoCoMo temporal F1 从 0.0295 到 0.1705;作者也报告 host-dependent 和非一致增益。它支持显式状态角色,不支持通用解决方案。 ### 3. 行动任务需要的是最小充分状态,不是相似历史 [MemoryArena](https://arxiv.org/abs/2602.16313) 把 memory 放回 agent-environment loop。通用 memory 系统在 Bundled Shopping 全部 0 成功,在 Group Travel 全部 0;RAG 的总体平均成功率最高也只有 0.23。作者观察到 representation mismatch、training mismatch 和额外延迟。 [MAGE](https://arxiv.org/abs/2606.06090) 是目前最值得继续追的正结果。它在同一 Qwen3.6-27B 设置中,Shopping 0.3333 到 0.3933,Travel 0.0519 到 0.1519,Web Search 0.4842 到 0.5656;移除 Compress/Maintain/Revise 都会下降。还缺跨团队复现、更多模型和更难任务上的绝对成功率。 [ATMem](https://arxiv.org/abs/2606.31612) 在 AndroidWorld 8B 上从基础 47.6,经 SFT/GRPO/结构奖励到 76.6,但训练用了 128 张 H20;在更难的 DataScope 分层任务上绝对成功率仍只有 6.2/6.2/3.1。它证明 active state 有价值,也同时说明代价和剩余差距巨大。 ### 4. 写入的本质正在从总结变成决策和治理 [GovMem](https://arxiv.org/abs/2607.02579) 的内部 synthetic 结果把 false promotion 从 0.597 降到 0.040、recall 保持 0.960;但真实项目子集依靠 0.692 review burden,外部 133 条高影响 coding-agent 候选最终没有一条可安全自动晋升。这个负结果比一个漂亮总分更有用:重复出现、测试日志和 Agent 自己的叙述都不能单独构成可复用知识证据。 [Cross-Component Interference](https://arxiv.org/abs/2605.05716) 在 32 个组件子集、32k+ 次评测中发现,HotpotQA 上 tool-only F1 0.233,高于 all-in 的 0.177;最优 proper subset 在所有测试设置中匹配或超过 all-in。它要求每个 memory 设计都必须做 no-memory 和组件组合消融。 ## 怎么证明一个 memory 设计不是画图 一份能说服人的实验至少要同时满足: 1. 先说工作负载:信息是否超窗、是否会更新、是否跨任务、是否影响行动、错误写入会不会传播。 2. 指定瓶颈阶段:write preservation、retrieval recall、state resolution、utilization、action outcome 只能选清楚,不能只报端到端总分。 3. 必须有 full context、verbatim RAG、no memory 三个 baseline;做技能复用时还要有 raw trajectory replay。 4. actor model、embedding、chunking、top-k、prompt、可见信息和 token/调用预算固定,只改一个组件。 5. 报预处理时间、LLM 调用、推理 token、延迟和存储;不能只报“检索后上下文更短”。 6. 做 harmful-memory、stale-memory 和 no-memory 消融;memory 可能是负贡献。 7. 至少跨两个任务类型、两个模型、多个 seed;否则结论只能写成“在该 harness 中有效”。 可以把论证压成一句话:**在工作负载 W 中,阶段 B 的失败占主要误差;固定其余变量后,机制 C 把结果从 X 提到 Y,额外成本是 Z,且在边界 Q 外不成立。** 架构图只能解释 C,不能替代 W、B、X、Y、Z 和 Q。 ## 对我们自己的直接影响 现在不应该先做一个“统一 Agent Memory 知识图谱”。更合理的最小系统是四个彼此独立、都保留原始证据的平面: - `archive`:原始论文、对话、轨迹和版本,只追加,不让摘要覆盖证据。 - `current state`:明确哪些事实和任务状态当前有效,保留 supersession 链。 - `skills`:只保存有任务结果和适用范围支撑的程序性经验,允许回滚。 - `governance`:记录来源、反例、写入决定、评测结果和人工复核。 检索先从 raw archive + 强 baseline 做起。只有在确定是 retrieval、state resolution、execution state 或 skill transfer 的哪一种失败后,才增加对应结构。否则我们很容易复现这半年论文里最常见的问题:系统越来越复杂,但不知道增益来自哪里。 ## 材料边界 - 516 是 5 组 arXiv 查询的并集,不是人工确认的 516 篇核心论文。 - 379 和 292 是保守词法筛选后的上界,仍可能有误收;标题主题统计可重叠。 - 32 篇做了全文下载和章节定位,23 篇进入证据账本;其余论文目前只用于背景和冲突检索。 - 大多数 2026 工作仍是 arXiv preprint,独立复现很少。这里把“同论文内受控增益”和“跨论文已建立共识”严格分开。 - 跨 benchmark 的绝对分数不能直接排名;这里只比较同协议内结果,或明确写出不可比原因。