Files
2026-07-10 18:52:00 +08:00

106 lines
12 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 先说结论
截至 2026-07-10,这轮可复核的材料是:5 组分页 arXiv 查询得到 516 篇候选;其中 379 篇是标题含 memory/remember/forget 等词、正文处于 LLM Agent 语境的词法上界;最近六个月有 292 篇,前六个月只有 61 篇。论文数量增加了约 4.8 倍,但这不能解释成能力增加了 4.8 倍。
本轮下载并转成可检索文本的全文是 32 篇。下面的判断主要依靠其中 23 篇的实验表、消融和限制章节,不用标题和摘要投票。
能站住的判断只有四条:
1. **真正进步最大的是诊断和评测,不是通用记忆能力。** 研究开始把写入、检索、使用、当前状态、行动结果和成本拆开测,也开始暴露 embedding、基础模型、上下文长度和额外 LLM 调用造成的假增益。
2. **静态对话事实召回已经是可用工程问题,但没有证据证明复杂 memory 普遍优于强 RAG 或完整上下文。** 在一个 3x3 控制实验中,换检索方法造成 14-23 个准确率点差异,换写入方法只有 3-8 个点;原始文本 RAG 还击败了两种有损写入。
3. **最近半年唯一比较像“能力进步”的,是把长任务记忆从资料库改成执行状态。** MAGE 在同一篇论文、同一 backbone、同一 MemoryArena 协议下,平均比长上下文高 7.8 个成功率点,同时少用 32.9%-71.4% token。它证明了任务状态表示是有效方向,但还只是一个基准上的单篇结果。
4. **更新、遗忘、经验复用和自动写入仍未解决。** 更强模型和更大 memory 都不能稳定消除旧事实污染;经验可能传播错误;保守写入可以降低错误晋升,却把代价转成大量人工复核。
## 具体问题有没有变好
| 问题 | 六个月前能做到什么 | 最近证据 | 判断 |
| --- | --- | --- | --- |
| 静态事实召回 | 图、note、摘要等结构在 LoCoMo/LongMemEval 上可以优于较弱 baselineZep 用约 1.6k 上下文替代 115kLongMemEval 从 55.4% 到 63.8% 或 60.2% 到 71.2% | 控制实验表明检索器比复杂写入更重要;MemDelta 中 verbatim RAG 47.2% 与 full context 49.8% 无显著差异 | 工程上部分成熟;“新结构更聪明”没有普遍证据 |
| 长范围综合和 test-time learning | top-k retrieval 经常拿不到全局信息;长上下文在预算够时领先 | compute-matched 结果显示 book summarization 只有拿到接近完整信息后才明显上升,架构差异次要 | 没解决,瓶颈是信息覆盖阈值 |
| 当前值、更新和选择性遗忘 | MemoryAgentBench 的复杂多跳更新普遍很低,简单 overwrite prompt 无法修复 | Supersede 中 bounded memory 相对 full context 分别为 63% vs 82%、64% vs 91%、77% vs 92%;历史增长 24 倍后 68% 跌到 28%memory 同比扩大仍是 28% | 没解决;现在只是把问题隔离得更清楚 |
| 长任务执行状态 | 通用 memory/RAG 在 MemoryArena 上平均成功率约 0.12-0.15/0.17-0.23Group Travel 几乎全为 0 | MAGE 把 memory 变成可 Grow/Compress/Maintain/Revise 的状态树,平均 +7.8pp SRGUI 的 ATMem 也显示主动任务状态有效 | 有真实但任务特定的进展,需要独立复现 |
| 经验和技能复用 | 相似任务会复用相似经验,但错误经验也会让输出沿相同方向出错 | 32k+ full-factorial 评测中 memory 对 HotpotQA 为负、对 GSM8K 略正;AgenticSTS 的技能层 3/10 到 6/10Fisher p 约 0.37 | 没有通用增益,强依赖任务、模型和 scaffold |
| 自动写入和压缩 | 主要优化“写得短、写得结构化” | TrustMem 开始监督每次 transition;GovMem 把写入改成证据治理,但内部 direct recall 降到 0.448、review burden 升到 0.692,外部 133 条高影响候选中安全自动晋升为 0 | 研究方向变对了,自动写入仍不可靠 |
| 安全和来源 | 主要研究检索语料投毒 | 新工作覆盖持久污染、伪造推理、共享 memory 传播、provenance 和 false promotion | 威胁模型进步明显;防御多为自定义攻击上的单篇结果 |
| 评测可信度 | 常见做法是端到端比一个总分,模型、embedding、token 和写入成本都不同 | MemDelta 只换 embedding 就 +6.2pp,并把 Mem0 相对 RAG 的 +11pp 变成 -1.2pp;相近效果下写入成本约 50 倍 | 这是最近半年最确定的进步 |
## 这些论文实际上在做什么
最近六个月 292 篇“标题中心”候选中,按标题声明的贡献做多标签统计:
| 方向 | 篇数 | 实际工作 |
| --- | ---: | --- |
| retrieval / representation | 65 | 图、层级、索引、rerank、topic document、typed memory |
| experience / skill / learned policy | 65 | 经验提炼、技能库、RL 写入/检索/遗忘策略、自演化 |
| execution / multimodal | 58 | GUI、embodied、video、spatial、long-horizon task state |
| benchmark / diagnosis | 56 | 新 benchmark、stage-wise probe、跨场景和受控 baseline |
| systems / efficiency | 37 | token、延迟、预算、压缩、端侧和 serving |
| security / governance | 32 | poisoning、privacy、provenance、写入 gate、审计 |
| personalization / shared memory | 27 | 用户长期状态、多 Agent 共享和协作 memory |
| update / forgetting 明示在标题 | 22 | 冲突、时序、过期、遗忘、写入和生命周期 |
这些数字可重叠,而且只是研究议程,不是成果计数。数量暴涨主要表示大家把“memory”扩展成了八九个不同问题;不是 292 个方法都在共同推进同一个分数。
## 哪些结果最值得信
### 1. 静态 QA 先做强 retrieval,不要先发明 memory 架构
[Diagnosing Retrieval vs. Utilization](https://arxiv.org/abs/2603.02473) 在 LoCoMo 1540 题上固定 answer model 和 prompt,交叉三种写法与三种检索法。Basic RAG 在 cosine/hybrid 下为 77.9%/81.1%fact extraction 为 72.2%/77.3%episode summary 为 70.1%/73.3%retrieval precision 与最终准确率相关系数为 0.98。这个结论只适用于静态对话 QA 和固定 top-k=5,但它足以否定“复杂写入天然更好”。
[MemDelta](https://arxiv.org/abs/2606.29914) 更进一步:500 题上 cloud embedding RAG 为 53.4%MiniLM RAG 为 47.2%,完整上下文为 49.8%。在可做 matched comparison 的 88 题上,Mem0 72.7%cloud RAG 73.9%p=1.0 且置信区间很宽;Mem0 需要 1000+ LLM 调用、约 120 分钟和 $0.50+ 写入成本,RAG 是 0 次 LLM 调用、约 60 秒和 $0.01。它没有证明 memory 无用,只证明当前很多“架构增益”无法归因。
### 2. 更新问题不是检索一个最新 chunk 那么简单
[MemoryAgentBench](https://arxiv.org/abs/2507.05257) 把能力拆成准确检索、test-time learning、长范围理解和选择性遗忘。GPT-4.1-mini 的默认 single-hop/multi-hop 更新为 36%/5%;强制总选最新后为 40%/4%,保守 overwrite 为 28%/4%。prompt 没有传播多跳依赖上的更新。
[Supersede](https://arxiv.org/abs/2606.27472) 把 full context 与 bounded self-maintained memory 配对比较,证明维护过程本身丢失当前值。其 GRPO 训练把 Qwen2.5-3B 从 9.0% 提到 16.7%,但只有一次训练、绝对结果仍很低。合理表述是“这个失败可被训练信号推动”,不是“已经补上差距”。
[A-TMA](https://arxiv.org/abs/2607.01935) 用 current/historical/transition 角色缓解 ghost memoryGraphiti/Zep 的冲突准确率从 0.480 到 0.720LoCoMo temporal F1 从 0.0295 到 0.1705;作者也报告 host-dependent 和非一致增益。它支持显式状态角色,不支持通用解决方案。
### 3. 行动任务需要的是最小充分状态,不是相似历史
[MemoryArena](https://arxiv.org/abs/2602.16313) 把 memory 放回 agent-environment loop。通用 memory 系统在 Bundled Shopping 全部 0 成功,在 Group Travel 全部 0;RAG 的总体平均成功率最高也只有 0.23。作者观察到 representation mismatch、training mismatch 和额外延迟。
[MAGE](https://arxiv.org/abs/2606.06090) 是目前最值得继续追的正结果。它在同一 Qwen3.6-27B 设置中,Shopping 0.3333 到 0.3933Travel 0.0519 到 0.1519Web Search 0.4842 到 0.5656;移除 Compress/Maintain/Revise 都会下降。还缺跨团队复现、更多模型和更难任务上的绝对成功率。
[ATMem](https://arxiv.org/abs/2606.31612) 在 AndroidWorld 8B 上从基础 47.6,经 SFT/GRPO/结构奖励到 76.6,但训练用了 128 张 H20;在更难的 DataScope 分层任务上绝对成功率仍只有 6.2/6.2/3.1。它证明 active state 有价值,也同时说明代价和剩余差距巨大。
### 4. 写入的本质正在从总结变成决策和治理
[GovMem](https://arxiv.org/abs/2607.02579) 的内部 synthetic 结果把 false promotion 从 0.597 降到 0.040、recall 保持 0.960;但真实项目子集依靠 0.692 review burden,外部 133 条高影响 coding-agent 候选最终没有一条可安全自动晋升。这个负结果比一个漂亮总分更有用:重复出现、测试日志和 Agent 自己的叙述都不能单独构成可复用知识证据。
[Cross-Component Interference](https://arxiv.org/abs/2605.05716) 在 32 个组件子集、32k+ 次评测中发现,HotpotQA 上 tool-only F1 0.233,高于 all-in 的 0.177;最优 proper subset 在所有测试设置中匹配或超过 all-in。它要求每个 memory 设计都必须做 no-memory 和组件组合消融。
## 怎么证明一个 memory 设计不是画图
一份能说服人的实验至少要同时满足:
1. 先说工作负载:信息是否超窗、是否会更新、是否跨任务、是否影响行动、错误写入会不会传播。
2. 指定瓶颈阶段:write preservation、retrieval recall、state resolution、utilization、action outcome 只能选清楚,不能只报端到端总分。
3. 必须有 full context、verbatim RAG、no memory 三个 baseline;做技能复用时还要有 raw trajectory replay。
4. actor model、embedding、chunking、top-k、prompt、可见信息和 token/调用预算固定,只改一个组件。
5. 报预处理时间、LLM 调用、推理 token、延迟和存储;不能只报“检索后上下文更短”。
6. 做 harmful-memory、stale-memory 和 no-memory 消融;memory 可能是负贡献。
7. 至少跨两个任务类型、两个模型、多个 seed;否则结论只能写成“在该 harness 中有效”。
可以把论证压成一句话:**在工作负载 W 中,阶段 B 的失败占主要误差;固定其余变量后,机制 C 把结果从 X 提到 Y,额外成本是 Z,且在边界 Q 外不成立。** 架构图只能解释 C,不能替代 W、B、X、Y、Z 和 Q。
## 对我们自己的直接影响
现在不应该先做一个“统一 Agent Memory 知识图谱”。更合理的最小系统是四个彼此独立、都保留原始证据的平面:
- `archive`:原始论文、对话、轨迹和版本,只追加,不让摘要覆盖证据。
- `current state`:明确哪些事实和任务状态当前有效,保留 supersession 链。
- `skills`:只保存有任务结果和适用范围支撑的程序性经验,允许回滚。
- `governance`:记录来源、反例、写入决定、评测结果和人工复核。
检索先从 raw archive + 强 baseline 做起。只有在确定是 retrieval、state resolution、execution state 或 skill transfer 的哪一种失败后,才增加对应结构。否则我们很容易复现这半年论文里最常见的问题:系统越来越复杂,但不知道增益来自哪里。
## 材料边界
- 516 是 5 组 arXiv 查询的并集,不是人工确认的 516 篇核心论文。
- 379 和 292 是保守词法筛选后的上界,仍可能有误收;标题主题统计可重叠。
- 32 篇做了全文下载和章节定位,23 篇进入证据账本;其余论文目前只用于背景和冲突检索。
- 大多数 2026 工作仍是 arXiv preprint,独立复现很少。这里把“同论文内受控增益”和“跨论文已建立共识”严格分开。
- 跨 benchmark 的绝对分数不能直接排名;这里只比较同协议内结果,或明确写出不可比原因。