5.9 KiB
5.9 KiB
证据账本
full 表示核过实验表、关键消融或 limitation;context 表示全文已转文本并做章节定位,但不承担本轮核心结论。
| Date | Paper | Depth | 可支持的判断 | 不能外推的部分 |
|---|---|---|---|---|
| 2025-01 | Zep, 2501.13956 | full | 长对话静态 QA 可用时间图谱大幅缩短上下文和延迟,并提升部分题型 | DMR 已饱和;single-session-assistant 反而下降;不是行动任务 |
| 2025-02 | A-MEM, 2502.12110 | full | 动态 linked-note 组织在 LoCoMo 上能优于若干早期 memory baseline | 方法、模型和 token 配置并非严格单变量控制 |
| 2025-05 | Experience-Following, 2505.16067 | full | 经验会影响后续相似任务,错误和错配经验会传播 | 不能证明某种通用写入或删除策略最优 |
| 2025-07 | MemoryAgentBench, 2507.05257 | full | retrieval、TTL、LRU、forgetting 是不同能力;复杂更新和全局综合仍弱 | 数据集转换和统一 prompt 不能覆盖真实 agent loop |
| 2026-02 | MemoryArena, 2602.16313 | full | 通用 memory/RAG 在相互依赖的多 session 行动任务上成功率低,额外 memory 延迟更高 | benchmark 本身很难,失败同时含 policy/reasoning 问题 |
| 2026-03 | Retrieval vs Utilization, 2603.02473 | full | LoCoMo 上 retrieval 方法差异大于 write strategy,raw RAG 是强 baseline | 单模型、单 benchmark、固定 top-k=5 |
| 2026-05 | Cross-Component Interference, 2605.05716 | full | memory 与其他 scaffold 的边际作用可为负,必须做 subset ablation | 只有 HotpotQA/GSM8K;tool 组件含协议因素 |
| 2026-05 | EvoMemBench, 2605.18421 | full | 15 种方法间不存在跨能力通用最优 memory form | 统一 benchmark 仍不能消除所有实现质量差异 |
| 2026-05 | DeMem, 2605.10870 | full | 决策充分状态比描述相似性更适合行动记忆;LoCoMo 描述相似性相关很弱 | 主要是自定义决策任务和理论建模 |
| 2026-05 | MemQ, 2605.08374 | full | provenance DAG credit assignment 在多步任务有增益,单步接近无增益 | 没有处理删除和长期错误积累 |
| 2026-06 | AutoMEM, 2606.04315 | full | 跨场景无通用赢家;索引会产生 schema loss,passive retrieval 会产生 retrieval loss | 新增 DCI harness 与已有系统的工程成熟度不同 |
| 2026-06 | MAGE, 2606.06090 | full | MemoryArena 同设置下,active execution-state tree 同时提高 SR 并减少 token | 单团队结果;绝对成功率在 Travel 仍只有 0.1519 |
| 2026-06 | Infini Memory, 2606.10677 | full | topic document 的 maintenance 对结果贡献明显,memory 维护不应被当后台清理 | 系统组件较多,维护和检索仍依赖 LLM |
| 2026-06 | HORMA, 2606.11680 | full | organize 与 retrieve 可拆分;高能力 manager 比大 retriever 更关键 | 结论依赖其层级 memory 和任务设置 |
| 2026-06 | Online Budget Study, 2606.15017 | full | budget-matched 时,vanilla agent 在 WebArena 多模型汇总上可胜 online skill/memory | 只研究 online augmentation,不覆盖离线学习 |
| 2026-06 | TrustMem, 2606.25161 | full | transition-level verifier 和排名训练可降低 omission/corruption/hallucination | verifier 仍是模型;训练、judge 和跨域泛化需要独立核验 |
| 2026-06 | Supersede, 2606.27472 | full | 当前值维护是独立瓶颈,更强模型和更大 memory 不足;训练信号能推动它 | 训练只有 Qwen2.5-3B 单次运行,16.7% 远非解决 |
| 2026-06 | MemDelta, 2606.29914 | full | embedding、model behavior 和 write cost 足以翻转架构结论 | Mem0 只在 88 题、2/6 题型上做 matched comparison |
| 2026-06 | ATMem, 2606.31612 | full | GUI agent 的主动任务状态和选择性调用能提高结果 | 128xH20 训练;更难 DataScope 仍接近失败 |
| 2026-06 | GovMem, 2607.02579 | full | 自动写入必须检查独立证据、反例、scope 和 provenance;真实轨迹暴露 false promotion | 外部 133 条是 stress slice,安全自动覆盖率为 0 |
| 2026-07 | A-TMA, 2607.01935 | full | current/historical/transition 角色能缓解 ghost memory | 收益 host-dependent,LoCoMo 部分指标不一致 |
| 2026-07 | AgenticSTS, 2607.02255 | full | typed memory contract 让技能/episode 可消融和复现 | 3/10 到 6/10 不显著;缺 same-code accumulating-context baseline |
| 2026-07 | FARMA, 2607.05029 | full | 伪造推理记录是不同于事实投毒的写入攻击面 | 50-trial 自定义攻击;0% ASR 防御不等于开放环境稳健 |
全文池
本轮全文池共 32 篇:
2501.13956, 2502.12110, 2505.16067, 2507.02259, 2507.05257, 2507.07957, 2511.20857, 2512.18746, 2601.01885, 2602.16313, 2602.19320, 2603.02473, 2603.07670, 2603.15666, 2605.05716, 2605.08374, 2605.10870, 2605.14421, 2605.18421, 2606.04315, 2606.06090, 2606.10677, 2606.11680, 2606.15017, 2606.25161, 2606.27472, 2606.29914, 2606.31612, 2607.01935, 2607.02255, 2607.02579, 2607.05029。
其中没有进入上表核心论证的 9 篇暂标为 context,不把“下载过 PDF”写成“已得到结论”。