Files
agent/papers/items/2026-wang-evomembench.md
T

1.6 KiB

Paper: EvoMemBench


type: paper title: "EvoMemBench: Benchmarking Agent Memory from a Self-Evolving Perspective" authors: Yuyao Wang, Zhongjian Zhang, Mo Chi, Kaichi Yu, Yuhan Li, Miao Peng, Bing Tong, Chen Zhang, Yan Zhou, Jia Li year: 2026 venue: url: https://arxiv.org/html/2605.18421 code_url: source: arxiv collected_at: 2026-07-08 status: skimmed relevance: high topics:

  • memory
  • agent-evaluation methods:
  • memory-benchmark
  • self-evolving-agent benchmarks:
  • EvoMemBench models:

datasets:

related_concepts:

  • memory
  • procedural-memory related_jobs:
  • 2026-07-08-baidu-aidu-agent-algorithm-engineer-beijing
  • 2026-07-08-bytedance-seed-llm-agent-research-engineer related_experiments:

One-line Takeaway

Memory 的价值取决于任务类型和上下文约束;长上下文 baseline 仍然很强,不能假设外部记忆天然更好。

Problem

现有 Agent benchmark 主要评估 reasoning、planning、execution,对 memory 的更新、修正和复用能力覆盖不足。

Core Idea

EvoMemBench 按 memory scope 和 memory content 两条轴设计 benchmark,比较 15 种 memory 方法和长上下文 baseline。

Evidence

结果显示 memory 在当前上下文不足或任务较难时更有价值;知识密集任务更适合 retrieval memory,执行导向任务更依赖 procedural/long-term memory。

Useful For Us

  • 设计 memory 实验时要加入长上下文 baseline。
  • 不同岗位里提到 memory 时,要进一步区分事实记忆、过程记忆和跨任务经验。

Follow-up Experiments

  • 用 Agent 项目任务集做 memory-vs-long-context 对照实验。