1.6 KiB
1.6 KiB
Paper: EvoMemBench
type: paper title: "EvoMemBench: Benchmarking Agent Memory from a Self-Evolving Perspective" authors: Yuyao Wang, Zhongjian Zhang, Mo Chi, Kaichi Yu, Yuhan Li, Miao Peng, Bing Tong, Chen Zhang, Yan Zhou, Jia Li year: 2026 venue: url: https://arxiv.org/html/2605.18421 code_url: source: arxiv collected_at: 2026-07-08 status: skimmed relevance: high topics:
- memory
- agent-evaluation methods:
- memory-benchmark
- self-evolving-agent benchmarks:
- EvoMemBench models:
datasets:
related_concepts:
- memory
- procedural-memory related_jobs:
- 2026-07-08-baidu-aidu-agent-algorithm-engineer-beijing
- 2026-07-08-bytedance-seed-llm-agent-research-engineer related_experiments:
related_projects:
One-line Takeaway
Memory 的价值取决于任务类型和上下文约束;长上下文 baseline 仍然很强,不能假设外部记忆天然更好。
Problem
现有 Agent benchmark 主要评估 reasoning、planning、execution,对 memory 的更新、修正和复用能力覆盖不足。
Core Idea
EvoMemBench 按 memory scope 和 memory content 两条轴设计 benchmark,比较 15 种 memory 方法和长上下文 baseline。
Evidence
结果显示 memory 在当前上下文不足或任务较难时更有价值;知识密集任务更适合 retrieval memory,执行导向任务更依赖 procedural/long-term memory。
Useful For Us
- 设计 memory 实验时要加入长上下文 baseline。
- 不同岗位里提到 memory 时,要进一步区分事实记忆、过程记忆和跨任务经验。
Follow-up Experiments
- 用 Agent 项目任务集做 memory-vs-long-context 对照实验。