63 lines
1.6 KiB
Markdown
63 lines
1.6 KiB
Markdown
# Paper: EvoMemBench
|
|
|
|
---
|
|
type: paper
|
|
title: "EvoMemBench: Benchmarking Agent Memory from a Self-Evolving Perspective"
|
|
authors: Yuyao Wang, Zhongjian Zhang, Mo Chi, Kaichi Yu, Yuhan Li, Miao Peng, Bing Tong, Chen Zhang, Yan Zhou, Jia Li
|
|
year: 2026
|
|
venue:
|
|
url: https://arxiv.org/html/2605.18421
|
|
code_url:
|
|
source: arxiv
|
|
collected_at: 2026-07-08
|
|
status: skimmed
|
|
relevance: high
|
|
topics:
|
|
- memory
|
|
- agent-evaluation
|
|
methods:
|
|
- memory-benchmark
|
|
- self-evolving-agent
|
|
benchmarks:
|
|
- EvoMemBench
|
|
models:
|
|
-
|
|
datasets:
|
|
-
|
|
related_concepts:
|
|
- memory
|
|
- procedural-memory
|
|
related_jobs:
|
|
- 2026-07-08-baidu-aidu-agent-algorithm-engineer-beijing
|
|
- 2026-07-08-bytedance-seed-llm-agent-research-engineer
|
|
related_experiments:
|
|
-
|
|
related_projects:
|
|
-
|
|
---
|
|
|
|
## One-line Takeaway
|
|
|
|
Memory 的价值取决于任务类型和上下文约束;长上下文 baseline 仍然很强,不能假设外部记忆天然更好。
|
|
|
|
## Problem
|
|
|
|
现有 Agent benchmark 主要评估 reasoning、planning、execution,对 memory 的更新、修正和复用能力覆盖不足。
|
|
|
|
## Core Idea
|
|
|
|
EvoMemBench 按 memory scope 和 memory content 两条轴设计 benchmark,比较 15 种 memory 方法和长上下文 baseline。
|
|
|
|
## Evidence
|
|
|
|
结果显示 memory 在当前上下文不足或任务较难时更有价值;知识密集任务更适合 retrieval memory,执行导向任务更依赖 procedural/long-term memory。
|
|
|
|
## Useful For Us
|
|
|
|
- 设计 memory 实验时要加入长上下文 baseline。
|
|
- 不同岗位里提到 memory 时,要进一步区分事实记忆、过程记忆和跨任务经验。
|
|
|
|
## Follow-up Experiments
|
|
|
|
- 用 Agent 项目任务集做 memory-vs-long-context 对照实验。
|