Audit recent Agent memory research

This commit is contained in:
wuyang
2026-07-10 18:52:00 +08:00
parent 36c631e026
commit ab758e774e
17 changed files with 42663 additions and 3 deletions
+1
View File
@@ -15,6 +15,7 @@
- [Glossary](docs/99-glossary.md): 统一术语表 - [Glossary](docs/99-glossary.md): 统一术语表
- [Jobs](jobs/README.md): 北京大厂 Agent / LLM 相关岗位要求 - [Jobs](jobs/README.md): 北京大厂 Agent / LLM 相关岗位要求
- [Papers](papers/README.md): Agent 相关论文、阅读队列和研究洞察 - [Papers](papers/README.md): Agent 相关论文、阅读队列和研究洞察
- [Research](research/README.md): 跨论文时间对照、受控证据和领域判断
- [Learning](learning/README.md): 从论文编译出的认知地图、讲义、证据和主动回忆模块 - [Learning](learning/README.md): 从论文编译出的认知地图、讲义、证据和主动回忆模块
- [Industry](industry/README.md): 大公司 Agent 工作、技术报告和工程博客 - [Industry](industry/README.md): 大公司 Agent 工作、技术报告和工程博客
- [Projects](projects/README.md): 项目目录、项目记录和复盘 - [Projects](projects/README.md): 项目目录、项目记录和复盘
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
+676
View File
@@ -0,0 +1,676 @@
{
"generated_at": "2026-07-10",
"model": "ChatGPT-5.6:Sol",
"source": "data/research/memory-corpus.json",
"total": 293,
"completed": 12,
"papers": [
{
"arxiv_id": "2509.02444",
"title": "AppCopilot: Toward General, Accurate, Long-Horizon, and Efficient Mobile Agent",
"abstract": "With the raid evolution of large language models and multimodal models, the mobile-agent landscape has proliferated without converging on the fundamental challenges. This paper identifies four core problems that should be solved for mobile agents to deliver practical, scalable impact: (1) generalization across tasks, APPs, and devices; (2) accuracy, specifically precise on-screen interaction and click targeting; (3) long-horizon capability for sustained, multi-step goals; and (4) efficiency, specifically high-performance runtime on resource-constrained devices. We present AppCopilot, a multimodal, multi-agent, general-purpose mobile agent that operates across applications. AppCopilot operationalizes this position through an end-to-end pipeline spanning data collection, training, finetuning, efficient inference, and PC/mobile application. At the model layer, it integrates multimodal foundation models with robust Chinese-English support. At the reasoning and control layer, it combines chain-of-thought reasoning, hierarchical task planning and decomposition, and multi-agent collaboration. At the execution layer, it enables experiential adaptation, voice interaction, function calling, cross-APP and cross-device orchestration, and comprehensive mobile APP support. The system design incorporates profiling-driven optimization for latency and memory across heterogeneous hardware. Empirically, AppCopilot achieves significant improvements on four dimensions: stronger generalization, higher precision of on screen actions, more reliable long horizon task completion, and faster, more resource efficient runtime. By articulating a cohesive position and a reference architecture that closes the loop from data collection, training to finetuning and efficient inference, this paper offers a concrete roadmap for general purpose mobile agent and provides actionable guidance.",
"published": "2025-09-02",
"updated": "2025-10-17",
"authors": [
"Jingru Fan",
"Yufan Dang",
"Jingyao Wu",
"Huatao Li",
"Runde Yang",
"Xiyuan Yang",
"Yuheng Wang",
"Chen Qian"
],
"categories": [
"cs.AI",
"cs.CL",
"cs.CV",
"cs.HC"
],
"url": "https://arxiv.org/abs/2509.02444",
"pdf_url": "https://arxiv.org/pdf/2509.02444",
"path": "papers/items/2025-2509-02444-appcopilot-toward-general-accurate-long-horizon-and-efficient-mobile-agent.md",
"local_title": "\"AppCopilot: Toward General, Accurate, Long-Horizon, and Efficient Mobile Agent\"",
"local_status": "queued",
"local_topics": [
"computer-use",
"memory",
"multi-agent",
"planning",
"reasoning",
"tool-use"
],
"collection_queries": "function-calling",
"collection_score": "15",
"analysis": {
"arxiv_id": "2509.02444",
"relevance": "peripheral",
"relevance_reason": "Memory is an implementation detail for profiling-driven optimization, not the main research object.",
"primary_problem": "systems_efficiency",
"secondary_problems": [
"domain_application"
],
"research_role": "application",
"memory_object": "execution_state",
"temporal_scope": "in_episode",
"claimed_gap": "",
"mechanism": "",
"benchmarks": [],
"baselines": [],
"reported_results": [
"significant improvements on four dimensions"
],
"evidence_design": "case_study",
"evidence_strength": "weak",
"failure_or_boundary": ""
}
},
{
"arxiv_id": "2509.10769",
"title": "AgentArch: A Comprehensive Benchmark to Evaluate Agent Architectures in Enterprise",
"abstract": "While individual components of agentic architectures have been studied in isolation, there remains limited empirical understanding of how different design dimensions interact within complex multi-agent systems. This study aims to address these gaps by providing a comprehensive enterprise-specific benchmark evaluating 18 distinct agentic configurations across state-of-the-art large language models. We examine four critical agentic system dimensions: orchestration strategy, agent prompt implementation (ReAct versus function calling), memory architecture, and thinking tool integration. Our benchmark reveals significant model-specific architectural preferences that challenge the prevalent one-size-fits-all paradigm in agentic AI systems. It also reveals significant weaknesses in overall agentic performance on enterprise tasks with the highest scoring models achieving a maximum of only 35.3\\% success on the more complex task and 70.8\\% on the simpler task. We hope these findings inform the design of future agentic systems by enabling more empirically backed decisions regarding architectural components and model selection.",
"published": "2025-09-13",
"updated": "2026-01-06",
"authors": [
"Tara Bogavelli",
"Roshnee Sharma",
"Hari Subramani"
],
"categories": [
"cs.AI",
"cs.CL",
"cs.MA"
],
"url": "https://arxiv.org/abs/2509.10769",
"pdf_url": "https://arxiv.org/pdf/2509.10769",
"path": "papers/items/2025-2509-10769-agentarch-a-comprehensive-benchmark-to-evaluate-agent-architectures-in-enterpris.md",
"local_title": "\"AgentArch: A Comprehensive Benchmark to Evaluate Agent Architectures in Enterprise\"",
"local_status": "queued",
"local_topics": [
"agent-evaluation",
"memory",
"multi-agent",
"tool-use",
"workflow-agent"
],
"collection_queries": "function-calling",
"collection_score": "18",
"analysis": {
"arxiv_id": "2509.10769",
"relevance": "supporting",
"relevance_reason": "Memory architecture is a critical dimension evaluated in the benchmark.",
"primary_problem": "evaluation_measurement",
"secondary_problems": [
"organization_representation"
],
"research_role": "benchmark",
"memory_object": "mixed",
"temporal_scope": "cross_episode",
"claimed_gap": "",
"mechanism": "",
"benchmarks": [
"AgentArch"
],
"baselines": [],
"reported_results": [
"35.3% success on complex task",
"70.8% success on simpler task"
],
"evidence_design": "benchmark_comparison",
"evidence_strength": "moderate",
"failure_or_boundary": ""
}
},
{
"arxiv_id": "2510.14548",
"title": "LLM Agents Beyond Utility: An Open-Ended Perspective",
"abstract": "Recent LLM agents have made great use of chain of thought reasoning and function calling. As their capabilities grow, an important question arises: can this software represent not only a smart problem-solving tool, but an entity in its own right, that can plan, design immediate tasks, and reason toward broader, more ambiguous goals? To study this question, we adopt an open-ended experimental setting where we augment a pretrained LLM agent with the ability to generate its own tasks, accumulate knowledge, and interact extensively with its environment. We study the resulting open-ended agent qualitatively. It can reliably follow complex multi-step instructions, store and reuse information across runs, and propose and solve its own tasks, though it remains sensitive to prompt design, prone to repetitive task generation, and unable to form self-representations. These findings illustrate both the promise and current limits of adapting pretrained LLMs toward open-endedness, and point to future directions for training agents to manage memory, explore productively, and pursue abstract long-term goals.",
"published": "2025-10-16",
"updated": "2025-10-16",
"authors": [
"Asen Nachkov",
"Xi Wang",
"Luc Van Gool"
],
"categories": [
"cs.AI"
],
"url": "https://arxiv.org/abs/2510.14548",
"pdf_url": "https://arxiv.org/pdf/2510.14548",
"path": "papers/items/2025-2510-14548-llm-agents-beyond-utility-an-open-ended-perspective.md",
"local_title": "\"LLM Agents Beyond Utility: An Open-Ended Perspective\"",
"local_status": "queued",
"local_topics": [
"memory",
"planning",
"reasoning",
"tool-use"
],
"collection_queries": "function-calling",
"collection_score": "15",
"analysis": {
"arxiv_id": "2510.14548",
"relevance": "supporting",
"relevance_reason": "Memory accumulation and reuse are studied as capabilities of open-ended agents.",
"primary_problem": "experience_skill_learning",
"secondary_problems": [
"retention_context"
],
"research_role": "diagnostic",
"memory_object": "facts",
"temporal_scope": "cross_episode",
"claimed_gap": "",
"mechanism": "",
"benchmarks": [],
"baselines": [],
"reported_results": [
"store and reuse information across runs"
],
"evidence_design": "case_study",
"evidence_strength": "weak",
"failure_or_boundary": ""
}
},
{
"arxiv_id": "2510.18586",
"title": "TokenCake: A KV-Cache-centric Serving Framework for LLM-based Multi-Agent Applications",
"abstract": "Large Language Models (LLMs) are increasingly deployed in complex multi-agent applications that rely on external function calls. This workload creates severe performance challenges for the KV Cache: spatial contention leads to the eviction of critical agents' caches and temporal underutilization leaves the cache of agents stalled on long-running function calls idling in GPU memory. We present TokenCake, a KV-Cache-centric serving framework that bridges this gap by co-optimizing scheduling and memory management through an agent-aware design. TokenCake's Temporal Scheduler employs an event-driven, opportunistic policy to proactively offload idle KV Caches during function calls and uses predictive uploading to hide data transfer latency. TokenCake's Spatial Scheduler uses dynamic memory partitioning, guided by a hybrid priority metric combining graph structure and runtime state, to reserve GPU memory for critical-path agents. Our evaluation on representative multi-agent benchmarks shows that TokenCake reduces end-to-end latency by over 47.06% and improves effective GPU memory utilization by up to 16.9% compared to vLLM.",
"published": "2025-10-21",
"updated": "2026-05-20",
"authors": [
"Zhuohang Bian",
"Feiyang Wu",
"Zhuoran Li",
"Teng Ma",
"Youwei Zhuo"
],
"categories": [
"cs.DC"
],
"url": "https://arxiv.org/abs/2510.18586",
"pdf_url": "https://arxiv.org/pdf/2510.18586",
"path": "papers/items/2025-2510-18586-tokencake-a-kv-cache-centric-serving-framework-for-llm-based-multi-agent-applica.md",
"local_title": "\"TokenCake: A KV-Cache-centric Serving Framework for LLM-based Multi-Agent Applications\"",
"local_status": "queued",
"local_topics": [
"agent-evaluation",
"computer-use",
"memory",
"multi-agent"
],
"collection_queries": "function-calling",
"collection_score": "17",
"analysis": {
"arxiv_id": "2510.18586",
"relevance": "peripheral",
"relevance_reason": "Focuses on KV-Cache serving framework, not agent memory mechanisms.",
"primary_problem": "systems_efficiency",
"secondary_problems": [],
"research_role": "infrastructure",
"memory_object": "execution_state",
"temporal_scope": "in_episode",
"claimed_gap": "",
"mechanism": "",
"benchmarks": [
"vLLM"
],
"baselines": [
"vLLM"
],
"reported_results": [
"reduces end-to-end latency by over 47.06%",
"improves effective GPU memory utilization by up to 16.9%"
],
"evidence_design": "benchmark_comparison",
"evidence_strength": "moderate",
"failure_or_boundary": ""
}
},
{
"arxiv_id": "2512.02605",
"title": "IACT: A Self-Organizing Recursive Model for General AI Agents: A Technical White Paper on the Architecture Behind kragent.ai",
"abstract": "This technical white paper introduces the Interactive Agents Call Tree (IACT), a computational model designed to address the limitations of static, hard-coded agent workflows. Unlike traditional systems that require pre-defined graphs or specialized programming, IACT operates as a general-purpose autonomous system driven purely by user dialogue. Given a high-level objective, the system autonomously grows a dynamic, recursive agent topology incrementally tailored to the problem's structure. This allows it to scale its organizational complexity to match open-ended tasks. To mitigate the error propagation inherent in unidirectional function calls, IACT introduces interactional redundancy by replacing rigid invocations with bidirectional, stateful dialogues. This mechanism enables runtime error correction and ambiguity resolution. We describe the architecture, design principles, and practical lessons behind the production deployment of this model in the kragent.ai system, presenting qualitative evidence from real-world workflows rather than exhaustive benchmark results.",
"published": "2025-12-02",
"updated": "2025-12-02",
"authors": [
"Pengju Lu"
],
"categories": [
"cs.AI",
"cs.MA",
"cs.SE"
],
"url": "https://arxiv.org/abs/2512.02605",
"pdf_url": "https://arxiv.org/pdf/2512.02605",
"path": "papers/items/2025-2512-02605-iact-a-self-organizing-recursive-model-for-general-ai-agents-a-technical-white-p.md",
"local_title": "\"IACT: A Self-Organizing Recursive Model for General AI Agents: A Technical White Paper on the Architecture Behind kragent.ai\"",
"local_status": "queued",
"local_topics": [
"agent-evaluation",
"computer-use",
"memory",
"rag",
"tool-use",
"workflow-agent"
],
"collection_queries": "function-calling",
"collection_score": "15",
"analysis": {
"arxiv_id": "2512.02605",
"relevance": "peripheral",
"relevance_reason": "Focuses on recursive agent topology and dialogue, not memory mechanisms.",
"primary_problem": "execution_state",
"secondary_problems": [],
"research_role": "application",
"memory_object": "execution_state",
"temporal_scope": "in_episode",
"claimed_gap": "",
"mechanism": "",
"benchmarks": [],
"baselines": [],
"reported_results": [
"qualitative evidence from real-world workflows"
],
"evidence_design": "case_study",
"evidence_strength": "weak",
"failure_or_boundary": ""
}
},
{
"arxiv_id": "2602.03224",
"title": "TAME: A Trustworthy Test-Time Evolution of Agent Memory with Systematic Benchmarking",
"abstract": "Test-time evolution of agent memory represents a pivotal paradigm for advancing AGI, as it strengthens complex reasoning through experience accumulation without requiring parameter updates. However, even during benign task evolution, agent safety alignment remains vulnerable, a phenomenon known as Agent Memory Misevolution. To evaluate this phenomenon, we construct the Trust-Memevo benchmark and find that agents exhibit an overall decline in trustworthiness across multiple tasks during benign task evolution. To address this issue, we propose TAME, a trust-aware memory evolution framework in which a shared memory bank is jointly governed by an Executor and an Evaluator. The Executor retrieves and applies transferable experiences to support task solving, while the Evaluator assesses the contribution of each utilized experience to the outcome and produces trust-aware feedback to guide subsequent memory use. This executor-evaluator loop enables memory to be selectively reinforced, cautiously reused, and continuously expanded over time. Experiments show that TAME mitigates memory misevolution while achieving strong task performance. In particular, on the GPT-5.2 AIME benchmark, TAME improves accuracy by 14.6 percentage points over the strongest existing method and maintains competitive trustworthiness.",
"published": "2026-02-03",
"updated": "2026-06-06",
"authors": [
"Yu Cheng",
"Yongkang Hu",
"Jiuan Zhou",
"Yushuo Zhang",
"Yihang Chen",
"Huichi Zhou",
"Mingang Chen",
"Zhizhong Zhang",
"Kun Shao",
"Yuan Xie",
"Zhaoxia Yin"
],
"categories": [
"cs.AI",
"cs.LG"
],
"url": "https://arxiv.org/abs/2602.03224",
"pdf_url": "https://arxiv.org/pdf/2602.03224",
"path": "papers/items/2026-2602-03224-tame-a-trustworthy-test-time-evolution-of-agent-memory-with-systematic-benchmark.md",
"local_title": "\"TAME: A Trustworthy Test-Time Evolution of Agent Memory with Systematic Benchmarking\"",
"local_status": "queued",
"local_topics": [
"agent-evaluation",
"agent-safety",
"computer-use",
"memory",
"reasoning"
],
"collection_queries": "agent-safety",
"collection_score": "17",
"analysis": {
"arxiv_id": "2602.03224",
"relevance": "core",
"relevance_reason": "Proposes TAME framework for trust-aware memory evolution and benchmark.",
"primary_problem": "update_consolidation_forgetting",
"secondary_problems": [
"security_trust_privacy"
],
"research_role": "method",
"memory_object": "facts",
"temporal_scope": "cross_episode",
"claimed_gap": "",
"mechanism": "",
"benchmarks": [
"Trust-Memevo",
"GPT-5.2 AIME"
],
"baselines": [],
"reported_results": [
"improves accuracy by 14.6 percentage points over the strongest existing method"
],
"evidence_design": "benchmark_comparison",
"evidence_strength": "moderate",
"failure_or_boundary": ""
}
},
{
"arxiv_id": "2602.07652",
"title": "Agent-Fence: Mapping Security Vulnerabilities Across Deep Research Agents",
"abstract": "Large language models are increasingly deployed as *deep agents* that plan, maintain persistent state, and invoke external tools, shifting safety failures from unsafe text to unsafe *trajectories*. We introduce **AgentFence**, an architecture-centric security evaluation that defines 14 trust-boundary attack classes spanning planning, memory, retrieval, tool use, and delegation, and detects failures via *trace-auditable conversation breaks* (unauthorized or unsafe tool use, wrong-principal actions, state/objective integrity violations, and attack-linked deviations). Holding the base model fixed, we evaluate eight agent archetypes under persistent multi-turn interaction and observe substantial architectural variation in mean security break rate (MSBR), ranging from $0.29 \\pm 0.04$ (LangGraph) to $0.51 \\pm 0.07$ (AutoGPT). The highest-risk classes are operational: Denial-of-Wallet ($0.62 \\pm 0.08$), Authorization Confusion ($0.54 \\pm 0.10$), Retrieval Poisoning ($0.47 \\pm 0.09$), and Planning Manipulation ($0.44 \\pm 0.11$), while prompt-centric classes remain below $0.20$ under standard settings. Breaks are dominated by boundary violations (SIV 31%, WPA 27%, UTI+UTA 24%, ATD 18%), and authorization confusion correlates with objective and tool hijacking ($ρ\\approx 0.63$ and $ρ\\approx 0.58$). AgentFence reframes agent security around what matters operationally: whether an agent stays within its goal and authority envelope over time.",
"published": "2026-02-07",
"updated": "2026-02-07",
"authors": [
"Sai Puppala",
"Ismail Hossain",
"Md Jahangir Alam",
"Yoonpyo Lee",
"Jay Yoo",
"Tanzim Ahad",
"Syed Bahauddin Alam",
"Sajedul Talukder"
],
"categories": [
"cs.CR",
"cs.AI"
],
"url": "https://arxiv.org/abs/2602.07652",
"pdf_url": "https://arxiv.org/pdf/2602.07652",
"path": "papers/items/2026-2602-07652-agent-fence-mapping-security-vulnerabilities-across-deep-research-agents.md",
"local_title": "\"Agent-Fence: Mapping Security Vulnerabilities Across Deep Research Agents\"",
"local_status": "queued",
"local_topics": [
"agent-evaluation",
"agent-safety",
"memory",
"planning",
"rag",
"tool-use"
],
"collection_queries": "agent-safety",
"collection_score": "16",
"analysis": {
"arxiv_id": "2602.07652",
"relevance": "supporting",
"relevance_reason": "Evaluates memory retrieval as a security vulnerability class.",
"primary_problem": "security_trust_privacy",
"secondary_problems": [
"retrieval_access"
],
"research_role": "benchmark",
"memory_object": "facts",
"temporal_scope": "cross_episode",
"claimed_gap": "",
"mechanism": "",
"benchmarks": [
"AgentFence"
],
"baselines": [],
"reported_results": [
"MSBR ranging from 0.29 to 0.51",
"Retrieval Poisoning 0.47"
],
"evidence_design": "benchmark_comparison",
"evidence_strength": "moderate",
"failure_or_boundary": ""
}
},
{
"arxiv_id": "2602.08412",
"title": "From Assistant to Double Agent: Formalizing and Benchmarking Attacks on OpenClaw for Personalized Local AI Agent",
"abstract": "Although large language model (LLM)-based agents, exemplified by OpenClaw, are increasingly evolving from task-oriented systems into personalized AI assistants for solving complex real-world tasks, their practical deployment also introduces severe security risks. However, existing agent security research and evaluation frameworks primarily focus on synthetic or task-centric settings, and thus fail to accurately capture the attack surface and risk propagation mechanisms of personalized agents in real-world deployments. To address this gap, we propose Personalized Agent Security Bench (PASB), an end-to-end security evaluation framework tailored for real-world personalized agents. Building upon existing agent attack paradigms, PASB incorporates personalized usage scenarios, realistic toolchains, and long-horizon interactions, enabling black-box, end-to-end security evaluation on real systems. Using OpenClaw as a representative case study, we systematically evaluate its security across multiple personalized scenarios, tool capabilities, and attack types. Our results indicate that OpenClaw exhibits critical vulnerabilities at different execution stages, including user prompt processing, tool usage, and memory retrieval, highlighting substantial security risks in personalized agent deployments. The code for the proposed PASB framework is available at https://github.com/AstorYH/PASB.",
"published": "2026-02-09",
"updated": "2026-02-11",
"authors": [
"Yuhang Wang",
"Feiming Xu",
"Zheng Lin",
"Guangyu He",
"Yuzhe Huang",
"Haichang Gao",
"Zhenxing Niu",
"Shiguo Lian",
"Zhaoxiang Liu"
],
"categories": [
"cs.AI"
],
"url": "https://arxiv.org/abs/2602.08412",
"pdf_url": "https://arxiv.org/pdf/2602.08412",
"path": "papers/items/2026-2602-08412-from-assistant-to-double-agent-formalizing-and-benchmarking-attacks-on-openclaw-.md",
"local_title": "\"From Assistant to Double Agent: Formalizing and Benchmarking Attacks on OpenClaw for Personalized Local AI Agent\"",
"local_status": "queued",
"local_topics": [
"agent-evaluation",
"agent-safety",
"memory",
"planning",
"rag",
"tool-use"
],
"collection_queries": "agent-safety",
"collection_score": "21",
"analysis": {
"arxiv_id": "2602.08412",
"relevance": "supporting",
"relevance_reason": "Evaluates memory retrieval as a security vulnerability in personalized agents.",
"primary_problem": "security_trust_privacy",
"secondary_problems": [
"retrieval_access"
],
"research_role": "benchmark",
"memory_object": "facts",
"temporal_scope": "cross_episode",
"claimed_gap": "",
"mechanism": "",
"benchmarks": [
"PASB"
],
"baselines": [],
"reported_results": [
"critical vulnerabilities at memory retrieval"
],
"evidence_design": "case_study",
"evidence_strength": "weak",
"failure_or_boundary": ""
}
},
{
"arxiv_id": "2602.13530",
"title": "REMem: Reasoning with Episodic Memory in Language Agent",
"abstract": "Humans excel at remembering concrete experiences along spatiotemporal contexts and performing reasoning across those events, i.e., the capacity for episodic memory. In contrast, memory in language agents remains mainly semantic, and current agents are not yet capable of effectively recollecting and reasoning over interaction histories. We identify and formalize the core challenges of episodic recollection and reasoning from this gap, and observe that existing work often overlooks episodicity, lacks explicit event modeling, or overemphasizes simple retrieval rather than complex reasoning. We present REMem, a two-phase framework for constructing and reasoning with episodic memory: 1) Offline indexing, where REMem converts experiences into a hybrid memory graph that flexibly links time-aware gists and facts. 2) Online inference, where REMem employs an agentic retriever with carefully curated tools for iterative retrieval over the memory graph. Comprehensive evaluation across four episodic memory benchmarks shows that REMem substantially outperforms state-of-the-art memory systems such as Mem0 and HippoRAG 2, showing 3.4% and 13.4% absolute improvements on episodic recollection and reasoning tasks, respectively. Moreover, REMem also demonstrates more robust refusal behavior for unanswerable questions.",
"published": "2026-02-13",
"updated": "2026-02-28",
"authors": [
"Yiheng Shu",
"Saisri Padmaja Jonnalagedda",
"Xiang Gao",
"Bernal Jiménez Gutiérrez",
"Weijian Qi",
"Kamalika Das",
"Huan Sun",
"Yu Su"
],
"categories": [
"cs.AI"
],
"url": "https://arxiv.org/abs/2602.13530",
"pdf_url": "https://arxiv.org/pdf/2602.13530",
"path": "papers/items/2026-2602-13530-remem-reasoning-with-episodic-memory-in-language-agent.md",
"local_title": "\"REMem: Reasoning with Episodic Memory in Language Agent\"",
"local_status": "queued",
"local_topics": [
"agent-evaluation",
"memory",
"rag",
"reasoning",
"tool-use"
],
"collection_queries": "language-agent",
"collection_score": "19",
"analysis": {
"arxiv_id": "2602.13530",
"relevance": "core",
"relevance_reason": "Proposes REMem framework for episodic memory construction and reasoning.",
"primary_problem": "organization_representation",
"secondary_problems": [
"retrieval_access"
],
"research_role": "method",
"memory_object": "events",
"temporal_scope": "cross_episode",
"claimed_gap": "",
"mechanism": "",
"benchmarks": [],
"baselines": [
"Mem0",
"HippoRAG 2"
],
"reported_results": [
"3.4% absolute improvements on episodic recollection",
"13.4% absolute improvements on reasoning tasks"
],
"evidence_design": "benchmark_comparison",
"evidence_strength": "moderate",
"failure_or_boundary": ""
}
},
{
"arxiv_id": "2602.23320",
"title": "ParamMem: Augmenting Language Agents with Parametric Reflective Memory",
"abstract": "Self-reflection enables language agents to iteratively refine solutions, yet often produces repetitive outputs that limit reasoning performance. Recent studies have attempted to address this limitation through various approaches, among which increasing reflective diversity has shown promise. Our empirical analysis reveals a strong positive correlation between reflective diversity and task success, further motivating the need for diverse reflection signals. We introduce ParamMem, a parametric memory module that encodes cross-sample reflection patterns into model parameters, enabling diverse reflection generation through temperature-controlled sampling. Building on this module, we propose ParamAgent, a reflection-based agent framework that integrates parametric memory with episodic and cross-sample memory. Extensive experiments on code generation, mathematical reasoning, and multi-hop question answering demonstrate consistent improvements over state-of-the-art baselines. Further analysis reveals that ParamMem is sample-efficient, enables weak-to-strong transfer across model scales, and supports self-improvement without reliance on stronger external model, highlighting the potential of ParamMem as an effective component for enhancing language agents.",
"published": "2026-02-26",
"updated": "2026-02-27",
"authors": [
"Tianjun Yao",
"Yongqiang Chen",
"Yujia Zheng",
"Pan Li",
"Zhiqiang Shen",
"Kun Zhang"
],
"categories": [
"cs.LG",
"cs.MA"
],
"url": "https://arxiv.org/abs/2602.23320",
"pdf_url": "https://arxiv.org/pdf/2602.23320",
"path": "papers/items/2026-2602-23320-parammem-augmenting-language-agents-with-parametric-reflective-memory.md",
"local_title": "\"ParamMem: Augmenting Language Agents with Parametric Reflective Memory\"",
"local_status": "queued",
"local_topics": [
"agent-evaluation",
"memory",
"reasoning"
],
"collection_queries": "language-agent",
"collection_score": "14",
"analysis": {
"arxiv_id": "2602.23320",
"relevance": "core",
"relevance_reason": "Proposes ParamMem module for parametric reflective memory.",
"primary_problem": "update_consolidation_forgetting",
"secondary_problems": [
"experience_skill_learning"
],
"research_role": "method",
"memory_object": "model_internal",
"temporal_scope": "cross_episode",
"claimed_gap": "",
"mechanism": "",
"benchmarks": [],
"baselines": [],
"reported_results": [
"consistent improvements over state-of-the-art baselines"
],
"evidence_design": "benchmark_comparison",
"evidence_strength": "moderate",
"failure_or_boundary": ""
}
},
{
"arxiv_id": "2603.03680",
"title": "MAGE: Meta-Reinforcement Learning for Language Agents toward Strategic Exploration and Exploitation",
"abstract": "Large Language Model (LLM) agents have demonstrated remarkable proficiency in learned tasks, yet they often struggle to adapt to non-stationary environments with feedback. While In-Context Learning and external memory offer some flexibility, they fail to internalize the adaptive ability required for long-term improvement. Meta-Reinforcement Learning (meta-RL) provides an alternative by embedding the learning process directly within the model. However, existing meta-RL approaches for LLMs focus primarily on exploration in single-agent settings, neglecting the strategic exploitation necessary for multi-agent environments. We propose MAGE, a meta-RL framework that empowers LLM agents for strategic exploration and exploitation. MAGE utilizes a multi-episode training regime where interaction histories and reflections are integrated into the context window. By using the final episode reward as the objective, MAGE incentivizes the agent to refine its strategy based on past experiences. We further combine population-based training with an agent-specific advantage normalization technique to enrich agent diversity and ensure stable learning. Experiment results show that MAGE outperforms existing baselines in both exploration and exploitation tasks. Furthermore, MAGE exhibits strong generalization to unseen opponents, suggesting it has internalized the ability for strategic exploration and exploitation. Code is available at https://github.com/Lu-Yang666/MAGE.",
"published": "2026-03-04",
"updated": "2026-03-04",
"authors": [
"Lu Yang",
"Zelai Xu",
"Minyang Xie",
"Jiaxuan Gao",
"Zhao Shok",
"Yu Wang",
"Yi Wu"
],
"categories": [
"cs.AI"
],
"url": "https://arxiv.org/abs/2603.03680",
"pdf_url": "https://arxiv.org/pdf/2603.03680",
"path": "papers/items/2026-2603-03680-mage-meta-reinforcement-learning-for-language-agents-toward-strategic-exploratio.md",
"local_title": "\"MAGE: Meta-Reinforcement Learning for Language Agents toward Strategic Exploration and Exploitation\"",
"local_status": "queued",
"local_topics": [
"memory",
"multi-agent",
"reasoning",
"tool-use"
],
"collection_queries": "language-agent",
"collection_score": "17",
"analysis": {
"arxiv_id": "2603.03680",
"relevance": "supporting",
"relevance_reason": "Uses interaction histories in context window for meta-RL adaptation.",
"primary_problem": "experience_skill_learning",
"secondary_problems": [
"retention_context"
],
"research_role": "method",
"memory_object": "trajectories",
"temporal_scope": "cross_episode",
"claimed_gap": "",
"mechanism": "",
"benchmarks": [],
"baselines": [],
"reported_results": [
"outperforms existing baselines in both exploration and exploitation tasks"
],
"evidence_design": "benchmark_comparison",
"evidence_strength": "moderate",
"failure_or_boundary": ""
}
},
{
"arxiv_id": "2603.07670",
"title": "Memory for Autonomous LLM Agents:Mechanisms, Evaluation, and Emerging Frontiers",
"abstract": "Large language model (LLM) agents increasingly operate in settings where a single context window is far too small to capture what has happened, what was learned, and what should not be repeated. Memory -- the ability to persist, organize, and selectively recall information across interactions -- is what turns a stateless text generator into a genuinely adaptive agent. This survey offers a structured account of how memory is designed, implemented, and evaluated in modern LLM-based agents, covering work from 2022 through early 2026. We formalize agent memory as a \\emph{write--manage--read} loop tightly coupled with perception and action, then introduce a three-dimensional taxonomy spanning temporal scope, representational substrate, and control policy. Five mechanism families are examined in depth: context-resident compression, retrieval-augmented stores, reflective self-improvement, hierarchical virtual context, and policy-learned management. On the evaluation side, we trace the shift from static recall benchmarks to multi-session agentic tests that interleave memory with decision-making, analyzing four recent benchmarks that expose stubborn gaps in current systems. We also survey applications where memory is the differentiating factor -- personal assistants, coding agents, open-world games, scientific reasoning, and multi-agent teamwork -- and address the engineering realities of write-path filtering, contradiction handling, latency budgets, and privacy governance. The paper closes with open challenges: continual consolidation, causally grounded retrieval, trustworthy reflection, learned forgetting, and multimodal embodied memory.",
"published": "2026-03-08",
"updated": "2026-03-08",
"authors": [
"Pengfei Du"
],
"categories": [
"cs.AI"
],
"url": "https://arxiv.org/abs/2603.07670",
"pdf_url": "https://arxiv.org/pdf/2603.07670",
"path": "papers/items/2026-memory-agent-survey.md",
"local_title": "\"Memory for Autonomous LLM Agents: Mechanisms, Evaluation, and Emerging Frontiers\"",
"local_status": "skimmed",
"local_topics": [
"memory",
"agent-architecture",
"agent-evaluation"
],
"collection_queries": null,
"collection_score": null,
"analysis": {
"arxiv_id": "2603.07670",
"relevance": "core",
"relevance_reason": "Survey of agent memory mechanisms, evaluation, and frontiers.",
"primary_problem": "evaluation_measurement",
"secondary_problems": [
"organization_representation"
],
"research_role": "survey",
"memory_object": "mixed",
"temporal_scope": "both",
"claimed_gap": "",
"mechanism": "",
"benchmarks": [],
"baselines": [],
"reported_results": [],
"evidence_design": "survey_synthesis",
"evidence_strength": "none",
"failure_or_boundary": ""
}
}
]
}
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
+517
View File
@@ -0,0 +1,517 @@
arxiv_id,published,period,title,url,title_central,screen_relevance,screen_problem,screen_source,themes,title_themes,evidence_score,matched_queries
2501.13956,2025-01-20,2025-H1,Zep: A Temporal Knowledge Graph Architecture for Agent Memory,https://arxiv.org/abs/2501.13956,True,core,update_forgetting,model,retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis;systems_efficiency,retrieval_representation;systems_efficiency,7,agent-memory
2501.12485,2025-01-21,2025-H1,"R2D2: Remembering, Replaying and Dynamic Decision Making with a Reflective Agentic Memory",https://arxiv.org/abs/2501.12485,True,core,update_forgetting,model,representation_organization;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,,4,agent-memory
2501.18160,2025-01-30,2025-H1,RepoAudit: An Autonomous LLM-Agent for Repository-Level Code Auditing,https://arxiv.org/abs/2501.18160,False,core,execution_state,model,evaluation_diagnosis;systems_efficiency,,6,agent-memory
2502.06975,2025-02-10,2025-H1,Position: Episodic Memory is the Missing Piece for Long-Term LLM Agents,https://arxiv.org/abs/2502.06975,True,core,execution_state,model,retrieval_access;systems_efficiency,,0,episodic-memory
2502.10177,2025-02-14,2025-H1,STMA: A Spatio-Temporal Memory Agent for Long-Horizon Embodied Task Planning,https://arxiv.org/abs/2502.10177,True,core,update_forgetting,model,representation_organization;execution_state;evaluation_diagnosis;multimodal_embodied_gui,execution_multimodal,6,agent-memory
2502.10550,2025-02-14,2025-H1,"Memory, Benchmark & Robots: A Benchmark for Solving Complex Tasks with Reinforcement Learning",https://arxiv.org/abs/2502.10550,True,core,representation,model,retrieval_access;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui,benchmark_diagnosis;experience_skill_policy;execution_multimodal,2,agent-memory;memory-evaluation
2502.12110,2025-02-17,2025-H1,A-MEM: Agentic Memory for LLM Agents,https://arxiv.org/abs/2502.12110,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis;systems_efficiency,,6,agent-memory
2502.13172,2025-02-17,2025-H1,Unveiling Privacy Risks in LLM Agent Memory,https://arxiv.org/abs/2502.13172,True,core,security_privacy,model,security_privacy_trust,security_governance,2,agent-memory
2502.16090,2025-02-22,2025-H1,Echo: A Large Language Model with Temporal Episodic Memory,https://arxiv.org/abs/2502.16090,True,core,execution_state,model,retrieval_access;evaluation_diagnosis;multi_agent_shared;multimodal_embodied_gui,,6,episodic-memory
2502.19145,2025-02-26,2025-H1,Multi-Agent Security Tax: Trading Off Security and Collaboration Capabilities in Multi-Agent Systems,https://arxiv.org/abs/2502.19145,False,core,security_privacy,model,evaluation_diagnosis;security_privacy_trust;multi_agent_shared,security_governance;personal_shared,2,agent-memory
2503.03704,2025-03-05,2025-H1,Memory Injection Attacks on LLM Agents via Query-Only Interaction,https://arxiv.org/abs/2503.03704,True,core,execution_state,model,retrieval_access;security_privacy_trust;multimodal_embodied_gui,security_governance,2,agent-memory
2503.04392,2025-03-06,2025-H1,AgentSafe: Safeguarding Large Language Model-based Multi-agent Systems via Hierarchical Data Management,https://arxiv.org/abs/2503.04392,False,core,security_privacy,model,representation_organization;security_privacy_trust;multi_agent_shared,retrieval_representation;personal_shared,5,agent-memory
2503.21760,2025-03-27,2025-H1,MemInsight: Autonomous Memory Augmentation for LLM Agents,https://arxiv.org/abs/2503.21760,True,core,experience_learning,model,retrieval_access;representation_organization,,5,long-term-memory
2503.23514,2025-03-30,2025-H1,"If an LLM Were a Character, Would It Know Its Own Story? Evaluating Lifelong Learning in LLMs",https://arxiv.org/abs/2503.23514,False,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;multi_agent_shared,benchmark_diagnosis;experience_skill_policy,6,episodic-memory
2504.09283,2025-04-12,2025-H1,Semantic Commit: Helping Users Update Intent Specifications for AI Memory at Scale,https://arxiv.org/abs/2504.09283,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis,update_forgetting,2,agent-memory
2504.16946,2025-04-18,2025-H1,MobileCity: An Efficient Framework for Large-Scale Urban Behavior Simulation,https://arxiv.org/abs/2504.16946,False,core,experience_learning,model,evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,systems_efficiency,6,agent-memory
2504.15263,2025-04-21,2025-H1,Interpretable Locomotion Prediction in Construction Using a Memory-Driven LLM Agent With Chain-of-Thought Reasoning,https://arxiv.org/abs/2504.15263,True,core,experience_learning,model,evaluation_diagnosis;multimodal_embodied_gui,,5,long-term-memory
2504.20117,2025-04-28,2025-H1,ResearchCodeAgent: An LLM Multi-Agent System for Automated Codification of Research Methodologies,https://arxiv.org/abs/2504.20117,False,core,update_forgetting,model,retrieval_access;execution_state;evaluation_diagnosis;multi_agent_shared,retrieval_representation;personal_shared,7,long-term-memory
2505.00472,2025-05-01,2025-H1,UserCentrix: An Agentic Memory-augmented AI Framework for Smart Spaces,https://arxiv.org/abs/2505.00472,True,core,update_forgetting,model,experience_skill_learning;security_privacy_trust;multimodal_embodied_gui;systems_efficiency,,2,agent-memory
2505.05177,2025-05-08,2025-H1,MARK: Memory Augmented Refinement of Knowledge,https://arxiv.org/abs/2505.05177,True,core,update_forgetting,model,retrieval_access;representation_organization;systems_efficiency,systems_efficiency,1,agent-memory
2505.12923,2025-05-19,2025-H1,The Traitors: Deception and Trust in Multi-Agent Language Model Simulations,https://arxiv.org/abs/2505.12923,False,core,experience_learning,model,retrieval_access;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multi_agent_shared,security_governance;personal_shared,2,long-term-memory
2505.13941,2025-05-20,2025-H1,MLZero: A Multi-Agent System for End-to-end Machine Learning Automation,https://arxiv.org/abs/2505.13941,False,core,update_forgetting,model,evaluation_diagnosis;multi_agent_shared;multimodal_embodied_gui,experience_skill_policy;personal_shared,5,episodic-memory
2505.14163,2025-05-20,2025-H1,DSMentor: Enhancing Data Science Agents with Curriculum Learning and Online Knowledge Accumulation,https://arxiv.org/abs/2505.14163,False,core,experience_learning,model,retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui,experience_skill_policy;systems_efficiency,6,long-term-memory
2505.16067,2025-05-21,2025-H1,How Memory Management Impacts LLM Agents: An Empirical Study of Experience-Following Behavior,https://arxiv.org/abs/2505.16067,True,core,experience_learning,model,retrieval_access;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui,benchmark_diagnosis;experience_skill_policy,3,agent-memory
2505.16348,2025-05-22,2025-H1,Embodied Agents Meet Personalization: Investigating Challenges and Solutions Through the Lens of Memory Utilization,https://arxiv.org/abs/2505.16348,True,core,experience_learning,model,retrieval_access;representation_organization;execution_state;evaluation_diagnosis;multimodal_embodied_gui,execution_multimodal;personal_shared,4,agent-memory;episodic-memory
2505.18279,2025-05-23,2025-H1,Collaborative Memory: Multi-User Memory Sharing in LLM Agents with Dynamic Access Control,https://arxiv.org/abs/2505.18279,True,supporting,shared_memory,model,representation_organization;update_forgetting;evaluation_diagnosis;security_privacy_trust;multi_agent_shared;systems_efficiency,personal_shared,0,long-term-memory
2505.19237,2025-05-25,2025-H1,Sensorimotor Self-Recognition in Multimodal Large Language Model-Driven Robots,https://arxiv.org/abs/2505.19237,False,core,representation,model,representation_organization;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui,execution_multimodal,1,episodic-memory
2505.19436,2025-05-26,2025-H1,Task Memory Engine: Spatial Memory for Robust Multi-Step LLM Agents,https://arxiv.org/abs/2505.19436,True,core,representation,model,retrieval_access;representation_organization;execution_state;evaluation_diagnosis;security_privacy_trust,execution_multimodal,7,long-term-memory
2505.20231,2025-05-26,2025-H1,MemGuide: Intent-Driven Memory Selection for Goal-Oriented Multi-Session LLM Agents,https://arxiv.org/abs/2505.20231,True,supporting,representation,model,retrieval_access;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,execution_multimodal,4,long-term-memory
2505.22657,2025-05-28,2025-H1,3DLLM-Mem: Long-Term Spatial-Temporal Memory for Embodied 3D Large Language Model,https://arxiv.org/abs/2505.22657,True,core,representation,model,execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,execution_multimodal,7,episodic-memory
2506.01442,2025-06-02,2025-H1,Agentic Episodic Control,https://arxiv.org/abs/2506.01442,False,core,representation,model,retrieval_access;representation_organization;experience_skill_learning;systems_efficiency,,5,episodic-memory
2506.01936,2025-06-02,2025-H1,Should Decision-Makers Reveal Classifiers in Online Strategic Classification?,https://arxiv.org/abs/2506.01936,False,supporting,representation,model,,,2,agent-memory
2506.07398,2025-06-09,2025-H1,G-Memory: Tracing Hierarchical Memory for Multi-Agent Systems,https://arxiv.org/abs/2506.07398,True,core,representation,model,retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis;multi_agent_shared;multimodal_embodied_gui,retrieval_representation;personal_shared,3,agent-memory
2506.12088,2025-06-10,2025-H1,"Risks & Benefits of LLMs & GenAI for Platform Integrity, Healthcare Diagnostics, Financial Trust and Compliance, Cybersecurity, Privacy & AI Safety: A Comprehensive Survey, Roadmap & Implementation Blueprint",https://arxiv.org/abs/2506.12088,False,peripheral,security_privacy,model,evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui,benchmark_diagnosis;security_governance,3,agent-memory
2506.17318,2025-06-18,2025-H1,Context manipulation attacks : Web agents are susceptible to corrupted memory,https://arxiv.org/abs/2506.17318,True,supporting,representation,model,retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui,execution_multimodal;security_governance,5,agent-memory
2506.17338,2025-06-19,2025-H1,PBFT-Backed Semantic Voting for Multi-Agent Memory Pruning,https://arxiv.org/abs/2506.17338,True,supporting,representation,model,retrieval_access;update_forgetting;evaluation_diagnosis;multi_agent_shared;systems_efficiency,personal_shared,4,agent-memory
2506.19433,2025-06-24,2025-H1,Mem4Nav: Boosting Vision-and-Language Navigation in Urban Environments with a Hierarchical Spatial-Cognition Long-Short Memory System,https://arxiv.org/abs/2506.19433,True,core,update_forgetting,model,retrieval_access;representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,retrieval_representation;execution_multimodal,6,long-term-memory
2507.02259,2025-07-03,baseline-2025H2-Jan2026,MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent,https://arxiv.org/abs/2507.02259,True,core,update_forgetting,model,update_forgetting;experience_skill_learning;systems_efficiency,experience_skill_policy,2,agent-memory
2507.04172,2025-07-05,baseline-2025H2-Jan2026,Gathering Teams of Bounded Memory Agents on a Line,https://arxiv.org/abs/2507.04172,False,peripheral,systems_cost,model,multimodal_embodied_gui,,0,agent-memory
2507.10562,2025-07-05,baseline-2025H2-Jan2026,SAMEP: A Secure Protocol for Persistent Context Sharing Across AI Agents,https://arxiv.org/abs/2507.10562,False,core,update_forgetting,model,retrieval_access;security_privacy_trust;multi_agent_shared;systems_efficiency,,5,agent-memory
2507.05257,2025-07-07,baseline-2025H2-Jan2026,Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions,https://arxiv.org/abs/2507.05257,True,core,update_forgetting,model,retrieval_access;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis,benchmark_diagnosis,2,agent-memory
2507.05445,2025-07-07,baseline-2025H2-Jan2026,A Systematization of Security Vulnerabilities in Computer Use Agents,https://arxiv.org/abs/2507.05445,False,peripheral,security_privacy,model,evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui,security_governance,2,agent-memory
2507.07957,2025-07-10,baseline-2025H2-Jan2026,MIRIX: Multi-Agent Memory System for LLM-Based Agents,https://arxiv.org/abs/2507.07957,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multi_agent_shared;multimodal_embodied_gui;systems_efficiency,personal_shared,6,agent-memory
2507.16713,2025-07-22,baseline-2025H2-Jan2026,A Pragmatist Robot: Learning to Plan Tasks by Experiencing the Real World,https://arxiv.org/abs/2507.16713,False,core,update_forgetting,model,retrieval_access;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui,experience_skill_policy;execution_multimodal,8,long-term-memory
2507.22925,2025-07-23,baseline-2025H2-Jan2026,Hierarchical Memory for High-Efficiency Long-Term Reasoning in LLM Agents,https://arxiv.org/abs/2507.22925,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;systems_efficiency,retrieval_representation,6,long-term-memory
2507.21407,2025-07-29,baseline-2025H2-Jan2026,Graph-Augmented Large Language Model Agents: Current Progress and Future Prospects,https://arxiv.org/abs/2507.21407,False,core,update_forgetting,model,retrieval_access;representation_organization;execution_state;security_privacy_trust;multi_agent_shared;multimodal_embodied_gui,retrieval_representation,0,long-term-memory
2508.00031,2025-07-30,baseline-2025H2-Jan2026,Git Context Controller: Manage the Context of LLM-based Agents like Git,https://arxiv.org/abs/2508.00031,False,core,update_forgetting,model,retrieval_access;representation_organization;execution_state;evaluation_diagnosis;systems_efficiency,,5,agent-memory
2508.01287,2025-08-02,baseline-2025H2-Jan2026,Exploitation Is All You Need... for Exploration,https://arxiv.org/abs/2508.01287,False,peripheral,systems_cost,model,representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis,,4,agent-memory
2508.01415,2025-08-02,baseline-2025H2-Jan2026,RoboMemory: A Brain-inspired Multi-memory Agentic Framework for Interactive Environmental Learning in Physical Embodied Systems,https://arxiv.org/abs/2508.01415,True,core,update_forgetting,model,representation_organization;update_forgetting;execution_state;multimodal_embodied_gui;systems_efficiency,experience_skill_policy;execution_multimodal,6,agent-memory
2508.03341,2025-08-05,baseline-2025H2-Jan2026,What Deserves Memory: Adaptive Memory Distillation for LLM Agents,https://arxiv.org/abs/2508.03341,True,supporting,experience_learning,model,update_forgetting;experience_skill_learning;systems_efficiency,experience_skill_policy,3,episodic-memory
2508.05002,2025-08-07,baseline-2025H2-Jan2026,AgenticData: An Agentic Data Analytics System for Heterogeneous Data,https://arxiv.org/abs/2508.05002,False,supporting,execution_state,model,retrieval_access;representation_organization;execution_state;evaluation_diagnosis;multi_agent_shared,,5,agent-memory
2508.07010,2025-08-09,baseline-2025H2-Jan2026,Narrative Memory in Machines: Multi-Agent Arc Extraction in Serialized TV,https://arxiv.org/abs/2508.07010,True,supporting,execution_state,model,representation_organization;update_forgetting;multi_agent_shared;multimodal_embodied_gui,personal_shared,4,episodic-memory
2508.08997,2025-08-12,baseline-2025H2-Jan2026,Intrinsic Memory Agents: Heterogeneous Multi-Agent LLM Systems through Structured Contextual Memory,https://arxiv.org/abs/2508.08997,True,core,update_forgetting,model,representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multi_agent_shared;systems_efficiency,retrieval_representation;personal_shared,3,agent-memory
2508.09486,2025-08-13,baseline-2025H2-Jan2026,Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding,https://arxiv.org/abs/2508.09486,True,supporting,experience_learning,model,retrieval_access;experience_skill_learning;multimodal_embodied_gui,execution_multimodal,0,agent-memory;episodic-memory
2508.12630,2025-08-18,baseline-2025H2-Jan2026,Semantic Anchoring in Agentic Memory: Leveraging Linguistic Structures for Persistent Conversational Context,https://arxiv.org/abs/2508.12630,True,supporting,execution_state,model,retrieval_access;representation_organization;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,retrieval_representation;execution_multimodal,7,agent-memory
2508.13250,2025-08-18,baseline-2025H2-Jan2026,Explicit v.s. Implicit Memory: Exploring Multi-hop Complex Reasoning Over Personalized Information,https://arxiv.org/abs/2508.13250,True,core,update_forgetting,model,retrieval_access;evaluation_diagnosis,personal_shared,5,agent-memory
2508.15294,2025-08-21,baseline-2025H2-Jan2026,A Multi-Memory Segment System for Generating High-Quality Long-Term Memory Content in Agents,https://arxiv.org/abs/2508.15294,True,core,update_forgetting,model,retrieval_access;evaluation_diagnosis,,3,agent-memory
2508.16153,2025-08-22,baseline-2025H2-Jan2026,Memento: Fine-tuning LLM Agents without Fine-tuning LLMs,https://arxiv.org/abs/2508.16153,False,core,update_forgetting,model,retrieval_access;update_forgetting;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,,3,episodic-memory
2508.19005,2025-08-26,baseline-2025H2-Jan2026,Building Self-Evolving Agents via Experience-Driven Lifelong Learning: A Framework and Benchmark,https://arxiv.org/abs/2508.19005,False,supporting,execution_state,model,representation_organization;experience_skill_learning;evaluation_diagnosis,benchmark_diagnosis;experience_skill_policy,2,agent-memory
2509.00997,2025-08-31,baseline-2025H2-Jan2026,Supporting Our AI Overlords: Redesigning Data Systems to be Agent-First,https://arxiv.org/abs/2509.00997,False,supporting,execution_state,model,retrieval_access;systems_efficiency,,0,agent-memory
2509.11914,2025-09-15,baseline-2025H2-Jan2026,EgoMem: Lifelong Memory Agent for Full-duplex Omnimodal Models,https://arxiv.org/abs/2509.11914,True,core,update_forgetting,model,retrieval_access;update_forgetting;multimodal_embodied_gui,,6,agent-memory
2509.21224,2025-09-25,baseline-2025H2-Jan2026,What Do LLM Agents Do When Left Alone? Evidence of Spontaneous Meta-Cognitive Patterns,https://arxiv.org/abs/2509.21224,False,core,execution_state,model,evaluation_diagnosis;multimodal_embodied_gui,,2,long-term-memory
2509.25250,2025-09-27,baseline-2025H2-Jan2026,Memory Management and Contextual Consistency for Long-Running Low-Code Agents,https://arxiv.org/abs/2509.25250,True,core,update_forgetting,model,update_forgetting;multimodal_embodied_gui;systems_efficiency,,5,agent-memory
2509.24704,2025-09-29,baseline-2025H2-Jan2026,MemGen: Weaving Generative Latent Memory for Self-Evolving Agents,https://arxiv.org/abs/2509.24704,True,core,update_forgetting,model,retrieval_access;representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;systems_efficiency,experience_skill_policy,2,agent-memory
2510.02373,2025-09-29,baseline-2025H2-Jan2026,A-MemGuard: A Proactive Defense Framework for LLM-Based Agent Memory,https://arxiv.org/abs/2510.02373,True,core,security_privacy,model,representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;systems_efficiency,,6,agent-memory
2510.03612,2025-10-04,baseline-2025H2-Jan2026,Cross-Modal Content Optimization for Steering Web Agent Preferences,https://arxiv.org/abs/2510.03612,False,core,update_forgetting,model,evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui,execution_multimodal,7,agent-memory
2510.04618,2025-10-06,baseline-2025H2-Jan2026,Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models,https://arxiv.org/abs/2510.04618,False,core,update_forgetting,model,representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis;systems_efficiency,experience_skill_policy,8,agent-memory
2510.04851,2025-10-06,baseline-2025H2-Jan2026,LEGOMem: Modular Procedural Memory for Multi-agent LLM Systems for Workflow Automation,https://arxiv.org/abs/2510.04851,True,core,execution_state,model,retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis;multi_agent_shared,experience_skill_policy;personal_shared,2,agent-memory
2510.05520,2025-10-07,baseline-2025H2-Jan2026,CAM: A Constructivist View of Agentic Memory for LLM-Based Reading Comprehension,https://arxiv.org/abs/2510.05520,True,core,access,model,retrieval_access;representation_organization;systems_efficiency,,2,agent-memory
2510.08081,2025-10-09,baseline-2025H2-Jan2026,AutoQual: An LLM Agent for Automated Discovery of Interpretable Features for Review Quality Assessment,https://arxiv.org/abs/2510.08081,False,core,experience_learning,model,retrieval_access;experience_skill_learning,,3,long-term-memory
2510.09720,2025-10-10,baseline-2025H2-Jan2026,Preference-Aware Memory Update for Long-Term LLM Agents,https://arxiv.org/abs/2510.09720,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;systems_efficiency,update_forgetting,5,long-term-memory
2510.15966,2025-10-12,baseline-2025H2-Jan2026,PISA: A Pragmatic Psych-Inspired Unified Memory System for Enhanced AI Agency,https://arxiv.org/abs/2510.15966,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis,,4,agent-memory
2510.11144,2025-10-13,baseline-2025H2-Jan2026,$How^{2}$: How to learn from procedural How-to questions,https://arxiv.org/abs/2510.11144,False,core,experience_learning,model,execution_state;experience_skill_learning;evaluation_diagnosis;systems_efficiency,experience_skill_policy,2,agent-memory
2510.13896,2025-10-14,baseline-2025H2-Jan2026,"GenCellAgent: Generalizable, Training-Free Cellular Image Segmentation via Large Language Model Agents",https://arxiv.org/abs/2510.13896,False,core,shared_memory,model,representation_organization;evaluation_diagnosis;multi_agent_shared;multimodal_embodied_gui,,5,long-term-memory
2510.15620,2025-10-17,baseline-2025H2-Jan2026,On-device Semantic Selection Made Low Latency and Memory Efficient with Monolithic Forwarding,https://arxiv.org/abs/2510.15620,False,core,execution_state,model,retrieval_access;evaluation_diagnosis;systems_efficiency,systems_efficiency,6,agent-memory
2510.18515,2025-10-21,baseline-2025H2-Jan2026,Socialized Learning and Emergent Behaviors in Multi-Agent Systems based on Multimodal Large Language Models,https://arxiv.org/abs/2510.18515,False,core,shared_memory,model,retrieval_access;representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multi_agent_shared;multimodal_embodied_gui;systems_efficiency,experience_skill_policy;execution_multimodal;personal_shared,5,episodic-memory
2510.19747,2025-10-22,baseline-2025H2-Jan2026,Review of Tools for Zero-Code LLM Based Application Development,https://arxiv.org/abs/2510.19747,False,core,shared_memory,model,multimodal_embodied_gui,,1,agent-memory
2510.19897,2025-10-22,baseline-2025H2-Jan2026,Learning from Supervision with Semantic and Episodic Memory: A Reflective Approach to Agent Adaptation,https://arxiv.org/abs/2510.19897,True,core,representation,model,update_forgetting;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,experience_skill_policy,4,episodic-memory
2510.23730,2025-10-27,baseline-2025H2-Jan2026,Evaluating Long-Term Memory for Long-Context Question Answering,https://arxiv.org/abs/2510.23730,True,core,representation,model,retrieval_access;experience_skill_learning;evaluation_diagnosis;systems_efficiency,benchmark_diagnosis,2,agent-memory;episodic-memory
2510.25423,2025-10-29,baseline-2025H2-Jan2026,What Challenges Do Developers Face in AI Agent Systems? An Empirical Study on Stack Overflow & GitHub Issues,https://arxiv.org/abs/2510.25423,False,core,representation,model,retrieval_access;execution_state;evaluation_diagnosis,benchmark_diagnosis,2,agent-memory
2510.26536,2025-10-30,baseline-2025H2-Jan2026,"RoboOS-NeXT: A Unified Memory-based Framework for Lifelong, Scalable, and Robust Multi-Robot Collaboration",https://arxiv.org/abs/2510.26536,True,core,representation,model,retrieval_access;representation_organization;execution_state;multi_agent_shared;multimodal_embodied_gui,execution_multimodal;systems_efficiency,4,agent-memory
2510.27418,2025-10-31,baseline-2025H2-Jan2026,Dynamic Affective Memory Management for Personalized LLM Agents,https://arxiv.org/abs/2510.27418,True,core,representation,model,retrieval_access;representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis,personal_shared,3,long-term-memory
2511.01448,2025-11-03,baseline-2025H2-Jan2026,LiCoMemory: Lightweight and Cognitive Agentic Memory for Efficient Long-Term Reasoning,https://arxiv.org/abs/2511.01448,True,core,representation,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;systems_efficiency,systems_efficiency,6,agent-memory;long-term-memory
2511.02424,2025-11-04,baseline-2025H2-Jan2026,ReAcTree: Hierarchical LLM Agent Trees with Control Flow for Long-Horizon Task Planning,https://arxiv.org/abs/2511.02424,False,core,representation,model,retrieval_access;representation_organization;execution_state;multimodal_embodied_gui,retrieval_representation;execution_multimodal,9,episodic-memory
2511.03475,2025-11-05,baseline-2025H2-Jan2026,ContextPilot: Fast Long-Context Inference via Context Reuse,https://arxiv.org/abs/2511.03475,False,core,access,model,retrieval_access;representation_organization;evaluation_diagnosis;multi_agent_shared;systems_efficiency,,5,agent-memory
2511.06179,2025-11-09,baseline-2025H2-Jan2026,MemoriesDB: A Temporal-Semantic-Relational Database for Long-Term Agent Memory / Modeling Experience as a Graph of Temporal-Semantic Surfaces,https://arxiv.org/abs/2511.06179,True,core,experience_learning,model,retrieval_access;representation_organization;experience_skill_learning;systems_efficiency,retrieval_representation;experience_skill_policy,0,agent-memory
2511.07587,2025-11-10,baseline-2025H2-Jan2026,Beyond Fact Retrieval: Episodic Memory for RAG with Generative Semantic Workspaces,https://arxiv.org/abs/2511.07587,True,core,representation,model,retrieval_access;representation_organization;evaluation_diagnosis;systems_efficiency,retrieval_representation,6,episodic-memory
2511.08301,2025-11-11,baseline-2025H2-Jan2026,Smarter Together: Creating Agentic Communities of Practice through Shared Experiential Learning,https://arxiv.org/abs/2511.08301,False,core,experience_learning,model,experience_skill_learning;evaluation_diagnosis;multi_agent_shared,experience_skill_policy,5,agent-memory
2511.12027,2025-11-15,baseline-2025H2-Jan2026,GCAgent: Long-Video Understanding via Schematic and Narrative Episodic Memory,https://arxiv.org/abs/2511.12027,True,core,execution_state,model,retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,execution_multimodal,6,episodic-memory
2511.12997,2025-11-17,baseline-2025H2-Jan2026,WebCoach: Self-Evolving Web Agents with Cross-Session Memory Guidance,https://arxiv.org/abs/2511.12997,True,core,update_forgetting,model,retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui,experience_skill_policy;execution_multimodal,4,episodic-memory
2511.16108,2025-11-20,baseline-2025H2-Jan2026,SkyRL-Agent: Efficient RL Training for Multi-turn LLM Agent,https://arxiv.org/abs/2511.16108,False,core,update_forgetting,model,retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,experience_skill_policy;systems_efficiency,6,agent-memory
2511.17775,2025-11-21,baseline-2025H2-Jan2026,Episodic Memory in Agentic Frameworks: Suggesting Next Tasks,https://arxiv.org/abs/2511.17775,True,core,update_forgetting,model,retrieval_access;multimodal_embodied_gui,,0,episodic-memory
2511.21730,2025-11-21,baseline-2025H2-Jan2026,A Benchmark for Procedural Memory Retrieval in Language Agents,https://arxiv.org/abs/2511.21730,True,core,access,model,retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis,benchmark_diagnosis;retrieval_representation;experience_skill_policy,5,procedural-memory
2511.18112,2025-11-22,baseline-2025H2-Jan2026,EchoVLA: Synergistic Declarative Memory for VLA-Driven Mobile Manipulation,https://arxiv.org/abs/2511.18112,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui,,4,episodic-memory
2511.18423,2025-11-23,baseline-2025H2-Jan2026,General Agentic Memory Via Deep Research,https://arxiv.org/abs/2511.18423,True,core,update_forgetting,model,retrieval_access;experience_skill_learning;multimodal_embodied_gui,retrieval_representation,3,agent-memory
2511.19192,2025-11-24,baseline-2025H2-Jan2026,AME: An Efficient Heterogeneous Agentic Memory Engine for Smartphones,https://arxiv.org/abs/2511.19192,True,core,update_forgetting,model,retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui;systems_efficiency,systems_efficiency,4,agent-memory
2511.20297,2025-11-25,baseline-2025H2-Jan2026,Improving Language Agents through BREW,https://arxiv.org/abs/2511.20297,False,core,update_forgetting,model,retrieval_access;representation_organization;execution_state;evaluation_diagnosis;systems_efficiency,,2,agent-memory
2511.20857,2025-11-25,baseline-2025H2-Jan2026,Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory,https://arxiv.org/abs/2511.20857,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui,benchmark_diagnosis;experience_skill_policy,5,memory-evaluation
2512.00742,2025-11-30,baseline-2025H2-Jan2026,On the Regulatory Potential of User Interfaces for AI Agent Governance,https://arxiv.org/abs/2512.00742,False,core,access,model,representation_organization;security_privacy_trust,security_governance,0,agent-memory
2512.02227,2025-12-01,baseline-2025H2-Jan2026,Orchestration Framework for Financial Agents: From Algorithmic Trading to Agentic Trading,https://arxiv.org/abs/2512.02227,False,core,access,model,representation_organization,,1,agent-memory
2512.02228,2025-12-01,baseline-2025H2-Jan2026,"STRIDE: A Systematic Framework for Selecting AI Modalities -- Agentic AI, AI Assistants, or LLM Calls",https://arxiv.org/abs/2512.02228,False,core,access,model,representation_organization;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,,4,long-term-memory
2512.02425,2025-12-02,baseline-2025H2-Jan2026,WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning,https://arxiv.org/abs/2512.02425,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;multimodal_embodied_gui,execution_multimodal,8,agent-memory;episodic-memory
2512.02458,2025-12-02,baseline-2025H2-Jan2026,Vision to Geometry: 3D Spatial Memory for Sequential Embodied MLLM Reasoning and Exploration,https://arxiv.org/abs/2512.02458,True,core,update_forgetting,model,retrieval_access;evaluation_diagnosis;multimodal_embodied_gui,execution_multimodal,3,agent-memory
2512.03627,2025-12-03,baseline-2025H2-Jan2026,MemVerse: Multimodal Memory for Lifelong Learning Agents,https://arxiv.org/abs/2512.03627,True,core,experience_learning,model,retrieval_access;representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,experience_skill_policy;execution_multimodal,4,agent-memory
2512.04668,2025-12-04,baseline-2025H2-Jan2026,Topology Matters: Measuring Memory Leakage in Multi-Agent LLMs,https://arxiv.org/abs/2512.04668,True,core,execution_state,model,representation_organization;evaluation_diagnosis;security_privacy_trust;multi_agent_shared;multimodal_embodied_gui,security_governance;personal_shared,4,agent-memory
2512.06688,2025-12-07,baseline-2025H2-Jan2026,PersonaMem-v2: Towards Personalized Intelligence via Learning Implicit User Personas and Agentic Memory,https://arxiv.org/abs/2512.06688,True,core,application,model,experience_skill_learning;systems_efficiency,experience_skill_policy;personal_shared,6,agent-memory
2512.09458,2025-12-10,baseline-2025H2-Jan2026,Architectures for Building Agentic AI,https://arxiv.org/abs/2512.09458,False,core,execution_state,model,execution_state;security_privacy_trust;multi_agent_shared;multimodal_embodied_gui;systems_efficiency,,1,agent-memory
2512.10166,2025-12-10,baseline-2025H2-Jan2026,Emergent Collective Memory in Decentralized Multi-Agent AI Systems,https://arxiv.org/abs/2512.10166,True,core,update_forgetting,model,representation_organization;evaluation_diagnosis;multi_agent_shared,personal_shared,7,agent-memory
2512.10696,2025-12-11,baseline-2025H2-Jan2026,"Remember Me, Refine Me: A Dynamic Procedural Memory Framework for Experience-Driven Agent Evolution",https://arxiv.org/abs/2512.10696,True,core,update_forgetting,model,retrieval_access;representation_organization;experience_skill_learning;systems_efficiency,experience_skill_policy,7,agent-memory;procedural-memory
2512.11303,2025-12-12,baseline-2025H2-Jan2026,Unifying Dynamic Tool Creation and Cross-Task Experience Sharing through Cognitive Memory Architecture,https://arxiv.org/abs/2512.11303,True,core,update_forgetting,model,retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis;multi_agent_shared;systems_efficiency,experience_skill_policy,8,agent-memory;episodic-memory
2512.12686,2025-12-14,baseline-2025H2-Jan2026,Memoria: A Scalable Agentic Memory Framework for Personalized Conversational AI,https://arxiv.org/abs/2512.12686,True,core,access,model,representation_organization;experience_skill_learning;systems_efficiency,systems_efficiency;personal_shared,0,agent-memory
2512.12818,2025-12-14,baseline-2025H2-Jan2026,"Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects",https://arxiv.org/abs/2512.12818,True,core,execution_state,model,retrieval_access;representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui,retrieval_representation,7,agent-memory;memory-evaluation
2512.12856,2025-12-14,baseline-2025H2-Jan2026,Forgetful but Faithful: A Cognitive Memory Architecture and Benchmark for Privacy-Aware Generative Agents,https://arxiv.org/abs/2512.12856,True,core,update_forgetting,model,retrieval_access;update_forgetting;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui;systems_efficiency,benchmark_diagnosis;update_forgetting;security_governance,2,agent-memory
2512.12967,2025-12-15,baseline-2025H2-Jan2026,QwenLong-L1.5: Post-Training Recipe for Long-Context Reasoning and Memory Management,https://arxiv.org/abs/2512.12967,True,core,update_forgetting,model,retrieval_access;experience_skill_learning;evaluation_diagnosis;systems_efficiency,,7,agent-memory
2512.13564,2025-12-15,baseline-2025H2-Jan2026,Memory in the Age of AI Agents,https://arxiv.org/abs/2512.13564,True,core,access,model,retrieval_access;update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multi_agent_shared;multimodal_embodied_gui;systems_efficiency,,3,agent-memory;memory-evaluation
2512.16301,2025-12-18,baseline-2025H2-Jan2026,"Adaptation of Agentic AI: A Survey of Post-Training, Memory, and Skills",https://arxiv.org/abs/2512.16301,True,core,experience_learning,model,retrieval_access;experience_skill_learning;evaluation_diagnosis;systems_efficiency,benchmark_diagnosis;experience_skill_policy,4,long-term-memory
2512.16962,2025-12-18,baseline-2025H2-Jan2026,MemoryGraft: Persistent Compromise of LLM Agents via Poisoned Experience Retrieval,https://arxiv.org/abs/2512.16962,True,core,update_forgetting,model,retrieval_access;experience_skill_learning;evaluation_diagnosis;security_privacy_trust,retrieval_representation;experience_skill_policy;security_governance,3,agent-memory;long-term-memory
2512.18337,2025-12-20,baseline-2025H2-Jan2026,Towards Efficient Agents: A Co-Design of Inference Architecture and System,https://arxiv.org/abs/2512.18337,False,core,execution_state,model,representation_organization;execution_state;evaluation_diagnosis;systems_efficiency,systems_efficiency,4,agent-memory
2512.18571,2025-12-21,baseline-2025H2-Jan2026,ESearch-R1: Learning Cost-Aware MLLM Agents for Interactive Embodied Search via Reinforcement Learning,https://arxiv.org/abs/2512.18571,False,core,update_forgetting,model,retrieval_access;execution_state;experience_skill_learning;multimodal_embodied_gui;systems_efficiency,retrieval_representation;experience_skill_policy;execution_multimodal;systems_efficiency,6,episodic-memory
2512.18746,2025-12-21,baseline-2025H2-Jan2026,MemEvolve: Meta-Evolution of Agent Memory Systems,https://arxiv.org/abs/2512.18746,True,core,update_forgetting,model,retrieval_access;experience_skill_learning;evaluation_diagnosis,experience_skill_policy,2,agent-memory
2512.18950,2025-12-22,baseline-2025H2-Jan2026,Learning Hierarchical Procedural Memory for LLM Agents through Bayesian Selection and Contrastive Refinement,https://arxiv.org/abs/2512.18950,True,core,update_forgetting,model,representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis;systems_efficiency,retrieval_representation;experience_skill_policy,5,procedural-memory
2512.19537,2025-12-22,baseline-2025H2-Jan2026,Event Extraction in Large Language Model,https://arxiv.org/abs/2512.19537,False,core,execution_state,model,retrieval_access;representation_organization;evaluation_diagnosis;multimodal_embodied_gui,,3,agent-memory
2512.20111,2025-12-23,baseline-2025H2-Jan2026,ABBEL: Learning Natural-Language Belief States for Memory-Efficient Interaction,https://arxiv.org/abs/2512.20111,False,core,update_forgetting,model,update_forgetting;execution_state;experience_skill_learning;systems_efficiency,experience_skill_policy;systems_efficiency,7,agent-memory
2512.21567,2025-12-25,baseline-2025H2-Jan2026,Beyond Heuristics: A Decision-Theoretic Framework for Agent Memory Management,https://arxiv.org/abs/2512.21567,True,core,update_forgetting,model,retrieval_access;representation_organization;evaluation_diagnosis;systems_efficiency,,3,agent-memory
2512.22716,2025-12-27,baseline-2025H2-Jan2026,Memento 2: Learning by Stateful Reflective Memory,https://arxiv.org/abs/2512.22716,True,core,update_forgetting,model,retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,experience_skill_policy,2,episodic-memory
2512.23343,2025-12-29,baseline-2025H2-Jan2026,AI Meets Brain: Memory Systems from Cognitive Neuroscience to Autonomous Agents,https://arxiv.org/abs/2512.23343,True,core,representation,model,retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui;systems_efficiency,,2,agent-memory
2601.01885,2026-01-05,baseline-2025H2-Jan2026,Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents,https://arxiv.org/abs/2601.01885,True,core,update_forgetting,model,retrieval_access;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;systems_efficiency,experience_skill_policy,5,agent-memory;long-term-memory
2601.02577,2026-01-05,baseline-2025H2-Jan2026,Orchestral AI: A Framework for Agent Orchestration,https://arxiv.org/abs/2601.02577,False,core,representation,model,representation_organization;systems_efficiency,,0,agent-memory
2601.02732,2026-01-06,baseline-2025H2-Jan2026,Agentic Memory Enhanced Recursive Reasoning for Root Cause Localization in Microservices,https://arxiv.org/abs/2601.02732,True,core,update_forgetting,model,multi_agent_shared;systems_efficiency,,5,agent-memory
2601.02744,2026-01-06,baseline-2025H2-Jan2026,SYNAPSE: Empowering LLM Agents with Episodic-Semantic Memory via Spreading Activation,https://arxiv.org/abs/2601.02744,True,core,update_forgetting,model,retrieval_access;evaluation_diagnosis,,6,agent-memory
2601.03236,2026-01-06,baseline-2025H2-Jan2026,MAGMA: A Multi-Graph based Agentic Memory Architecture for AI Agents,https://arxiv.org/abs/2601.03236,True,core,update_forgetting,model,retrieval_access;representation_organization;execution_state;multimodal_embodied_gui,retrieval_representation,4,agent-memory
2601.03543,2026-01-07,baseline-2025H2-Jan2026,EvolMem: A Cognitive-Driven Benchmark for Multi-Session Dialogue Memory,https://arxiv.org/abs/2601.03543,True,core,representation,model,evaluation_diagnosis;multimodal_embodied_gui,benchmark_diagnosis,6,agent-memory
2601.03785,2026-01-07,baseline-2025H2-Jan2026,Membox: Weaving Topic Continuity into Long-Range Memory for LLM Agents,https://arxiv.org/abs/2601.03785,True,core,experience_learning,model,retrieval_access;representation_organization;update_forgetting,,4,agent-memory
2601.04170,2026-01-07,baseline-2025H2-Jan2026,Agent Drift: Quantifying Behavioral Degradation in Multi-Agent LLM Systems Over Extended Interactions,https://arxiv.org/abs/2601.04170,False,supporting,execution_state,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;multi_agent_shared;systems_efficiency,personal_shared,1,episodic-memory
2601.05504,2026-01-09,baseline-2025H2-Jan2026,Memory Poisoning Attack and Defense on Memory Based LLM-Agents,https://arxiv.org/abs/2601.05504,True,supporting,security_privacy,model,retrieval_access;evaluation_diagnosis;security_privacy_trust,security_governance,6,long-term-memory
2601.06282,2026-01-09,baseline-2025H2-Jan2026,Amory: Building Coherent Narrative-Driven Agent Memory through Agentic Reasoning,https://arxiv.org/abs/2601.06282,True,core,experience_learning,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;systems_efficiency,,8,agent-memory
2601.06377,2026-01-10,baseline-2025H2-Jan2026,HiMem: Hierarchical Long-Term Memory for LLM Long-Horizon Agents,https://arxiv.org/abs/2601.06377,True,core,experience_learning,model,retrieval_access;representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;systems_efficiency,retrieval_representation;execution_multimodal,6,episodic-memory
2601.06411,2026-01-10,baseline-2025H2-Jan2026,Structured Episodic Event Memory,https://arxiv.org/abs/2601.06411,True,core,experience_learning,model,retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust,retrieval_representation,6,episodic-memory
2601.10744,2026-01-11,baseline-2025H2-Jan2026,Explore with Long-term Memory: A Benchmark and Multimodal LLM-based Reinforcement Learning Framework for Embodied Exploration,https://arxiv.org/abs/2601.10744,True,supporting,execution_state,model,retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui,benchmark_diagnosis;experience_skill_policy;execution_multimodal,4,agent-memory;episodic-memory
2601.07470,2026-01-12,baseline-2025H2-Jan2026,Learning How to Remember: A Meta-Cognitive Management Method for Structured and Transferable Agent Memory,https://arxiv.org/abs/2601.07470,True,core,experience_learning,model,representation_organization;execution_state;experience_skill_learning,retrieval_representation;experience_skill_policy,4,agent-memory
2601.07779,2026-01-12,baseline-2025H2-Jan2026,OS-Symphony: A Holistic Framework for Robust and Generalist Computer-Using Agent,https://arxiv.org/abs/2601.07779,False,supporting,execution_state,model,retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui,,6,agent-memory
2601.08160,2026-01-13,baseline-2025H2-Jan2026,SwiftMem: Fast Agentic Memory via Query-aware Indexing,https://arxiv.org/abs/2601.08160,True,core,experience_learning,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;systems_efficiency,retrieval_representation,5,agent-memory
2601.08323,2026-01-13,baseline-2025H2-Jan2026,AtomMem : Learnable Dynamic Agentic Memory with Atomic Memory Operation,https://arxiv.org/abs/2601.08323,True,core,experience_learning,model,representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis,experience_skill_policy,4,agent-memory
2601.09113,2026-01-14,baseline-2025H2-Jan2026,The AI Hippocampus: How Far are We From Human Memory?,https://arxiv.org/abs/2601.09113,True,supporting,experience_learning,model,retrieval_access;representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multi_agent_shared;multimodal_embodied_gui;systems_efficiency,benchmark_diagnosis,2,agent-memory
2601.09636,2026-01-14,baseline-2025H2-Jan2026,PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records,https://arxiv.org/abs/2601.09636,False,core,execution_state,model,representation_organization;evaluation_diagnosis;multimodal_embodied_gui,retrieval_representation;execution_multimodal;personal_shared,5,agent-memory
2602.06051,2026-01-14,baseline-2025H2-Jan2026,CAST: Character-and-Scene Episodic Memory for Agents,https://arxiv.org/abs/2602.06051,True,core,representation,model,retrieval_access;representation_organization;experience_skill_learning,,6,agent-memory;episodic-memory
2602.06052,2026-01-14,baseline-2025H2-Jan2026,Rethinking Memory Mechanisms of Foundation Agents in the Second Half: A Survey,https://arxiv.org/abs/2602.06052,True,core,access,model,retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis,benchmark_diagnosis,2,agent-memory
2601.10702,2026-01-15,baseline-2025H2-Jan2026,Grounding Agent Memory in Contextual Intent,https://arxiv.org/abs/2601.10702,True,core,update_forgetting,model,retrieval_access;representation_organization;execution_state;evaluation_diagnosis,,6,agent-memory
2601.11854,2026-01-17,baseline-2025H2-Jan2026,ATOD: An Evaluation Framework and Benchmark for Agentic Task-Oriented Dialogue Systems,https://arxiv.org/abs/2601.11854,False,core,representation,model,execution_state;evaluation_diagnosis,benchmark_diagnosis,4,agent-memory
2601.12771,2026-01-19,baseline-2025H2-Jan2026,Who Does This Name Remind You of ? Nationality Prediction via Large Language Model Associative Memory,https://arxiv.org/abs/2601.12771,True,core,update_forgetting,model,retrieval_access;multi_agent_shared;multimodal_embodied_gui,,5,agent-memory
2601.14192,2026-01-20,baseline-2025H2-Jan2026,"Toward Efficient Agents: Memory, Tool learning, and Planning",https://arxiv.org/abs/2601.14192,True,core,update_forgetting,model,retrieval_access;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;systems_efficiency,experience_skill_policy;systems_efficiency,3,agent-memory
2601.14735,2026-01-21,baseline-2025H2-Jan2026,Optimizing FaaS Platforms for MCP-enabled Agentic Workflows,https://arxiv.org/abs/2601.14735,False,core,execution_state,model,retrieval_access;evaluation_diagnosis;multi_agent_shared;systems_efficiency,,4,agent-memory
2601.16690,2026-01-23,baseline-2025H2-Jan2026,EMemBench: Interactive Benchmarking of Episodic Memory for VLM Agents,https://arxiv.org/abs/2601.16690,True,core,experience_learning,model,retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui,benchmark_diagnosis,6,agent-memory
2601.16872,2026-01-23,baseline-2025H2-Jan2026,From Atom to Community: Structured and Evolving Agent Memory for User Behavior Modeling,https://arxiv.org/abs/2601.16872,True,core,update_forgetting,model,representation_organization;update_forgetting,retrieval_representation;experience_skill_policy,4,agent-memory
2601.17887,2026-01-25,baseline-2025H2-Jan2026,When Personalization Legitimizes Risks: Uncovering Safety Vulnerabilities in Personalized Dialogue Agents,https://arxiv.org/abs/2601.17887,False,core,execution_state,model,representation_organization;experience_skill_learning;evaluation_diagnosis;security_privacy_trust,security_governance;personal_shared,6,long-term-memory
2601.18642,2026-01-26,baseline-2025H2-Jan2026,FadeMem: Biologically-Inspired Forgetting for Efficient Agent Memory,https://arxiv.org/abs/2601.18642,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;security_privacy_trust;multimodal_embodied_gui;systems_efficiency,update_forgetting;systems_efficiency,3,agent-memory
2601.20352,2026-01-28,baseline-2025H2-Jan2026,AMA: Adaptive Memory via Multi-Agent Collaboration,https://arxiv.org/abs/2601.20352,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;multi_agent_shared;systems_efficiency,experience_skill_policy;personal_shared,7,agent-memory;long-term-memory
2601.20465,2026-01-28,baseline-2025H2-Jan2026,BMAM: Brain-inspired Multi-Agent Memory Framework,https://arxiv.org/abs/2601.20465,True,core,execution_state,model,retrieval_access;representation_organization;execution_state;evaluation_diagnosis;multi_agent_shared;systems_efficiency,personal_shared,4,agent-memory
2601.21468,2026-01-29,baseline-2025H2-Jan2026,MemOCR: Layout-Aware Visual Memory for Efficient Long-Horizon Reasoning,https://arxiv.org/abs/2601.21468,True,core,update_forgetting,model,representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,execution_multimodal;systems_efficiency,4,agent-memory
2601.21714,2026-01-29,baseline-2025H2-Jan2026,E-mem: Multi-agent based Episodic Context Reconstruction for LLM Agent Memory,https://arxiv.org/abs/2601.21714,True,core,update_forgetting,model,retrieval_access;representation_organization;execution_state;evaluation_diagnosis;security_privacy_trust;multi_agent_shared;systems_efficiency,personal_shared,2,agent-memory
2601.21841,2026-01-29,baseline-2025H2-Jan2026,Embodied Task Planning via Graph-Informed Action Generation with Large Language Models,https://arxiv.org/abs/2601.21841,False,core,update_forgetting,model,retrieval_access;representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,retrieval_representation;execution_multimodal,7,agent-memory
2601.22964,2026-01-30,baseline-2025H2-Jan2026,EvoClinician: A Self-Evolving Agent for Multi-Turn Medical Diagnosis via Test-Time Evolutionary Learning,https://arxiv.org/abs/2601.22964,False,core,update_forgetting,model,update_forgetting;experience_skill_learning;evaluation_diagnosis;systems_efficiency,benchmark_diagnosis;experience_skill_policy,5,agent-memory
2601.22974,2026-01-30,baseline-2025H2-Jan2026,MiTa: A Hierarchical Multi-Agent Collaboration Framework with Memory-integrated and Task Allocation,https://arxiv.org/abs/2601.22974,True,core,update_forgetting,model,representation_organization;update_forgetting;execution_state;multi_agent_shared;multimodal_embodied_gui,retrieval_representation;personal_shared,4,episodic-memory
2601.23014,2026-01-30,baseline-2025H2-Jan2026,Mem-T: Densifying Rewards for Long-Horizon Memory Agents,https://arxiv.org/abs/2601.23014,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;execution_state;experience_skill_learning;multimodal_embodied_gui;systems_efficiency,execution_multimodal,3,agent-memory
2602.00352,2026-01-30,baseline-2025H2-Jan2026,DETOUR: An Interactive Benchmark for Dual-Agent Search and Reasoning,https://arxiv.org/abs/2602.00352,False,core,access,model,retrieval_access;evaluation_diagnosis;multimodal_embodied_gui,benchmark_diagnosis;retrieval_representation,4,agent-memory
2602.00364,2026-01-30,baseline-2025H2-Jan2026,"""Someone Hid It"": Query-Agnostic Black-Box Attacks on LLM-Based Retrieval",https://arxiv.org/abs/2602.00364,False,core,access,model,retrieval_access;evaluation_diagnosis;security_privacy_trust;systems_efficiency,retrieval_representation;security_governance,2,agent-memory
2602.00675,2026-01-31,baseline-2025H2-Jan2026,Factored Reasoning with Inner Speech and Persistent Memory for Evidence-Grounded Human-Robot Interaction,https://arxiv.org/abs/2602.00675,True,core,execution_state,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,execution_multimodal,3,agent-memory
2602.01869,2026-02-02,transition-2026-Feb-Mar,Skill-Pro: Learning Reusable Skills from Experience via Non-Parametric PPO for LLM Agents,https://arxiv.org/abs/2602.01869,False,core,update_forgetting,model,update_forgetting;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,experience_skill_policy,3,procedural-memory
2602.02007,2026-02-02,transition-2026-Feb-Mar,Beyond RAG for Agent Memory: Retrieval by Decoupling and Aggregation,https://arxiv.org/abs/2602.02007,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;multimodal_embodied_gui;systems_efficiency,retrieval_representation,2,agent-memory
2602.02164,2026-02-02,transition-2026-Feb-Mar,Co-RedTeam: Orchestrated Security Discovery and Exploitation with LLM Agents,https://arxiv.org/abs/2602.02164,False,supporting,security_privacy,model,representation_organization;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multi_agent_shared,security_governance,7,long-term-memory
2602.02369,2026-02-02,transition-2026-Feb-Mar,Live-Evo: Online Evolution of Agentic Memory from Continuous Feedback,https://arxiv.org/abs/2602.02369,True,core,update_forgetting,model,retrieval_access;update_forgetting;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui,,5,agent-memory
2602.02474,2026-02-02,transition-2026-Feb-Mar,MemSkill: Learning and Evolving Memory Skills for Self-Evolving Agents,https://arxiv.org/abs/2602.02474,True,core,update_forgetting,model,representation_organization;update_forgetting;experience_skill_learning;multimodal_embodied_gui;systems_efficiency,experience_skill_policy,5,agent-memory
2602.03036,2026-02-03,transition-2026-Feb-Mar,LatentMem: Customizing Latent Memory for Multi-Agent Systems,https://arxiv.org/abs/2602.03036,True,core,update_forgetting,model,retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis;multi_agent_shared;systems_efficiency,personal_shared,5,agent-memory
2602.03224,2026-02-03,transition-2026-Feb-Mar,TAME: A Trustworthy Test-Time Evolution of Agent Memory with Systematic Benchmarking,https://arxiv.org/abs/2602.03224,True,core,security_privacy,model,retrieval_access;update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multi_agent_shared;multimodal_embodied_gui,benchmark_diagnosis;security_governance,2,agent-memory
2602.03315,2026-02-03,transition-2026-Feb-Mar,Memora: A Harmonic Memory Representation Balancing Abstraction and Specificity,https://arxiv.org/abs/2602.03315,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;systems_efficiency,retrieval_representation,2,agent-memory
2602.04482,2026-02-04,transition-2026-Feb-Mar,ProAgentBench: Evaluating LLM Agents for Proactive Assistance with Real-World Data,https://arxiv.org/abs/2602.04482,False,supporting,application,model,representation_organization;evaluation_diagnosis;security_privacy_trust;systems_efficiency,benchmark_diagnosis,7,long-term-memory
2602.04640,2026-02-04,transition-2026-Feb-Mar,"Towards Structured, State-Aware, and Execution-Grounded Reasoning for Software Engineering Agents",https://arxiv.org/abs/2602.04640,False,core,update_forgetting,model,representation_organization;execution_state,retrieval_representation,0,agent-memory
2603.00026,2026-02-04,transition-2026-Feb-Mar,ActMem: Bridging the Gap Between Memory Retrieval and Reasoning in LLM Agents,https://arxiv.org/abs/2603.00026,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis,retrieval_representation,6,memory-evaluation
2602.05665,2026-02-05,transition-2026-Feb-Mar,"Graph-based Agent Memory: Taxonomy, Techniques, and Applications",https://arxiv.org/abs/2602.05665,True,core,update_forgetting,model,retrieval_access;representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;systems_efficiency,benchmark_diagnosis;retrieval_representation,5,agent-memory
2602.06025,2026-02-05,transition-2026-Feb-Mar,Learning Query-Aware Budget-Tier Routing for Runtime Agent Memory,https://arxiv.org/abs/2602.06025,True,supporting,application,model,retrieval_access;representation_organization;experience_skill_learning;systems_efficiency,experience_skill_policy;systems_efficiency,2,agent-memory
2602.17692,2026-02-06,transition-2026-Feb-Mar,Agentic Unlearning: When LLM Agent Meets Machine Unlearning,https://arxiv.org/abs/2602.17692,False,core,update_forgetting,model,retrieval_access;update_forgetting;evaluation_diagnosis;multimodal_embodied_gui,experience_skill_policy;security_governance,2,long-term-memory
2603.03296,2026-02-06,transition-2026-Feb-Mar,PlugMem: A Task-Agnostic Plugin Memory Module for LLM Agents,https://arxiv.org/abs/2603.03296,True,core,update_forgetting,model,retrieval_access;representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,,5,episodic-memory;long-term-memory
2602.07398,2026-02-07,transition-2026-Feb-Mar,AgentSys: Secure and Dynamic LLM Agents Through Explicit Hierarchical Memory Management,https://arxiv.org/abs/2602.07398,True,core,update_forgetting,model,representation_organization;evaluation_diagnosis;security_privacy_trust,retrieval_representation,6,agent-memory
2602.07624,2026-02-07,transition-2026-Feb-Mar,M2A: Multimodal Memory Agent with Dual-Layer Hybrid Memory for Long-Term Personalized Interactions,https://arxiv.org/abs/2602.07624,True,core,update_forgetting,model,retrieval_access;update_forgetting;multimodal_embodied_gui;systems_efficiency,execution_multimodal;personal_shared,6,agent-memory
2602.07755,2026-02-08,transition-2026-Feb-Mar,Learning to Continually Learn via Meta-learning Agentic Memory Designs,https://arxiv.org/abs/2602.07755,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;systems_efficiency,experience_skill_policy,3,agent-memory
2602.07885,2026-02-08,transition-2026-Feb-Mar,MemFly: On-the-Fly Memory Optimization via Information Bottleneck,https://arxiv.org/abs/2602.07885,True,core,update_forgetting,model,retrieval_access;representation_organization;systems_efficiency,,4,long-term-memory
2602.08369,2026-02-09,transition-2026-Feb-Mar,MemAdapter: Fast Alignment across Agent Memory Paradigms via Generative Subgraph Retrieval,https://arxiv.org/abs/2602.08369,True,core,update_forgetting,model,retrieval_access;execution_state;evaluation_diagnosis;systems_efficiency,retrieval_representation;experience_skill_policy,6,agent-memory
2602.09319,2026-02-10,transition-2026-Feb-Mar,Benchmarking Knowledge-Extraction Attack and Defense on Retrieval-Augmented Generation,https://arxiv.org/abs/2602.09319,False,core,access,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;security_privacy_trust;systems_efficiency,benchmark_diagnosis;retrieval_representation;security_governance;systems_efficiency,2,agent-memory
2602.09712,2026-02-10,transition-2026-Feb-Mar,TraceMem: Weaving Narrative Memory Schemata from User Conversational Traces,https://arxiv.org/abs/2602.09712,True,core,execution_state,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis,,6,episodic-memory
2602.10715,2026-02-11,transition-2026-Feb-Mar,Locomo-Plus: Beyond-Factual Cognitive Memory Evaluation Framework for LLM Agents,https://arxiv.org/abs/2602.10715,True,core,execution_state,model,retrieval_access;evaluation_diagnosis,benchmark_diagnosis,4,memory-evaluation
2602.11243,2026-02-11,transition-2026-Feb-Mar,Evaluating Memory Structure in LLM Agents,https://arxiv.org/abs/2602.11243,True,core,representation,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;multimodal_embodied_gui,benchmark_diagnosis;retrieval_representation,3,agent-memory;long-term-memory;memory-evaluation
2602.13530,2026-02-13,transition-2026-Feb-Mar,REMem: Reasoning with Episodic Memory in Language Agent,https://arxiv.org/abs/2602.13530,True,core,representation,model,retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis,,6,memory-evaluation
2602.18493,2026-02-13,transition-2026-Feb-Mar,Learning to Remember: End-to-End Training of Memory Agents for Long-Context Reasoning,https://arxiv.org/abs/2602.18493,True,core,execution_state,model,retrieval_access;representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis,experience_skill_policy,4,agent-memory
2602.13594,2026-02-14,transition-2026-Feb-Mar,Hippocampus: An Efficient and Scalable Memory Module for Agentic AI,https://arxiv.org/abs/2602.13594,True,core,execution_state,model,retrieval_access;representation_organization;execution_state;evaluation_diagnosis;systems_efficiency,systems_efficiency,2,agent-memory
2602.13933,2026-02-15,transition-2026-Feb-Mar,HyMem: Hybrid Memory Architecture with Dynamic Retrieval Scheduling,https://arxiv.org/abs/2602.13933,True,core,execution_state,model,retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis;systems_efficiency,retrieval_representation,6,long-term-memory
2602.14038,2026-02-15,transition-2026-Feb-Mar,Choosing How to Remember: Adaptive Memory Structures for LLM Agents,https://arxiv.org/abs/2602.14038,True,core,execution_state,model,representation_organization;execution_state;evaluation_diagnosis,retrieval_representation;experience_skill_policy,4,agent-memory
2602.15274,2026-02-17,transition-2026-Feb-Mar,When Remembering and Planning are Worth it: Navigating under Change,https://arxiv.org/abs/2602.15274,True,core,execution_state,model,retrieval_access;execution_state;experience_skill_learning;multimodal_embodied_gui;systems_efficiency,,0,agent-memory
2602.15513,2026-02-17,transition-2026-Feb-Mar,HIMM: Human-Inspired Long-Term Memory Modeling for Embodied Exploration and Question Answering,https://arxiv.org/abs/2602.15513,True,core,execution_state,model,retrieval_access;representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,execution_multimodal,4,episodic-memory
2602.15654,2026-02-17,transition-2026-Feb-Mar,Zombie Agents: Persistent Control of Self-Evolving LLM Agents via Self-Reinforcing Injections,https://arxiv.org/abs/2602.15654,False,core,execution_state,model,retrieval_access;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;systems_efficiency,experience_skill_policy,3,long-term-memory
2603.02240,2026-02-17,transition-2026-Feb-Mar,SuperLocalMemory: Privacy-Preserving Multi-Agent Memory with Bayesian Trust Defense Against Memory Poisoning,https://arxiv.org/abs/2603.02240,True,core,execution_state,model,retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust;multi_agent_shared;systems_efficiency,security_governance;systems_efficiency;personal_shared,5,agent-memory
2603.04428,2026-02-17,transition-2026-Feb-Mar,Agent Memory Below the Prompt: Persistent Q4 KV Cache for Multi-Agent LLM Inference on Edge Devices,https://arxiv.org/abs/2603.04428,True,core,execution_state,model,evaluation_diagnosis;multi_agent_shared;systems_efficiency,systems_efficiency;personal_shared,5,agent-memory
2602.16313,2026-02-18,transition-2026-Feb-Mar,MemoryArena: Benchmarking Agent Memory in Interdependent Multi-Session Agentic Tasks,https://arxiv.org/abs/2602.16313,True,core,execution_state,model,retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui,benchmark_diagnosis,3,agent-memory;memory-evaluation
2602.16493,2026-02-18,transition-2026-Feb-Mar,MMA: Multimodal Memory Agent,https://arxiv.org/abs/2602.16493,True,core,execution_state,model,retrieval_access;representation_organization;update_forgetting;execution_state;evaluation_diagnosis;multimodal_embodied_gui,execution_multimodal,8,agent-memory
2602.19320,2026-02-22,transition-2026-Feb-Mar,Anatomy of Agentic Memory: Taxonomy and Empirical Analysis of Evaluation and System Limitations,https://arxiv.org/abs/2602.19320,True,core,execution_state,model,representation_organization;execution_state;evaluation_diagnosis;systems_efficiency,benchmark_diagnosis,4,agent-memory
2603.04443,2026-02-22,transition-2026-Feb-Mar,AMV-L: Lifecycle-Managed Agent Memory for Tail-Latency Control in Long-Running LLM Systems,https://arxiv.org/abs/2603.04443,True,core,execution_state,model,retrieval_access;update_forgetting;evaluation_diagnosis;systems_efficiency,update_forgetting;systems_efficiency,7,agent-memory;long-term-memory
2602.21394,2026-02-24,transition-2026-Feb-Mar,MemoPhishAgent: Memory-Augmented Multi-Modal LLM Agent for Phishing URL Detection,https://arxiv.org/abs/2602.21394,True,core,execution_state,model,retrieval_access;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui,,8,episodic-memory
2602.21477,2026-02-25,transition-2026-Feb-Mar,Pancake: Hierarchical Memory System for Multi-Agent LLM Serving,https://arxiv.org/abs/2602.21477,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;multi_agent_shared;systems_efficiency,retrieval_representation;systems_efficiency;personal_shared,6,agent-memory
2602.22406,2026-02-25,transition-2026-Feb-Mar,Towards Autonomous Memory Agents,https://arxiv.org/abs/2602.22406,True,core,update_forgetting,model,retrieval_access;update_forgetting;experience_skill_learning;evaluation_diagnosis;systems_efficiency,,6,agent-memory
2602.22769,2026-02-26,transition-2026-Feb-Mar,AMA-Bench: Evaluating Long-Horizon Memory for Agentic Applications,https://arxiv.org/abs/2602.22769,True,core,update_forgetting,model,retrieval_access;execution_state;evaluation_diagnosis,benchmark_diagnosis;execution_multimodal,8,agent-memory;memory-evaluation
2602.23720,2026-02-27,transition-2026-Feb-Mar,The Auton Agentic AI Framework,https://arxiv.org/abs/2602.23720,False,core,execution_state,model,representation_organization;update_forgetting;experience_skill_learning;security_privacy_trust;systems_efficiency,,0,episodic-memory
2602.23937,2026-02-27,transition-2026-Feb-Mar,Enhancing Vision-Language Navigation with Multimodal Event Knowledge from Real-World Indoor Tour Videos,https://arxiv.org/abs/2602.23937,False,core,execution_state,model,retrieval_access;representation_organization;execution_state;evaluation_diagnosis;multimodal_embodied_gui,execution_multimodal;systems_efficiency,4,episodic-memory
2603.01160,2026-03-01,transition-2026-Feb-Mar,Semantic XPath: Structured Agentic Memory Access for Conversational AI,https://arxiv.org/abs/2603.01160,True,core,access,model,retrieval_access;representation_organization;update_forgetting;multimodal_embodied_gui;systems_efficiency,retrieval_representation,4,agent-memory
2603.01966,2026-03-02,transition-2026-Feb-Mar,AMemGym: Interactive Memory Benchmarking for Assistants in Long-Horizon Conversations,https://arxiv.org/abs/2603.01966,True,core,update_forgetting,model,representation_organization;execution_state;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,benchmark_diagnosis;execution_multimodal,2,agent-memory;memory-evaluation
2603.02206,2026-03-02,transition-2026-Feb-Mar,VoiceAgentRAG: Solving the RAG Latency Bottleneck in Real-Time Voice Agents Using Dual-Agent Architectures,https://arxiv.org/abs/2603.02206,False,core,access,model,retrieval_access;representation_organization;systems_efficiency,retrieval_representation;systems_efficiency,1,agent-memory
2603.02473,2026-03-02,transition-2026-Feb-Mar,Diagnosing Retrieval vs. Utilization Bottlenecks in LLM Agent Memory,https://arxiv.org/abs/2603.02473,True,core,access,model,retrieval_access;evaluation_diagnosis;systems_efficiency,benchmark_diagnosis;retrieval_representation,6,agent-memory
2603.03024,2026-03-03,transition-2026-Feb-Mar,MA-CoNav: A Master-Slave Multi-Agent Framework with Hierarchical Collaboration and Dual-Level Reflection for Long-Horizon Embodied VLN,https://arxiv.org/abs/2603.03024,False,core,update_forgetting,model,representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multi_agent_shared;multimodal_embodied_gui;systems_efficiency,retrieval_representation;execution_multimodal;personal_shared,4,agent-memory
2603.03148,2026-03-03,transition-2026-Feb-Mar,From Language to Action: Can LLM-Based Agents Be Used for Embodied Robot Cognition?,https://arxiv.org/abs/2603.03148,False,core,execution_state,model,representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui,execution_multimodal,4,episodic-memory
2603.15642,2026-03-03,transition-2026-Feb-Mar,CraniMem: Cranial Inspired Gated and Bounded Memory for Agentic Systems,https://arxiv.org/abs/2603.15642,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;execution_state;evaluation_diagnosis,,5,agent-memory
2603.04549,2026-03-04,transition-2026-Feb-Mar,Adaptive Memory Admission Control for LLM Agents,https://arxiv.org/abs/2603.04549,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;systems_efficiency,experience_skill_policy,7,long-term-memory
2603.04740,2026-03-05,transition-2026-Feb-Mar,Memory as Ontology: A Constitutional Memory Architecture for Persistent Digital Citizens,https://arxiv.org/abs/2603.04740,True,core,execution_state,model,retrieval_access;representation_organization;security_privacy_trust;multimodal_embodied_gui;systems_efficiency,retrieval_representation,0,agent-memory
2603.23516,2026-03-06,transition-2026-Feb-Mar,MSA: Memory Sparse Attention for Efficient End-to-End Memory Model Scaling to 100M Tokens,https://arxiv.org/abs/2603.23516,True,core,update_forgetting,model,evaluation_diagnosis;systems_efficiency,systems_efficiency,5,agent-memory
2603.08755,2026-03-07,transition-2026-Feb-Mar,Turn: A Language for Agentic Computation,https://arxiv.org/abs/2603.08755,False,core,update_forgetting,model,evaluation_diagnosis,,3,agent-memory
2603.07392,2026-03-08,transition-2026-Feb-Mar,Can Large Language Models Keep Up? Benchmarking Online Adaptation to Continual Knowledge Streams,https://arxiv.org/abs/2603.07392,False,core,update_forgetting,model,representation_organization;evaluation_diagnosis,benchmark_diagnosis;experience_skill_policy;systems_efficiency,4,agent-memory
2603.07670,2026-03-08,transition-2026-Feb-Mar,"Memory for Autonomous LLM Agents:Mechanisms, Evaluation, and Emerging Frontiers",https://arxiv.org/abs/2603.07670,True,core,representation,model,retrieval_access;representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multi_agent_shared;multimodal_embodied_gui;systems_efficiency,benchmark_diagnosis,2,agent-memory
2603.07784,2026-03-08,transition-2026-Feb-Mar,ProgAgent:A Continual RL Agent with Progress-Aware Rewards,https://arxiv.org/abs/2603.07784,False,core,update_forgetting,model,update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui;systems_efficiency,experience_skill_policy,4,agent-memory
2603.10062,2026-03-09,transition-2026-Feb-Mar,Multi-Agent Memory from a Computer Architecture Perspective: Visions and Challenges Ahead,https://arxiv.org/abs/2603.10062,True,core,execution_state,model,representation_organization;multi_agent_shared;multimodal_embodied_gui,personal_shared,0,agent-memory
2604.00009,2026-03-09,transition-2026-Feb-Mar,"Eyla: Toward an Identity-Anchored LLM Architecture with Integrated Biological Priors -- Vision, Implementation Attempt, and Lessons from AI-Assisted Development",https://arxiv.org/abs/2604.00009,False,core,representation,model,retrieval_access;evaluation_diagnosis;security_privacy_trust,,5,episodic-memory
2603.11721,2026-03-12,transition-2026-Feb-Mar,When OpenClaw Meets Hospital: Toward an Agentic Operating System for Dynamic Clinical Workflows,https://arxiv.org/abs/2603.11721,False,core,execution_state,model,retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,,7,long-term-memory
2603.11768,2026-03-12,transition-2026-Feb-Mar,"Governing Evolving Memory in LLM Agents: Risks, Mechanisms, and the Stability and Safety Governed Memory (SSGM) Framework",https://arxiv.org/abs/2603.11768,True,core,execution_state,model,retrieval_access;representation_organization;update_forgetting;security_privacy_trust;multimodal_embodied_gui;systems_efficiency,experience_skill_policy;security_governance,0,agent-memory;long-term-memory
2603.12631,2026-03-13,transition-2026-Feb-Mar,Joint Optimization of Multi-agent Memory System,https://arxiv.org/abs/2603.12631,True,core,update_forgetting,model,retrieval_access;execution_state;experience_skill_learning;multi_agent_shared;multimodal_embodied_gui,personal_shared,5,agent-memory
2603.13017,2026-03-13,transition-2026-Feb-Mar,Structured Distillation for Personalized Agent Memory: 11x Token Reduction with Retrieval Preservation,https://arxiv.org/abs/2603.13017,True,core,access,model,retrieval_access;representation_organization;evaluation_diagnosis;systems_efficiency,retrieval_representation;experience_skill_policy;systems_efficiency;personal_shared,8,agent-memory
2603.13676,2026-03-14,transition-2026-Feb-Mar,TheraAgent: Multi-Agent Framework with Self-Evolving Memory and Evidence-Calibrated Reasoning for PET Theranostics,https://arxiv.org/abs/2603.13676,True,core,execution_state,model,representation_organization;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multi_agent_shared,experience_skill_policy;personal_shared,7,agent-memory
2603.14588,2026-03-15,transition-2026-Feb-Mar,SuperLocalMemory V3: Information-Geometric Foundations for Zero-LLM Enterprise Agent Memory,https://arxiv.org/abs/2603.14588,True,core,access,model,retrieval_access;representation_organization;evaluation_diagnosis,,6,agent-memory
2603.14597,2026-03-15,transition-2026-Feb-Mar,D-MEM: Dopamine-Gated Agentic Memory via Reward Prediction Error Routing,https://arxiv.org/abs/2603.14597,True,core,update_forgetting,model,representation_organization;evaluation_diagnosis;security_privacy_trust;systems_efficiency,,7,agent-memory;long-term-memory
2603.15280,2026-03-16,transition-2026-Feb-Mar,Advancing Multimodal Agent Reasoning with Long-Term Neuro-Symbolic Memory,https://arxiv.org/abs/2603.15280,True,core,execution_state,model,retrieval_access;representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui,execution_multimodal,5,agent-memory
2603.15421,2026-03-16,transition-2026-Feb-Mar,CLAG: Adaptive Memory Organization via Agent-Driven Clustering for Small Language Model Agents,https://arxiv.org/abs/2603.15421,True,core,access,model,retrieval_access;representation_organization;experience_skill_learning;systems_efficiency,retrieval_representation;experience_skill_policy,2,agent-memory
2603.16734,2026-03-17,transition-2026-Feb-Mar,Differential Harm Propensity in Personalized LLM Agents: The Curious Case of Mental Health Disclosure,https://arxiv.org/abs/2603.16734,False,core,execution_state,model,evaluation_diagnosis;security_privacy_trust,personal_shared,4,long-term-memory
2603.17043,2026-03-17,transition-2026-Feb-Mar,OpenQlaw: An Agentic AI Assistant for Analysis of 2D Quantum Materials,https://arxiv.org/abs/2603.17043,False,core,execution_state,model,retrieval_access;multimodal_embodied_gui;systems_efficiency,benchmark_diagnosis,0,long-term-memory
2603.17244,2026-03-18,transition-2026-Feb-Mar,Graph-Native Cognitive Memory for AI Agents: Formal Belief Revision Semantics for Versioned Memory Architectures,https://arxiv.org/abs/2603.17244,True,core,execution_state,model,retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust;systems_efficiency,retrieval_representation;update_forgetting,6,agent-memory;memory-evaluation
2603.17831,2026-03-18,transition-2026-Feb-Mar,RPMS: Enhancing LLM-Based Embodied Planning through Rule-Augmented Memory Synergy,https://arxiv.org/abs/2603.17831,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;execution_state;evaluation_diagnosis;multimodal_embodied_gui,execution_multimodal,6,episodic-memory
2603.17948,2026-03-18,transition-2026-Feb-Mar,VideoAtlas: Navigating Long-Form Video in Logarithmic Compute,https://arxiv.org/abs/2603.17948,False,core,experience_learning,model,representation_organization;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,execution_multimodal,2,agent-memory
2603.19935,2026-03-20,transition-2026-Feb-Mar,"Memori: A Persistent Memory Layer for Efficient, Context-Aware LLM Agents",https://arxiv.org/abs/2603.19935,True,core,experience_learning,model,retrieval_access;representation_organization;evaluation_diagnosis;systems_efficiency,systems_efficiency,6,long-term-memory
2604.14158,2026-03-23,transition-2026-Feb-Mar,MemGround: Long-Term Memory Evaluation Kit for Large Language Models in Gamified Scenarios,https://arxiv.org/abs/2604.14158,True,supporting,evaluation,model,retrieval_access;representation_organization;execution_state;evaluation_diagnosis,benchmark_diagnosis,3,agent-memory
2605.20189,2026-03-23,transition-2026-Feb-Mar,SOLAR: A Self-Optimizing Open-Ended Autonomous Agent for Lifelong Learning and Continual Adaptation,https://arxiv.org/abs/2605.20189,False,supporting,evaluation,model,update_forgetting;experience_skill_learning;systems_efficiency,experience_skill_policy,6,episodic-memory
2603.23064,2026-03-24,transition-2026-Feb-Mar,Mind Your HEARTBEAT! Claw Background Execution Inherently Enables Silent Memory Pollution,https://arxiv.org/abs/2603.23064,True,peripheral,security_privacy,model,retrieval_access;evaluation_diagnosis;security_privacy_trust,,3,agent-memory
2603.23160,2026-03-24,transition-2026-Feb-Mar,UniDial-EvalKit: A Unified Toolkit for Evaluating Multi-Faceted Conversational Abilities,https://arxiv.org/abs/2603.23160,False,supporting,evaluation,model,representation_organization;evaluation_diagnosis;systems_efficiency,benchmark_diagnosis,6,agent-memory
2603.23231,2026-03-24,transition-2026-Feb-Mar,PERMA: Benchmarking Personalized Memory Agents via Event-Driven Preference and Realistic Task Environments,https://arxiv.org/abs/2603.23231,True,core,experience_learning,model,retrieval_access;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,benchmark_diagnosis;personal_shared,5,agent-memory
2603.24564,2026-03-25,transition-2026-Feb-Mar,"Infrastructure for Valuable, Tradable, and Verifiable Agent Memory",https://arxiv.org/abs/2603.24564,True,supporting,evaluation,model,representation_organization;security_privacy_trust;systems_efficiency,retrieval_representation,0,agent-memory
2603.25097,2026-03-26,transition-2026-Feb-Mar,ElephantBroker: A Knowledge-Grounded Cognitive Runtime for Trustworthy AI Agents,https://arxiv.org/abs/2603.25097,False,core,evaluation,model,retrieval_access;representation_organization;update_forgetting;security_privacy_trust;systems_efficiency,security_governance;systems_efficiency,0,agent-memory
2603.25973,2026-03-26,transition-2026-Feb-Mar,MemoryCD: Benchmarking Long-Context User Memory of LLM Agents for Lifelong Cross-Domain Personalization,https://arxiv.org/abs/2603.25973,True,supporting,evaluation,model,evaluation_diagnosis;systems_efficiency,benchmark_diagnosis;personal_shared,5,memory-evaluation
2604.19771,2026-03-27,transition-2026-Feb-Mar,Cognis: Context-Aware Memory for Conversational AI Agents,https://arxiv.org/abs/2604.19771,True,core,experience_learning,model,retrieval_access;evaluation_diagnosis;systems_efficiency,,4,long-term-memory
2603.28088,2026-03-30,transition-2026-Feb-Mar,GEMS: Agent-Native Multimodal Generation with Memory and Skills,https://arxiv.org/abs/2603.28088,True,core,experience_learning,model,representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multi_agent_shared;multimodal_embodied_gui,experience_skill_policy;execution_multimodal,4,agent-memory
2603.29493,2026-03-31,transition-2026-Feb-Mar,MemFactory: Unified Inference & Training Framework for Agent Memory,https://arxiv.org/abs/2603.29493,True,core,update_forgetting,model,retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis,,6,agent-memory
2604.00131,2026-03-31,transition-2026-Feb-Mar,Oblivion: Self-Adaptive Agentic Memory Control through Decay-Driven Activation,https://arxiv.org/abs/2604.00131,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;systems_efficiency,update_forgetting;experience_skill_policy,2,agent-memory
2604.00556,2026-04-01,recent-2026-Apr-Jul,HabitatAgent: An End-to-End Multi-Agent System for Housing Consultation,https://arxiv.org/abs/2604.00556,False,core,experience_learning,model,retrieval_access;update_forgetting;evaluation_diagnosis;multi_agent_shared,personal_shared,6,agent-memory
2604.01007,2026-04-01,recent-2026-Apr-Jul,Omni-SimpleMem: Autoresearch-Guided Discovery of Lifelong Multimodal Agent Memory,https://arxiv.org/abs/2604.01007,True,core,update_forgetting,model,retrieval_access;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui,retrieval_representation;execution_multimodal,8,agent-memory
2604.01560,2026-04-02,recent-2026-Apr-Jul,DeltaMem: Towards Agentic Memory Management via Reinforcement Learning,https://arxiv.org/abs/2604.01560,True,core,update_forgetting,model,experience_skill_learning;evaluation_diagnosis;multi_agent_shared,experience_skill_policy,4,agent-memory;memory-evaluation
2604.01658,2026-04-02,recent-2026-Apr-Jul,CORAL: Towards Autonomous Multi-Agent Evolution for Open-Ended Discovery,https://arxiv.org/abs/2604.01658,False,core,update_forgetting,model,retrieval_access;experience_skill_learning;evaluation_diagnosis;multi_agent_shared,personal_shared,5,long-term-memory
2604.01707,2026-04-02,recent-2026-Apr-Jul,Memory in the LLM Era: Modular Architectures and Strategies in a Unified Framework,https://arxiv.org/abs/2604.01707,True,core,access,model,retrieval_access;execution_state;evaluation_diagnosis,,4,agent-memory
2604.02522,2026-04-02,recent-2026-Apr-Jul,Opal: Private Memory for Personal AI,https://arxiv.org/abs/2604.02522,True,core,access,model,retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust;systems_efficiency,,6,agent-memory
2604.02623,2026-04-03,recent-2026-Apr-Jul,"Poison Once, Exploit Forever: Environment-Injected Memory Poisoning Attacks on Web Agents",https://arxiv.org/abs/2604.02623,True,core,update_forgetting,model,retrieval_access;execution_state;security_privacy_trust;multi_agent_shared;multimodal_embodied_gui;systems_efficiency,execution_multimodal;security_governance,4,agent-memory
2604.03588,2026-04-04,recent-2026-Apr-Jul,Rashomon Memory: Towards Argumentation-Driven Retrieval for Multi-Perspective Agent Memory,https://arxiv.org/abs/2604.03588,True,core,experience_learning,model,retrieval_access;representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;systems_efficiency,retrieval_representation,0,agent-memory
2604.04157,2026-04-05,recent-2026-Apr-Jul,Readable Minds: Emergent Theory-of-Mind-Like Behavior in LLM Poker Agents,https://arxiv.org/abs/2604.04157,False,core,execution_state,model,,,8,long-term-memory
2604.04503,2026-04-06,recent-2026-Apr-Jul,Memory Intelligence Agent,https://arxiv.org/abs/2604.04503,True,core,update_forgetting,model,retrieval_access;update_forgetting;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,,3,agent-memory
2604.04514,2026-04-06,recent-2026-Apr-Jul,"SuperLocalMemory V3.3: The Living Brain -- Biologically-Inspired Forgetting, Cognitive Quantization, and Multi-Channel Retrieval for Zero-LLM Agent Memory Systems",https://arxiv.org/abs/2604.04514,True,core,experience_learning,model,retrieval_access;representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;systems_efficiency,retrieval_representation;update_forgetting,4,agent-memory
2604.04660,2026-04-06,recent-2026-Apr-Jul,"Springdrift: An Auditable Persistent Runtime for LLM Agents with Case-Based Memory, Normative Safety, and Ambient Self-Perception",https://arxiv.org/abs/2604.04660,True,supporting,execution_state,model,retrieval_access;representation_organization;evaluation_diagnosis;multimodal_embodied_gui,systems_efficiency,6,long-term-memory
2604.04853,2026-04-06,recent-2026-Apr-Jul,MemMachine: A Ground-Truth-Preserving Memory System for Personalized AI Agents,https://arxiv.org/abs/2604.04853,True,core,experience_learning,model,retrieval_access;execution_state;evaluation_diagnosis;systems_efficiency,systems_efficiency;personal_shared,6,long-term-memory
2604.04901,2026-04-06,recent-2026-Apr-Jul,FileGram: Grounding Agent Personalization in File-System Behavioral Traces,https://arxiv.org/abs/2604.04901,False,supporting,execution_state,model,retrieval_access;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui,personal_shared,2,agent-memory
2604.05719,2026-04-07,recent-2026-Apr-Jul,Hackers or Hallucinators? A Comprehensive Analysis of LLM-Based Automated Penetration Testing,https://arxiv.org/abs/2604.05719,False,supporting,execution_state,model,retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust;systems_efficiency,benchmark_diagnosis,5,agent-memory
2604.07798,2026-04-09,recent-2026-Apr-Jul,Lightweight LLM Agent Memory with Small Language Models,https://arxiv.org/abs/2604.07798,True,core,experience_learning,model,retrieval_access;update_forgetting;execution_state;systems_efficiency,,2,agent-memory;long-term-memory
2604.07877,2026-04-09,recent-2026-Apr-Jul,MemReader: From Passive to Active Extraction for Long-Term Agent Memory,https://arxiv.org/abs/2604.07877,True,core,experience_learning,model,retrieval_access;representation_organization;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,,5,agent-memory
2604.08064,2026-04-09,recent-2026-Apr-Jul,ImplicitMemBench: Measuring Unconscious Behavioral Adaptation in Large Language Models,https://arxiv.org/abs/2604.08064,False,supporting,execution_state,model,retrieval_access;experience_skill_learning;evaluation_diagnosis,experience_skill_policy,8,memory-evaluation;procedural-memory
2604.08756,2026-04-09,recent-2026-Apr-Jul,Artifacts as Memory Beyond the Agent Boundary,https://arxiv.org/abs/2604.08756,True,supporting,execution_state,model,experience_skill_learning,,2,agent-memory
2604.09000,2026-04-10,recent-2026-Apr-Jul,StreamMeCo: Long-Term Agent Memory Compression for Efficient Streaming Video Understanding,https://arxiv.org/abs/2604.09000,True,core,experience_learning,model,retrieval_access;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,execution_multimodal;systems_efficiency,5,agent-memory
2604.09388,2026-04-10,recent-2026-Apr-Jul,The AI Codebase Maturity Model: From Assisted Coding to Fully Autonomous Systems,https://arxiv.org/abs/2604.09388,False,core,experience_learning,model,representation_organization;experience_skill_learning;evaluation_diagnosis;multi_agent_shared;systems_efficiency,,3,agent-memory
2604.09747,2026-04-10,recent-2026-Apr-Jul,ADAM: A Systematic Data Extraction Attack on Agent Memory via Adaptive Querying,https://arxiv.org/abs/2604.09747,True,supporting,execution_state,model,retrieval_access;security_privacy_trust;multimodal_embodied_gui;systems_efficiency,experience_skill_policy;security_governance,6,agent-memory
2604.11811,2026-04-10,recent-2026-Apr-Jul,M$^\star$: Every Task Deserves Its Own Memory Harness,https://arxiv.org/abs/2604.11811,True,core,update_forgetting,model,retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,,5,agent-memory
2604.10981,2026-04-13,recent-2026-Apr-Jul,"ATANT v1.1: Positioning Continuity Evaluation Against Memory, Long-Context, and Agentic-Memory Benchmarks",https://arxiv.org/abs/2604.10981,True,supporting,evaluation,model,evaluation_diagnosis;security_privacy_trust,benchmark_diagnosis,5,agent-memory;memory-evaluation
2604.11544,2026-04-13,recent-2026-Apr-Jul,Time is Not a Label: Continuous Phase Rotation for Temporal Knowledge Graphs and Agentic Memory,https://arxiv.org/abs/2604.11544,True,core,update_forgetting,model,representation_organization;evaluation_diagnosis;multimodal_embodied_gui,retrieval_representation;systems_efficiency,4,agent-memory
2604.11563,2026-04-13,recent-2026-Apr-Jul,Synthius-Mem: Brain-Inspired Hallucination-Resistant Persona Memory Achieving 94.4% Memory Accuracy and 99.6% Adversarial Robustness on LoCoMo,https://arxiv.org/abs/2604.11563,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;systems_efficiency,,8,long-term-memory
2604.12007,2026-04-13,recent-2026-Apr-Jul,When to Forget: A Memory Governance Primitive,https://arxiv.org/abs/2604.12007,True,core,update_forgetting,model,retrieval_access;update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust,update_forgetting;security_governance,6,agent-memory
2604.12179,2026-04-14,recent-2026-Apr-Jul,AgenticAI-DialogGen: Topic-Guided Conversation Generation for Fine-Tuning and Evaluating Short- and Long-Term Memories of LLMs,https://arxiv.org/abs/2604.12179,True,core,update_forgetting,model,representation_organization;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,benchmark_diagnosis;execution_multimodal,2,long-term-memory
2604.12285,2026-04-14,recent-2026-Apr-Jul,GAM: Hierarchical Graph-based Agentic Memory for LLM Agents,https://arxiv.org/abs/2604.12285,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;multimodal_embodied_gui;systems_efficiency,retrieval_representation,4,agent-memory
2604.12948,2026-04-14,recent-2026-Apr-Jul,Drawing on Memory: Dual-Trace Encoding Improves Cross-Session Recall in LLM Agents,https://arxiv.org/abs/2604.12948,True,core,update_forgetting,model,retrieval_access;update_forgetting;evaluation_diagnosis;systems_efficiency,retrieval_representation,7,long-term-memory
2604.15774,2026-04-17,recent-2026-Apr-Jul,MemEvoBench: Benchmarking Safety Risks from Memory Misevolution in LLM Agents,https://arxiv.org/abs/2604.15774,True,supporting,evaluation,model,update_forgetting;execution_state;evaluation_diagnosis;security_privacy_trust,benchmark_diagnosis,4,long-term-memory
2604.15877,2026-04-17,recent-2026-Apr-Jul,"Experience Compression Spectrum: Unifying Memory, Skills, and Rules in LLM Agents",https://arxiv.org/abs/2604.15877,True,supporting,evaluation,model,retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis;systems_efficiency,experience_skill_policy;systems_efficiency,2,agent-memory;episodic-memory
2604.16548,2026-04-17,recent-2026-Apr-Jul,"A Survey on Long-Term Memory Security in LLM Agents: Attacks, Defenses, and Governance Across the Memory Lifecycle",https://arxiv.org/abs/2604.16548,True,core,update_forgetting,model,retrieval_access;update_forgetting;security_privacy_trust;systems_efficiency,benchmark_diagnosis;update_forgetting;security_governance,0,long-term-memory
2604.16839,2026-04-18,recent-2026-Apr-Jul,HeLa-Mem: Hebbian Learning and Associative Memory for LLM Agents,https://arxiv.org/abs/2604.16839,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;experience_skill_learning;systems_efficiency,experience_skill_policy,5,episodic-memory;long-term-memory
2604.17273,2026-04-19,recent-2026-Apr-Jul,The Continuity Layer: Why Intelligence Needs an Architecture for What It Carries Forward,https://arxiv.org/abs/2604.17273,False,core,execution_state,model,retrieval_access;representation_organization;execution_state;evaluation_diagnosis;security_privacy_trust;systems_efficiency,,3,agent-memory;memory-evaluation
2604.17456,2026-04-19,recent-2026-Apr-Jul,TrafficClaw: A Generalizable LLM Agent in the Unified Physical Environment for Urban Traffic Control,https://arxiv.org/abs/2604.17456,False,core,execution_state,model,representation_organization;execution_state;experience_skill_learning,,3,long-term-memory
2604.17658,2026-04-19,recent-2026-Apr-Jul,Towards Self-Improving Error Diagnosis in Multi-Agent Systems,https://arxiv.org/abs/2604.17658,False,core,execution_state,model,update_forgetting;evaluation_diagnosis;multi_agent_shared,benchmark_diagnosis;personal_shared,6,episodic-memory
2604.19541,2026-04-21,recent-2026-Apr-Jul,FOCAL: Filtered On-device Continuous Activity Logging for Efficient Personal Desktop Summarization,https://arxiv.org/abs/2604.19541,False,core,execution_state,model,retrieval_access;security_privacy_trust;multi_agent_shared;multimodal_embodied_gui;systems_efficiency,systems_efficiency,6,agent-memory
2604.20006,2026-04-21,recent-2026-Apr-Jul,From Recall to Forgetting: Benchmarking Long-Term Memory for Personalized Agents,https://arxiv.org/abs/2604.20006,True,core,execution_state,model,retrieval_access;update_forgetting;evaluation_diagnosis,benchmark_diagnosis;retrieval_representation;update_forgetting;personal_shared,3,agent-memory
2604.20117,2026-04-22,recent-2026-Apr-Jul,To Know is to Construct: Schema-Constrained Generation for Agent Memory,https://arxiv.org/abs/2604.20117,True,core,execution_state,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;multimodal_embodied_gui,,5,agent-memory
2604.20183,2026-04-22,recent-2026-Apr-Jul,Dual-Cluster Memory Agent: Resolving Multi-Paradigm Ambiguity in Optimization Problem Solving,https://arxiv.org/abs/2604.20183,True,core,execution_state,model,representation_organization;update_forgetting;evaluation_diagnosis;multimodal_embodied_gui,execution_multimodal,4,agent-memory
2604.20300,2026-04-22,recent-2026-Apr-Jul,FSFM: A Biologically-Inspired Framework for Selective Forgetting of Agent Memory,https://arxiv.org/abs/2604.20300,True,core,execution_state,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;security_privacy_trust,update_forgetting,5,agent-memory
2604.20582,2026-04-22,recent-2026-Apr-Jul,"Trust, Lies, and Long Memories: Emergent Social Dynamics and Reputation in Multi-Round Avalon with LLM Agents",https://arxiv.org/abs/2604.20582,True,core,execution_state,model,security_privacy_trust,security_governance,4,agent-memory
2604.20598,2026-04-22,recent-2026-Apr-Jul,"Self-Aware Vector Embeddings for Retrieval-Augmented Generation: A Neuroscience-Inspired Framework for Temporal, Confidence-Weighted, and Relational Knowledge",https://arxiv.org/abs/2604.20598,False,core,execution_state,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;security_privacy_trust;systems_efficiency,retrieval_representation;systems_efficiency,6,agent-memory
2604.22085,2026-04-23,recent-2026-Apr-Jul,Memanto: Typed Semantic Memory with Information-Theoretic Retrieval for Long-Horizon Agents,https://arxiv.org/abs/2604.22085,True,core,execution_state,model,retrieval_access;representation_organization;update_forgetting;execution_state;evaluation_diagnosis;systems_efficiency,retrieval_representation;execution_multimodal,3,agent-memory
2604.23711,2026-04-26,recent-2026-Apr-Jul,Spore: Efficient and Training-Free Privacy Extraction Attack on LLMs via Inference-Time Hybrid Probing,https://arxiv.org/abs/2604.23711,False,core,execution_state,model,retrieval_access;evaluation_diagnosis;security_privacy_trust;systems_efficiency,security_governance;systems_efficiency,4,agent-memory
2606.20570,2026-04-26,recent-2026-Apr-Jul,Infrastructure for the Agentic Web: Gap Analysis and Architecture from the Agentverse Platform,https://arxiv.org/abs/2606.20570,False,core,access,model,retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui;systems_efficiency,benchmark_diagnosis;retrieval_representation,1,agent-memory
2604.26197,2026-04-29,recent-2026-Apr-Jul,Hierarchical Long-Term Semantic Memory for LinkedIn's Hiring Agent,https://arxiv.org/abs/2604.26197,True,core,execution_state,model,retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust;systems_efficiency,retrieval_representation,5,long-term-memory
2604.26622,2026-04-29,recent-2026-Apr-Jul,OCR-Memory: Optical Context Retrieval for Long-Horizon Agent Memory,https://arxiv.org/abs/2604.26622,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,retrieval_representation;execution_multimodal,3,agent-memory
2604.27003,2026-04-29,recent-2026-Apr-Jul,When Continual Learning Moves to Memory: A Study of Experience Reuse in LLM Agents,https://arxiv.org/abs/2604.27003,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis,benchmark_diagnosis;experience_skill_policy,3,procedural-memory
2604.27045,2026-04-29,recent-2026-Apr-Jul,Detecting Clinical Discrepancies in Health Coaching Agents: A Dual-Stream Memory and Reconciliation Architecture,https://arxiv.org/abs/2604.27045,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;security_privacy_trust,,5,agent-memory
2604.27283,2026-04-30,recent-2026-Apr-Jul,Learning When to Remember: Risk-Sensitive Contextual Bandits for Abstention-Aware Memory Retrieval in LLM-Based Coding Agents,https://arxiv.org/abs/2604.27283,True,core,update_forgetting,model,retrieval_access;execution_state;experience_skill_learning;systems_efficiency,retrieval_representation;experience_skill_policy,3,agent-memory
2604.27707,2026-04-30,recent-2026-Apr-Jul,"Contextual Agentic Memory is a Memo, Not True Memory",https://arxiv.org/abs/2604.27707,True,core,update_forgetting,model,retrieval_access;update_forgetting;evaluation_diagnosis;security_privacy_trust;systems_efficiency,,3,agent-memory
2604.27996,2026-04-30,recent-2026-Apr-Jul,Exploring LLM Agent Designs and Interaction Modalities for Scientific Visualization,https://arxiv.org/abs/2604.27996,False,core,update_forgetting,model,representation_organization;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,,4,long-term-memory
2605.00702,2026-05-01,recent-2026-Apr-Jul,Learning How and What to Memorize: Cognition-Inspired Two-Stage Optimization for Evolving Memory,https://arxiv.org/abs/2605.00702,True,core,update_forgetting,model,representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui,experience_skill_policy,4,memory-evaluation
2605.01386,2026-05-02,recent-2026-Apr-Jul,MemORAI: Memory Organization and Retrieval via Adaptive Graph Intelligence for LLM Conversational Agents,https://arxiv.org/abs/2605.01386,True,core,representation,model,retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust;systems_efficiency,retrieval_representation;experience_skill_policy,2,long-term-memory
2605.01970,2026-05-03,recent-2026-Apr-Jul,Trojan Hippo: Weaponizing Agent Memory for Data Exfiltration,https://arxiv.org/abs/2605.01970,True,core,update_forgetting,model,evaluation_diagnosis;security_privacy_trust;systems_efficiency,,4,agent-memory;long-term-memory
2605.02199,2026-05-04,recent-2026-Apr-Jul,MEMAUDIT: An Exact Package-Oracle Evaluation Protocol for Budgeted Long-Term LLM Memory Writing,https://arxiv.org/abs/2605.02199,True,core,update_forgetting,model,retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis;systems_efficiency,benchmark_diagnosis;systems_efficiency,3,long-term-memory
2605.03228,2026-05-04,recent-2026-Apr-Jul,MAGE: Safeguarding LLM Agents against Long-Horizon Threats via Shadow Memory,https://arxiv.org/abs/2605.03228,True,core,update_forgetting,model,retrieval_access;execution_state;evaluation_diagnosis;security_privacy_trust,execution_multimodal,5,agent-memory
2605.03312,2026-05-05,recent-2026-Apr-Jul,MemFlow: Intent-Driven Memory Orchestration for Small Language Model Agents,https://arxiv.org/abs/2605.03312,True,core,update_forgetting,model,retrieval_access;representation_organization;execution_state;evaluation_diagnosis;systems_efficiency,,7,agent-memory;memory-evaluation
2605.03354,2026-05-05,recent-2026-Apr-Jul,What Happens Inside Agent Memory? Circuit Analysis from Emergence to Diagnosis,https://arxiv.org/abs/2605.03354,True,core,execution_state,model,retrieval_access;representation_organization;evaluation_diagnosis;multimodal_embodied_gui,benchmark_diagnosis,5,agent-memory
2605.03804,2026-05-05,recent-2026-Apr-Jul,ScrapMem: A Bio-inspired Framework for On-device Personalized Agent Memory via Optical Forgetting,https://arxiv.org/abs/2605.03804,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;multimodal_embodied_gui;systems_efficiency,update_forgetting;systems_efficiency;personal_shared,4,agent-memory;episodic-memory;long-term-memory
2605.06702,2026-05-05,recent-2026-Apr-Jul,CASCADE: Case-Based Continual Adaptation for Large Language Models During Deployment,https://arxiv.org/abs/2605.06702,False,core,update_forgetting,model,retrieval_access;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui,experience_skill_policy,5,episodic-memory
2605.04811,2026-05-06,recent-2026-Apr-Jul,Tree-based Credit Assignment for Multi-Agent Memory System,https://arxiv.org/abs/2605.04811,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;multi_agent_shared;systems_efficiency,experience_skill_policy;personal_shared,5,agent-memory
2605.04897,2026-05-06,recent-2026-Apr-Jul,Storage Is Not Memory: A Retrieval-Centered Architecture for Agent Recall,https://arxiv.org/abs/2605.04897,True,core,access,model,retrieval_access;representation_organization;evaluation_diagnosis;systems_efficiency,retrieval_representation;systems_efficiency,3,agent-memory
2605.05583,2026-05-07,recent-2026-Apr-Jul,Belief Memory: Agent Memory Under Partial Observability,https://arxiv.org/abs/2605.05583,True,core,update_forgetting,model,retrieval_access;update_forgetting;evaluation_diagnosis,,5,agent-memory
2605.06132,2026-05-07,recent-2026-Apr-Jul,MemReranker: Reasoning-Aware Reranking for Agent Memory Retrieval,https://arxiv.org/abs/2605.06132,True,core,update_forgetting,model,retrieval_access;evaluation_diagnosis;systems_efficiency,retrieval_representation,7,agent-memory
2605.06527,2026-05-07,recent-2026-Apr-Jul,STALE: Can LLM Agents Know When Their Memories Are No Longer Valid?,https://arxiv.org/abs/2605.06527,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;systems_efficiency,update_forgetting,7,agent-memory
2605.06716,2026-05-07,recent-2026-Apr-Jul,From Storage to Experience: A Survey on the Evolution of LLM Agent Memory Mechanisms,https://arxiv.org/abs/2605.06716,True,core,experience_learning,model,retrieval_access;execution_state;experience_skill_learning;systems_efficiency,benchmark_diagnosis;experience_skill_policy;systems_efficiency,0,agent-memory
2605.06812,2026-05-07,recent-2026-Apr-Jul,Towards Security-Auditable LLM Agents: A Unified Graph Representation,https://arxiv.org/abs/2605.06812,False,core,security_privacy,model,retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust;multi_agent_shared,retrieval_representation;security_governance,3,long-term-memory
2605.07242,2026-05-08,recent-2026-Apr-Jul,MEMOREPAIR: Barrier-First Cascade Repair in Agentic Memory,https://arxiv.org/abs/2605.07242,True,core,update_forgetting,model,update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;systems_efficiency,,8,agent-memory
2605.07313,2026-05-08,recent-2026-Apr-Jul,When Stored Evidence Stops Being Usable: Scale-Conditioned Evaluation of Agent Memory,https://arxiv.org/abs/2605.07313,True,supporting,evaluation,model,retrieval_access;representation_organization;evaluation_diagnosis;systems_efficiency,benchmark_diagnosis,3,agent-memory
2605.08374,2026-05-08,recent-2026-Apr-Jul,MemQ: Integrating Q-Learning into Self-Evolving Memory Agents over Provenance DAGs,https://arxiv.org/abs/2605.08374,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui,experience_skill_policy;security_governance,3,agent-memory;episodic-memory
2605.08442,2026-05-08,recent-2026-Apr-Jul,Defense effectiveness across architectural layers: a mechanistic evaluation of persistent memory attacks on stateful LLM agents,https://arxiv.org/abs/2605.08442,True,supporting,security_privacy,model,retrieval_access;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui;systems_efficiency,benchmark_diagnosis;security_governance,7,long-term-memory
2605.08468,2026-05-08,recent-2026-Apr-Jul,"PYTHALAB-MERA: Validation-Grounded Memory, Retrieval, and Acceptance Control for Frozen-LLM Coding Agents",https://arxiv.org/abs/2605.08468,True,core,update_forgetting,model,retrieval_access;experience_skill_learning;evaluation_diagnosis;systems_efficiency,retrieval_representation,5,episodic-memory
2605.08538,2026-05-08,recent-2026-Apr-Jul,Human-Inspired Memory Architecture for LLM Agents,https://arxiv.org/abs/2605.08538,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;security_privacy_trust;systems_efficiency,,8,long-term-memory
2605.09033,2026-05-09,recent-2026-Apr-Jul,ShadowMerge: A Novel Poisoning Attack on Graph-Based Agent Memory via Relation-Channel Conflicts,https://arxiv.org/abs/2605.09033,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;security_privacy_trust,retrieval_representation;security_governance,7,agent-memory
2605.09315,2026-05-10,recent-2026-Apr-Jul,Do Self-Evolving Agents Forget? Capability Degradation and Preservation in Lifelong LLM Agent Adaptation,https://arxiv.org/abs/2605.09315,True,core,update_forgetting,model,update_forgetting;execution_state;experience_skill_learning;systems_efficiency,update_forgetting;experience_skill_policy,0,long-term-memory
2605.09330,2026-05-10,recent-2026-Apr-Jul,The Trap of Trajectory: Towards Understanding and Mitigating Spurious Correlations in Agentic Memory,https://arxiv.org/abs/2605.09330,True,supporting,evaluation,model,retrieval_access;representation_organization;execution_state;evaluation_diagnosis;security_privacy_trust;systems_efficiency,,2,agent-memory
2605.11032,2026-05-10,recent-2026-Apr-Jul,Portable Agent Memory: A Protocol for Cryptographically-Verified Memory Transfer Across Heterogeneous AI Agents,https://arxiv.org/abs/2605.11032,True,core,update_forgetting,model,retrieval_access;representation_organization;experience_skill_learning;security_privacy_trust;systems_efficiency,retrieval_representation,1,agent-memory
2605.09863,2026-05-11,recent-2026-Apr-Jul,Nautilus Compass: Black-box Persona Drift Detection for Production LLM Agents,https://arxiv.org/abs/2605.09863,False,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;systems_efficiency,,7,agent-memory
2605.09942,2026-05-11,recent-2026-Apr-Jul,HAGE: Harnessing Agentic Memory via RL-Driven Weighted Graph Evolution,https://arxiv.org/abs/2605.09942,True,core,update_forgetting,model,retrieval_access;representation_organization;execution_state;experience_skill_learning;multi_agent_shared,retrieval_representation;experience_skill_policy,3,agent-memory
2605.10268,2026-05-11,recent-2026-Apr-Jul,MemReread: Enhancing Agentic Long-Context Reasoning via Memory-Guided Rereading,https://arxiv.org/abs/2605.10268,True,core,update_forgetting,model,retrieval_access;update_forgetting;experience_skill_learning;multimodal_embodied_gui;systems_efficiency,execution_multimodal,5,agent-memory
2605.10870,2026-05-11,recent-2026-Apr-Jul,"Remember the Decision, Not the Description: A Rate-Distortion Framework for Agent Memory",https://arxiv.org/abs/2605.10870,True,core,update_forgetting,model,update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;systems_efficiency,,3,agent-memory
2605.10899,2026-05-11,recent-2026-Apr-Jul,RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards,https://arxiv.org/abs/2605.10899,False,core,update_forgetting,model,retrieval_access;representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui,experience_skill_policy;execution_multimodal,4,agent-memory
2605.13880,2026-05-11,recent-2026-Apr-Jul,PREPING: Building Agent Memory without Tasks,https://arxiv.org/abs/2605.13880,True,core,update_forgetting,model,representation_organization;update_forgetting;experience_skill_learning;multimodal_embodied_gui;systems_efficiency,,5,agent-memory
2605.11814,2026-05-12,recent-2026-Apr-Jul,MedMemoryBench: Benchmarking Agent Memory in Personalized Healthcare,https://arxiv.org/abs/2605.11814,True,core,execution_state,model,retrieval_access;execution_state;evaluation_diagnosis;systems_efficiency,benchmark_diagnosis;personal_shared,3,agent-memory
2605.12061,2026-05-12,recent-2026-Apr-Jul,SAGE: A Self-Evolving Agentic Graph-Memory Engine for Structure-Aware Associative Memory,https://arxiv.org/abs/2605.12061,True,core,update_forgetting,model,retrieval_access;representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis,retrieval_representation;experience_skill_policy,2,agent-memory;long-term-memory;memory-evaluation
2605.12213,2026-05-12,recent-2026-Apr-Jul,Goal-Oriented Reasoning for RAG-based Memory in Conversational Agentic LLM Systems,https://arxiv.org/abs/2605.12213,True,core,update_forgetting,model,retrieval_access;execution_state,retrieval_representation,5,agent-memory
2605.12294,2026-05-12,recent-2026-Apr-Jul,Executable Agentic Memory for GUI Agent,https://arxiv.org/abs/2605.12294,True,core,execution_state,model,retrieval_access;representation_organization;execution_state;multimodal_embodied_gui;systems_efficiency,execution_multimodal,2,agent-memory
2605.12493,2026-05-12,recent-2026-Apr-Jul,LongMemEval-V2: Evaluating Long-Term Agent Memory Toward Experienced Colleagues,https://arxiv.org/abs/2605.12493,True,core,experience_learning,model,retrieval_access;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,benchmark_diagnosis;experience_skill_policy,8,agent-memory;memory-evaluation
2605.12978,2026-05-13,recent-2026-Apr-Jul,Useful Memories Become Faulty When Continuously Updated by LLMs,https://arxiv.org/abs/2605.12978,True,core,update_forgetting,model,update_forgetting;experience_skill_learning;evaluation_diagnosis,update_forgetting,6,agent-memory
2605.13438,2026-05-13,recent-2026-Apr-Jul,CogniFold: Always-On Proactive Memory via Cognitive Folding,https://arxiv.org/abs/2605.13438,True,core,representation,model,retrieval_access;representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis,,3,agent-memory
2605.13542,2026-05-13,recent-2026-Apr-Jul,RealICU: Do LLM Agents Understand Long-Context ICU Data? A Benchmark Beyond Behavior Imitation,https://arxiv.org/abs/2605.13542,False,core,execution_state,model,retrieval_access;representation_organization;execution_state;evaluation_diagnosis,benchmark_diagnosis,4,agent-memory
2605.13941,2026-05-13,recent-2026-Apr-Jul,EvolveMem:Self-Evolving Memory Architecture via AutoResearch for LLM Agents,https://arxiv.org/abs/2605.13941,True,core,update_forgetting,model,retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis,retrieval_representation;experience_skill_policy,8,long-term-memory
2605.14421,2026-05-14,recent-2026-Apr-Jul,MemLineage: Lineage-Guided Enforcement for LLM Agent Memory,https://arxiv.org/abs/2605.14421,True,supporting,security_privacy,model,retrieval_access;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui,execution_multimodal,5,agent-memory
2605.14498,2026-05-14,recent-2026-Apr-Jul,GroupMemBench: Benchmarking LLM Agent Memory in Multi-Party Conversations,https://arxiv.org/abs/2605.14498,True,supporting,evaluation,model,retrieval_access;representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui,benchmark_diagnosis,7,agent-memory
2605.14906,2026-05-14,recent-2026-Apr-Jul,MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models,https://arxiv.org/abs/2605.14906,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,benchmark_diagnosis;execution_multimodal,6,agent-memory
2605.15128,2026-05-14,recent-2026-Apr-Jul,MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory,https://arxiv.org/abs/2605.15128,True,supporting,evaluation,model,retrieval_access;representation_organization;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,benchmark_diagnosis;execution_multimodal,3,agent-memory
2605.15338,2026-05-14,recent-2026-Apr-Jul,Hidden in Memory: Sleeper Memory Poisoning in LLM Agents,https://arxiv.org/abs/2605.15338,True,supporting,security_privacy,model,retrieval_access;evaluation_diagnosis;security_privacy_trust,security_governance,4,long-term-memory
2605.15701,2026-05-15,recent-2026-Apr-Jul,H-Mem: A Novel Memory Mechanism for Evolving and Retrieving Agent Memory via a Hybrid Structure,https://arxiv.org/abs/2605.15701,True,core,update_forgetting,model,retrieval_access;representation_organization;evaluation_diagnosis;systems_efficiency,retrieval_representation;experience_skill_policy,2,agent-memory;memory-evaluation
2605.15710,2026-05-15,recent-2026-Apr-Jul,SMMBench: A Benchmark for Source-Distributed Multimodal Agent Memory,https://arxiv.org/abs/2605.15710,True,supporting,evaluation,model,retrieval_access;update_forgetting;evaluation_diagnosis;multimodal_embodied_gui,benchmark_diagnosis;execution_multimodal,4,agent-memory;memory-evaluation
2605.15759,2026-05-15,recent-2026-Apr-Jul,DimMem: Dimensional Structuring for Efficient Long-Term Agent Memory,https://arxiv.org/abs/2605.15759,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;systems_efficiency,systems_efficiency,5,agent-memory;long-term-memory
2605.16233,2026-05-15,recent-2026-Apr-Jul,FORGE: Self-Evolving Agent Memory With No Weight Updates via Population Broadcast,https://arxiv.org/abs/2605.16233,True,supporting,evaluation,model,representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;systems_efficiency,update_forgetting;experience_skill_policy,8,agent-memory
2605.16481,2026-05-15,recent-2026-Apr-Jul,"Visual Agentic Memory: Enabling Online Long Video Understanding via Online Indexing, Hierarchical Memory, and Agentic Retrieval",https://arxiv.org/abs/2605.16481,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;execution_state;multimodal_embodied_gui,retrieval_representation;execution_multimodal,5,agent-memory
2605.16746,2026-05-16,recent-2026-Apr-Jul,State Contamination in Memory-Augmented LLM Agents,https://arxiv.org/abs/2605.16746,True,supporting,security_privacy,model,retrieval_access;representation_organization;update_forgetting;execution_state;security_privacy_trust;multi_agent_shared;systems_efficiency,security_governance,6,long-term-memory
2605.16858,2026-05-16,recent-2026-Apr-Jul,Pedestrian-Aware LLM-Driven Behavioral Planning for Autonomous Vehicles,https://arxiv.org/abs/2605.16858,False,core,execution_state,model,representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis,,7,episodic-memory
2605.23986,2026-05-16,recent-2026-Apr-Jul,MemForest: An Efficient Agent Memory System with Hierarchical Temporal Indexing,https://arxiv.org/abs/2605.23986,True,core,update_forgetting,model,representation_organization;update_forgetting;evaluation_diagnosis;systems_efficiency,retrieval_representation;systems_efficiency,8,agent-memory;memory-evaluation
2605.17348,2026-05-17,recent-2026-Apr-Jul,"Taming ""Zombie'' Agents: A Markov State-Aware Framework for Resilient Multi-Agent Evolution",https://arxiv.org/abs/2605.17348,False,core,update_forgetting,model,multi_agent_shared;systems_efficiency,personal_shared,5,agent-memory
2605.17596,2026-05-17,recent-2026-Apr-Jul,"NeuSymMS: A Hybrid Neuro-Symbolic Memory System for Persistent, Self-Curating LLM Agents",https://arxiv.org/abs/2605.17596,True,core,update_forgetting,model,retrieval_access;representation_organization;security_privacy_trust,,0,long-term-memory
2605.17625,2026-05-17,recent-2026-Apr-Jul,Episodic-Semantic Memory Architecture for Long-Horizon Scientific Agents,https://arxiv.org/abs/2605.17625,True,core,update_forgetting,model,retrieval_access;update_forgetting;execution_state;evaluation_diagnosis;systems_efficiency,execution_multimodal,7,agent-memory
2605.17641,2026-05-17,recent-2026-Apr-Jul,Causal Intervention-Based Memory Selection for Long-Horizon LLM Agents,https://arxiv.org/abs/2605.17641,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis,execution_multimodal,6,long-term-memory
2605.18284,2026-05-18,recent-2026-Apr-Jul,CommitDistill: A Lightweight Knowledge-Centric Memory Layer for Software Repositories,https://arxiv.org/abs/2605.18284,True,core,execution_state,model,retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui;systems_efficiency,experience_skill_policy;systems_efficiency,6,agent-memory
2605.18421,2026-05-18,recent-2026-Apr-Jul,EvoMemBench: Benchmarking Agent Memory from a Self-Evolving Perspective,https://arxiv.org/abs/2605.18421,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis,benchmark_diagnosis;experience_skill_policy,6,agent-memory;long-term-memory
2605.18652,2026-05-18,recent-2026-Apr-Jul,MementoGUI: Learning Agentic Multimodal Memory Control for Long-Horizon GUI Agents,https://arxiv.org/abs/2605.18652,True,core,update_forgetting,model,retrieval_access;execution_state;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,experience_skill_policy;execution_multimodal,5,agent-memory
2605.18930,2026-05-18,recent-2026-Apr-Jul,OEP: Poisoning Self-Evolving LLM Agents via Locally Correct but Non-Transferable Experiences,https://arxiv.org/abs/2605.18930,False,core,update_forgetting,model,representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust,experience_skill_policy;security_governance,6,agent-memory
2605.19952,2026-05-19,recent-2026-Apr-Jul,Rethinking How to Remember: Beyond Atomic Facts in Lifelong LLM Agent Memory,https://arxiv.org/abs/2605.19952,True,core,update_forgetting,model,retrieval_access;representation_organization;systems_efficiency,benchmark_diagnosis,6,agent-memory
2605.20616,2026-05-20,recent-2026-Apr-Jul,Auto-Dreamer: Learning Offline Memory Consolidation for Language Agents,https://arxiv.org/abs/2605.20616,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;experience_skill_learning;security_privacy_trust,update_forgetting;experience_skill_policy,4,agent-memory
2605.20724,2026-05-20,recent-2026-Apr-Jul,CALMem : Application-Layer Dual Memory for Conversational AI,https://arxiv.org/abs/2605.20724,True,core,execution_state,model,retrieval_access;representation_organization;multimodal_embodied_gui;systems_efficiency,,0,episodic-memory
2605.20833,2026-05-20,recent-2026-Apr-Jul,MemGym: a Long-Horizon Memory Environment for LLM Agents,https://arxiv.org/abs/2605.20833,True,core,execution_state,model,retrieval_access;update_forgetting;execution_state;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,execution_multimodal,3,agent-memory;memory-evaluation
2605.21463,2026-05-20,recent-2026-Apr-Jul,Mem-$π$: Adaptive Memory through Learning When and What to Generate,https://arxiv.org/abs/2605.21463,True,core,execution_state,model,retrieval_access;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui,experience_skill_policy,6,episodic-memory
2605.22411,2026-05-21,recent-2026-Apr-Jul,DeferMem: Query-Time Evidence Distillation via Reinforcement Learning for Long-Term Memory QA,https://arxiv.org/abs/2605.22411,True,core,execution_state,model,retrieval_access;representation_organization;experience_skill_learning;systems_efficiency,experience_skill_policy,2,long-term-memory
2605.22721,2026-05-21,recent-2026-Apr-Jul,Self-Evolving Multi-Agent Systems via Decentralized Memory,https://arxiv.org/abs/2605.22721,True,core,execution_state,model,update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multi_agent_shared;multimodal_embodied_gui;systems_efficiency,experience_skill_policy;personal_shared,6,long-term-memory
2605.23067,2026-05-21,recent-2026-Apr-Jul,What Training Data Teaches RL Memory Agents: An Empirical Study of Curriculum Effects in Memory-Augmented QA,https://arxiv.org/abs/2605.23067,True,core,execution_state,model,experience_skill_learning;evaluation_diagnosis,benchmark_diagnosis;experience_skill_policy,3,agent-memory
2605.23723,2026-05-22,recent-2026-Apr-Jul,MemAudit: Post-hoc Auditing of Poisoned Agent Memory via Causal Attribution and Structural Anomaly Detection,https://arxiv.org/abs/2605.23723,True,core,execution_state,model,retrieval_access;execution_state;evaluation_diagnosis;security_privacy_trust,security_governance,2,agent-memory;long-term-memory
2605.24941,2026-05-24,recent-2026-Apr-Jul,Memory-Induced Tool-Drift in LLM Agents,https://arxiv.org/abs/2605.24941,True,core,execution_state,model,evaluation_diagnosis;security_privacy_trust;systems_efficiency,,5,long-term-memory
2605.25002,2026-05-24,recent-2026-Apr-Jul,MemMark: State-Evolution Attribution Watermarking for Agent Long-Term Memory Systems,https://arxiv.org/abs/2605.25002,True,core,execution_state,model,update_forgetting;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui;systems_efficiency,,5,agent-memory
2605.26154,2026-05-24,recent-2026-Apr-Jul,MemMorph: Tool Hijacking in LLM Agents via Memory Poisoning,https://arxiv.org/abs/2605.26154,True,core,execution_state,model,experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui,security_governance,6,long-term-memory
2605.25869,2026-05-25,recent-2026-Apr-Jul,Mitigating Provenance-Role Collapse in Long-Term Agents via Typed Memory Representation,https://arxiv.org/abs/2605.25869,True,core,execution_state,model,retrieval_access;representation_organization;security_privacy_trust;systems_efficiency,retrieval_representation;security_governance,5,long-term-memory
2605.26252,2026-05-25,recent-2026-Apr-Jul,Is Agent Memory a Database? Rethinking Data Foundations for Long-Term AI Agent Memory,https://arxiv.org/abs/2605.26252,True,core,execution_state,model,retrieval_access;representation_organization;update_forgetting;execution_state;security_privacy_trust;systems_efficiency,benchmark_diagnosis;retrieval_representation,1,agent-memory
2605.26256,2026-05-25,recent-2026-Apr-Jul,Personalizing Embodied Multimodal Large Language Model Agents over Long-term User Interactions,https://arxiv.org/abs/2605.26256,False,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui,execution_multimodal;personal_shared,2,episodic-memory
2605.27366,2026-05-26,recent-2026-Apr-Jul,"MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation",https://arxiv.org/abs/2605.27366,True,core,update_forgetting,model,retrieval_access;experience_skill_learning;evaluation_diagnosis,benchmark_diagnosis;experience_skill_policy,6,agent-memory
2605.27760,2026-05-26,recent-2026-Apr-Jul,SkillGrad: Optimizing Agent Skills Like Gradient Descent,https://arxiv.org/abs/2605.27760,False,core,update_forgetting,model,representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis,experience_skill_policy,5,long-term-memory
2605.27762,2026-05-26,recent-2026-Apr-Jul,PEAM: Parametric Embodied Agent Memory through Contrastive Internalization of Experience in Minecraft,https://arxiv.org/abs/2605.27762,True,core,update_forgetting,model,retrieval_access;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui,experience_skill_policy;execution_multimodal,5,agent-memory
2605.27825,2026-05-27,recent-2026-Apr-Jul,MRMMIA: Membership Inference Attacks on Memory in Chat Agents,https://arxiv.org/abs/2605.27825,True,core,security_privacy,model,retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust,security_governance,4,agent-memory
2605.28046,2026-05-27,recent-2026-Apr-Jul,MemCog: From Memory-as-Tool to Memory-as-Cognition in Conversational Agents,https://arxiv.org/abs/2605.28046,True,core,execution_state,model,retrieval_access;evaluation_diagnosis;multimodal_embodied_gui,,4,agent-memory
2605.29341,2026-05-28,recent-2026-Apr-Jul,WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction,https://arxiv.org/abs/2605.29341,True,core,update_forgetting,model,retrieval_access;update_forgetting;execution_state;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,benchmark_diagnosis;execution_multimodal,5,agent-memory
2605.29630,2026-05-28,recent-2026-Apr-Jul,Entity-Collision: A Stratified Protocol for Attributing Retrieval Lift in Agent Memory,https://arxiv.org/abs/2605.29630,True,core,update_forgetting,model,retrieval_access;evaluation_diagnosis;security_privacy_trust;systems_efficiency,retrieval_representation,7,agent-memory;memory-evaluation
2605.29640,2026-05-28,recent-2026-Apr-Jul,VikingMem: A Memory Base Management System for Stateful LLM-based Applications,https://arxiv.org/abs/2605.29640,True,core,update_forgetting,model,retrieval_access;update_forgetting;evaluation_diagnosis;systems_efficiency,,6,agent-memory;memory-evaluation
2605.29960,2026-05-28,recent-2026-Apr-Jul,Hijacking Agent Memory: Stealthy Trojan Attacks Through Conversational Interaction,https://arxiv.org/abs/2605.29960,True,core,update_forgetting,model,evaluation_diagnosis;security_privacy_trust,security_governance,5,agent-memory;long-term-memory
2605.30058,2026-05-28,recent-2026-Apr-Jul,HEART-Bench: Do LLM Agents Exhibit Human-like Psychology?,https://arxiv.org/abs/2605.30058,False,core,experience_learning,model,representation_organization;update_forgetting;execution_state;evaluation_diagnosis;multimodal_embodied_gui,,2,episodic-memory
2605.30621,2026-05-28,recent-2026-Apr-Jul,Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM Agents,https://arxiv.org/abs/2605.30621,False,core,update_forgetting,model,update_forgetting;execution_state;experience_skill_learning;systems_efficiency,experience_skill_policy,2,procedural-memory
2607.00017,2026-05-28,recent-2026-Apr-Jul,Learning User-Aware Recall: Personalized Retrieval in Long-Term Conversational Memory,https://arxiv.org/abs/2607.00017,True,core,experience_learning,model,retrieval_access;evaluation_diagnosis;multimodal_embodied_gui,retrieval_representation;experience_skill_policy;personal_shared,5,long-term-memory
2605.30690,2026-05-29,recent-2026-Apr-Jul,ElasticMem: Latent Memory as a Learnable Resource for LLM Agents,https://arxiv.org/abs/2605.30690,True,core,representation,model,retrieval_access;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,experience_skill_policy,8,long-term-memory
2605.30711,2026-05-29,recent-2026-Apr-Jul,SAGE: A Novelty Gate for Efficient Memory Evolution in Agentic LLMs,https://arxiv.org/abs/2605.30711,True,core,representation,model,retrieval_access;systems_efficiency,systems_efficiency,3,agent-memory
2605.30858,2026-05-29,recent-2026-Apr-Jul,ForecastCompass: Guiding Agentic Forecasting with Adaptive Factor Memory,https://arxiv.org/abs/2605.30858,True,core,representation,model,retrieval_access;representation_organization;experience_skill_learning;multimodal_embodied_gui,experience_skill_policy;execution_multimodal,2,agent-memory
2605.31075,2026-05-29,recent-2026-Apr-Jul,Task-Focused Memorization for Multimodal Agents,https://arxiv.org/abs/2605.31075,True,core,representation,model,experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui,execution_multimodal,4,agent-memory
2606.00619,2026-05-30,recent-2026-Apr-Jul,MemPro: Agentic Memory Systems as Evolvable Programs,https://arxiv.org/abs/2606.00619,True,core,representation,model,retrieval_access;representation_organization;execution_state;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,experience_skill_policy,6,agent-memory
2606.00734,2026-05-30,recent-2026-Apr-Jul,EMA: Approximate Nearest Neighbor Search with General Attribute Filtering and Dynamic Updates,https://arxiv.org/abs/2606.00734,False,core,representation,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,retrieval_representation;update_forgetting,4,agent-memory
2606.00756,2026-05-30,recent-2026-Apr-Jul,CoMIC: Collaborative Memory and Insights Circulation for Long-Horizon LLM Agents in Cloud-Edge Systems,https://arxiv.org/abs/2606.00756,True,core,representation,model,representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;multi_agent_shared;multimodal_embodied_gui;systems_efficiency,execution_multimodal;systems_efficiency;personal_shared,2,long-term-memory
2606.01138,2026-05-31,recent-2026-Apr-Jul,memorywire: A Vendor-Neutral Wire Format for Agent Memory Operations,https://arxiv.org/abs/2606.01138,True,core,representation,model,retrieval_access;update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;systems_efficiency,systems_efficiency,6,agent-memory
2606.01528,2026-06-01,recent-2026-Apr-Jul,Joint Agent Memory and Exploration Learning via Novelty Signals,https://arxiv.org/abs/2606.01528,True,core,representation,model,evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,experience_skill_policy,5,agent-memory
2606.01722,2026-06-01,recent-2026-Apr-Jul,Post-Deterministic Distributed Systems: A New Foundation for Trustworthy Autonomous Infrastructure,https://arxiv.org/abs/2606.01722,False,core,representation,model,retrieval_access;representation_organization;security_privacy_trust;multimodal_embodied_gui,retrieval_representation;security_governance,1,agent-memory
2606.02812,2026-06-01,recent-2026-Apr-Jul,Traj-Evolve: A Self-Evolving Multi-Agent System for Patient Trajectory Modeling in Lung Cancer Early Detection,https://arxiv.org/abs/2606.02812,False,core,representation,model,retrieval_access;representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multi_agent_shared;multimodal_embodied_gui,experience_skill_policy;personal_shared,3,agent-memory
2606.03197,2026-06-02,recent-2026-Apr-Jul,MemTrain: Self-Supervised Context Memory Training,https://arxiv.org/abs/2606.03197,True,core,update_forgetting,model,retrieval_access;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;systems_efficiency,,4,agent-memory
2606.03329,2026-06-02,recent-2026-Apr-Jul,InfoMem: Training Long-Context Memory Agents with Answer-Conditioned Information Gain,https://arxiv.org/abs/2606.03329,True,core,update_forgetting,model,retrieval_access;experience_skill_learning;evaluation_diagnosis;systems_efficiency,,5,agent-memory
2606.03374,2026-06-02,recent-2026-Apr-Jul,eMEM: A Hybrid Spatio-Temporal Memory System For Embodied Agents,https://arxiv.org/abs/2606.03374,True,core,execution_state,model,retrieval_access;representation_organization;update_forgetting;execution_state;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,execution_multimodal,6,agent-memory;memory-evaluation
2606.04120,2026-06-02,recent-2026-Apr-Jul,SaliMory: Orchestrating Cognitive Memory for Conversational Agents,https://arxiv.org/abs/2606.04120,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;experience_skill_learning,,5,agent-memory
2606.04315,2026-06-03,recent-2026-Apr-Jul,Exploring Cross-Scenario Generality of Agentic Memory Systems: Diagnostics and a Strong Baseline,https://arxiv.org/abs/2606.04315,True,core,execution_state,model,retrieval_access;execution_state;evaluation_diagnosis;systems_efficiency,benchmark_diagnosis,2,agent-memory
2606.04329,2026-06-03,recent-2026-Apr-Jul,From Untrusted Input to Trusted Memory: A Systematic Study of Memory Poisoning Attacks in LLM Agents,https://arxiv.org/abs/2606.04329,True,core,security_privacy,model,retrieval_access;evaluation_diagnosis;security_privacy_trust,benchmark_diagnosis;security_governance,3,long-term-memory
2606.04555,2026-06-03,recent-2026-Apr-Jul,Temporal Order Matters for Agentic Memory: Segment Trees for Long-Horizon Agents,https://arxiv.org/abs/2606.04555,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;execution_state;evaluation_diagnosis;systems_efficiency,execution_multimodal,4,agent-memory;memory-evaluation
2606.04628,2026-06-03,recent-2026-Apr-Jul,RAMPART: Registry-based Agentic Memory with Priority-Aware Runtime Transformation,https://arxiv.org/abs/2606.04628,True,core,update_forgetting,model,retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust;systems_efficiency,systems_efficiency,6,agent-memory
2606.04780,2026-06-03,recent-2026-Apr-Jul,PersonaTree: Structured Lifecycle Memory for Person Understanding in LLM Agents,https://arxiv.org/abs/2606.04780,True,core,experience_learning,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,retrieval_representation;update_forgetting,3,agent-memory;long-term-memory;memory-evaluation
2606.05513,2026-06-03,recent-2026-Apr-Jul,EpiEvolve: Self-Evolving Agents for Streaming Pandemic Forecasting under Regime Shifts,https://arxiv.org/abs/2606.05513,False,core,update_forgetting,model,retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis;security_privacy_trust,experience_skill_policy,5,episodic-memory
2606.28349,2026-06-03,recent-2026-Apr-Jul,HMARS: A Hierarchical Multi-Agent Memory System for Long-Context Reasoning,https://arxiv.org/abs/2606.28349,True,core,representation,model,retrieval_access;representation_organization;evaluation_diagnosis;multi_agent_shared,retrieval_representation;personal_shared,4,agent-memory
2606.05646,2026-06-04,recent-2026-Apr-Jul,Enhancing Software Engineering Through Closed-Loop Memory Optimization,https://arxiv.org/abs/2606.05646,True,core,update_forgetting,model,experience_skill_learning;evaluation_diagnosis;systems_efficiency,,4,episodic-memory
2606.05684,2026-06-04,recent-2026-Apr-Jul,AdaMEM: Test-Time Adaptive Memory for Language Agents,https://arxiv.org/abs/2606.05684,True,core,update_forgetting,model,retrieval_access;execution_state;experience_skill_learning;multimodal_embodied_gui;systems_efficiency,experience_skill_policy,6,agent-memory
2606.06054,2026-06-04,recent-2026-Apr-Jul,Beyond Similarity: Trustworthy Memory Search for Personal AI Agents,https://arxiv.org/abs/2606.06054,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;security_privacy_trust;systems_efficiency,retrieval_representation;security_governance,2,agent-memory
2606.06090,2026-06-04,recent-2026-Apr-Jul,Beyond Semantic Organization: Memory as Execution State Management for Long-Horizon Agents,https://arxiv.org/abs/2606.06090,True,core,execution_state,model,retrieval_access;representation_organization;execution_state;security_privacy_trust;multimodal_embodied_gui;systems_efficiency,retrieval_representation;execution_multimodal,6,agent-memory
2606.06240,2026-06-04,recent-2026-Apr-Jul,TOKI: A Bitemporal Operator Algebra for Contradiction Resolution in LLM-Agent Persistent Memory,https://arxiv.org/abs/2606.06240,True,core,update_forgetting,model,update_forgetting;security_privacy_trust,,2,long-term-memory
2606.06448,2026-06-04,recent-2026-Apr-Jul,Agent Memory: Characterization and System Implications of Stateful Long-Horizon Workloads,https://arxiv.org/abs/2606.06448,True,core,execution_state,model,retrieval_access;update_forgetting;execution_state;evaluation_diagnosis;systems_efficiency,execution_multimodal,2,agent-memory
2606.07402,2026-06-05,recent-2026-Apr-Jul,M$^3$Exam: Benchmarking Multimodal Memory for Realistic User-Agent Interactions,https://arxiv.org/abs/2606.07402,True,core,access,model,retrieval_access;representation_organization;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,benchmark_diagnosis;execution_multimodal,4,memory-evaluation
2606.09900,2026-06-05,recent-2026-Apr-Jul,"Less Context, More Accuracy: A Bi-Temporal Memory Engine for LLM Agents Where a Lean Retrieved Context Beats the Full History",https://arxiv.org/abs/2606.09900,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;security_privacy_trust;systems_efficiency,retrieval_representation,7,long-term-memory;memory-evaluation
2606.24896,2026-06-05,recent-2026-Apr-Jul,Why Memory Components Fail: Eight Years of License and Sustainability Events in Open-Source Data Infrastructure,https://arxiv.org/abs/2606.24896,True,core,access,model,representation_organization;experience_skill_learning;security_privacy_trust,retrieval_representation,1,agent-memory
2606.08367,2026-06-06,recent-2026-Apr-Jul,Emergence World: A Platform for Evaluating Long-Horizon Multi-Agent Autonomy,https://arxiv.org/abs/2606.08367,False,core,execution_state,model,retrieval_access;execution_state;evaluation_diagnosis;security_privacy_trust;multi_agent_shared,benchmark_diagnosis;execution_multimodal;personal_shared,3,long-term-memory
2606.09198,2026-06-08,recent-2026-Apr-Jul,MASS: Deep Research for Social Sciences with Memory-Augmented Social Simulation,https://arxiv.org/abs/2606.09198,True,core,experience_learning,model,retrieval_access;representation_organization;update_forgetting;execution_state;multimodal_embodied_gui,retrieval_representation,4,agent-memory
2606.09461,2026-06-08,recent-2026-Apr-Jul,H2HMem: A Multimodal Memory Benchmark for Agents in Human-Human Interactions,https://arxiv.org/abs/2606.09461,True,core,representation,model,retrieval_access;update_forgetting;evaluation_diagnosis;multimodal_embodied_gui,benchmark_diagnosis;execution_multimodal,3,memory-evaluation
2606.09483,2026-06-08,recent-2026-Apr-Jul,Memory Beyond Recall: A Dual-Process Cognitive Memory System for Self-Evolving LLM Agents,https://arxiv.org/abs/2606.09483,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis,retrieval_representation;experience_skill_policy,2,agent-memory;long-term-memory
2606.09774,2026-06-08,recent-2026-Apr-Jul,Auto-Configuring Scientific Simulators with Lightweight Coding-Agent Adapters,https://arxiv.org/abs/2606.09774,False,core,execution_state,model,retrieval_access;experience_skill_learning;systems_efficiency,experience_skill_policy,2,agent-memory
2606.10062,2026-06-08,recent-2026-Apr-Jul,Deployment-Time Memorization in Foundation-Model Agents,https://arxiv.org/abs/2606.10062,True,supporting,evaluation,model,retrieval_access;update_forgetting;evaluation_diagnosis;security_privacy_trust;systems_efficiency,,5,agent-memory
2606.10299,2026-06-09,recent-2026-Apr-Jul,What Spatial Memory Must Store: Occlusion as the Test for Language-Agent Memory,https://arxiv.org/abs/2606.10299,True,core,execution_state,model,retrieval_access,execution_multimodal,7,agent-memory
2606.10423,2026-06-09,recent-2026-Apr-Jul,WebChallenger: A Reliable and Efficient Generalist Web Agent,https://arxiv.org/abs/2606.10423,False,core,execution_state,model,representation_organization;experience_skill_learning;multimodal_embodied_gui;systems_efficiency,execution_multimodal;systems_efficiency,4,long-term-memory
2606.10532,2026-06-09,recent-2026-Apr-Jul,ActiveMem: Distributed Active Memory for Long-Horizon LLM Reasoning,https://arxiv.org/abs/2606.10532,True,core,execution_state,model,retrieval_access;update_forgetting;execution_state,execution_multimodal,3,agent-memory
2606.10577,2026-06-09,recent-2026-Apr-Jul,AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness,https://arxiv.org/abs/2606.10577,False,core,execution_state,model,retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui,execution_multimodal,6,agent-memory
2606.10677,2026-06-09,recent-2026-Apr-Jul,Infini Memory: Maintainable Topic Documents for Long-Term LLM Agent Memory,https://arxiv.org/abs/2606.10677,True,core,execution_state,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;systems_efficiency,retrieval_representation,3,agent-memory;long-term-memory
2606.11680,2026-06-10,recent-2026-Apr-Jul,Organize then Retrieve: Hierarchical Memory Navigation for Efficient Agents,https://arxiv.org/abs/2606.11680,True,core,execution_state,model,retrieval_access;representation_organization;execution_state;experience_skill_learning;multimodal_embodied_gui;systems_efficiency,retrieval_representation;execution_multimodal;systems_efficiency,5,agent-memory
2606.12290,2026-06-10,recent-2026-Apr-Jul,Selection Integrity for LLM Graph Memory: An Accumulability Criterion for Information-Flow-Blind Retrieval,https://arxiv.org/abs/2606.12290,True,core,execution_state,model,retrieval_access;representation_organization;security_privacy_trust;systems_efficiency,retrieval_representation;security_governance,0,agent-memory
2606.12703,2026-06-10,recent-2026-Apr-Jul,SMSR: Certified Defence Against Runtime Memory Poisoning in Persistent LLM Agent Systems,https://arxiv.org/abs/2606.12703,True,core,execution_state,model,retrieval_access;evaluation_diagnosis;security_privacy_trust,security_governance;systems_efficiency,3,long-term-memory
2606.12852,2026-06-11,recent-2026-Apr-Jul,WISE: A Long-Horizon Agent in Minecraft with Why-Which Reasoning,https://arxiv.org/abs/2606.12852,False,core,execution_state,model,retrieval_access;representation_organization;execution_state;multimodal_embodied_gui,execution_multimodal,3,episodic-memory
2606.12945,2026-06-11,recent-2026-Apr-Jul,Learning What to Remember: A Cognitively Grounded Multi-Factor Value Model for Agentic Memory,https://arxiv.org/abs/2606.12945,True,core,execution_state,model,retrieval_access;update_forgetting;evaluation_diagnosis;systems_efficiency,experience_skill_policy,9,agent-memory
2606.13177,2026-06-11,recent-2026-Apr-Jul,MemRefine: LLM-Guided Compression for Long-Term Agent Memory,https://arxiv.org/abs/2606.13177,True,core,update_forgetting,model,retrieval_access;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,execution_multimodal;systems_efficiency,4,agent-memory
2606.13392,2026-06-11,recent-2026-Apr-Jul,MiniMax Sparse Attention,https://arxiv.org/abs/2606.13392,False,supporting,execution_state,model,retrieval_access;representation_organization;multimodal_embodied_gui;systems_efficiency,,4,long-term-memory
2606.14470,2026-06-12,recent-2026-Apr-Jul,"GitOfThoughts: Version-Controlled Reasoning and Agent Memory You Can Replay, Diff, and Merge",https://arxiv.org/abs/2606.14470,True,supporting,execution_state,model,retrieval_access;representation_organization;evaluation_diagnosis;systems_efficiency,,6,agent-memory
2606.14571,2026-06-12,recent-2026-Apr-Jul,StreamMemBench: Streaming Evaluation of Agent Memory for Future-Oriented Assistance,https://arxiv.org/abs/2606.14571,True,supporting,execution_state,model,retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis,benchmark_diagnosis,4,agent-memory;memory-evaluation
2606.15071,2026-06-13,recent-2026-Apr-Jul,Quantum learning with a single-atom sensor,https://arxiv.org/abs/2606.15071,False,supporting,execution_state,model,systems_efficiency,experience_skill_policy,0,agent-memory
2606.15609,2026-06-14,recent-2026-Apr-Jul,FragFuse: Bypassing Access Control of Large Language Model Agents via Memory-Based Query Fragmentation and Fusion,https://arxiv.org/abs/2606.15609,True,supporting,execution_state,model,retrieval_access;evaluation_diagnosis;security_privacy_trust,,6,agent-memory;long-term-memory
2606.15903,2026-06-14,recent-2026-Apr-Jul,Control-Plane Placement Shapes Forgetting: An Architectural Study of Agent Memory Across Thirteen System Configurations,https://arxiv.org/abs/2606.15903,True,supporting,execution_state,model,retrieval_access;update_forgetting;evaluation_diagnosis;security_privacy_trust;systems_efficiency,benchmark_diagnosis;update_forgetting,8,agent-memory
2606.16903,2026-06-15,recent-2026-Apr-Jul,Directory-Aware Query and Maintenance in Vector Databases,https://arxiv.org/abs/2606.16903,False,supporting,execution_state,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;systems_efficiency,retrieval_representation,4,agent-memory
2606.17328,2026-06-15,recent-2026-Apr-Jul,MemTrace: Probing What Final Accuracy Misses in Long-Term Memory,https://arxiv.org/abs/2606.17328,True,supporting,execution_state,model,retrieval_access;execution_state;evaluation_diagnosis;systems_efficiency,,4,long-term-memory
2606.17628,2026-06-16,recent-2026-Apr-Jul,OPD-Evolver: Cultivating Holistic Agent Evolver via On-Policy Distillation,https://arxiv.org/abs/2606.17628,False,supporting,execution_state,model,retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis,experience_skill_policy,4,agent-memory
2606.18356,2026-06-16,recent-2026-Apr-Jul,"SafeClawBench: Separating Semantic, Audit-Evidence, and Sandbox Harm in Tool-Using LLM Agents",https://arxiv.org/abs/2606.18356,False,supporting,execution_state,model,representation_organization;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui,,7,long-term-memory
2606.18406,2026-06-16,recent-2026-Apr-Jul,CoreMem: Riemannian Retrieval and Fisher-Guided Distillation for Long-Term Memory in Dialogue Agents,https://arxiv.org/abs/2606.18406,True,supporting,execution_state,model,retrieval_access;representation_organization;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,retrieval_representation;experience_skill_policy;execution_multimodal,5,agent-memory
2606.18746,2026-06-17,recent-2026-Apr-Jul,What Must Generalist Agents Remember?,https://arxiv.org/abs/2606.18746,True,core,experience_learning,model,execution_state,,0,agent-memory
2606.18829,2026-06-17,recent-2026-Apr-Jul,GateMem: Benchmarking Memory Governance in Multi-Principal Shared-Memory Agents,https://arxiv.org/abs/2606.18829,True,supporting,shared_memory,model,retrieval_access;representation_organization;update_forgetting;execution_state;evaluation_diagnosis;security_privacy_trust;systems_efficiency,benchmark_diagnosis;security_governance,5,agent-memory;memory-evaluation
2606.18950,2026-06-17,recent-2026-Apr-Jul,RTSGameBench: An RTS Benchmark for Strategic Reasoning by Vision-Language Models,https://arxiv.org/abs/2606.18950,False,supporting,update_forgetting,model,representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multi_agent_shared,benchmark_diagnosis,3,agent-memory
2606.19409,2026-06-17,recent-2026-Apr-Jul,OpenRath: Session-Centered Runtime State for Agent Systems,https://arxiv.org/abs/2606.19409,False,core,representation,model,evaluation_diagnosis;security_privacy_trust;multi_agent_shared;systems_efficiency,systems_efficiency,3,agent-memory
2606.19847,2026-06-18,recent-2026-Apr-Jul,AtomMem: Building Simple and Effective Memory System for LLM Agents via Atomic Facts,https://arxiv.org/abs/2606.19847,True,core,representation,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;systems_efficiency,,2,long-term-memory
2606.19857,2026-06-18,recent-2026-Apr-Jul,Large Language Models Do Not Always Need Readable Language,https://arxiv.org/abs/2606.19857,False,supporting,representation,model,representation_organization;evaluation_diagnosis;multi_agent_shared;systems_efficiency,,4,agent-memory
2606.20047,2026-06-18,recent-2026-Apr-Jul,PACMS: Submodular Context Selection as a Pluggable Engine for LLM Agents,https://arxiv.org/abs/2606.20047,False,supporting,update_forgetting,model,retrieval_access;systems_efficiency,,2,long-term-memory
2606.20515,2026-06-18,recent-2026-Apr-Jul,S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence,https://arxiv.org/abs/2606.20515,False,core,representation,model,representation_organization;evaluation_diagnosis;multimodal_embodied_gui,execution_multimodal,6,agent-memory
2606.20954,2026-06-18,recent-2026-Apr-Jul,Learning What Not to Forget: Long-Horizon Agent Memory from a Few Kilobytes of Learning,https://arxiv.org/abs/2606.20954,True,core,representation,model,retrieval_access;update_forgetting;execution_state;evaluation_diagnosis;systems_efficiency,update_forgetting;experience_skill_policy;execution_multimodal,8,agent-memory
2606.21144,2026-06-19,recent-2026-Apr-Jul,AdaMem: Learning What to Remember for Personalized Long-Horizon LLM Agents,https://arxiv.org/abs/2606.21144,True,core,representation,model,representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;systems_efficiency,experience_skill_policy;execution_multimodal;personal_shared,5,long-term-memory
2606.21562,2026-06-19,recent-2026-Apr-Jul,Compressing Observation History into Agent Memory: Distilling Transformers into Recurrent Transformers,https://arxiv.org/abs/2606.21562,True,supporting,representation,model,representation_organization;execution_state;multimodal_embodied_gui;systems_efficiency,experience_skill_policy;systems_efficiency,2,agent-memory
2606.21649,2026-06-19,recent-2026-Apr-Jul,EvoEmbedding: Evolvable Representations for Long-Context Retrieval and Agentic Memory,https://arxiv.org/abs/2606.21649,True,supporting,representation,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis,retrieval_representation;experience_skill_policy,6,agent-memory
2606.22030,2026-06-20,recent-2026-Apr-Jul,Nous: A Predictive World Model for Long-Term Agent Memory,https://arxiv.org/abs/2606.22030,True,core,experience_learning,model,representation_organization;update_forgetting;evaluation_diagnosis;systems_efficiency,,5,agent-memory;memory-evaluation
2606.22263,2026-06-20,recent-2026-Apr-Jul,Revelio: Cost-Efficient Agentic Memory Safety Vulnerability Detection For Repository-Scale Codebases,https://arxiv.org/abs/2606.22263,True,supporting,security_privacy,model,evaluation_diagnosis;security_privacy_trust;systems_efficiency,security_governance;systems_efficiency,5,agent-memory
2606.22844,2026-06-22,recent-2026-Apr-Jul,RaMem: Contextual Reinstatement for Long-term Agentic Memory,https://arxiv.org/abs/2606.22844,True,core,execution_state,model,retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis,,7,agent-memory;long-term-memory;memory-evaluation
2606.22877,2026-06-22,recent-2026-Apr-Jul,DynamicMem: A Long-Horizon Memory Benchmark in Real-World Settings,https://arxiv.org/abs/2606.22877,True,supporting,security_privacy,model,retrieval_access;update_forgetting;execution_state;evaluation_diagnosis;security_privacy_trust;systems_efficiency,benchmark_diagnosis;execution_multimodal,6,memory-evaluation
2606.23127,2026-06-22,recent-2026-Apr-Jul,"Managing Procedural Memory in LLM Agents: Control, Adaptation, and Evaluation",https://arxiv.org/abs/2606.23127,True,core,evaluation,model,experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui,benchmark_diagnosis;experience_skill_policy,7,procedural-memory
2606.23195,2026-06-22,recent-2026-Apr-Jul,Memory Contagion: Cross-Temporal Propagation of Evaluator Bias via Agent Memory,https://arxiv.org/abs/2606.23195,True,supporting,security_privacy,model,retrieval_access;update_forgetting;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui,benchmark_diagnosis,4,agent-memory
2606.23283,2026-06-22,recent-2026-Apr-Jul,Towards Root Memories: Benchmarking and Enhancing Implicit Logical Memory Retrieval for Personalized LLMs,https://arxiv.org/abs/2606.23283,True,core,execution_state,model,retrieval_access;representation_organization;evaluation_diagnosis;systems_efficiency,benchmark_diagnosis;retrieval_representation;personal_shared,5,agent-memory
2606.24322,2026-06-23,recent-2026-Apr-Jul,"Securing LLM-Agent Long-Term Memory Against Poisoning: Non-Malleable, Origin-Bound Authority with Machine-Checked Guarantees",https://arxiv.org/abs/2606.24322,True,supporting,security_privacy,model,retrieval_access;evaluation_diagnosis;security_privacy_trust,security_governance,6,agent-memory;long-term-memory
2606.24535,2026-06-23,recent-2026-Apr-Jul,Governed Shared Memory for Multi-Agent LLM Systems,https://arxiv.org/abs/2606.24535,True,core,shared_memory,model,retrieval_access;update_forgetting;evaluation_diagnosis;security_privacy_trust;multi_agent_shared;systems_efficiency,security_governance;personal_shared,7,agent-memory
2606.24595,2026-06-23,recent-2026-Apr-Jul,MEMPROBE: Probing Long-Term Agent Memory via Hidden User-State Recovery,https://arxiv.org/abs/2606.24595,True,supporting,security_privacy,model,retrieval_access;representation_organization;execution_state;evaluation_diagnosis;security_privacy_trust;systems_efficiency,,5,agent-memory;long-term-memory
2606.24775,2026-06-23,recent-2026-Apr-Jul,Are We Ready For An Agent-Native Memory System?,https://arxiv.org/abs/2606.24775,True,core,update_forgetting,model,retrieval_access;representation_organization;update_forgetting;execution_state;evaluation_diagnosis;security_privacy_trust;systems_efficiency,,6,agent-memory
2606.25115,2026-06-23,recent-2026-Apr-Jul,Forget to Improve: On-Device LLM-Agent Continual Learning via Budget-Curated Memory,https://arxiv.org/abs/2606.25115,True,supporting,security_privacy,model,retrieval_access;update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui;systems_efficiency,update_forgetting;experience_skill_policy;systems_efficiency,2,agent-memory
2606.25161,2026-06-23,recent-2026-Apr-Jul,TRUSTMEM: Learning Trustworthy Memory Consolidation for LLM Agents with Long-Term Memory,https://arxiv.org/abs/2606.25161,True,core,update_forgetting,model,update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui,update_forgetting;experience_skill_policy;security_governance,7,agent-memory;long-term-memory
2606.25206,2026-06-23,recent-2026-Apr-Jul,RAVEN: Long-Horizon Reasoning & Navigation with a Visuo-Spatio-Temporal Memory,https://arxiv.org/abs/2606.25206,True,core,execution_state,model,retrieval_access;representation_organization;execution_state;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,execution_multimodal,2,agent-memory
2606.26627,2026-06-25,recent-2026-Apr-Jul,Agents That Know Too Much: A Data-Centric Survey of Privacy in LLM Agents,https://arxiv.org/abs/2606.26627,False,supporting,security_privacy,model,retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust,benchmark_diagnosis;security_governance,2,agent-memory
2606.26790,2026-06-25,recent-2026-Apr-Jul,OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning,https://arxiv.org/abs/2606.26790,False,core,update_forgetting,model,retrieval_access;representation_organization;execution_state;experience_skill_learning;multimodal_embodied_gui;systems_efficiency,experience_skill_policy,6,procedural-memory
2606.27499,2026-06-25,recent-2026-Apr-Jul,DMV-Bench: Diagnosing Long-Horizon Multimodal Agents' Visual Memory with Incidental Cue Injection,https://arxiv.org/abs/2606.27499,True,core,execution_state,model,retrieval_access;execution_state;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui,benchmark_diagnosis;execution_multimodal,6,agent-memory
2606.28781,2026-06-27,recent-2026-Apr-Jul,HyphaeDB: A Living Knowledge Topology for Agent-First Memory,https://arxiv.org/abs/2606.28781,True,core,execution_state,model,retrieval_access;representation_organization;multi_agent_shared;systems_efficiency,systems_efficiency,0,agent-memory
2606.28971,2026-06-27,recent-2026-Apr-Jul,Self-Evolving Agentic Image Restoration via Deliberate Planning and Intuitive Execution,https://arxiv.org/abs/2606.28971,False,core,update_forgetting,model,retrieval_access;representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,experience_skill_policy,3,episodic-memory
2606.29774,2026-06-29,recent-2026-Apr-Jul,Analytic Concept-Centric Memory for Agentic Embodied Manipulation,https://arxiv.org/abs/2606.29774,True,core,update_forgetting,model,retrieval_access;representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui,execution_multimodal,5,agent-memory;memory-evaluation
2606.29778,2026-06-29,recent-2026-Apr-Jul,Mandol: An Agglomerative Agent Memory System for Long-Term Conversations,https://arxiv.org/abs/2606.29778,True,core,execution_state,model,retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;systems_efficiency,,4,agent-memory
2606.29788,2026-06-29,recent-2026-Apr-Jul,MemLeak: Diagnosing Information Leaks in Multimodal Agent Memory,https://arxiv.org/abs/2606.29788,True,core,update_forgetting,model,representation_organization;update_forgetting;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui,benchmark_diagnosis;execution_multimodal;security_governance,7,agent-memory
2606.29824,2026-06-29,recent-2026-Apr-Jul,Neural Procedural Memory: Empowering LLM Agents with Implicit Activation Steering,https://arxiv.org/abs/2606.29824,True,core,update_forgetting,model,retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui,experience_skill_policy,5,agent-memory;procedural-memory
2606.29914,2026-06-29,recent-2026-Apr-Jul,MemDelta: Controlled Baselines and Hidden Confounds in Agent Memory Evaluation,https://arxiv.org/abs/2606.29914,True,supporting,security_privacy,model,retrieval_access;update_forgetting;evaluation_diagnosis;systems_efficiency,benchmark_diagnosis,7,agent-memory;memory-evaluation
2606.29961,2026-06-29,recent-2026-Apr-Jul,DuoMem: Towards Capable On-Device Memory Agents via Dual-Space Distillation,https://arxiv.org/abs/2606.29961,True,core,update_forgetting,model,experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui,experience_skill_policy;systems_efficiency,5,agent-memory
2606.30296,2026-06-29,recent-2026-Apr-Jul,ManimAgent: Self-Evolving Multimodal Agents for Visual Education,https://arxiv.org/abs/2606.30296,False,core,execution_state,model,retrieval_access;update_forgetting;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,experience_skill_policy;execution_multimodal,6,episodic-memory
2606.30566,2026-06-29,recent-2026-Apr-Jul,Forensic Trajectory Signatures for Agent Memory Poisoning Detection,https://arxiv.org/abs/2606.30566,True,core,update_forgetting,model,retrieval_access;execution_state;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui,security_governance,4,agent-memory;long-term-memory
2606.30639,2026-06-29,recent-2026-Apr-Jul,Self-Evolving World Models for LLM Agent Planning,https://arxiv.org/abs/2606.30639,False,core,update_forgetting,model,retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis,experience_skill_policy,4,episodic-memory
2606.31046,2026-06-30,recent-2026-Apr-Jul,OpenLife: Toward Open-World Artificial Life with Autonomous LLM Agents,https://arxiv.org/abs/2606.31046,False,core,experience_learning,model,retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis;systems_efficiency,,2,long-term-memory
2606.31612,2026-06-30,recent-2026-Apr-Jul,What Memory Do GUI Agents Really Need? From Passive Records to Active Task-Driving States,https://arxiv.org/abs/2606.31612,True,core,update_forgetting,model,retrieval_access;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,benchmark_diagnosis;execution_multimodal,3,agent-memory
2607.02579,2026-06-30,recent-2026-Apr-Jul,When Not to Write Memory: Governing False Promotion from Correlated Agent Traces,https://arxiv.org/abs/2607.02579,True,core,update_forgetting,model,retrieval_access;update_forgetting;evaluation_diagnosis;security_privacy_trust;systems_efficiency,update_forgetting;security_governance,4,agent-memory
2607.00454,2026-07-01,recent-2026-Apr-Jul,Agri-SAGE: Simulation-Grounded Multi-Agent LLM for Context-Aware Agricultural Advisory Generation,https://arxiv.org/abs/2607.00454,False,core,update_forgetting,model,retrieval_access;evaluation_diagnosis;multi_agent_shared;multimodal_embodied_gui;systems_efficiency,personal_shared,6,episodic-memory
2607.01047,2026-07-01,recent-2026-Apr-Jul,Conversable Complexity: Agentic LLM Collectives as Interpretable Substrates,https://arxiv.org/abs/2607.01047,False,core,execution_state,model,retrieval_access;experience_skill_learning;evaluation_diagnosis,personal_shared,3,long-term-memory
2607.01071,2026-07-01,recent-2026-Apr-Jul,MemSyco-Bench: Benchmarking Sycophancy in Agent Memory,https://arxiv.org/abs/2607.01071,True,core,execution_state,model,retrieval_access;update_forgetting;evaluation_diagnosis;systems_efficiency,benchmark_diagnosis,4,agent-memory;memory-evaluation
2607.01523,2026-07-01,recent-2026-Apr-Jul,Multi-Head Recurrent Memory Agents,https://arxiv.org/abs/2607.01523,True,core,update_forgetting,model,update_forgetting;evaluation_diagnosis;security_privacy_trust;systems_efficiency,,7,agent-memory
2607.01709,2026-07-02,recent-2026-Apr-Jul,COMFYCLAW: Self-Evolving Skill Harnesses for Image Generation Workflows,https://arxiv.org/abs/2607.01709,False,core,update_forgetting,model,retrieval_access;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,experience_skill_policy,5,agent-memory
2607.01916,2026-07-02,recent-2026-Apr-Jul,ContextSniper: AntTrail's Token-Efficient Code Memory for Repository-Level Program Repair,https://arxiv.org/abs/2607.01916,True,core,update_forgetting,model,retrieval_access;representation_organization;evaluation_diagnosis;systems_efficiency,systems_efficiency,6,agent-memory
2607.01935,2026-07-02,recent-2026-Apr-Jul,A-TMA: Decoupling State-Aware Memory Failures in Long-Term Agent Memory,https://arxiv.org/abs/2607.01935,True,core,update_forgetting,model,retrieval_access;update_forgetting;evaluation_diagnosis,,3,agent-memory;long-term-memory
2607.03726,2026-07-04,recent-2026-Apr-Jul,SelfMem: Self-Optimizing Memory for AI Agents,https://arxiv.org/abs/2607.03726,True,core,update_forgetting,model,retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency,,7,agent-memory
2607.04089,2026-07-05,recent-2026-Apr-Jul,PLACEMEM: Toward a Compute-Aware Memory Plane for Lifelong Agents,https://arxiv.org/abs/2607.04089,True,core,update_forgetting,model,retrieval_access;update_forgetting;evaluation_diagnosis;security_privacy_trust;systems_efficiency,,2,agent-memory
2607.04391,2026-07-05,recent-2026-Apr-Jul,Memory-Orchestrated Semantic System (MOSS): An Auditable Agentic Memory Architecture,https://arxiv.org/abs/2607.04391,True,core,update_forgetting,model,retrieval_access;representation_organization;systems_efficiency,,0,agent-memory
2607.05029,2026-07-06,recent-2026-Apr-Jul,Your Agent's Memories Are Not Its Own: Forged Reasoning Attacks on LLM Agent Memory and Defenses,https://arxiv.org/abs/2607.05029,True,core,update_forgetting,model,retrieval_access;evaluation_diagnosis;security_privacy_trust,security_governance,6,agent-memory;long-term-memory
2607.05577,2026-07-06,recent-2026-Apr-Jul,Narrative World Model: Narratology-Grounded Writer Memory for Long-Form Fiction,https://arxiv.org/abs/2607.05577,True,core,update_forgetting,model,retrieval_access;representation_organization;evaluation_diagnosis,,5,agent-memory
2607.06595,2026-07-06,recent-2026-Apr-Jul,When Agents Remember Too Much: Memory Poisoning Attacks on Large Language Model Agents,https://arxiv.org/abs/2607.06595,True,core,update_forgetting,model,retrieval_access;execution_state;security_privacy_trust;systems_efficiency,security_governance,4,agent-memory;long-term-memory
2607.06195,2026-07-07,recent-2026-Apr-Jul,LogicHunter: Testing LLM Agent Frameworks with an Agentic Oracle,https://arxiv.org/abs/2607.06195,False,core,update_forgetting,model,retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui,,7,memory-evaluation
2607.07108,2026-07-08,recent-2026-Apr-Jul,Seeing and Reflecting: Multimodal Memory-Enhanced Agent Collaboration for Recommendation,https://arxiv.org/abs/2607.07108,True,core,update_forgetting,model,representation_organization;update_forgetting;experience_skill_learning;multimodal_embodied_gui,execution_multimodal,5,agent-memory
2607.08032,2026-07-09,recent-2026-Apr-Jul,"What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents",https://arxiv.org/abs/2607.08032,True,core,update_forgetting,model,retrieval_access;update_forgetting;evaluation_diagnosis;systems_efficiency,update_forgetting,5,agent-memory
2607.08716,2026-07-09,recent-2026-Apr-Jul,Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents,https://arxiv.org/abs/2607.08716,True,core,update_forgetting,model,retrieval_access;representation_organization;execution_state;evaluation_diagnosis;multimodal_embodied_gui,execution_multimodal,6,agent-memory
1 arxiv_id published period title url title_central screen_relevance screen_problem screen_source themes title_themes evidence_score matched_queries
2 2501.13956 2025-01-20 2025-H1 Zep: A Temporal Knowledge Graph Architecture for Agent Memory https://arxiv.org/abs/2501.13956 True core update_forgetting model retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis;systems_efficiency retrieval_representation;systems_efficiency 7 agent-memory
3 2501.12485 2025-01-21 2025-H1 R2D2: Remembering, Replaying and Dynamic Decision Making with a Reflective Agentic Memory https://arxiv.org/abs/2501.12485 True core update_forgetting model representation_organization;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency 4 agent-memory
4 2501.18160 2025-01-30 2025-H1 RepoAudit: An Autonomous LLM-Agent for Repository-Level Code Auditing https://arxiv.org/abs/2501.18160 False core execution_state model evaluation_diagnosis;systems_efficiency 6 agent-memory
5 2502.06975 2025-02-10 2025-H1 Position: Episodic Memory is the Missing Piece for Long-Term LLM Agents https://arxiv.org/abs/2502.06975 True core execution_state model retrieval_access;systems_efficiency 0 episodic-memory
6 2502.10177 2025-02-14 2025-H1 STMA: A Spatio-Temporal Memory Agent for Long-Horizon Embodied Task Planning https://arxiv.org/abs/2502.10177 True core update_forgetting model representation_organization;execution_state;evaluation_diagnosis;multimodal_embodied_gui execution_multimodal 6 agent-memory
7 2502.10550 2025-02-14 2025-H1 Memory, Benchmark & Robots: A Benchmark for Solving Complex Tasks with Reinforcement Learning https://arxiv.org/abs/2502.10550 True core representation model retrieval_access;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui benchmark_diagnosis;experience_skill_policy;execution_multimodal 2 agent-memory;memory-evaluation
8 2502.12110 2025-02-17 2025-H1 A-MEM: Agentic Memory for LLM Agents https://arxiv.org/abs/2502.12110 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis;systems_efficiency 6 agent-memory
9 2502.13172 2025-02-17 2025-H1 Unveiling Privacy Risks in LLM Agent Memory https://arxiv.org/abs/2502.13172 True core security_privacy model security_privacy_trust security_governance 2 agent-memory
10 2502.16090 2025-02-22 2025-H1 Echo: A Large Language Model with Temporal Episodic Memory https://arxiv.org/abs/2502.16090 True core execution_state model retrieval_access;evaluation_diagnosis;multi_agent_shared;multimodal_embodied_gui 6 episodic-memory
11 2502.19145 2025-02-26 2025-H1 Multi-Agent Security Tax: Trading Off Security and Collaboration Capabilities in Multi-Agent Systems https://arxiv.org/abs/2502.19145 False core security_privacy model evaluation_diagnosis;security_privacy_trust;multi_agent_shared security_governance;personal_shared 2 agent-memory
12 2503.03704 2025-03-05 2025-H1 Memory Injection Attacks on LLM Agents via Query-Only Interaction https://arxiv.org/abs/2503.03704 True core execution_state model retrieval_access;security_privacy_trust;multimodal_embodied_gui security_governance 2 agent-memory
13 2503.04392 2025-03-06 2025-H1 AgentSafe: Safeguarding Large Language Model-based Multi-agent Systems via Hierarchical Data Management https://arxiv.org/abs/2503.04392 False core security_privacy model representation_organization;security_privacy_trust;multi_agent_shared retrieval_representation;personal_shared 5 agent-memory
14 2503.21760 2025-03-27 2025-H1 MemInsight: Autonomous Memory Augmentation for LLM Agents https://arxiv.org/abs/2503.21760 True core experience_learning model retrieval_access;representation_organization 5 long-term-memory
15 2503.23514 2025-03-30 2025-H1 If an LLM Were a Character, Would It Know Its Own Story? Evaluating Lifelong Learning in LLMs https://arxiv.org/abs/2503.23514 False core update_forgetting model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;multi_agent_shared benchmark_diagnosis;experience_skill_policy 6 episodic-memory
16 2504.09283 2025-04-12 2025-H1 Semantic Commit: Helping Users Update Intent Specifications for AI Memory at Scale https://arxiv.org/abs/2504.09283 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis update_forgetting 2 agent-memory
17 2504.16946 2025-04-18 2025-H1 MobileCity: An Efficient Framework for Large-Scale Urban Behavior Simulation https://arxiv.org/abs/2504.16946 False core experience_learning model evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency systems_efficiency 6 agent-memory
18 2504.15263 2025-04-21 2025-H1 Interpretable Locomotion Prediction in Construction Using a Memory-Driven LLM Agent With Chain-of-Thought Reasoning https://arxiv.org/abs/2504.15263 True core experience_learning model evaluation_diagnosis;multimodal_embodied_gui 5 long-term-memory
19 2504.20117 2025-04-28 2025-H1 ResearchCodeAgent: An LLM Multi-Agent System for Automated Codification of Research Methodologies https://arxiv.org/abs/2504.20117 False core update_forgetting model retrieval_access;execution_state;evaluation_diagnosis;multi_agent_shared retrieval_representation;personal_shared 7 long-term-memory
20 2505.00472 2025-05-01 2025-H1 UserCentrix: An Agentic Memory-augmented AI Framework for Smart Spaces https://arxiv.org/abs/2505.00472 True core update_forgetting model experience_skill_learning;security_privacy_trust;multimodal_embodied_gui;systems_efficiency 2 agent-memory
21 2505.05177 2025-05-08 2025-H1 MARK: Memory Augmented Refinement of Knowledge https://arxiv.org/abs/2505.05177 True core update_forgetting model retrieval_access;representation_organization;systems_efficiency systems_efficiency 1 agent-memory
22 2505.12923 2025-05-19 2025-H1 The Traitors: Deception and Trust in Multi-Agent Language Model Simulations https://arxiv.org/abs/2505.12923 False core experience_learning model retrieval_access;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multi_agent_shared security_governance;personal_shared 2 long-term-memory
23 2505.13941 2025-05-20 2025-H1 MLZero: A Multi-Agent System for End-to-end Machine Learning Automation https://arxiv.org/abs/2505.13941 False core update_forgetting model evaluation_diagnosis;multi_agent_shared;multimodal_embodied_gui experience_skill_policy;personal_shared 5 episodic-memory
24 2505.14163 2025-05-20 2025-H1 DSMentor: Enhancing Data Science Agents with Curriculum Learning and Online Knowledge Accumulation https://arxiv.org/abs/2505.14163 False core experience_learning model retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui experience_skill_policy;systems_efficiency 6 long-term-memory
25 2505.16067 2025-05-21 2025-H1 How Memory Management Impacts LLM Agents: An Empirical Study of Experience-Following Behavior https://arxiv.org/abs/2505.16067 True core experience_learning model retrieval_access;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui benchmark_diagnosis;experience_skill_policy 3 agent-memory
26 2505.16348 2025-05-22 2025-H1 Embodied Agents Meet Personalization: Investigating Challenges and Solutions Through the Lens of Memory Utilization https://arxiv.org/abs/2505.16348 True core experience_learning model retrieval_access;representation_organization;execution_state;evaluation_diagnosis;multimodal_embodied_gui execution_multimodal;personal_shared 4 agent-memory;episodic-memory
27 2505.18279 2025-05-23 2025-H1 Collaborative Memory: Multi-User Memory Sharing in LLM Agents with Dynamic Access Control https://arxiv.org/abs/2505.18279 True supporting shared_memory model representation_organization;update_forgetting;evaluation_diagnosis;security_privacy_trust;multi_agent_shared;systems_efficiency personal_shared 0 long-term-memory
28 2505.19237 2025-05-25 2025-H1 Sensorimotor Self-Recognition in Multimodal Large Language Model-Driven Robots https://arxiv.org/abs/2505.19237 False core representation model representation_organization;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui execution_multimodal 1 episodic-memory
29 2505.19436 2025-05-26 2025-H1 Task Memory Engine: Spatial Memory for Robust Multi-Step LLM Agents https://arxiv.org/abs/2505.19436 True core representation model retrieval_access;representation_organization;execution_state;evaluation_diagnosis;security_privacy_trust execution_multimodal 7 long-term-memory
30 2505.20231 2025-05-26 2025-H1 MemGuide: Intent-Driven Memory Selection for Goal-Oriented Multi-Session LLM Agents https://arxiv.org/abs/2505.20231 True supporting representation model retrieval_access;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency execution_multimodal 4 long-term-memory
31 2505.22657 2025-05-28 2025-H1 3DLLM-Mem: Long-Term Spatial-Temporal Memory for Embodied 3D Large Language Model https://arxiv.org/abs/2505.22657 True core representation model execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency execution_multimodal 7 episodic-memory
32 2506.01442 2025-06-02 2025-H1 Agentic Episodic Control https://arxiv.org/abs/2506.01442 False core representation model retrieval_access;representation_organization;experience_skill_learning;systems_efficiency 5 episodic-memory
33 2506.01936 2025-06-02 2025-H1 Should Decision-Makers Reveal Classifiers in Online Strategic Classification? https://arxiv.org/abs/2506.01936 False supporting representation model 2 agent-memory
34 2506.07398 2025-06-09 2025-H1 G-Memory: Tracing Hierarchical Memory for Multi-Agent Systems https://arxiv.org/abs/2506.07398 True core representation model retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis;multi_agent_shared;multimodal_embodied_gui retrieval_representation;personal_shared 3 agent-memory
35 2506.12088 2025-06-10 2025-H1 Risks & Benefits of LLMs & GenAI for Platform Integrity, Healthcare Diagnostics, Financial Trust and Compliance, Cybersecurity, Privacy & AI Safety: A Comprehensive Survey, Roadmap & Implementation Blueprint https://arxiv.org/abs/2506.12088 False peripheral security_privacy model evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui benchmark_diagnosis;security_governance 3 agent-memory
36 2506.17318 2025-06-18 2025-H1 Context manipulation attacks : Web agents are susceptible to corrupted memory https://arxiv.org/abs/2506.17318 True supporting representation model retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui execution_multimodal;security_governance 5 agent-memory
37 2506.17338 2025-06-19 2025-H1 PBFT-Backed Semantic Voting for Multi-Agent Memory Pruning https://arxiv.org/abs/2506.17338 True supporting representation model retrieval_access;update_forgetting;evaluation_diagnosis;multi_agent_shared;systems_efficiency personal_shared 4 agent-memory
38 2506.19433 2025-06-24 2025-H1 Mem4Nav: Boosting Vision-and-Language Navigation in Urban Environments with a Hierarchical Spatial-Cognition Long-Short Memory System https://arxiv.org/abs/2506.19433 True core update_forgetting model retrieval_access;representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency retrieval_representation;execution_multimodal 6 long-term-memory
39 2507.02259 2025-07-03 baseline-2025H2-Jan2026 MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent https://arxiv.org/abs/2507.02259 True core update_forgetting model update_forgetting;experience_skill_learning;systems_efficiency experience_skill_policy 2 agent-memory
40 2507.04172 2025-07-05 baseline-2025H2-Jan2026 Gathering Teams of Bounded Memory Agents on a Line https://arxiv.org/abs/2507.04172 False peripheral systems_cost model multimodal_embodied_gui 0 agent-memory
41 2507.10562 2025-07-05 baseline-2025H2-Jan2026 SAMEP: A Secure Protocol for Persistent Context Sharing Across AI Agents https://arxiv.org/abs/2507.10562 False core update_forgetting model retrieval_access;security_privacy_trust;multi_agent_shared;systems_efficiency 5 agent-memory
42 2507.05257 2025-07-07 baseline-2025H2-Jan2026 Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions https://arxiv.org/abs/2507.05257 True core update_forgetting model retrieval_access;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis benchmark_diagnosis 2 agent-memory
43 2507.05445 2025-07-07 baseline-2025H2-Jan2026 A Systematization of Security Vulnerabilities in Computer Use Agents https://arxiv.org/abs/2507.05445 False peripheral security_privacy model evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui security_governance 2 agent-memory
44 2507.07957 2025-07-10 baseline-2025H2-Jan2026 MIRIX: Multi-Agent Memory System for LLM-Based Agents https://arxiv.org/abs/2507.07957 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multi_agent_shared;multimodal_embodied_gui;systems_efficiency personal_shared 6 agent-memory
45 2507.16713 2025-07-22 baseline-2025H2-Jan2026 A Pragmatist Robot: Learning to Plan Tasks by Experiencing the Real World https://arxiv.org/abs/2507.16713 False core update_forgetting model retrieval_access;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui experience_skill_policy;execution_multimodal 8 long-term-memory
46 2507.22925 2025-07-23 baseline-2025H2-Jan2026 Hierarchical Memory for High-Efficiency Long-Term Reasoning in LLM Agents https://arxiv.org/abs/2507.22925 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;systems_efficiency retrieval_representation 6 long-term-memory
47 2507.21407 2025-07-29 baseline-2025H2-Jan2026 Graph-Augmented Large Language Model Agents: Current Progress and Future Prospects https://arxiv.org/abs/2507.21407 False core update_forgetting model retrieval_access;representation_organization;execution_state;security_privacy_trust;multi_agent_shared;multimodal_embodied_gui retrieval_representation 0 long-term-memory
48 2508.00031 2025-07-30 baseline-2025H2-Jan2026 Git Context Controller: Manage the Context of LLM-based Agents like Git https://arxiv.org/abs/2508.00031 False core update_forgetting model retrieval_access;representation_organization;execution_state;evaluation_diagnosis;systems_efficiency 5 agent-memory
49 2508.01287 2025-08-02 baseline-2025H2-Jan2026 Exploitation Is All You Need... for Exploration https://arxiv.org/abs/2508.01287 False peripheral systems_cost model representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis 4 agent-memory
50 2508.01415 2025-08-02 baseline-2025H2-Jan2026 RoboMemory: A Brain-inspired Multi-memory Agentic Framework for Interactive Environmental Learning in Physical Embodied Systems https://arxiv.org/abs/2508.01415 True core update_forgetting model representation_organization;update_forgetting;execution_state;multimodal_embodied_gui;systems_efficiency experience_skill_policy;execution_multimodal 6 agent-memory
51 2508.03341 2025-08-05 baseline-2025H2-Jan2026 What Deserves Memory: Adaptive Memory Distillation for LLM Agents https://arxiv.org/abs/2508.03341 True supporting experience_learning model update_forgetting;experience_skill_learning;systems_efficiency experience_skill_policy 3 episodic-memory
52 2508.05002 2025-08-07 baseline-2025H2-Jan2026 AgenticData: An Agentic Data Analytics System for Heterogeneous Data https://arxiv.org/abs/2508.05002 False supporting execution_state model retrieval_access;representation_organization;execution_state;evaluation_diagnosis;multi_agent_shared 5 agent-memory
53 2508.07010 2025-08-09 baseline-2025H2-Jan2026 Narrative Memory in Machines: Multi-Agent Arc Extraction in Serialized TV https://arxiv.org/abs/2508.07010 True supporting execution_state model representation_organization;update_forgetting;multi_agent_shared;multimodal_embodied_gui personal_shared 4 episodic-memory
54 2508.08997 2025-08-12 baseline-2025H2-Jan2026 Intrinsic Memory Agents: Heterogeneous Multi-Agent LLM Systems through Structured Contextual Memory https://arxiv.org/abs/2508.08997 True core update_forgetting model representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multi_agent_shared;systems_efficiency retrieval_representation;personal_shared 3 agent-memory
55 2508.09486 2025-08-13 baseline-2025H2-Jan2026 Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding https://arxiv.org/abs/2508.09486 True supporting experience_learning model retrieval_access;experience_skill_learning;multimodal_embodied_gui execution_multimodal 0 agent-memory;episodic-memory
56 2508.12630 2025-08-18 baseline-2025H2-Jan2026 Semantic Anchoring in Agentic Memory: Leveraging Linguistic Structures for Persistent Conversational Context https://arxiv.org/abs/2508.12630 True supporting execution_state model retrieval_access;representation_organization;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency retrieval_representation;execution_multimodal 7 agent-memory
57 2508.13250 2025-08-18 baseline-2025H2-Jan2026 Explicit v.s. Implicit Memory: Exploring Multi-hop Complex Reasoning Over Personalized Information https://arxiv.org/abs/2508.13250 True core update_forgetting model retrieval_access;evaluation_diagnosis personal_shared 5 agent-memory
58 2508.15294 2025-08-21 baseline-2025H2-Jan2026 A Multi-Memory Segment System for Generating High-Quality Long-Term Memory Content in Agents https://arxiv.org/abs/2508.15294 True core update_forgetting model retrieval_access;evaluation_diagnosis 3 agent-memory
59 2508.16153 2025-08-22 baseline-2025H2-Jan2026 Memento: Fine-tuning LLM Agents without Fine-tuning LLMs https://arxiv.org/abs/2508.16153 False core update_forgetting model retrieval_access;update_forgetting;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency 3 episodic-memory
60 2508.19005 2025-08-26 baseline-2025H2-Jan2026 Building Self-Evolving Agents via Experience-Driven Lifelong Learning: A Framework and Benchmark https://arxiv.org/abs/2508.19005 False supporting execution_state model representation_organization;experience_skill_learning;evaluation_diagnosis benchmark_diagnosis;experience_skill_policy 2 agent-memory
61 2509.00997 2025-08-31 baseline-2025H2-Jan2026 Supporting Our AI Overlords: Redesigning Data Systems to be Agent-First https://arxiv.org/abs/2509.00997 False supporting execution_state model retrieval_access;systems_efficiency 0 agent-memory
62 2509.11914 2025-09-15 baseline-2025H2-Jan2026 EgoMem: Lifelong Memory Agent for Full-duplex Omnimodal Models https://arxiv.org/abs/2509.11914 True core update_forgetting model retrieval_access;update_forgetting;multimodal_embodied_gui 6 agent-memory
63 2509.21224 2025-09-25 baseline-2025H2-Jan2026 What Do LLM Agents Do When Left Alone? Evidence of Spontaneous Meta-Cognitive Patterns https://arxiv.org/abs/2509.21224 False core execution_state model evaluation_diagnosis;multimodal_embodied_gui 2 long-term-memory
64 2509.25250 2025-09-27 baseline-2025H2-Jan2026 Memory Management and Contextual Consistency for Long-Running Low-Code Agents https://arxiv.org/abs/2509.25250 True core update_forgetting model update_forgetting;multimodal_embodied_gui;systems_efficiency 5 agent-memory
65 2509.24704 2025-09-29 baseline-2025H2-Jan2026 MemGen: Weaving Generative Latent Memory for Self-Evolving Agents https://arxiv.org/abs/2509.24704 True core update_forgetting model retrieval_access;representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;systems_efficiency experience_skill_policy 2 agent-memory
66 2510.02373 2025-09-29 baseline-2025H2-Jan2026 A-MemGuard: A Proactive Defense Framework for LLM-Based Agent Memory https://arxiv.org/abs/2510.02373 True core security_privacy model representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;systems_efficiency 6 agent-memory
67 2510.03612 2025-10-04 baseline-2025H2-Jan2026 Cross-Modal Content Optimization for Steering Web Agent Preferences https://arxiv.org/abs/2510.03612 False core update_forgetting model evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui execution_multimodal 7 agent-memory
68 2510.04618 2025-10-06 baseline-2025H2-Jan2026 Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models https://arxiv.org/abs/2510.04618 False core update_forgetting model representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis;systems_efficiency experience_skill_policy 8 agent-memory
69 2510.04851 2025-10-06 baseline-2025H2-Jan2026 LEGOMem: Modular Procedural Memory for Multi-agent LLM Systems for Workflow Automation https://arxiv.org/abs/2510.04851 True core execution_state model retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis;multi_agent_shared experience_skill_policy;personal_shared 2 agent-memory
70 2510.05520 2025-10-07 baseline-2025H2-Jan2026 CAM: A Constructivist View of Agentic Memory for LLM-Based Reading Comprehension https://arxiv.org/abs/2510.05520 True core access model retrieval_access;representation_organization;systems_efficiency 2 agent-memory
71 2510.08081 2025-10-09 baseline-2025H2-Jan2026 AutoQual: An LLM Agent for Automated Discovery of Interpretable Features for Review Quality Assessment https://arxiv.org/abs/2510.08081 False core experience_learning model retrieval_access;experience_skill_learning 3 long-term-memory
72 2510.09720 2025-10-10 baseline-2025H2-Jan2026 Preference-Aware Memory Update for Long-Term LLM Agents https://arxiv.org/abs/2510.09720 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;systems_efficiency update_forgetting 5 long-term-memory
73 2510.15966 2025-10-12 baseline-2025H2-Jan2026 PISA: A Pragmatic Psych-Inspired Unified Memory System for Enhanced AI Agency https://arxiv.org/abs/2510.15966 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis 4 agent-memory
74 2510.11144 2025-10-13 baseline-2025H2-Jan2026 $How^{2}$: How to learn from procedural How-to questions https://arxiv.org/abs/2510.11144 False core experience_learning model execution_state;experience_skill_learning;evaluation_diagnosis;systems_efficiency experience_skill_policy 2 agent-memory
75 2510.13896 2025-10-14 baseline-2025H2-Jan2026 GenCellAgent: Generalizable, Training-Free Cellular Image Segmentation via Large Language Model Agents https://arxiv.org/abs/2510.13896 False core shared_memory model representation_organization;evaluation_diagnosis;multi_agent_shared;multimodal_embodied_gui 5 long-term-memory
76 2510.15620 2025-10-17 baseline-2025H2-Jan2026 On-device Semantic Selection Made Low Latency and Memory Efficient with Monolithic Forwarding https://arxiv.org/abs/2510.15620 False core execution_state model retrieval_access;evaluation_diagnosis;systems_efficiency systems_efficiency 6 agent-memory
77 2510.18515 2025-10-21 baseline-2025H2-Jan2026 Socialized Learning and Emergent Behaviors in Multi-Agent Systems based on Multimodal Large Language Models https://arxiv.org/abs/2510.18515 False core shared_memory model retrieval_access;representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multi_agent_shared;multimodal_embodied_gui;systems_efficiency experience_skill_policy;execution_multimodal;personal_shared 5 episodic-memory
78 2510.19747 2025-10-22 baseline-2025H2-Jan2026 Review of Tools for Zero-Code LLM Based Application Development https://arxiv.org/abs/2510.19747 False core shared_memory model multimodal_embodied_gui 1 agent-memory
79 2510.19897 2025-10-22 baseline-2025H2-Jan2026 Learning from Supervision with Semantic and Episodic Memory: A Reflective Approach to Agent Adaptation https://arxiv.org/abs/2510.19897 True core representation model update_forgetting;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency experience_skill_policy 4 episodic-memory
80 2510.23730 2025-10-27 baseline-2025H2-Jan2026 Evaluating Long-Term Memory for Long-Context Question Answering https://arxiv.org/abs/2510.23730 True core representation model retrieval_access;experience_skill_learning;evaluation_diagnosis;systems_efficiency benchmark_diagnosis 2 agent-memory;episodic-memory
81 2510.25423 2025-10-29 baseline-2025H2-Jan2026 What Challenges Do Developers Face in AI Agent Systems? An Empirical Study on Stack Overflow & GitHub Issues https://arxiv.org/abs/2510.25423 False core representation model retrieval_access;execution_state;evaluation_diagnosis benchmark_diagnosis 2 agent-memory
82 2510.26536 2025-10-30 baseline-2025H2-Jan2026 RoboOS-NeXT: A Unified Memory-based Framework for Lifelong, Scalable, and Robust Multi-Robot Collaboration https://arxiv.org/abs/2510.26536 True core representation model retrieval_access;representation_organization;execution_state;multi_agent_shared;multimodal_embodied_gui execution_multimodal;systems_efficiency 4 agent-memory
83 2510.27418 2025-10-31 baseline-2025H2-Jan2026 Dynamic Affective Memory Management for Personalized LLM Agents https://arxiv.org/abs/2510.27418 True core representation model retrieval_access;representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis personal_shared 3 long-term-memory
84 2511.01448 2025-11-03 baseline-2025H2-Jan2026 LiCoMemory: Lightweight and Cognitive Agentic Memory for Efficient Long-Term Reasoning https://arxiv.org/abs/2511.01448 True core representation model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;systems_efficiency systems_efficiency 6 agent-memory;long-term-memory
85 2511.02424 2025-11-04 baseline-2025H2-Jan2026 ReAcTree: Hierarchical LLM Agent Trees with Control Flow for Long-Horizon Task Planning https://arxiv.org/abs/2511.02424 False core representation model retrieval_access;representation_organization;execution_state;multimodal_embodied_gui retrieval_representation;execution_multimodal 9 episodic-memory
86 2511.03475 2025-11-05 baseline-2025H2-Jan2026 ContextPilot: Fast Long-Context Inference via Context Reuse https://arxiv.org/abs/2511.03475 False core access model retrieval_access;representation_organization;evaluation_diagnosis;multi_agent_shared;systems_efficiency 5 agent-memory
87 2511.06179 2025-11-09 baseline-2025H2-Jan2026 MemoriesDB: A Temporal-Semantic-Relational Database for Long-Term Agent Memory / Modeling Experience as a Graph of Temporal-Semantic Surfaces https://arxiv.org/abs/2511.06179 True core experience_learning model retrieval_access;representation_organization;experience_skill_learning;systems_efficiency retrieval_representation;experience_skill_policy 0 agent-memory
88 2511.07587 2025-11-10 baseline-2025H2-Jan2026 Beyond Fact Retrieval: Episodic Memory for RAG with Generative Semantic Workspaces https://arxiv.org/abs/2511.07587 True core representation model retrieval_access;representation_organization;evaluation_diagnosis;systems_efficiency retrieval_representation 6 episodic-memory
89 2511.08301 2025-11-11 baseline-2025H2-Jan2026 Smarter Together: Creating Agentic Communities of Practice through Shared Experiential Learning https://arxiv.org/abs/2511.08301 False core experience_learning model experience_skill_learning;evaluation_diagnosis;multi_agent_shared experience_skill_policy 5 agent-memory
90 2511.12027 2025-11-15 baseline-2025H2-Jan2026 GCAgent: Long-Video Understanding via Schematic and Narrative Episodic Memory https://arxiv.org/abs/2511.12027 True core execution_state model retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency execution_multimodal 6 episodic-memory
91 2511.12997 2025-11-17 baseline-2025H2-Jan2026 WebCoach: Self-Evolving Web Agents with Cross-Session Memory Guidance https://arxiv.org/abs/2511.12997 True core update_forgetting model retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui experience_skill_policy;execution_multimodal 4 episodic-memory
92 2511.16108 2025-11-20 baseline-2025H2-Jan2026 SkyRL-Agent: Efficient RL Training for Multi-turn LLM Agent https://arxiv.org/abs/2511.16108 False core update_forgetting model retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency experience_skill_policy;systems_efficiency 6 agent-memory
93 2511.17775 2025-11-21 baseline-2025H2-Jan2026 Episodic Memory in Agentic Frameworks: Suggesting Next Tasks https://arxiv.org/abs/2511.17775 True core update_forgetting model retrieval_access;multimodal_embodied_gui 0 episodic-memory
94 2511.21730 2025-11-21 baseline-2025H2-Jan2026 A Benchmark for Procedural Memory Retrieval in Language Agents https://arxiv.org/abs/2511.21730 True core access model retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis benchmark_diagnosis;retrieval_representation;experience_skill_policy 5 procedural-memory
95 2511.18112 2025-11-22 baseline-2025H2-Jan2026 EchoVLA: Synergistic Declarative Memory for VLA-Driven Mobile Manipulation https://arxiv.org/abs/2511.18112 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui 4 episodic-memory
96 2511.18423 2025-11-23 baseline-2025H2-Jan2026 General Agentic Memory Via Deep Research https://arxiv.org/abs/2511.18423 True core update_forgetting model retrieval_access;experience_skill_learning;multimodal_embodied_gui retrieval_representation 3 agent-memory
97 2511.19192 2025-11-24 baseline-2025H2-Jan2026 AME: An Efficient Heterogeneous Agentic Memory Engine for Smartphones https://arxiv.org/abs/2511.19192 True core update_forgetting model retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui;systems_efficiency systems_efficiency 4 agent-memory
98 2511.20297 2025-11-25 baseline-2025H2-Jan2026 Improving Language Agents through BREW https://arxiv.org/abs/2511.20297 False core update_forgetting model retrieval_access;representation_organization;execution_state;evaluation_diagnosis;systems_efficiency 2 agent-memory
99 2511.20857 2025-11-25 baseline-2025H2-Jan2026 Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory https://arxiv.org/abs/2511.20857 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui benchmark_diagnosis;experience_skill_policy 5 memory-evaluation
100 2512.00742 2025-11-30 baseline-2025H2-Jan2026 On the Regulatory Potential of User Interfaces for AI Agent Governance https://arxiv.org/abs/2512.00742 False core access model representation_organization;security_privacy_trust security_governance 0 agent-memory
101 2512.02227 2025-12-01 baseline-2025H2-Jan2026 Orchestration Framework for Financial Agents: From Algorithmic Trading to Agentic Trading https://arxiv.org/abs/2512.02227 False core access model representation_organization 1 agent-memory
102 2512.02228 2025-12-01 baseline-2025H2-Jan2026 STRIDE: A Systematic Framework for Selecting AI Modalities -- Agentic AI, AI Assistants, or LLM Calls https://arxiv.org/abs/2512.02228 False core access model representation_organization;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency 4 long-term-memory
103 2512.02425 2025-12-02 baseline-2025H2-Jan2026 WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning https://arxiv.org/abs/2512.02425 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;multimodal_embodied_gui execution_multimodal 8 agent-memory;episodic-memory
104 2512.02458 2025-12-02 baseline-2025H2-Jan2026 Vision to Geometry: 3D Spatial Memory for Sequential Embodied MLLM Reasoning and Exploration https://arxiv.org/abs/2512.02458 True core update_forgetting model retrieval_access;evaluation_diagnosis;multimodal_embodied_gui execution_multimodal 3 agent-memory
105 2512.03627 2025-12-03 baseline-2025H2-Jan2026 MemVerse: Multimodal Memory for Lifelong Learning Agents https://arxiv.org/abs/2512.03627 True core experience_learning model retrieval_access;representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency experience_skill_policy;execution_multimodal 4 agent-memory
106 2512.04668 2025-12-04 baseline-2025H2-Jan2026 Topology Matters: Measuring Memory Leakage in Multi-Agent LLMs https://arxiv.org/abs/2512.04668 True core execution_state model representation_organization;evaluation_diagnosis;security_privacy_trust;multi_agent_shared;multimodal_embodied_gui security_governance;personal_shared 4 agent-memory
107 2512.06688 2025-12-07 baseline-2025H2-Jan2026 PersonaMem-v2: Towards Personalized Intelligence via Learning Implicit User Personas and Agentic Memory https://arxiv.org/abs/2512.06688 True core application model experience_skill_learning;systems_efficiency experience_skill_policy;personal_shared 6 agent-memory
108 2512.09458 2025-12-10 baseline-2025H2-Jan2026 Architectures for Building Agentic AI https://arxiv.org/abs/2512.09458 False core execution_state model execution_state;security_privacy_trust;multi_agent_shared;multimodal_embodied_gui;systems_efficiency 1 agent-memory
109 2512.10166 2025-12-10 baseline-2025H2-Jan2026 Emergent Collective Memory in Decentralized Multi-Agent AI Systems https://arxiv.org/abs/2512.10166 True core update_forgetting model representation_organization;evaluation_diagnosis;multi_agent_shared personal_shared 7 agent-memory
110 2512.10696 2025-12-11 baseline-2025H2-Jan2026 Remember Me, Refine Me: A Dynamic Procedural Memory Framework for Experience-Driven Agent Evolution https://arxiv.org/abs/2512.10696 True core update_forgetting model retrieval_access;representation_organization;experience_skill_learning;systems_efficiency experience_skill_policy 7 agent-memory;procedural-memory
111 2512.11303 2025-12-12 baseline-2025H2-Jan2026 Unifying Dynamic Tool Creation and Cross-Task Experience Sharing through Cognitive Memory Architecture https://arxiv.org/abs/2512.11303 True core update_forgetting model retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis;multi_agent_shared;systems_efficiency experience_skill_policy 8 agent-memory;episodic-memory
112 2512.12686 2025-12-14 baseline-2025H2-Jan2026 Memoria: A Scalable Agentic Memory Framework for Personalized Conversational AI https://arxiv.org/abs/2512.12686 True core access model representation_organization;experience_skill_learning;systems_efficiency systems_efficiency;personal_shared 0 agent-memory
113 2512.12818 2025-12-14 baseline-2025H2-Jan2026 Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects https://arxiv.org/abs/2512.12818 True core execution_state model retrieval_access;representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui retrieval_representation 7 agent-memory;memory-evaluation
114 2512.12856 2025-12-14 baseline-2025H2-Jan2026 Forgetful but Faithful: A Cognitive Memory Architecture and Benchmark for Privacy-Aware Generative Agents https://arxiv.org/abs/2512.12856 True core update_forgetting model retrieval_access;update_forgetting;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui;systems_efficiency benchmark_diagnosis;update_forgetting;security_governance 2 agent-memory
115 2512.12967 2025-12-15 baseline-2025H2-Jan2026 QwenLong-L1.5: Post-Training Recipe for Long-Context Reasoning and Memory Management https://arxiv.org/abs/2512.12967 True core update_forgetting model retrieval_access;experience_skill_learning;evaluation_diagnosis;systems_efficiency 7 agent-memory
116 2512.13564 2025-12-15 baseline-2025H2-Jan2026 Memory in the Age of AI Agents https://arxiv.org/abs/2512.13564 True core access model retrieval_access;update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multi_agent_shared;multimodal_embodied_gui;systems_efficiency 3 agent-memory;memory-evaluation
117 2512.16301 2025-12-18 baseline-2025H2-Jan2026 Adaptation of Agentic AI: A Survey of Post-Training, Memory, and Skills https://arxiv.org/abs/2512.16301 True core experience_learning model retrieval_access;experience_skill_learning;evaluation_diagnosis;systems_efficiency benchmark_diagnosis;experience_skill_policy 4 long-term-memory
118 2512.16962 2025-12-18 baseline-2025H2-Jan2026 MemoryGraft: Persistent Compromise of LLM Agents via Poisoned Experience Retrieval https://arxiv.org/abs/2512.16962 True core update_forgetting model retrieval_access;experience_skill_learning;evaluation_diagnosis;security_privacy_trust retrieval_representation;experience_skill_policy;security_governance 3 agent-memory;long-term-memory
119 2512.18337 2025-12-20 baseline-2025H2-Jan2026 Towards Efficient Agents: A Co-Design of Inference Architecture and System https://arxiv.org/abs/2512.18337 False core execution_state model representation_organization;execution_state;evaluation_diagnosis;systems_efficiency systems_efficiency 4 agent-memory
120 2512.18571 2025-12-21 baseline-2025H2-Jan2026 ESearch-R1: Learning Cost-Aware MLLM Agents for Interactive Embodied Search via Reinforcement Learning https://arxiv.org/abs/2512.18571 False core update_forgetting model retrieval_access;execution_state;experience_skill_learning;multimodal_embodied_gui;systems_efficiency retrieval_representation;experience_skill_policy;execution_multimodal;systems_efficiency 6 episodic-memory
121 2512.18746 2025-12-21 baseline-2025H2-Jan2026 MemEvolve: Meta-Evolution of Agent Memory Systems https://arxiv.org/abs/2512.18746 True core update_forgetting model retrieval_access;experience_skill_learning;evaluation_diagnosis experience_skill_policy 2 agent-memory
122 2512.18950 2025-12-22 baseline-2025H2-Jan2026 Learning Hierarchical Procedural Memory for LLM Agents through Bayesian Selection and Contrastive Refinement https://arxiv.org/abs/2512.18950 True core update_forgetting model representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis;systems_efficiency retrieval_representation;experience_skill_policy 5 procedural-memory
123 2512.19537 2025-12-22 baseline-2025H2-Jan2026 Event Extraction in Large Language Model https://arxiv.org/abs/2512.19537 False core execution_state model retrieval_access;representation_organization;evaluation_diagnosis;multimodal_embodied_gui 3 agent-memory
124 2512.20111 2025-12-23 baseline-2025H2-Jan2026 ABBEL: Learning Natural-Language Belief States for Memory-Efficient Interaction https://arxiv.org/abs/2512.20111 False core update_forgetting model update_forgetting;execution_state;experience_skill_learning;systems_efficiency experience_skill_policy;systems_efficiency 7 agent-memory
125 2512.21567 2025-12-25 baseline-2025H2-Jan2026 Beyond Heuristics: A Decision-Theoretic Framework for Agent Memory Management https://arxiv.org/abs/2512.21567 True core update_forgetting model retrieval_access;representation_organization;evaluation_diagnosis;systems_efficiency 3 agent-memory
126 2512.22716 2025-12-27 baseline-2025H2-Jan2026 Memento 2: Learning by Stateful Reflective Memory https://arxiv.org/abs/2512.22716 True core update_forgetting model retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency experience_skill_policy 2 episodic-memory
127 2512.23343 2025-12-29 baseline-2025H2-Jan2026 AI Meets Brain: Memory Systems from Cognitive Neuroscience to Autonomous Agents https://arxiv.org/abs/2512.23343 True core representation model retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui;systems_efficiency 2 agent-memory
128 2601.01885 2026-01-05 baseline-2025H2-Jan2026 Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents https://arxiv.org/abs/2601.01885 True core update_forgetting model retrieval_access;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;systems_efficiency experience_skill_policy 5 agent-memory;long-term-memory
129 2601.02577 2026-01-05 baseline-2025H2-Jan2026 Orchestral AI: A Framework for Agent Orchestration https://arxiv.org/abs/2601.02577 False core representation model representation_organization;systems_efficiency 0 agent-memory
130 2601.02732 2026-01-06 baseline-2025H2-Jan2026 Agentic Memory Enhanced Recursive Reasoning for Root Cause Localization in Microservices https://arxiv.org/abs/2601.02732 True core update_forgetting model multi_agent_shared;systems_efficiency 5 agent-memory
131 2601.02744 2026-01-06 baseline-2025H2-Jan2026 SYNAPSE: Empowering LLM Agents with Episodic-Semantic Memory via Spreading Activation https://arxiv.org/abs/2601.02744 True core update_forgetting model retrieval_access;evaluation_diagnosis 6 agent-memory
132 2601.03236 2026-01-06 baseline-2025H2-Jan2026 MAGMA: A Multi-Graph based Agentic Memory Architecture for AI Agents https://arxiv.org/abs/2601.03236 True core update_forgetting model retrieval_access;representation_organization;execution_state;multimodal_embodied_gui retrieval_representation 4 agent-memory
133 2601.03543 2026-01-07 baseline-2025H2-Jan2026 EvolMem: A Cognitive-Driven Benchmark for Multi-Session Dialogue Memory https://arxiv.org/abs/2601.03543 True core representation model evaluation_diagnosis;multimodal_embodied_gui benchmark_diagnosis 6 agent-memory
134 2601.03785 2026-01-07 baseline-2025H2-Jan2026 Membox: Weaving Topic Continuity into Long-Range Memory for LLM Agents https://arxiv.org/abs/2601.03785 True core experience_learning model retrieval_access;representation_organization;update_forgetting 4 agent-memory
135 2601.04170 2026-01-07 baseline-2025H2-Jan2026 Agent Drift: Quantifying Behavioral Degradation in Multi-Agent LLM Systems Over Extended Interactions https://arxiv.org/abs/2601.04170 False supporting execution_state model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;multi_agent_shared;systems_efficiency personal_shared 1 episodic-memory
136 2601.05504 2026-01-09 baseline-2025H2-Jan2026 Memory Poisoning Attack and Defense on Memory Based LLM-Agents https://arxiv.org/abs/2601.05504 True supporting security_privacy model retrieval_access;evaluation_diagnosis;security_privacy_trust security_governance 6 long-term-memory
137 2601.06282 2026-01-09 baseline-2025H2-Jan2026 Amory: Building Coherent Narrative-Driven Agent Memory through Agentic Reasoning https://arxiv.org/abs/2601.06282 True core experience_learning model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;systems_efficiency 8 agent-memory
138 2601.06377 2026-01-10 baseline-2025H2-Jan2026 HiMem: Hierarchical Long-Term Memory for LLM Long-Horizon Agents https://arxiv.org/abs/2601.06377 True core experience_learning model retrieval_access;representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;systems_efficiency retrieval_representation;execution_multimodal 6 episodic-memory
139 2601.06411 2026-01-10 baseline-2025H2-Jan2026 Structured Episodic Event Memory https://arxiv.org/abs/2601.06411 True core experience_learning model retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust retrieval_representation 6 episodic-memory
140 2601.10744 2026-01-11 baseline-2025H2-Jan2026 Explore with Long-term Memory: A Benchmark and Multimodal LLM-based Reinforcement Learning Framework for Embodied Exploration https://arxiv.org/abs/2601.10744 True supporting execution_state model retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui benchmark_diagnosis;experience_skill_policy;execution_multimodal 4 agent-memory;episodic-memory
141 2601.07470 2026-01-12 baseline-2025H2-Jan2026 Learning How to Remember: A Meta-Cognitive Management Method for Structured and Transferable Agent Memory https://arxiv.org/abs/2601.07470 True core experience_learning model representation_organization;execution_state;experience_skill_learning retrieval_representation;experience_skill_policy 4 agent-memory
142 2601.07779 2026-01-12 baseline-2025H2-Jan2026 OS-Symphony: A Holistic Framework for Robust and Generalist Computer-Using Agent https://arxiv.org/abs/2601.07779 False supporting execution_state model retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui 6 agent-memory
143 2601.08160 2026-01-13 baseline-2025H2-Jan2026 SwiftMem: Fast Agentic Memory via Query-aware Indexing https://arxiv.org/abs/2601.08160 True core experience_learning model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;systems_efficiency retrieval_representation 5 agent-memory
144 2601.08323 2026-01-13 baseline-2025H2-Jan2026 AtomMem : Learnable Dynamic Agentic Memory with Atomic Memory Operation https://arxiv.org/abs/2601.08323 True core experience_learning model representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis experience_skill_policy 4 agent-memory
145 2601.09113 2026-01-14 baseline-2025H2-Jan2026 The AI Hippocampus: How Far are We From Human Memory? https://arxiv.org/abs/2601.09113 True supporting experience_learning model retrieval_access;representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multi_agent_shared;multimodal_embodied_gui;systems_efficiency benchmark_diagnosis 2 agent-memory
146 2601.09636 2026-01-14 baseline-2025H2-Jan2026 PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records https://arxiv.org/abs/2601.09636 False core execution_state model representation_organization;evaluation_diagnosis;multimodal_embodied_gui retrieval_representation;execution_multimodal;personal_shared 5 agent-memory
147 2602.06051 2026-01-14 baseline-2025H2-Jan2026 CAST: Character-and-Scene Episodic Memory for Agents https://arxiv.org/abs/2602.06051 True core representation model retrieval_access;representation_organization;experience_skill_learning 6 agent-memory;episodic-memory
148 2602.06052 2026-01-14 baseline-2025H2-Jan2026 Rethinking Memory Mechanisms of Foundation Agents in the Second Half: A Survey https://arxiv.org/abs/2602.06052 True core access model retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis benchmark_diagnosis 2 agent-memory
149 2601.10702 2026-01-15 baseline-2025H2-Jan2026 Grounding Agent Memory in Contextual Intent https://arxiv.org/abs/2601.10702 True core update_forgetting model retrieval_access;representation_organization;execution_state;evaluation_diagnosis 6 agent-memory
150 2601.11854 2026-01-17 baseline-2025H2-Jan2026 ATOD: An Evaluation Framework and Benchmark for Agentic Task-Oriented Dialogue Systems https://arxiv.org/abs/2601.11854 False core representation model execution_state;evaluation_diagnosis benchmark_diagnosis 4 agent-memory
151 2601.12771 2026-01-19 baseline-2025H2-Jan2026 Who Does This Name Remind You of ? Nationality Prediction via Large Language Model Associative Memory https://arxiv.org/abs/2601.12771 True core update_forgetting model retrieval_access;multi_agent_shared;multimodal_embodied_gui 5 agent-memory
152 2601.14192 2026-01-20 baseline-2025H2-Jan2026 Toward Efficient Agents: Memory, Tool learning, and Planning https://arxiv.org/abs/2601.14192 True core update_forgetting model retrieval_access;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;systems_efficiency experience_skill_policy;systems_efficiency 3 agent-memory
153 2601.14735 2026-01-21 baseline-2025H2-Jan2026 Optimizing FaaS Platforms for MCP-enabled Agentic Workflows https://arxiv.org/abs/2601.14735 False core execution_state model retrieval_access;evaluation_diagnosis;multi_agent_shared;systems_efficiency 4 agent-memory
154 2601.16690 2026-01-23 baseline-2025H2-Jan2026 EMemBench: Interactive Benchmarking of Episodic Memory for VLM Agents https://arxiv.org/abs/2601.16690 True core experience_learning model retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui benchmark_diagnosis 6 agent-memory
155 2601.16872 2026-01-23 baseline-2025H2-Jan2026 From Atom to Community: Structured and Evolving Agent Memory for User Behavior Modeling https://arxiv.org/abs/2601.16872 True core update_forgetting model representation_organization;update_forgetting retrieval_representation;experience_skill_policy 4 agent-memory
156 2601.17887 2026-01-25 baseline-2025H2-Jan2026 When Personalization Legitimizes Risks: Uncovering Safety Vulnerabilities in Personalized Dialogue Agents https://arxiv.org/abs/2601.17887 False core execution_state model representation_organization;experience_skill_learning;evaluation_diagnosis;security_privacy_trust security_governance;personal_shared 6 long-term-memory
157 2601.18642 2026-01-26 baseline-2025H2-Jan2026 FadeMem: Biologically-Inspired Forgetting for Efficient Agent Memory https://arxiv.org/abs/2601.18642 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;security_privacy_trust;multimodal_embodied_gui;systems_efficiency update_forgetting;systems_efficiency 3 agent-memory
158 2601.20352 2026-01-28 baseline-2025H2-Jan2026 AMA: Adaptive Memory via Multi-Agent Collaboration https://arxiv.org/abs/2601.20352 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;multi_agent_shared;systems_efficiency experience_skill_policy;personal_shared 7 agent-memory;long-term-memory
159 2601.20465 2026-01-28 baseline-2025H2-Jan2026 BMAM: Brain-inspired Multi-Agent Memory Framework https://arxiv.org/abs/2601.20465 True core execution_state model retrieval_access;representation_organization;execution_state;evaluation_diagnosis;multi_agent_shared;systems_efficiency personal_shared 4 agent-memory
160 2601.21468 2026-01-29 baseline-2025H2-Jan2026 MemOCR: Layout-Aware Visual Memory for Efficient Long-Horizon Reasoning https://arxiv.org/abs/2601.21468 True core update_forgetting model representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency execution_multimodal;systems_efficiency 4 agent-memory
161 2601.21714 2026-01-29 baseline-2025H2-Jan2026 E-mem: Multi-agent based Episodic Context Reconstruction for LLM Agent Memory https://arxiv.org/abs/2601.21714 True core update_forgetting model retrieval_access;representation_organization;execution_state;evaluation_diagnosis;security_privacy_trust;multi_agent_shared;systems_efficiency personal_shared 2 agent-memory
162 2601.21841 2026-01-29 baseline-2025H2-Jan2026 Embodied Task Planning via Graph-Informed Action Generation with Large Language Models https://arxiv.org/abs/2601.21841 False core update_forgetting model retrieval_access;representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency retrieval_representation;execution_multimodal 7 agent-memory
163 2601.22964 2026-01-30 baseline-2025H2-Jan2026 EvoClinician: A Self-Evolving Agent for Multi-Turn Medical Diagnosis via Test-Time Evolutionary Learning https://arxiv.org/abs/2601.22964 False core update_forgetting model update_forgetting;experience_skill_learning;evaluation_diagnosis;systems_efficiency benchmark_diagnosis;experience_skill_policy 5 agent-memory
164 2601.22974 2026-01-30 baseline-2025H2-Jan2026 MiTa: A Hierarchical Multi-Agent Collaboration Framework with Memory-integrated and Task Allocation https://arxiv.org/abs/2601.22974 True core update_forgetting model representation_organization;update_forgetting;execution_state;multi_agent_shared;multimodal_embodied_gui retrieval_representation;personal_shared 4 episodic-memory
165 2601.23014 2026-01-30 baseline-2025H2-Jan2026 Mem-T: Densifying Rewards for Long-Horizon Memory Agents https://arxiv.org/abs/2601.23014 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;execution_state;experience_skill_learning;multimodal_embodied_gui;systems_efficiency execution_multimodal 3 agent-memory
166 2602.00352 2026-01-30 baseline-2025H2-Jan2026 DETOUR: An Interactive Benchmark for Dual-Agent Search and Reasoning https://arxiv.org/abs/2602.00352 False core access model retrieval_access;evaluation_diagnosis;multimodal_embodied_gui benchmark_diagnosis;retrieval_representation 4 agent-memory
167 2602.00364 2026-01-30 baseline-2025H2-Jan2026 "Someone Hid It": Query-Agnostic Black-Box Attacks on LLM-Based Retrieval https://arxiv.org/abs/2602.00364 False core access model retrieval_access;evaluation_diagnosis;security_privacy_trust;systems_efficiency retrieval_representation;security_governance 2 agent-memory
168 2602.00675 2026-01-31 baseline-2025H2-Jan2026 Factored Reasoning with Inner Speech and Persistent Memory for Evidence-Grounded Human-Robot Interaction https://arxiv.org/abs/2602.00675 True core execution_state model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency execution_multimodal 3 agent-memory
169 2602.01869 2026-02-02 transition-2026-Feb-Mar Skill-Pro: Learning Reusable Skills from Experience via Non-Parametric PPO for LLM Agents https://arxiv.org/abs/2602.01869 False core update_forgetting model update_forgetting;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency experience_skill_policy 3 procedural-memory
170 2602.02007 2026-02-02 transition-2026-Feb-Mar Beyond RAG for Agent Memory: Retrieval by Decoupling and Aggregation https://arxiv.org/abs/2602.02007 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;multimodal_embodied_gui;systems_efficiency retrieval_representation 2 agent-memory
171 2602.02164 2026-02-02 transition-2026-Feb-Mar Co-RedTeam: Orchestrated Security Discovery and Exploitation with LLM Agents https://arxiv.org/abs/2602.02164 False supporting security_privacy model representation_organization;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multi_agent_shared security_governance 7 long-term-memory
172 2602.02369 2026-02-02 transition-2026-Feb-Mar Live-Evo: Online Evolution of Agentic Memory from Continuous Feedback https://arxiv.org/abs/2602.02369 True core update_forgetting model retrieval_access;update_forgetting;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui 5 agent-memory
173 2602.02474 2026-02-02 transition-2026-Feb-Mar MemSkill: Learning and Evolving Memory Skills for Self-Evolving Agents https://arxiv.org/abs/2602.02474 True core update_forgetting model representation_organization;update_forgetting;experience_skill_learning;multimodal_embodied_gui;systems_efficiency experience_skill_policy 5 agent-memory
174 2602.03036 2026-02-03 transition-2026-Feb-Mar LatentMem: Customizing Latent Memory for Multi-Agent Systems https://arxiv.org/abs/2602.03036 True core update_forgetting model retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis;multi_agent_shared;systems_efficiency personal_shared 5 agent-memory
175 2602.03224 2026-02-03 transition-2026-Feb-Mar TAME: A Trustworthy Test-Time Evolution of Agent Memory with Systematic Benchmarking https://arxiv.org/abs/2602.03224 True core security_privacy model retrieval_access;update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multi_agent_shared;multimodal_embodied_gui benchmark_diagnosis;security_governance 2 agent-memory
176 2602.03315 2026-02-03 transition-2026-Feb-Mar Memora: A Harmonic Memory Representation Balancing Abstraction and Specificity https://arxiv.org/abs/2602.03315 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;systems_efficiency retrieval_representation 2 agent-memory
177 2602.04482 2026-02-04 transition-2026-Feb-Mar ProAgentBench: Evaluating LLM Agents for Proactive Assistance with Real-World Data https://arxiv.org/abs/2602.04482 False supporting application model representation_organization;evaluation_diagnosis;security_privacy_trust;systems_efficiency benchmark_diagnosis 7 long-term-memory
178 2602.04640 2026-02-04 transition-2026-Feb-Mar Towards Structured, State-Aware, and Execution-Grounded Reasoning for Software Engineering Agents https://arxiv.org/abs/2602.04640 False core update_forgetting model representation_organization;execution_state retrieval_representation 0 agent-memory
179 2603.00026 2026-02-04 transition-2026-Feb-Mar ActMem: Bridging the Gap Between Memory Retrieval and Reasoning in LLM Agents https://arxiv.org/abs/2603.00026 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis retrieval_representation 6 memory-evaluation
180 2602.05665 2026-02-05 transition-2026-Feb-Mar Graph-based Agent Memory: Taxonomy, Techniques, and Applications https://arxiv.org/abs/2602.05665 True core update_forgetting model retrieval_access;representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;systems_efficiency benchmark_diagnosis;retrieval_representation 5 agent-memory
181 2602.06025 2026-02-05 transition-2026-Feb-Mar Learning Query-Aware Budget-Tier Routing for Runtime Agent Memory https://arxiv.org/abs/2602.06025 True supporting application model retrieval_access;representation_organization;experience_skill_learning;systems_efficiency experience_skill_policy;systems_efficiency 2 agent-memory
182 2602.17692 2026-02-06 transition-2026-Feb-Mar Agentic Unlearning: When LLM Agent Meets Machine Unlearning https://arxiv.org/abs/2602.17692 False core update_forgetting model retrieval_access;update_forgetting;evaluation_diagnosis;multimodal_embodied_gui experience_skill_policy;security_governance 2 long-term-memory
183 2603.03296 2026-02-06 transition-2026-Feb-Mar PlugMem: A Task-Agnostic Plugin Memory Module for LLM Agents https://arxiv.org/abs/2603.03296 True core update_forgetting model retrieval_access;representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency 5 episodic-memory;long-term-memory
184 2602.07398 2026-02-07 transition-2026-Feb-Mar AgentSys: Secure and Dynamic LLM Agents Through Explicit Hierarchical Memory Management https://arxiv.org/abs/2602.07398 True core update_forgetting model representation_organization;evaluation_diagnosis;security_privacy_trust retrieval_representation 6 agent-memory
185 2602.07624 2026-02-07 transition-2026-Feb-Mar M2A: Multimodal Memory Agent with Dual-Layer Hybrid Memory for Long-Term Personalized Interactions https://arxiv.org/abs/2602.07624 True core update_forgetting model retrieval_access;update_forgetting;multimodal_embodied_gui;systems_efficiency execution_multimodal;personal_shared 6 agent-memory
186 2602.07755 2026-02-08 transition-2026-Feb-Mar Learning to Continually Learn via Meta-learning Agentic Memory Designs https://arxiv.org/abs/2602.07755 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;systems_efficiency experience_skill_policy 3 agent-memory
187 2602.07885 2026-02-08 transition-2026-Feb-Mar MemFly: On-the-Fly Memory Optimization via Information Bottleneck https://arxiv.org/abs/2602.07885 True core update_forgetting model retrieval_access;representation_organization;systems_efficiency 4 long-term-memory
188 2602.08369 2026-02-09 transition-2026-Feb-Mar MemAdapter: Fast Alignment across Agent Memory Paradigms via Generative Subgraph Retrieval https://arxiv.org/abs/2602.08369 True core update_forgetting model retrieval_access;execution_state;evaluation_diagnosis;systems_efficiency retrieval_representation;experience_skill_policy 6 agent-memory
189 2602.09319 2026-02-10 transition-2026-Feb-Mar Benchmarking Knowledge-Extraction Attack and Defense on Retrieval-Augmented Generation https://arxiv.org/abs/2602.09319 False core access model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;security_privacy_trust;systems_efficiency benchmark_diagnosis;retrieval_representation;security_governance;systems_efficiency 2 agent-memory
190 2602.09712 2026-02-10 transition-2026-Feb-Mar TraceMem: Weaving Narrative Memory Schemata from User Conversational Traces https://arxiv.org/abs/2602.09712 True core execution_state model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis 6 episodic-memory
191 2602.10715 2026-02-11 transition-2026-Feb-Mar Locomo-Plus: Beyond-Factual Cognitive Memory Evaluation Framework for LLM Agents https://arxiv.org/abs/2602.10715 True core execution_state model retrieval_access;evaluation_diagnosis benchmark_diagnosis 4 memory-evaluation
192 2602.11243 2026-02-11 transition-2026-Feb-Mar Evaluating Memory Structure in LLM Agents https://arxiv.org/abs/2602.11243 True core representation model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;multimodal_embodied_gui benchmark_diagnosis;retrieval_representation 3 agent-memory;long-term-memory;memory-evaluation
193 2602.13530 2026-02-13 transition-2026-Feb-Mar REMem: Reasoning with Episodic Memory in Language Agent https://arxiv.org/abs/2602.13530 True core representation model retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis 6 memory-evaluation
194 2602.18493 2026-02-13 transition-2026-Feb-Mar Learning to Remember: End-to-End Training of Memory Agents for Long-Context Reasoning https://arxiv.org/abs/2602.18493 True core execution_state model retrieval_access;representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis experience_skill_policy 4 agent-memory
195 2602.13594 2026-02-14 transition-2026-Feb-Mar Hippocampus: An Efficient and Scalable Memory Module for Agentic AI https://arxiv.org/abs/2602.13594 True core execution_state model retrieval_access;representation_organization;execution_state;evaluation_diagnosis;systems_efficiency systems_efficiency 2 agent-memory
196 2602.13933 2026-02-15 transition-2026-Feb-Mar HyMem: Hybrid Memory Architecture with Dynamic Retrieval Scheduling https://arxiv.org/abs/2602.13933 True core execution_state model retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis;systems_efficiency retrieval_representation 6 long-term-memory
197 2602.14038 2026-02-15 transition-2026-Feb-Mar Choosing How to Remember: Adaptive Memory Structures for LLM Agents https://arxiv.org/abs/2602.14038 True core execution_state model representation_organization;execution_state;evaluation_diagnosis retrieval_representation;experience_skill_policy 4 agent-memory
198 2602.15274 2026-02-17 transition-2026-Feb-Mar When Remembering and Planning are Worth it: Navigating under Change https://arxiv.org/abs/2602.15274 True core execution_state model retrieval_access;execution_state;experience_skill_learning;multimodal_embodied_gui;systems_efficiency 0 agent-memory
199 2602.15513 2026-02-17 transition-2026-Feb-Mar HIMM: Human-Inspired Long-Term Memory Modeling for Embodied Exploration and Question Answering https://arxiv.org/abs/2602.15513 True core execution_state model retrieval_access;representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency execution_multimodal 4 episodic-memory
200 2602.15654 2026-02-17 transition-2026-Feb-Mar Zombie Agents: Persistent Control of Self-Evolving LLM Agents via Self-Reinforcing Injections https://arxiv.org/abs/2602.15654 False core execution_state model retrieval_access;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;systems_efficiency experience_skill_policy 3 long-term-memory
201 2603.02240 2026-02-17 transition-2026-Feb-Mar SuperLocalMemory: Privacy-Preserving Multi-Agent Memory with Bayesian Trust Defense Against Memory Poisoning https://arxiv.org/abs/2603.02240 True core execution_state model retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust;multi_agent_shared;systems_efficiency security_governance;systems_efficiency;personal_shared 5 agent-memory
202 2603.04428 2026-02-17 transition-2026-Feb-Mar Agent Memory Below the Prompt: Persistent Q4 KV Cache for Multi-Agent LLM Inference on Edge Devices https://arxiv.org/abs/2603.04428 True core execution_state model evaluation_diagnosis;multi_agent_shared;systems_efficiency systems_efficiency;personal_shared 5 agent-memory
203 2602.16313 2026-02-18 transition-2026-Feb-Mar MemoryArena: Benchmarking Agent Memory in Interdependent Multi-Session Agentic Tasks https://arxiv.org/abs/2602.16313 True core execution_state model retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui benchmark_diagnosis 3 agent-memory;memory-evaluation
204 2602.16493 2026-02-18 transition-2026-Feb-Mar MMA: Multimodal Memory Agent https://arxiv.org/abs/2602.16493 True core execution_state model retrieval_access;representation_organization;update_forgetting;execution_state;evaluation_diagnosis;multimodal_embodied_gui execution_multimodal 8 agent-memory
205 2602.19320 2026-02-22 transition-2026-Feb-Mar Anatomy of Agentic Memory: Taxonomy and Empirical Analysis of Evaluation and System Limitations https://arxiv.org/abs/2602.19320 True core execution_state model representation_organization;execution_state;evaluation_diagnosis;systems_efficiency benchmark_diagnosis 4 agent-memory
206 2603.04443 2026-02-22 transition-2026-Feb-Mar AMV-L: Lifecycle-Managed Agent Memory for Tail-Latency Control in Long-Running LLM Systems https://arxiv.org/abs/2603.04443 True core execution_state model retrieval_access;update_forgetting;evaluation_diagnosis;systems_efficiency update_forgetting;systems_efficiency 7 agent-memory;long-term-memory
207 2602.21394 2026-02-24 transition-2026-Feb-Mar MemoPhishAgent: Memory-Augmented Multi-Modal LLM Agent for Phishing URL Detection https://arxiv.org/abs/2602.21394 True core execution_state model retrieval_access;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui 8 episodic-memory
208 2602.21477 2026-02-25 transition-2026-Feb-Mar Pancake: Hierarchical Memory System for Multi-Agent LLM Serving https://arxiv.org/abs/2602.21477 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;multi_agent_shared;systems_efficiency retrieval_representation;systems_efficiency;personal_shared 6 agent-memory
209 2602.22406 2026-02-25 transition-2026-Feb-Mar Towards Autonomous Memory Agents https://arxiv.org/abs/2602.22406 True core update_forgetting model retrieval_access;update_forgetting;experience_skill_learning;evaluation_diagnosis;systems_efficiency 6 agent-memory
210 2602.22769 2026-02-26 transition-2026-Feb-Mar AMA-Bench: Evaluating Long-Horizon Memory for Agentic Applications https://arxiv.org/abs/2602.22769 True core update_forgetting model retrieval_access;execution_state;evaluation_diagnosis benchmark_diagnosis;execution_multimodal 8 agent-memory;memory-evaluation
211 2602.23720 2026-02-27 transition-2026-Feb-Mar The Auton Agentic AI Framework https://arxiv.org/abs/2602.23720 False core execution_state model representation_organization;update_forgetting;experience_skill_learning;security_privacy_trust;systems_efficiency 0 episodic-memory
212 2602.23937 2026-02-27 transition-2026-Feb-Mar Enhancing Vision-Language Navigation with Multimodal Event Knowledge from Real-World Indoor Tour Videos https://arxiv.org/abs/2602.23937 False core execution_state model retrieval_access;representation_organization;execution_state;evaluation_diagnosis;multimodal_embodied_gui execution_multimodal;systems_efficiency 4 episodic-memory
213 2603.01160 2026-03-01 transition-2026-Feb-Mar Semantic XPath: Structured Agentic Memory Access for Conversational AI https://arxiv.org/abs/2603.01160 True core access model retrieval_access;representation_organization;update_forgetting;multimodal_embodied_gui;systems_efficiency retrieval_representation 4 agent-memory
214 2603.01966 2026-03-02 transition-2026-Feb-Mar AMemGym: Interactive Memory Benchmarking for Assistants in Long-Horizon Conversations https://arxiv.org/abs/2603.01966 True core update_forgetting model representation_organization;execution_state;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency benchmark_diagnosis;execution_multimodal 2 agent-memory;memory-evaluation
215 2603.02206 2026-03-02 transition-2026-Feb-Mar VoiceAgentRAG: Solving the RAG Latency Bottleneck in Real-Time Voice Agents Using Dual-Agent Architectures https://arxiv.org/abs/2603.02206 False core access model retrieval_access;representation_organization;systems_efficiency retrieval_representation;systems_efficiency 1 agent-memory
216 2603.02473 2026-03-02 transition-2026-Feb-Mar Diagnosing Retrieval vs. Utilization Bottlenecks in LLM Agent Memory https://arxiv.org/abs/2603.02473 True core access model retrieval_access;evaluation_diagnosis;systems_efficiency benchmark_diagnosis;retrieval_representation 6 agent-memory
217 2603.03024 2026-03-03 transition-2026-Feb-Mar MA-CoNav: A Master-Slave Multi-Agent Framework with Hierarchical Collaboration and Dual-Level Reflection for Long-Horizon Embodied VLN https://arxiv.org/abs/2603.03024 False core update_forgetting model representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multi_agent_shared;multimodal_embodied_gui;systems_efficiency retrieval_representation;execution_multimodal;personal_shared 4 agent-memory
218 2603.03148 2026-03-03 transition-2026-Feb-Mar From Language to Action: Can LLM-Based Agents Be Used for Embodied Robot Cognition? https://arxiv.org/abs/2603.03148 False core execution_state model representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui execution_multimodal 4 episodic-memory
219 2603.15642 2026-03-03 transition-2026-Feb-Mar CraniMem: Cranial Inspired Gated and Bounded Memory for Agentic Systems https://arxiv.org/abs/2603.15642 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;execution_state;evaluation_diagnosis 5 agent-memory
220 2603.04549 2026-03-04 transition-2026-Feb-Mar Adaptive Memory Admission Control for LLM Agents https://arxiv.org/abs/2603.04549 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;systems_efficiency experience_skill_policy 7 long-term-memory
221 2603.04740 2026-03-05 transition-2026-Feb-Mar Memory as Ontology: A Constitutional Memory Architecture for Persistent Digital Citizens https://arxiv.org/abs/2603.04740 True core execution_state model retrieval_access;representation_organization;security_privacy_trust;multimodal_embodied_gui;systems_efficiency retrieval_representation 0 agent-memory
222 2603.23516 2026-03-06 transition-2026-Feb-Mar MSA: Memory Sparse Attention for Efficient End-to-End Memory Model Scaling to 100M Tokens https://arxiv.org/abs/2603.23516 True core update_forgetting model evaluation_diagnosis;systems_efficiency systems_efficiency 5 agent-memory
223 2603.08755 2026-03-07 transition-2026-Feb-Mar Turn: A Language for Agentic Computation https://arxiv.org/abs/2603.08755 False core update_forgetting model evaluation_diagnosis 3 agent-memory
224 2603.07392 2026-03-08 transition-2026-Feb-Mar Can Large Language Models Keep Up? Benchmarking Online Adaptation to Continual Knowledge Streams https://arxiv.org/abs/2603.07392 False core update_forgetting model representation_organization;evaluation_diagnosis benchmark_diagnosis;experience_skill_policy;systems_efficiency 4 agent-memory
225 2603.07670 2026-03-08 transition-2026-Feb-Mar Memory for Autonomous LLM Agents:Mechanisms, Evaluation, and Emerging Frontiers https://arxiv.org/abs/2603.07670 True core representation model retrieval_access;representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multi_agent_shared;multimodal_embodied_gui;systems_efficiency benchmark_diagnosis 2 agent-memory
226 2603.07784 2026-03-08 transition-2026-Feb-Mar ProgAgent:A Continual RL Agent with Progress-Aware Rewards https://arxiv.org/abs/2603.07784 False core update_forgetting model update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui;systems_efficiency experience_skill_policy 4 agent-memory
227 2603.10062 2026-03-09 transition-2026-Feb-Mar Multi-Agent Memory from a Computer Architecture Perspective: Visions and Challenges Ahead https://arxiv.org/abs/2603.10062 True core execution_state model representation_organization;multi_agent_shared;multimodal_embodied_gui personal_shared 0 agent-memory
228 2604.00009 2026-03-09 transition-2026-Feb-Mar Eyla: Toward an Identity-Anchored LLM Architecture with Integrated Biological Priors -- Vision, Implementation Attempt, and Lessons from AI-Assisted Development https://arxiv.org/abs/2604.00009 False core representation model retrieval_access;evaluation_diagnosis;security_privacy_trust 5 episodic-memory
229 2603.11721 2026-03-12 transition-2026-Feb-Mar When OpenClaw Meets Hospital: Toward an Agentic Operating System for Dynamic Clinical Workflows https://arxiv.org/abs/2603.11721 False core execution_state model retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency 7 long-term-memory
230 2603.11768 2026-03-12 transition-2026-Feb-Mar Governing Evolving Memory in LLM Agents: Risks, Mechanisms, and the Stability and Safety Governed Memory (SSGM) Framework https://arxiv.org/abs/2603.11768 True core execution_state model retrieval_access;representation_organization;update_forgetting;security_privacy_trust;multimodal_embodied_gui;systems_efficiency experience_skill_policy;security_governance 0 agent-memory;long-term-memory
231 2603.12631 2026-03-13 transition-2026-Feb-Mar Joint Optimization of Multi-agent Memory System https://arxiv.org/abs/2603.12631 True core update_forgetting model retrieval_access;execution_state;experience_skill_learning;multi_agent_shared;multimodal_embodied_gui personal_shared 5 agent-memory
232 2603.13017 2026-03-13 transition-2026-Feb-Mar Structured Distillation for Personalized Agent Memory: 11x Token Reduction with Retrieval Preservation https://arxiv.org/abs/2603.13017 True core access model retrieval_access;representation_organization;evaluation_diagnosis;systems_efficiency retrieval_representation;experience_skill_policy;systems_efficiency;personal_shared 8 agent-memory
233 2603.13676 2026-03-14 transition-2026-Feb-Mar TheraAgent: Multi-Agent Framework with Self-Evolving Memory and Evidence-Calibrated Reasoning for PET Theranostics https://arxiv.org/abs/2603.13676 True core execution_state model representation_organization;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multi_agent_shared experience_skill_policy;personal_shared 7 agent-memory
234 2603.14588 2026-03-15 transition-2026-Feb-Mar SuperLocalMemory V3: Information-Geometric Foundations for Zero-LLM Enterprise Agent Memory https://arxiv.org/abs/2603.14588 True core access model retrieval_access;representation_organization;evaluation_diagnosis 6 agent-memory
235 2603.14597 2026-03-15 transition-2026-Feb-Mar D-MEM: Dopamine-Gated Agentic Memory via Reward Prediction Error Routing https://arxiv.org/abs/2603.14597 True core update_forgetting model representation_organization;evaluation_diagnosis;security_privacy_trust;systems_efficiency 7 agent-memory;long-term-memory
236 2603.15280 2026-03-16 transition-2026-Feb-Mar Advancing Multimodal Agent Reasoning with Long-Term Neuro-Symbolic Memory https://arxiv.org/abs/2603.15280 True core execution_state model retrieval_access;representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui execution_multimodal 5 agent-memory
237 2603.15421 2026-03-16 transition-2026-Feb-Mar CLAG: Adaptive Memory Organization via Agent-Driven Clustering for Small Language Model Agents https://arxiv.org/abs/2603.15421 True core access model retrieval_access;representation_organization;experience_skill_learning;systems_efficiency retrieval_representation;experience_skill_policy 2 agent-memory
238 2603.16734 2026-03-17 transition-2026-Feb-Mar Differential Harm Propensity in Personalized LLM Agents: The Curious Case of Mental Health Disclosure https://arxiv.org/abs/2603.16734 False core execution_state model evaluation_diagnosis;security_privacy_trust personal_shared 4 long-term-memory
239 2603.17043 2026-03-17 transition-2026-Feb-Mar OpenQlaw: An Agentic AI Assistant for Analysis of 2D Quantum Materials https://arxiv.org/abs/2603.17043 False core execution_state model retrieval_access;multimodal_embodied_gui;systems_efficiency benchmark_diagnosis 0 long-term-memory
240 2603.17244 2026-03-18 transition-2026-Feb-Mar Graph-Native Cognitive Memory for AI Agents: Formal Belief Revision Semantics for Versioned Memory Architectures https://arxiv.org/abs/2603.17244 True core execution_state model retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust;systems_efficiency retrieval_representation;update_forgetting 6 agent-memory;memory-evaluation
241 2603.17831 2026-03-18 transition-2026-Feb-Mar RPMS: Enhancing LLM-Based Embodied Planning through Rule-Augmented Memory Synergy https://arxiv.org/abs/2603.17831 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;execution_state;evaluation_diagnosis;multimodal_embodied_gui execution_multimodal 6 episodic-memory
242 2603.17948 2026-03-18 transition-2026-Feb-Mar VideoAtlas: Navigating Long-Form Video in Logarithmic Compute https://arxiv.org/abs/2603.17948 False core experience_learning model representation_organization;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency execution_multimodal 2 agent-memory
243 2603.19935 2026-03-20 transition-2026-Feb-Mar Memori: A Persistent Memory Layer for Efficient, Context-Aware LLM Agents https://arxiv.org/abs/2603.19935 True core experience_learning model retrieval_access;representation_organization;evaluation_diagnosis;systems_efficiency systems_efficiency 6 long-term-memory
244 2604.14158 2026-03-23 transition-2026-Feb-Mar MemGround: Long-Term Memory Evaluation Kit for Large Language Models in Gamified Scenarios https://arxiv.org/abs/2604.14158 True supporting evaluation model retrieval_access;representation_organization;execution_state;evaluation_diagnosis benchmark_diagnosis 3 agent-memory
245 2605.20189 2026-03-23 transition-2026-Feb-Mar SOLAR: A Self-Optimizing Open-Ended Autonomous Agent for Lifelong Learning and Continual Adaptation https://arxiv.org/abs/2605.20189 False supporting evaluation model update_forgetting;experience_skill_learning;systems_efficiency experience_skill_policy 6 episodic-memory
246 2603.23064 2026-03-24 transition-2026-Feb-Mar Mind Your HEARTBEAT! Claw Background Execution Inherently Enables Silent Memory Pollution https://arxiv.org/abs/2603.23064 True peripheral security_privacy model retrieval_access;evaluation_diagnosis;security_privacy_trust 3 agent-memory
247 2603.23160 2026-03-24 transition-2026-Feb-Mar UniDial-EvalKit: A Unified Toolkit for Evaluating Multi-Faceted Conversational Abilities https://arxiv.org/abs/2603.23160 False supporting evaluation model representation_organization;evaluation_diagnosis;systems_efficiency benchmark_diagnosis 6 agent-memory
248 2603.23231 2026-03-24 transition-2026-Feb-Mar PERMA: Benchmarking Personalized Memory Agents via Event-Driven Preference and Realistic Task Environments https://arxiv.org/abs/2603.23231 True core experience_learning model retrieval_access;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency benchmark_diagnosis;personal_shared 5 agent-memory
249 2603.24564 2026-03-25 transition-2026-Feb-Mar Infrastructure for Valuable, Tradable, and Verifiable Agent Memory https://arxiv.org/abs/2603.24564 True supporting evaluation model representation_organization;security_privacy_trust;systems_efficiency retrieval_representation 0 agent-memory
250 2603.25097 2026-03-26 transition-2026-Feb-Mar ElephantBroker: A Knowledge-Grounded Cognitive Runtime for Trustworthy AI Agents https://arxiv.org/abs/2603.25097 False core evaluation model retrieval_access;representation_organization;update_forgetting;security_privacy_trust;systems_efficiency security_governance;systems_efficiency 0 agent-memory
251 2603.25973 2026-03-26 transition-2026-Feb-Mar MemoryCD: Benchmarking Long-Context User Memory of LLM Agents for Lifelong Cross-Domain Personalization https://arxiv.org/abs/2603.25973 True supporting evaluation model evaluation_diagnosis;systems_efficiency benchmark_diagnosis;personal_shared 5 memory-evaluation
252 2604.19771 2026-03-27 transition-2026-Feb-Mar Cognis: Context-Aware Memory for Conversational AI Agents https://arxiv.org/abs/2604.19771 True core experience_learning model retrieval_access;evaluation_diagnosis;systems_efficiency 4 long-term-memory
253 2603.28088 2026-03-30 transition-2026-Feb-Mar GEMS: Agent-Native Multimodal Generation with Memory and Skills https://arxiv.org/abs/2603.28088 True core experience_learning model representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multi_agent_shared;multimodal_embodied_gui experience_skill_policy;execution_multimodal 4 agent-memory
254 2603.29493 2026-03-31 transition-2026-Feb-Mar MemFactory: Unified Inference & Training Framework for Agent Memory https://arxiv.org/abs/2603.29493 True core update_forgetting model retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis 6 agent-memory
255 2604.00131 2026-03-31 transition-2026-Feb-Mar Oblivion: Self-Adaptive Agentic Memory Control through Decay-Driven Activation https://arxiv.org/abs/2604.00131 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;systems_efficiency update_forgetting;experience_skill_policy 2 agent-memory
256 2604.00556 2026-04-01 recent-2026-Apr-Jul HabitatAgent: An End-to-End Multi-Agent System for Housing Consultation https://arxiv.org/abs/2604.00556 False core experience_learning model retrieval_access;update_forgetting;evaluation_diagnosis;multi_agent_shared personal_shared 6 agent-memory
257 2604.01007 2026-04-01 recent-2026-Apr-Jul Omni-SimpleMem: Autoresearch-Guided Discovery of Lifelong Multimodal Agent Memory https://arxiv.org/abs/2604.01007 True core update_forgetting model retrieval_access;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui retrieval_representation;execution_multimodal 8 agent-memory
258 2604.01560 2026-04-02 recent-2026-Apr-Jul DeltaMem: Towards Agentic Memory Management via Reinforcement Learning https://arxiv.org/abs/2604.01560 True core update_forgetting model experience_skill_learning;evaluation_diagnosis;multi_agent_shared experience_skill_policy 4 agent-memory;memory-evaluation
259 2604.01658 2026-04-02 recent-2026-Apr-Jul CORAL: Towards Autonomous Multi-Agent Evolution for Open-Ended Discovery https://arxiv.org/abs/2604.01658 False core update_forgetting model retrieval_access;experience_skill_learning;evaluation_diagnosis;multi_agent_shared personal_shared 5 long-term-memory
260 2604.01707 2026-04-02 recent-2026-Apr-Jul Memory in the LLM Era: Modular Architectures and Strategies in a Unified Framework https://arxiv.org/abs/2604.01707 True core access model retrieval_access;execution_state;evaluation_diagnosis 4 agent-memory
261 2604.02522 2026-04-02 recent-2026-Apr-Jul Opal: Private Memory for Personal AI https://arxiv.org/abs/2604.02522 True core access model retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust;systems_efficiency 6 agent-memory
262 2604.02623 2026-04-03 recent-2026-Apr-Jul Poison Once, Exploit Forever: Environment-Injected Memory Poisoning Attacks on Web Agents https://arxiv.org/abs/2604.02623 True core update_forgetting model retrieval_access;execution_state;security_privacy_trust;multi_agent_shared;multimodal_embodied_gui;systems_efficiency execution_multimodal;security_governance 4 agent-memory
263 2604.03588 2026-04-04 recent-2026-Apr-Jul Rashomon Memory: Towards Argumentation-Driven Retrieval for Multi-Perspective Agent Memory https://arxiv.org/abs/2604.03588 True core experience_learning model retrieval_access;representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;systems_efficiency retrieval_representation 0 agent-memory
264 2604.04157 2026-04-05 recent-2026-Apr-Jul Readable Minds: Emergent Theory-of-Mind-Like Behavior in LLM Poker Agents https://arxiv.org/abs/2604.04157 False core execution_state model 8 long-term-memory
265 2604.04503 2026-04-06 recent-2026-Apr-Jul Memory Intelligence Agent https://arxiv.org/abs/2604.04503 True core update_forgetting model retrieval_access;update_forgetting;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency 3 agent-memory
266 2604.04514 2026-04-06 recent-2026-Apr-Jul SuperLocalMemory V3.3: The Living Brain -- Biologically-Inspired Forgetting, Cognitive Quantization, and Multi-Channel Retrieval for Zero-LLM Agent Memory Systems https://arxiv.org/abs/2604.04514 True core experience_learning model retrieval_access;representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;systems_efficiency retrieval_representation;update_forgetting 4 agent-memory
267 2604.04660 2026-04-06 recent-2026-Apr-Jul Springdrift: An Auditable Persistent Runtime for LLM Agents with Case-Based Memory, Normative Safety, and Ambient Self-Perception https://arxiv.org/abs/2604.04660 True supporting execution_state model retrieval_access;representation_organization;evaluation_diagnosis;multimodal_embodied_gui systems_efficiency 6 long-term-memory
268 2604.04853 2026-04-06 recent-2026-Apr-Jul MemMachine: A Ground-Truth-Preserving Memory System for Personalized AI Agents https://arxiv.org/abs/2604.04853 True core experience_learning model retrieval_access;execution_state;evaluation_diagnosis;systems_efficiency systems_efficiency;personal_shared 6 long-term-memory
269 2604.04901 2026-04-06 recent-2026-Apr-Jul FileGram: Grounding Agent Personalization in File-System Behavioral Traces https://arxiv.org/abs/2604.04901 False supporting execution_state model retrieval_access;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui personal_shared 2 agent-memory
270 2604.05719 2026-04-07 recent-2026-Apr-Jul Hackers or Hallucinators? A Comprehensive Analysis of LLM-Based Automated Penetration Testing https://arxiv.org/abs/2604.05719 False supporting execution_state model retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust;systems_efficiency benchmark_diagnosis 5 agent-memory
271 2604.07798 2026-04-09 recent-2026-Apr-Jul Lightweight LLM Agent Memory with Small Language Models https://arxiv.org/abs/2604.07798 True core experience_learning model retrieval_access;update_forgetting;execution_state;systems_efficiency 2 agent-memory;long-term-memory
272 2604.07877 2026-04-09 recent-2026-Apr-Jul MemReader: From Passive to Active Extraction for Long-Term Agent Memory https://arxiv.org/abs/2604.07877 True core experience_learning model retrieval_access;representation_organization;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency 5 agent-memory
273 2604.08064 2026-04-09 recent-2026-Apr-Jul ImplicitMemBench: Measuring Unconscious Behavioral Adaptation in Large Language Models https://arxiv.org/abs/2604.08064 False supporting execution_state model retrieval_access;experience_skill_learning;evaluation_diagnosis experience_skill_policy 8 memory-evaluation;procedural-memory
274 2604.08756 2026-04-09 recent-2026-Apr-Jul Artifacts as Memory Beyond the Agent Boundary https://arxiv.org/abs/2604.08756 True supporting execution_state model experience_skill_learning 2 agent-memory
275 2604.09000 2026-04-10 recent-2026-Apr-Jul StreamMeCo: Long-Term Agent Memory Compression for Efficient Streaming Video Understanding https://arxiv.org/abs/2604.09000 True core experience_learning model retrieval_access;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency execution_multimodal;systems_efficiency 5 agent-memory
276 2604.09388 2026-04-10 recent-2026-Apr-Jul The AI Codebase Maturity Model: From Assisted Coding to Fully Autonomous Systems https://arxiv.org/abs/2604.09388 False core experience_learning model representation_organization;experience_skill_learning;evaluation_diagnosis;multi_agent_shared;systems_efficiency 3 agent-memory
277 2604.09747 2026-04-10 recent-2026-Apr-Jul ADAM: A Systematic Data Extraction Attack on Agent Memory via Adaptive Querying https://arxiv.org/abs/2604.09747 True supporting execution_state model retrieval_access;security_privacy_trust;multimodal_embodied_gui;systems_efficiency experience_skill_policy;security_governance 6 agent-memory
278 2604.11811 2026-04-10 recent-2026-Apr-Jul M$^\star$: Every Task Deserves Its Own Memory Harness https://arxiv.org/abs/2604.11811 True core update_forgetting model retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency 5 agent-memory
279 2604.10981 2026-04-13 recent-2026-Apr-Jul ATANT v1.1: Positioning Continuity Evaluation Against Memory, Long-Context, and Agentic-Memory Benchmarks https://arxiv.org/abs/2604.10981 True supporting evaluation model evaluation_diagnosis;security_privacy_trust benchmark_diagnosis 5 agent-memory;memory-evaluation
280 2604.11544 2026-04-13 recent-2026-Apr-Jul Time is Not a Label: Continuous Phase Rotation for Temporal Knowledge Graphs and Agentic Memory https://arxiv.org/abs/2604.11544 True core update_forgetting model representation_organization;evaluation_diagnosis;multimodal_embodied_gui retrieval_representation;systems_efficiency 4 agent-memory
281 2604.11563 2026-04-13 recent-2026-Apr-Jul Synthius-Mem: Brain-Inspired Hallucination-Resistant Persona Memory Achieving 94.4% Memory Accuracy and 99.6% Adversarial Robustness on LoCoMo https://arxiv.org/abs/2604.11563 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;systems_efficiency 8 long-term-memory
282 2604.12007 2026-04-13 recent-2026-Apr-Jul When to Forget: A Memory Governance Primitive https://arxiv.org/abs/2604.12007 True core update_forgetting model retrieval_access;update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust update_forgetting;security_governance 6 agent-memory
283 2604.12179 2026-04-14 recent-2026-Apr-Jul AgenticAI-DialogGen: Topic-Guided Conversation Generation for Fine-Tuning and Evaluating Short- and Long-Term Memories of LLMs https://arxiv.org/abs/2604.12179 True core update_forgetting model representation_organization;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency benchmark_diagnosis;execution_multimodal 2 long-term-memory
284 2604.12285 2026-04-14 recent-2026-Apr-Jul GAM: Hierarchical Graph-based Agentic Memory for LLM Agents https://arxiv.org/abs/2604.12285 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;multimodal_embodied_gui;systems_efficiency retrieval_representation 4 agent-memory
285 2604.12948 2026-04-14 recent-2026-Apr-Jul Drawing on Memory: Dual-Trace Encoding Improves Cross-Session Recall in LLM Agents https://arxiv.org/abs/2604.12948 True core update_forgetting model retrieval_access;update_forgetting;evaluation_diagnosis;systems_efficiency retrieval_representation 7 long-term-memory
286 2604.15774 2026-04-17 recent-2026-Apr-Jul MemEvoBench: Benchmarking Safety Risks from Memory Misevolution in LLM Agents https://arxiv.org/abs/2604.15774 True supporting evaluation model update_forgetting;execution_state;evaluation_diagnosis;security_privacy_trust benchmark_diagnosis 4 long-term-memory
287 2604.15877 2026-04-17 recent-2026-Apr-Jul Experience Compression Spectrum: Unifying Memory, Skills, and Rules in LLM Agents https://arxiv.org/abs/2604.15877 True supporting evaluation model retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis;systems_efficiency experience_skill_policy;systems_efficiency 2 agent-memory;episodic-memory
288 2604.16548 2026-04-17 recent-2026-Apr-Jul A Survey on Long-Term Memory Security in LLM Agents: Attacks, Defenses, and Governance Across the Memory Lifecycle https://arxiv.org/abs/2604.16548 True core update_forgetting model retrieval_access;update_forgetting;security_privacy_trust;systems_efficiency benchmark_diagnosis;update_forgetting;security_governance 0 long-term-memory
289 2604.16839 2026-04-18 recent-2026-Apr-Jul HeLa-Mem: Hebbian Learning and Associative Memory for LLM Agents https://arxiv.org/abs/2604.16839 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;experience_skill_learning;systems_efficiency experience_skill_policy 5 episodic-memory;long-term-memory
290 2604.17273 2026-04-19 recent-2026-Apr-Jul The Continuity Layer: Why Intelligence Needs an Architecture for What It Carries Forward https://arxiv.org/abs/2604.17273 False core execution_state model retrieval_access;representation_organization;execution_state;evaluation_diagnosis;security_privacy_trust;systems_efficiency 3 agent-memory;memory-evaluation
291 2604.17456 2026-04-19 recent-2026-Apr-Jul TrafficClaw: A Generalizable LLM Agent in the Unified Physical Environment for Urban Traffic Control https://arxiv.org/abs/2604.17456 False core execution_state model representation_organization;execution_state;experience_skill_learning 3 long-term-memory
292 2604.17658 2026-04-19 recent-2026-Apr-Jul Towards Self-Improving Error Diagnosis in Multi-Agent Systems https://arxiv.org/abs/2604.17658 False core execution_state model update_forgetting;evaluation_diagnosis;multi_agent_shared benchmark_diagnosis;personal_shared 6 episodic-memory
293 2604.19541 2026-04-21 recent-2026-Apr-Jul FOCAL: Filtered On-device Continuous Activity Logging for Efficient Personal Desktop Summarization https://arxiv.org/abs/2604.19541 False core execution_state model retrieval_access;security_privacy_trust;multi_agent_shared;multimodal_embodied_gui;systems_efficiency systems_efficiency 6 agent-memory
294 2604.20006 2026-04-21 recent-2026-Apr-Jul From Recall to Forgetting: Benchmarking Long-Term Memory for Personalized Agents https://arxiv.org/abs/2604.20006 True core execution_state model retrieval_access;update_forgetting;evaluation_diagnosis benchmark_diagnosis;retrieval_representation;update_forgetting;personal_shared 3 agent-memory
295 2604.20117 2026-04-22 recent-2026-Apr-Jul To Know is to Construct: Schema-Constrained Generation for Agent Memory https://arxiv.org/abs/2604.20117 True core execution_state model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;multimodal_embodied_gui 5 agent-memory
296 2604.20183 2026-04-22 recent-2026-Apr-Jul Dual-Cluster Memory Agent: Resolving Multi-Paradigm Ambiguity in Optimization Problem Solving https://arxiv.org/abs/2604.20183 True core execution_state model representation_organization;update_forgetting;evaluation_diagnosis;multimodal_embodied_gui execution_multimodal 4 agent-memory
297 2604.20300 2026-04-22 recent-2026-Apr-Jul FSFM: A Biologically-Inspired Framework for Selective Forgetting of Agent Memory https://arxiv.org/abs/2604.20300 True core execution_state model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;security_privacy_trust update_forgetting 5 agent-memory
298 2604.20582 2026-04-22 recent-2026-Apr-Jul Trust, Lies, and Long Memories: Emergent Social Dynamics and Reputation in Multi-Round Avalon with LLM Agents https://arxiv.org/abs/2604.20582 True core execution_state model security_privacy_trust security_governance 4 agent-memory
299 2604.20598 2026-04-22 recent-2026-Apr-Jul Self-Aware Vector Embeddings for Retrieval-Augmented Generation: A Neuroscience-Inspired Framework for Temporal, Confidence-Weighted, and Relational Knowledge https://arxiv.org/abs/2604.20598 False core execution_state model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;security_privacy_trust;systems_efficiency retrieval_representation;systems_efficiency 6 agent-memory
300 2604.22085 2026-04-23 recent-2026-Apr-Jul Memanto: Typed Semantic Memory with Information-Theoretic Retrieval for Long-Horizon Agents https://arxiv.org/abs/2604.22085 True core execution_state model retrieval_access;representation_organization;update_forgetting;execution_state;evaluation_diagnosis;systems_efficiency retrieval_representation;execution_multimodal 3 agent-memory
301 2604.23711 2026-04-26 recent-2026-Apr-Jul Spore: Efficient and Training-Free Privacy Extraction Attack on LLMs via Inference-Time Hybrid Probing https://arxiv.org/abs/2604.23711 False core execution_state model retrieval_access;evaluation_diagnosis;security_privacy_trust;systems_efficiency security_governance;systems_efficiency 4 agent-memory
302 2606.20570 2026-04-26 recent-2026-Apr-Jul Infrastructure for the Agentic Web: Gap Analysis and Architecture from the Agentverse Platform https://arxiv.org/abs/2606.20570 False core access model retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui;systems_efficiency benchmark_diagnosis;retrieval_representation 1 agent-memory
303 2604.26197 2026-04-29 recent-2026-Apr-Jul Hierarchical Long-Term Semantic Memory for LinkedIn's Hiring Agent https://arxiv.org/abs/2604.26197 True core execution_state model retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust;systems_efficiency retrieval_representation 5 long-term-memory
304 2604.26622 2026-04-29 recent-2026-Apr-Jul OCR-Memory: Optical Context Retrieval for Long-Horizon Agent Memory https://arxiv.org/abs/2604.26622 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency retrieval_representation;execution_multimodal 3 agent-memory
305 2604.27003 2026-04-29 recent-2026-Apr-Jul When Continual Learning Moves to Memory: A Study of Experience Reuse in LLM Agents https://arxiv.org/abs/2604.27003 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis benchmark_diagnosis;experience_skill_policy 3 procedural-memory
306 2604.27045 2026-04-29 recent-2026-Apr-Jul Detecting Clinical Discrepancies in Health Coaching Agents: A Dual-Stream Memory and Reconciliation Architecture https://arxiv.org/abs/2604.27045 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;security_privacy_trust 5 agent-memory
307 2604.27283 2026-04-30 recent-2026-Apr-Jul Learning When to Remember: Risk-Sensitive Contextual Bandits for Abstention-Aware Memory Retrieval in LLM-Based Coding Agents https://arxiv.org/abs/2604.27283 True core update_forgetting model retrieval_access;execution_state;experience_skill_learning;systems_efficiency retrieval_representation;experience_skill_policy 3 agent-memory
308 2604.27707 2026-04-30 recent-2026-Apr-Jul Contextual Agentic Memory is a Memo, Not True Memory https://arxiv.org/abs/2604.27707 True core update_forgetting model retrieval_access;update_forgetting;evaluation_diagnosis;security_privacy_trust;systems_efficiency 3 agent-memory
309 2604.27996 2026-04-30 recent-2026-Apr-Jul Exploring LLM Agent Designs and Interaction Modalities for Scientific Visualization https://arxiv.org/abs/2604.27996 False core update_forgetting model representation_organization;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency 4 long-term-memory
310 2605.00702 2026-05-01 recent-2026-Apr-Jul Learning How and What to Memorize: Cognition-Inspired Two-Stage Optimization for Evolving Memory https://arxiv.org/abs/2605.00702 True core update_forgetting model representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui experience_skill_policy 4 memory-evaluation
311 2605.01386 2026-05-02 recent-2026-Apr-Jul MemORAI: Memory Organization and Retrieval via Adaptive Graph Intelligence for LLM Conversational Agents https://arxiv.org/abs/2605.01386 True core representation model retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust;systems_efficiency retrieval_representation;experience_skill_policy 2 long-term-memory
312 2605.01970 2026-05-03 recent-2026-Apr-Jul Trojan Hippo: Weaponizing Agent Memory for Data Exfiltration https://arxiv.org/abs/2605.01970 True core update_forgetting model evaluation_diagnosis;security_privacy_trust;systems_efficiency 4 agent-memory;long-term-memory
313 2605.02199 2026-05-04 recent-2026-Apr-Jul MEMAUDIT: An Exact Package-Oracle Evaluation Protocol for Budgeted Long-Term LLM Memory Writing https://arxiv.org/abs/2605.02199 True core update_forgetting model retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis;systems_efficiency benchmark_diagnosis;systems_efficiency 3 long-term-memory
314 2605.03228 2026-05-04 recent-2026-Apr-Jul MAGE: Safeguarding LLM Agents against Long-Horizon Threats via Shadow Memory https://arxiv.org/abs/2605.03228 True core update_forgetting model retrieval_access;execution_state;evaluation_diagnosis;security_privacy_trust execution_multimodal 5 agent-memory
315 2605.03312 2026-05-05 recent-2026-Apr-Jul MemFlow: Intent-Driven Memory Orchestration for Small Language Model Agents https://arxiv.org/abs/2605.03312 True core update_forgetting model retrieval_access;representation_organization;execution_state;evaluation_diagnosis;systems_efficiency 7 agent-memory;memory-evaluation
316 2605.03354 2026-05-05 recent-2026-Apr-Jul What Happens Inside Agent Memory? Circuit Analysis from Emergence to Diagnosis https://arxiv.org/abs/2605.03354 True core execution_state model retrieval_access;representation_organization;evaluation_diagnosis;multimodal_embodied_gui benchmark_diagnosis 5 agent-memory
317 2605.03804 2026-05-05 recent-2026-Apr-Jul ScrapMem: A Bio-inspired Framework for On-device Personalized Agent Memory via Optical Forgetting https://arxiv.org/abs/2605.03804 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;multimodal_embodied_gui;systems_efficiency update_forgetting;systems_efficiency;personal_shared 4 agent-memory;episodic-memory;long-term-memory
318 2605.06702 2026-05-05 recent-2026-Apr-Jul CASCADE: Case-Based Continual Adaptation for Large Language Models During Deployment https://arxiv.org/abs/2605.06702 False core update_forgetting model retrieval_access;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui experience_skill_policy 5 episodic-memory
319 2605.04811 2026-05-06 recent-2026-Apr-Jul Tree-based Credit Assignment for Multi-Agent Memory System https://arxiv.org/abs/2605.04811 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;multi_agent_shared;systems_efficiency experience_skill_policy;personal_shared 5 agent-memory
320 2605.04897 2026-05-06 recent-2026-Apr-Jul Storage Is Not Memory: A Retrieval-Centered Architecture for Agent Recall https://arxiv.org/abs/2605.04897 True core access model retrieval_access;representation_organization;evaluation_diagnosis;systems_efficiency retrieval_representation;systems_efficiency 3 agent-memory
321 2605.05583 2026-05-07 recent-2026-Apr-Jul Belief Memory: Agent Memory Under Partial Observability https://arxiv.org/abs/2605.05583 True core update_forgetting model retrieval_access;update_forgetting;evaluation_diagnosis 5 agent-memory
322 2605.06132 2026-05-07 recent-2026-Apr-Jul MemReranker: Reasoning-Aware Reranking for Agent Memory Retrieval https://arxiv.org/abs/2605.06132 True core update_forgetting model retrieval_access;evaluation_diagnosis;systems_efficiency retrieval_representation 7 agent-memory
323 2605.06527 2026-05-07 recent-2026-Apr-Jul STALE: Can LLM Agents Know When Their Memories Are No Longer Valid? https://arxiv.org/abs/2605.06527 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;systems_efficiency update_forgetting 7 agent-memory
324 2605.06716 2026-05-07 recent-2026-Apr-Jul From Storage to Experience: A Survey on the Evolution of LLM Agent Memory Mechanisms https://arxiv.org/abs/2605.06716 True core experience_learning model retrieval_access;execution_state;experience_skill_learning;systems_efficiency benchmark_diagnosis;experience_skill_policy;systems_efficiency 0 agent-memory
325 2605.06812 2026-05-07 recent-2026-Apr-Jul Towards Security-Auditable LLM Agents: A Unified Graph Representation https://arxiv.org/abs/2605.06812 False core security_privacy model retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust;multi_agent_shared retrieval_representation;security_governance 3 long-term-memory
326 2605.07242 2026-05-08 recent-2026-Apr-Jul MEMOREPAIR: Barrier-First Cascade Repair in Agentic Memory https://arxiv.org/abs/2605.07242 True core update_forgetting model update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;systems_efficiency 8 agent-memory
327 2605.07313 2026-05-08 recent-2026-Apr-Jul When Stored Evidence Stops Being Usable: Scale-Conditioned Evaluation of Agent Memory https://arxiv.org/abs/2605.07313 True supporting evaluation model retrieval_access;representation_organization;evaluation_diagnosis;systems_efficiency benchmark_diagnosis 3 agent-memory
328 2605.08374 2026-05-08 recent-2026-Apr-Jul MemQ: Integrating Q-Learning into Self-Evolving Memory Agents over Provenance DAGs https://arxiv.org/abs/2605.08374 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui experience_skill_policy;security_governance 3 agent-memory;episodic-memory
329 2605.08442 2026-05-08 recent-2026-Apr-Jul Defense effectiveness across architectural layers: a mechanistic evaluation of persistent memory attacks on stateful LLM agents https://arxiv.org/abs/2605.08442 True supporting security_privacy model retrieval_access;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui;systems_efficiency benchmark_diagnosis;security_governance 7 long-term-memory
330 2605.08468 2026-05-08 recent-2026-Apr-Jul PYTHALAB-MERA: Validation-Grounded Memory, Retrieval, and Acceptance Control for Frozen-LLM Coding Agents https://arxiv.org/abs/2605.08468 True core update_forgetting model retrieval_access;experience_skill_learning;evaluation_diagnosis;systems_efficiency retrieval_representation 5 episodic-memory
331 2605.08538 2026-05-08 recent-2026-Apr-Jul Human-Inspired Memory Architecture for LLM Agents https://arxiv.org/abs/2605.08538 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;security_privacy_trust;systems_efficiency 8 long-term-memory
332 2605.09033 2026-05-09 recent-2026-Apr-Jul ShadowMerge: A Novel Poisoning Attack on Graph-Based Agent Memory via Relation-Channel Conflicts https://arxiv.org/abs/2605.09033 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;security_privacy_trust retrieval_representation;security_governance 7 agent-memory
333 2605.09315 2026-05-10 recent-2026-Apr-Jul Do Self-Evolving Agents Forget? Capability Degradation and Preservation in Lifelong LLM Agent Adaptation https://arxiv.org/abs/2605.09315 True core update_forgetting model update_forgetting;execution_state;experience_skill_learning;systems_efficiency update_forgetting;experience_skill_policy 0 long-term-memory
334 2605.09330 2026-05-10 recent-2026-Apr-Jul The Trap of Trajectory: Towards Understanding and Mitigating Spurious Correlations in Agentic Memory https://arxiv.org/abs/2605.09330 True supporting evaluation model retrieval_access;representation_organization;execution_state;evaluation_diagnosis;security_privacy_trust;systems_efficiency 2 agent-memory
335 2605.11032 2026-05-10 recent-2026-Apr-Jul Portable Agent Memory: A Protocol for Cryptographically-Verified Memory Transfer Across Heterogeneous AI Agents https://arxiv.org/abs/2605.11032 True core update_forgetting model retrieval_access;representation_organization;experience_skill_learning;security_privacy_trust;systems_efficiency retrieval_representation 1 agent-memory
336 2605.09863 2026-05-11 recent-2026-Apr-Jul Nautilus Compass: Black-box Persona Drift Detection for Production LLM Agents https://arxiv.org/abs/2605.09863 False core update_forgetting model retrieval_access;representation_organization;update_forgetting;systems_efficiency 7 agent-memory
337 2605.09942 2026-05-11 recent-2026-Apr-Jul HAGE: Harnessing Agentic Memory via RL-Driven Weighted Graph Evolution https://arxiv.org/abs/2605.09942 True core update_forgetting model retrieval_access;representation_organization;execution_state;experience_skill_learning;multi_agent_shared retrieval_representation;experience_skill_policy 3 agent-memory
338 2605.10268 2026-05-11 recent-2026-Apr-Jul MemReread: Enhancing Agentic Long-Context Reasoning via Memory-Guided Rereading https://arxiv.org/abs/2605.10268 True core update_forgetting model retrieval_access;update_forgetting;experience_skill_learning;multimodal_embodied_gui;systems_efficiency execution_multimodal 5 agent-memory
339 2605.10870 2026-05-11 recent-2026-Apr-Jul Remember the Decision, Not the Description: A Rate-Distortion Framework for Agent Memory https://arxiv.org/abs/2605.10870 True core update_forgetting model update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;systems_efficiency 3 agent-memory
340 2605.10899 2026-05-11 recent-2026-Apr-Jul RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards https://arxiv.org/abs/2605.10899 False core update_forgetting model retrieval_access;representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui experience_skill_policy;execution_multimodal 4 agent-memory
341 2605.13880 2026-05-11 recent-2026-Apr-Jul PREPING: Building Agent Memory without Tasks https://arxiv.org/abs/2605.13880 True core update_forgetting model representation_organization;update_forgetting;experience_skill_learning;multimodal_embodied_gui;systems_efficiency 5 agent-memory
342 2605.11814 2026-05-12 recent-2026-Apr-Jul MedMemoryBench: Benchmarking Agent Memory in Personalized Healthcare https://arxiv.org/abs/2605.11814 True core execution_state model retrieval_access;execution_state;evaluation_diagnosis;systems_efficiency benchmark_diagnosis;personal_shared 3 agent-memory
343 2605.12061 2026-05-12 recent-2026-Apr-Jul SAGE: A Self-Evolving Agentic Graph-Memory Engine for Structure-Aware Associative Memory https://arxiv.org/abs/2605.12061 True core update_forgetting model retrieval_access;representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis retrieval_representation;experience_skill_policy 2 agent-memory;long-term-memory;memory-evaluation
344 2605.12213 2026-05-12 recent-2026-Apr-Jul Goal-Oriented Reasoning for RAG-based Memory in Conversational Agentic LLM Systems https://arxiv.org/abs/2605.12213 True core update_forgetting model retrieval_access;execution_state retrieval_representation 5 agent-memory
345 2605.12294 2026-05-12 recent-2026-Apr-Jul Executable Agentic Memory for GUI Agent https://arxiv.org/abs/2605.12294 True core execution_state model retrieval_access;representation_organization;execution_state;multimodal_embodied_gui;systems_efficiency execution_multimodal 2 agent-memory
346 2605.12493 2026-05-12 recent-2026-Apr-Jul LongMemEval-V2: Evaluating Long-Term Agent Memory Toward Experienced Colleagues https://arxiv.org/abs/2605.12493 True core experience_learning model retrieval_access;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency benchmark_diagnosis;experience_skill_policy 8 agent-memory;memory-evaluation
347 2605.12978 2026-05-13 recent-2026-Apr-Jul Useful Memories Become Faulty When Continuously Updated by LLMs https://arxiv.org/abs/2605.12978 True core update_forgetting model update_forgetting;experience_skill_learning;evaluation_diagnosis update_forgetting 6 agent-memory
348 2605.13438 2026-05-13 recent-2026-Apr-Jul CogniFold: Always-On Proactive Memory via Cognitive Folding https://arxiv.org/abs/2605.13438 True core representation model retrieval_access;representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis 3 agent-memory
349 2605.13542 2026-05-13 recent-2026-Apr-Jul RealICU: Do LLM Agents Understand Long-Context ICU Data? A Benchmark Beyond Behavior Imitation https://arxiv.org/abs/2605.13542 False core execution_state model retrieval_access;representation_organization;execution_state;evaluation_diagnosis benchmark_diagnosis 4 agent-memory
350 2605.13941 2026-05-13 recent-2026-Apr-Jul EvolveMem:Self-Evolving Memory Architecture via AutoResearch for LLM Agents https://arxiv.org/abs/2605.13941 True core update_forgetting model retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis retrieval_representation;experience_skill_policy 8 long-term-memory
351 2605.14421 2026-05-14 recent-2026-Apr-Jul MemLineage: Lineage-Guided Enforcement for LLM Agent Memory https://arxiv.org/abs/2605.14421 True supporting security_privacy model retrieval_access;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui execution_multimodal 5 agent-memory
352 2605.14498 2026-05-14 recent-2026-Apr-Jul GroupMemBench: Benchmarking LLM Agent Memory in Multi-Party Conversations https://arxiv.org/abs/2605.14498 True supporting evaluation model retrieval_access;representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui benchmark_diagnosis 7 agent-memory
353 2605.14906 2026-05-14 recent-2026-Apr-Jul MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models https://arxiv.org/abs/2605.14906 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency benchmark_diagnosis;execution_multimodal 6 agent-memory
354 2605.15128 2026-05-14 recent-2026-Apr-Jul MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory https://arxiv.org/abs/2605.15128 True supporting evaluation model retrieval_access;representation_organization;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency benchmark_diagnosis;execution_multimodal 3 agent-memory
355 2605.15338 2026-05-14 recent-2026-Apr-Jul Hidden in Memory: Sleeper Memory Poisoning in LLM Agents https://arxiv.org/abs/2605.15338 True supporting security_privacy model retrieval_access;evaluation_diagnosis;security_privacy_trust security_governance 4 long-term-memory
356 2605.15701 2026-05-15 recent-2026-Apr-Jul H-Mem: A Novel Memory Mechanism for Evolving and Retrieving Agent Memory via a Hybrid Structure https://arxiv.org/abs/2605.15701 True core update_forgetting model retrieval_access;representation_organization;evaluation_diagnosis;systems_efficiency retrieval_representation;experience_skill_policy 2 agent-memory;memory-evaluation
357 2605.15710 2026-05-15 recent-2026-Apr-Jul SMMBench: A Benchmark for Source-Distributed Multimodal Agent Memory https://arxiv.org/abs/2605.15710 True supporting evaluation model retrieval_access;update_forgetting;evaluation_diagnosis;multimodal_embodied_gui benchmark_diagnosis;execution_multimodal 4 agent-memory;memory-evaluation
358 2605.15759 2026-05-15 recent-2026-Apr-Jul DimMem: Dimensional Structuring for Efficient Long-Term Agent Memory https://arxiv.org/abs/2605.15759 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;systems_efficiency systems_efficiency 5 agent-memory;long-term-memory
359 2605.16233 2026-05-15 recent-2026-Apr-Jul FORGE: Self-Evolving Agent Memory With No Weight Updates via Population Broadcast https://arxiv.org/abs/2605.16233 True supporting evaluation model representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;systems_efficiency update_forgetting;experience_skill_policy 8 agent-memory
360 2605.16481 2026-05-15 recent-2026-Apr-Jul Visual Agentic Memory: Enabling Online Long Video Understanding via Online Indexing, Hierarchical Memory, and Agentic Retrieval https://arxiv.org/abs/2605.16481 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;execution_state;multimodal_embodied_gui retrieval_representation;execution_multimodal 5 agent-memory
361 2605.16746 2026-05-16 recent-2026-Apr-Jul State Contamination in Memory-Augmented LLM Agents https://arxiv.org/abs/2605.16746 True supporting security_privacy model retrieval_access;representation_organization;update_forgetting;execution_state;security_privacy_trust;multi_agent_shared;systems_efficiency security_governance 6 long-term-memory
362 2605.16858 2026-05-16 recent-2026-Apr-Jul Pedestrian-Aware LLM-Driven Behavioral Planning for Autonomous Vehicles https://arxiv.org/abs/2605.16858 False core execution_state model representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis 7 episodic-memory
363 2605.23986 2026-05-16 recent-2026-Apr-Jul MemForest: An Efficient Agent Memory System with Hierarchical Temporal Indexing https://arxiv.org/abs/2605.23986 True core update_forgetting model representation_organization;update_forgetting;evaluation_diagnosis;systems_efficiency retrieval_representation;systems_efficiency 8 agent-memory;memory-evaluation
364 2605.17348 2026-05-17 recent-2026-Apr-Jul Taming "Zombie'' Agents: A Markov State-Aware Framework for Resilient Multi-Agent Evolution https://arxiv.org/abs/2605.17348 False core update_forgetting model multi_agent_shared;systems_efficiency personal_shared 5 agent-memory
365 2605.17596 2026-05-17 recent-2026-Apr-Jul NeuSymMS: A Hybrid Neuro-Symbolic Memory System for Persistent, Self-Curating LLM Agents https://arxiv.org/abs/2605.17596 True core update_forgetting model retrieval_access;representation_organization;security_privacy_trust 0 long-term-memory
366 2605.17625 2026-05-17 recent-2026-Apr-Jul Episodic-Semantic Memory Architecture for Long-Horizon Scientific Agents https://arxiv.org/abs/2605.17625 True core update_forgetting model retrieval_access;update_forgetting;execution_state;evaluation_diagnosis;systems_efficiency execution_multimodal 7 agent-memory
367 2605.17641 2026-05-17 recent-2026-Apr-Jul Causal Intervention-Based Memory Selection for Long-Horizon LLM Agents https://arxiv.org/abs/2605.17641 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis execution_multimodal 6 long-term-memory
368 2605.18284 2026-05-18 recent-2026-Apr-Jul CommitDistill: A Lightweight Knowledge-Centric Memory Layer for Software Repositories https://arxiv.org/abs/2605.18284 True core execution_state model retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui;systems_efficiency experience_skill_policy;systems_efficiency 6 agent-memory
369 2605.18421 2026-05-18 recent-2026-Apr-Jul EvoMemBench: Benchmarking Agent Memory from a Self-Evolving Perspective https://arxiv.org/abs/2605.18421 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis benchmark_diagnosis;experience_skill_policy 6 agent-memory;long-term-memory
370 2605.18652 2026-05-18 recent-2026-Apr-Jul MementoGUI: Learning Agentic Multimodal Memory Control for Long-Horizon GUI Agents https://arxiv.org/abs/2605.18652 True core update_forgetting model retrieval_access;execution_state;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency experience_skill_policy;execution_multimodal 5 agent-memory
371 2605.18930 2026-05-18 recent-2026-Apr-Jul OEP: Poisoning Self-Evolving LLM Agents via Locally Correct but Non-Transferable Experiences https://arxiv.org/abs/2605.18930 False core update_forgetting model representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust experience_skill_policy;security_governance 6 agent-memory
372 2605.19952 2026-05-19 recent-2026-Apr-Jul Rethinking How to Remember: Beyond Atomic Facts in Lifelong LLM Agent Memory https://arxiv.org/abs/2605.19952 True core update_forgetting model retrieval_access;representation_organization;systems_efficiency benchmark_diagnosis 6 agent-memory
373 2605.20616 2026-05-20 recent-2026-Apr-Jul Auto-Dreamer: Learning Offline Memory Consolidation for Language Agents https://arxiv.org/abs/2605.20616 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;experience_skill_learning;security_privacy_trust update_forgetting;experience_skill_policy 4 agent-memory
374 2605.20724 2026-05-20 recent-2026-Apr-Jul CALMem : Application-Layer Dual Memory for Conversational AI https://arxiv.org/abs/2605.20724 True core execution_state model retrieval_access;representation_organization;multimodal_embodied_gui;systems_efficiency 0 episodic-memory
375 2605.20833 2026-05-20 recent-2026-Apr-Jul MemGym: a Long-Horizon Memory Environment for LLM Agents https://arxiv.org/abs/2605.20833 True core execution_state model retrieval_access;update_forgetting;execution_state;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency execution_multimodal 3 agent-memory;memory-evaluation
376 2605.21463 2026-05-20 recent-2026-Apr-Jul Mem-$π$: Adaptive Memory through Learning When and What to Generate https://arxiv.org/abs/2605.21463 True core execution_state model retrieval_access;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui experience_skill_policy 6 episodic-memory
377 2605.22411 2026-05-21 recent-2026-Apr-Jul DeferMem: Query-Time Evidence Distillation via Reinforcement Learning for Long-Term Memory QA https://arxiv.org/abs/2605.22411 True core execution_state model retrieval_access;representation_organization;experience_skill_learning;systems_efficiency experience_skill_policy 2 long-term-memory
378 2605.22721 2026-05-21 recent-2026-Apr-Jul Self-Evolving Multi-Agent Systems via Decentralized Memory https://arxiv.org/abs/2605.22721 True core execution_state model update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multi_agent_shared;multimodal_embodied_gui;systems_efficiency experience_skill_policy;personal_shared 6 long-term-memory
379 2605.23067 2026-05-21 recent-2026-Apr-Jul What Training Data Teaches RL Memory Agents: An Empirical Study of Curriculum Effects in Memory-Augmented QA https://arxiv.org/abs/2605.23067 True core execution_state model experience_skill_learning;evaluation_diagnosis benchmark_diagnosis;experience_skill_policy 3 agent-memory
380 2605.23723 2026-05-22 recent-2026-Apr-Jul MemAudit: Post-hoc Auditing of Poisoned Agent Memory via Causal Attribution and Structural Anomaly Detection https://arxiv.org/abs/2605.23723 True core execution_state model retrieval_access;execution_state;evaluation_diagnosis;security_privacy_trust security_governance 2 agent-memory;long-term-memory
381 2605.24941 2026-05-24 recent-2026-Apr-Jul Memory-Induced Tool-Drift in LLM Agents https://arxiv.org/abs/2605.24941 True core execution_state model evaluation_diagnosis;security_privacy_trust;systems_efficiency 5 long-term-memory
382 2605.25002 2026-05-24 recent-2026-Apr-Jul MemMark: State-Evolution Attribution Watermarking for Agent Long-Term Memory Systems https://arxiv.org/abs/2605.25002 True core execution_state model update_forgetting;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui;systems_efficiency 5 agent-memory
383 2605.26154 2026-05-24 recent-2026-Apr-Jul MemMorph: Tool Hijacking in LLM Agents via Memory Poisoning https://arxiv.org/abs/2605.26154 True core execution_state model experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui security_governance 6 long-term-memory
384 2605.25869 2026-05-25 recent-2026-Apr-Jul Mitigating Provenance-Role Collapse in Long-Term Agents via Typed Memory Representation https://arxiv.org/abs/2605.25869 True core execution_state model retrieval_access;representation_organization;security_privacy_trust;systems_efficiency retrieval_representation;security_governance 5 long-term-memory
385 2605.26252 2026-05-25 recent-2026-Apr-Jul Is Agent Memory a Database? Rethinking Data Foundations for Long-Term AI Agent Memory https://arxiv.org/abs/2605.26252 True core execution_state model retrieval_access;representation_organization;update_forgetting;execution_state;security_privacy_trust;systems_efficiency benchmark_diagnosis;retrieval_representation 1 agent-memory
386 2605.26256 2026-05-25 recent-2026-Apr-Jul Personalizing Embodied Multimodal Large Language Model Agents over Long-term User Interactions https://arxiv.org/abs/2605.26256 False core update_forgetting model retrieval_access;representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui execution_multimodal;personal_shared 2 episodic-memory
387 2605.27366 2026-05-26 recent-2026-Apr-Jul MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation https://arxiv.org/abs/2605.27366 True core update_forgetting model retrieval_access;experience_skill_learning;evaluation_diagnosis benchmark_diagnosis;experience_skill_policy 6 agent-memory
388 2605.27760 2026-05-26 recent-2026-Apr-Jul SkillGrad: Optimizing Agent Skills Like Gradient Descent https://arxiv.org/abs/2605.27760 False core update_forgetting model representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis experience_skill_policy 5 long-term-memory
389 2605.27762 2026-05-26 recent-2026-Apr-Jul PEAM: Parametric Embodied Agent Memory through Contrastive Internalization of Experience in Minecraft https://arxiv.org/abs/2605.27762 True core update_forgetting model retrieval_access;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui experience_skill_policy;execution_multimodal 5 agent-memory
390 2605.27825 2026-05-27 recent-2026-Apr-Jul MRMMIA: Membership Inference Attacks on Memory in Chat Agents https://arxiv.org/abs/2605.27825 True core security_privacy model retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust security_governance 4 agent-memory
391 2605.28046 2026-05-27 recent-2026-Apr-Jul MemCog: From Memory-as-Tool to Memory-as-Cognition in Conversational Agents https://arxiv.org/abs/2605.28046 True core execution_state model retrieval_access;evaluation_diagnosis;multimodal_embodied_gui 4 agent-memory
392 2605.29341 2026-05-28 recent-2026-Apr-Jul WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction https://arxiv.org/abs/2605.29341 True core update_forgetting model retrieval_access;update_forgetting;execution_state;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency benchmark_diagnosis;execution_multimodal 5 agent-memory
393 2605.29630 2026-05-28 recent-2026-Apr-Jul Entity-Collision: A Stratified Protocol for Attributing Retrieval Lift in Agent Memory https://arxiv.org/abs/2605.29630 True core update_forgetting model retrieval_access;evaluation_diagnosis;security_privacy_trust;systems_efficiency retrieval_representation 7 agent-memory;memory-evaluation
394 2605.29640 2026-05-28 recent-2026-Apr-Jul VikingMem: A Memory Base Management System for Stateful LLM-based Applications https://arxiv.org/abs/2605.29640 True core update_forgetting model retrieval_access;update_forgetting;evaluation_diagnosis;systems_efficiency 6 agent-memory;memory-evaluation
395 2605.29960 2026-05-28 recent-2026-Apr-Jul Hijacking Agent Memory: Stealthy Trojan Attacks Through Conversational Interaction https://arxiv.org/abs/2605.29960 True core update_forgetting model evaluation_diagnosis;security_privacy_trust security_governance 5 agent-memory;long-term-memory
396 2605.30058 2026-05-28 recent-2026-Apr-Jul HEART-Bench: Do LLM Agents Exhibit Human-like Psychology? https://arxiv.org/abs/2605.30058 False core experience_learning model representation_organization;update_forgetting;execution_state;evaluation_diagnosis;multimodal_embodied_gui 2 episodic-memory
397 2605.30621 2026-05-28 recent-2026-Apr-Jul Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM Agents https://arxiv.org/abs/2605.30621 False core update_forgetting model update_forgetting;execution_state;experience_skill_learning;systems_efficiency experience_skill_policy 2 procedural-memory
398 2607.00017 2026-05-28 recent-2026-Apr-Jul Learning User-Aware Recall: Personalized Retrieval in Long-Term Conversational Memory https://arxiv.org/abs/2607.00017 True core experience_learning model retrieval_access;evaluation_diagnosis;multimodal_embodied_gui retrieval_representation;experience_skill_policy;personal_shared 5 long-term-memory
399 2605.30690 2026-05-29 recent-2026-Apr-Jul ElasticMem: Latent Memory as a Learnable Resource for LLM Agents https://arxiv.org/abs/2605.30690 True core representation model retrieval_access;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency experience_skill_policy 8 long-term-memory
400 2605.30711 2026-05-29 recent-2026-Apr-Jul SAGE: A Novelty Gate for Efficient Memory Evolution in Agentic LLMs https://arxiv.org/abs/2605.30711 True core representation model retrieval_access;systems_efficiency systems_efficiency 3 agent-memory
401 2605.30858 2026-05-29 recent-2026-Apr-Jul ForecastCompass: Guiding Agentic Forecasting with Adaptive Factor Memory https://arxiv.org/abs/2605.30858 True core representation model retrieval_access;representation_organization;experience_skill_learning;multimodal_embodied_gui experience_skill_policy;execution_multimodal 2 agent-memory
402 2605.31075 2026-05-29 recent-2026-Apr-Jul Task-Focused Memorization for Multimodal Agents https://arxiv.org/abs/2605.31075 True core representation model experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui execution_multimodal 4 agent-memory
403 2606.00619 2026-05-30 recent-2026-Apr-Jul MemPro: Agentic Memory Systems as Evolvable Programs https://arxiv.org/abs/2606.00619 True core representation model retrieval_access;representation_organization;execution_state;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency experience_skill_policy 6 agent-memory
404 2606.00734 2026-05-30 recent-2026-Apr-Jul EMA: Approximate Nearest Neighbor Search with General Attribute Filtering and Dynamic Updates https://arxiv.org/abs/2606.00734 False core representation model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency retrieval_representation;update_forgetting 4 agent-memory
405 2606.00756 2026-05-30 recent-2026-Apr-Jul CoMIC: Collaborative Memory and Insights Circulation for Long-Horizon LLM Agents in Cloud-Edge Systems https://arxiv.org/abs/2606.00756 True core representation model representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;multi_agent_shared;multimodal_embodied_gui;systems_efficiency execution_multimodal;systems_efficiency;personal_shared 2 long-term-memory
406 2606.01138 2026-05-31 recent-2026-Apr-Jul memorywire: A Vendor-Neutral Wire Format for Agent Memory Operations https://arxiv.org/abs/2606.01138 True core representation model retrieval_access;update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;systems_efficiency systems_efficiency 6 agent-memory
407 2606.01528 2026-06-01 recent-2026-Apr-Jul Joint Agent Memory and Exploration Learning via Novelty Signals https://arxiv.org/abs/2606.01528 True core representation model evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency experience_skill_policy 5 agent-memory
408 2606.01722 2026-06-01 recent-2026-Apr-Jul Post-Deterministic Distributed Systems: A New Foundation for Trustworthy Autonomous Infrastructure https://arxiv.org/abs/2606.01722 False core representation model retrieval_access;representation_organization;security_privacy_trust;multimodal_embodied_gui retrieval_representation;security_governance 1 agent-memory
409 2606.02812 2026-06-01 recent-2026-Apr-Jul Traj-Evolve: A Self-Evolving Multi-Agent System for Patient Trajectory Modeling in Lung Cancer Early Detection https://arxiv.org/abs/2606.02812 False core representation model retrieval_access;representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multi_agent_shared;multimodal_embodied_gui experience_skill_policy;personal_shared 3 agent-memory
410 2606.03197 2026-06-02 recent-2026-Apr-Jul MemTrain: Self-Supervised Context Memory Training https://arxiv.org/abs/2606.03197 True core update_forgetting model retrieval_access;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;systems_efficiency 4 agent-memory
411 2606.03329 2026-06-02 recent-2026-Apr-Jul InfoMem: Training Long-Context Memory Agents with Answer-Conditioned Information Gain https://arxiv.org/abs/2606.03329 True core update_forgetting model retrieval_access;experience_skill_learning;evaluation_diagnosis;systems_efficiency 5 agent-memory
412 2606.03374 2026-06-02 recent-2026-Apr-Jul eMEM: A Hybrid Spatio-Temporal Memory System For Embodied Agents https://arxiv.org/abs/2606.03374 True core execution_state model retrieval_access;representation_organization;update_forgetting;execution_state;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency execution_multimodal 6 agent-memory;memory-evaluation
413 2606.04120 2026-06-02 recent-2026-Apr-Jul SaliMory: Orchestrating Cognitive Memory for Conversational Agents https://arxiv.org/abs/2606.04120 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;experience_skill_learning 5 agent-memory
414 2606.04315 2026-06-03 recent-2026-Apr-Jul Exploring Cross-Scenario Generality of Agentic Memory Systems: Diagnostics and a Strong Baseline https://arxiv.org/abs/2606.04315 True core execution_state model retrieval_access;execution_state;evaluation_diagnosis;systems_efficiency benchmark_diagnosis 2 agent-memory
415 2606.04329 2026-06-03 recent-2026-Apr-Jul From Untrusted Input to Trusted Memory: A Systematic Study of Memory Poisoning Attacks in LLM Agents https://arxiv.org/abs/2606.04329 True core security_privacy model retrieval_access;evaluation_diagnosis;security_privacy_trust benchmark_diagnosis;security_governance 3 long-term-memory
416 2606.04555 2026-06-03 recent-2026-Apr-Jul Temporal Order Matters for Agentic Memory: Segment Trees for Long-Horizon Agents https://arxiv.org/abs/2606.04555 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;execution_state;evaluation_diagnosis;systems_efficiency execution_multimodal 4 agent-memory;memory-evaluation
417 2606.04628 2026-06-03 recent-2026-Apr-Jul RAMPART: Registry-based Agentic Memory with Priority-Aware Runtime Transformation https://arxiv.org/abs/2606.04628 True core update_forgetting model retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust;systems_efficiency systems_efficiency 6 agent-memory
418 2606.04780 2026-06-03 recent-2026-Apr-Jul PersonaTree: Structured Lifecycle Memory for Person Understanding in LLM Agents https://arxiv.org/abs/2606.04780 True core experience_learning model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency retrieval_representation;update_forgetting 3 agent-memory;long-term-memory;memory-evaluation
419 2606.05513 2026-06-03 recent-2026-Apr-Jul EpiEvolve: Self-Evolving Agents for Streaming Pandemic Forecasting under Regime Shifts https://arxiv.org/abs/2606.05513 False core update_forgetting model retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis;security_privacy_trust experience_skill_policy 5 episodic-memory
420 2606.28349 2026-06-03 recent-2026-Apr-Jul HMARS: A Hierarchical Multi-Agent Memory System for Long-Context Reasoning https://arxiv.org/abs/2606.28349 True core representation model retrieval_access;representation_organization;evaluation_diagnosis;multi_agent_shared retrieval_representation;personal_shared 4 agent-memory
421 2606.05646 2026-06-04 recent-2026-Apr-Jul Enhancing Software Engineering Through Closed-Loop Memory Optimization https://arxiv.org/abs/2606.05646 True core update_forgetting model experience_skill_learning;evaluation_diagnosis;systems_efficiency 4 episodic-memory
422 2606.05684 2026-06-04 recent-2026-Apr-Jul AdaMEM: Test-Time Adaptive Memory for Language Agents https://arxiv.org/abs/2606.05684 True core update_forgetting model retrieval_access;execution_state;experience_skill_learning;multimodal_embodied_gui;systems_efficiency experience_skill_policy 6 agent-memory
423 2606.06054 2026-06-04 recent-2026-Apr-Jul Beyond Similarity: Trustworthy Memory Search for Personal AI Agents https://arxiv.org/abs/2606.06054 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;security_privacy_trust;systems_efficiency retrieval_representation;security_governance 2 agent-memory
424 2606.06090 2026-06-04 recent-2026-Apr-Jul Beyond Semantic Organization: Memory as Execution State Management for Long-Horizon Agents https://arxiv.org/abs/2606.06090 True core execution_state model retrieval_access;representation_organization;execution_state;security_privacy_trust;multimodal_embodied_gui;systems_efficiency retrieval_representation;execution_multimodal 6 agent-memory
425 2606.06240 2026-06-04 recent-2026-Apr-Jul TOKI: A Bitemporal Operator Algebra for Contradiction Resolution in LLM-Agent Persistent Memory https://arxiv.org/abs/2606.06240 True core update_forgetting model update_forgetting;security_privacy_trust 2 long-term-memory
426 2606.06448 2026-06-04 recent-2026-Apr-Jul Agent Memory: Characterization and System Implications of Stateful Long-Horizon Workloads https://arxiv.org/abs/2606.06448 True core execution_state model retrieval_access;update_forgetting;execution_state;evaluation_diagnosis;systems_efficiency execution_multimodal 2 agent-memory
427 2606.07402 2026-06-05 recent-2026-Apr-Jul M$^3$Exam: Benchmarking Multimodal Memory for Realistic User-Agent Interactions https://arxiv.org/abs/2606.07402 True core access model retrieval_access;representation_organization;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency benchmark_diagnosis;execution_multimodal 4 memory-evaluation
428 2606.09900 2026-06-05 recent-2026-Apr-Jul Less Context, More Accuracy: A Bi-Temporal Memory Engine for LLM Agents Where a Lean Retrieved Context Beats the Full History https://arxiv.org/abs/2606.09900 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;security_privacy_trust;systems_efficiency retrieval_representation 7 long-term-memory;memory-evaluation
429 2606.24896 2026-06-05 recent-2026-Apr-Jul Why Memory Components Fail: Eight Years of License and Sustainability Events in Open-Source Data Infrastructure https://arxiv.org/abs/2606.24896 True core access model representation_organization;experience_skill_learning;security_privacy_trust retrieval_representation 1 agent-memory
430 2606.08367 2026-06-06 recent-2026-Apr-Jul Emergence World: A Platform for Evaluating Long-Horizon Multi-Agent Autonomy https://arxiv.org/abs/2606.08367 False core execution_state model retrieval_access;execution_state;evaluation_diagnosis;security_privacy_trust;multi_agent_shared benchmark_diagnosis;execution_multimodal;personal_shared 3 long-term-memory
431 2606.09198 2026-06-08 recent-2026-Apr-Jul MASS: Deep Research for Social Sciences with Memory-Augmented Social Simulation https://arxiv.org/abs/2606.09198 True core experience_learning model retrieval_access;representation_organization;update_forgetting;execution_state;multimodal_embodied_gui retrieval_representation 4 agent-memory
432 2606.09461 2026-06-08 recent-2026-Apr-Jul H2HMem: A Multimodal Memory Benchmark for Agents in Human-Human Interactions https://arxiv.org/abs/2606.09461 True core representation model retrieval_access;update_forgetting;evaluation_diagnosis;multimodal_embodied_gui benchmark_diagnosis;execution_multimodal 3 memory-evaluation
433 2606.09483 2026-06-08 recent-2026-Apr-Jul Memory Beyond Recall: A Dual-Process Cognitive Memory System for Self-Evolving LLM Agents https://arxiv.org/abs/2606.09483 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;experience_skill_learning;evaluation_diagnosis retrieval_representation;experience_skill_policy 2 agent-memory;long-term-memory
434 2606.09774 2026-06-08 recent-2026-Apr-Jul Auto-Configuring Scientific Simulators with Lightweight Coding-Agent Adapters https://arxiv.org/abs/2606.09774 False core execution_state model retrieval_access;experience_skill_learning;systems_efficiency experience_skill_policy 2 agent-memory
435 2606.10062 2026-06-08 recent-2026-Apr-Jul Deployment-Time Memorization in Foundation-Model Agents https://arxiv.org/abs/2606.10062 True supporting evaluation model retrieval_access;update_forgetting;evaluation_diagnosis;security_privacy_trust;systems_efficiency 5 agent-memory
436 2606.10299 2026-06-09 recent-2026-Apr-Jul What Spatial Memory Must Store: Occlusion as the Test for Language-Agent Memory https://arxiv.org/abs/2606.10299 True core execution_state model retrieval_access execution_multimodal 7 agent-memory
437 2606.10423 2026-06-09 recent-2026-Apr-Jul WebChallenger: A Reliable and Efficient Generalist Web Agent https://arxiv.org/abs/2606.10423 False core execution_state model representation_organization;experience_skill_learning;multimodal_embodied_gui;systems_efficiency execution_multimodal;systems_efficiency 4 long-term-memory
438 2606.10532 2026-06-09 recent-2026-Apr-Jul ActiveMem: Distributed Active Memory for Long-Horizon LLM Reasoning https://arxiv.org/abs/2606.10532 True core execution_state model retrieval_access;update_forgetting;execution_state execution_multimodal 3 agent-memory
439 2606.10577 2026-06-09 recent-2026-Apr-Jul AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness https://arxiv.org/abs/2606.10577 False core execution_state model retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui execution_multimodal 6 agent-memory
440 2606.10677 2026-06-09 recent-2026-Apr-Jul Infini Memory: Maintainable Topic Documents for Long-Term LLM Agent Memory https://arxiv.org/abs/2606.10677 True core execution_state model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;systems_efficiency retrieval_representation 3 agent-memory;long-term-memory
441 2606.11680 2026-06-10 recent-2026-Apr-Jul Organize then Retrieve: Hierarchical Memory Navigation for Efficient Agents https://arxiv.org/abs/2606.11680 True core execution_state model retrieval_access;representation_organization;execution_state;experience_skill_learning;multimodal_embodied_gui;systems_efficiency retrieval_representation;execution_multimodal;systems_efficiency 5 agent-memory
442 2606.12290 2026-06-10 recent-2026-Apr-Jul Selection Integrity for LLM Graph Memory: An Accumulability Criterion for Information-Flow-Blind Retrieval https://arxiv.org/abs/2606.12290 True core execution_state model retrieval_access;representation_organization;security_privacy_trust;systems_efficiency retrieval_representation;security_governance 0 agent-memory
443 2606.12703 2026-06-10 recent-2026-Apr-Jul SMSR: Certified Defence Against Runtime Memory Poisoning in Persistent LLM Agent Systems https://arxiv.org/abs/2606.12703 True core execution_state model retrieval_access;evaluation_diagnosis;security_privacy_trust security_governance;systems_efficiency 3 long-term-memory
444 2606.12852 2026-06-11 recent-2026-Apr-Jul WISE: A Long-Horizon Agent in Minecraft with Why-Which Reasoning https://arxiv.org/abs/2606.12852 False core execution_state model retrieval_access;representation_organization;execution_state;multimodal_embodied_gui execution_multimodal 3 episodic-memory
445 2606.12945 2026-06-11 recent-2026-Apr-Jul Learning What to Remember: A Cognitively Grounded Multi-Factor Value Model for Agentic Memory https://arxiv.org/abs/2606.12945 True core execution_state model retrieval_access;update_forgetting;evaluation_diagnosis;systems_efficiency experience_skill_policy 9 agent-memory
446 2606.13177 2026-06-11 recent-2026-Apr-Jul MemRefine: LLM-Guided Compression for Long-Term Agent Memory https://arxiv.org/abs/2606.13177 True core update_forgetting model retrieval_access;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency execution_multimodal;systems_efficiency 4 agent-memory
447 2606.13392 2026-06-11 recent-2026-Apr-Jul MiniMax Sparse Attention https://arxiv.org/abs/2606.13392 False supporting execution_state model retrieval_access;representation_organization;multimodal_embodied_gui;systems_efficiency 4 long-term-memory
448 2606.14470 2026-06-12 recent-2026-Apr-Jul GitOfThoughts: Version-Controlled Reasoning and Agent Memory You Can Replay, Diff, and Merge https://arxiv.org/abs/2606.14470 True supporting execution_state model retrieval_access;representation_organization;evaluation_diagnosis;systems_efficiency 6 agent-memory
449 2606.14571 2026-06-12 recent-2026-Apr-Jul StreamMemBench: Streaming Evaluation of Agent Memory for Future-Oriented Assistance https://arxiv.org/abs/2606.14571 True supporting execution_state model retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis benchmark_diagnosis 4 agent-memory;memory-evaluation
450 2606.15071 2026-06-13 recent-2026-Apr-Jul Quantum learning with a single-atom sensor https://arxiv.org/abs/2606.15071 False supporting execution_state model systems_efficiency experience_skill_policy 0 agent-memory
451 2606.15609 2026-06-14 recent-2026-Apr-Jul FragFuse: Bypassing Access Control of Large Language Model Agents via Memory-Based Query Fragmentation and Fusion https://arxiv.org/abs/2606.15609 True supporting execution_state model retrieval_access;evaluation_diagnosis;security_privacy_trust 6 agent-memory;long-term-memory
452 2606.15903 2026-06-14 recent-2026-Apr-Jul Control-Plane Placement Shapes Forgetting: An Architectural Study of Agent Memory Across Thirteen System Configurations https://arxiv.org/abs/2606.15903 True supporting execution_state model retrieval_access;update_forgetting;evaluation_diagnosis;security_privacy_trust;systems_efficiency benchmark_diagnosis;update_forgetting 8 agent-memory
453 2606.16903 2026-06-15 recent-2026-Apr-Jul Directory-Aware Query and Maintenance in Vector Databases https://arxiv.org/abs/2606.16903 False supporting execution_state model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;systems_efficiency retrieval_representation 4 agent-memory
454 2606.17328 2026-06-15 recent-2026-Apr-Jul MemTrace: Probing What Final Accuracy Misses in Long-Term Memory https://arxiv.org/abs/2606.17328 True supporting execution_state model retrieval_access;execution_state;evaluation_diagnosis;systems_efficiency 4 long-term-memory
455 2606.17628 2026-06-16 recent-2026-Apr-Jul OPD-Evolver: Cultivating Holistic Agent Evolver via On-Policy Distillation https://arxiv.org/abs/2606.17628 False supporting execution_state model retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis experience_skill_policy 4 agent-memory
456 2606.18356 2026-06-16 recent-2026-Apr-Jul SafeClawBench: Separating Semantic, Audit-Evidence, and Sandbox Harm in Tool-Using LLM Agents https://arxiv.org/abs/2606.18356 False supporting execution_state model representation_organization;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui 7 long-term-memory
457 2606.18406 2026-06-16 recent-2026-Apr-Jul CoreMem: Riemannian Retrieval and Fisher-Guided Distillation for Long-Term Memory in Dialogue Agents https://arxiv.org/abs/2606.18406 True supporting execution_state model retrieval_access;representation_organization;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency retrieval_representation;experience_skill_policy;execution_multimodal 5 agent-memory
458 2606.18746 2026-06-17 recent-2026-Apr-Jul What Must Generalist Agents Remember? https://arxiv.org/abs/2606.18746 True core experience_learning model execution_state 0 agent-memory
459 2606.18829 2026-06-17 recent-2026-Apr-Jul GateMem: Benchmarking Memory Governance in Multi-Principal Shared-Memory Agents https://arxiv.org/abs/2606.18829 True supporting shared_memory model retrieval_access;representation_organization;update_forgetting;execution_state;evaluation_diagnosis;security_privacy_trust;systems_efficiency benchmark_diagnosis;security_governance 5 agent-memory;memory-evaluation
460 2606.18950 2026-06-17 recent-2026-Apr-Jul RTSGameBench: An RTS Benchmark for Strategic Reasoning by Vision-Language Models https://arxiv.org/abs/2606.18950 False supporting update_forgetting model representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multi_agent_shared benchmark_diagnosis 3 agent-memory
461 2606.19409 2026-06-17 recent-2026-Apr-Jul OpenRath: Session-Centered Runtime State for Agent Systems https://arxiv.org/abs/2606.19409 False core representation model evaluation_diagnosis;security_privacy_trust;multi_agent_shared;systems_efficiency systems_efficiency 3 agent-memory
462 2606.19847 2026-06-18 recent-2026-Apr-Jul AtomMem: Building Simple and Effective Memory System for LLM Agents via Atomic Facts https://arxiv.org/abs/2606.19847 True core representation model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;systems_efficiency 2 long-term-memory
463 2606.19857 2026-06-18 recent-2026-Apr-Jul Large Language Models Do Not Always Need Readable Language https://arxiv.org/abs/2606.19857 False supporting representation model representation_organization;evaluation_diagnosis;multi_agent_shared;systems_efficiency 4 agent-memory
464 2606.20047 2026-06-18 recent-2026-Apr-Jul PACMS: Submodular Context Selection as a Pluggable Engine for LLM Agents https://arxiv.org/abs/2606.20047 False supporting update_forgetting model retrieval_access;systems_efficiency 2 long-term-memory
465 2606.20515 2026-06-18 recent-2026-Apr-Jul S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence https://arxiv.org/abs/2606.20515 False core representation model representation_organization;evaluation_diagnosis;multimodal_embodied_gui execution_multimodal 6 agent-memory
466 2606.20954 2026-06-18 recent-2026-Apr-Jul Learning What Not to Forget: Long-Horizon Agent Memory from a Few Kilobytes of Learning https://arxiv.org/abs/2606.20954 True core representation model retrieval_access;update_forgetting;execution_state;evaluation_diagnosis;systems_efficiency update_forgetting;experience_skill_policy;execution_multimodal 8 agent-memory
467 2606.21144 2026-06-19 recent-2026-Apr-Jul AdaMem: Learning What to Remember for Personalized Long-Horizon LLM Agents https://arxiv.org/abs/2606.21144 True core representation model representation_organization;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;systems_efficiency experience_skill_policy;execution_multimodal;personal_shared 5 long-term-memory
468 2606.21562 2026-06-19 recent-2026-Apr-Jul Compressing Observation History into Agent Memory: Distilling Transformers into Recurrent Transformers https://arxiv.org/abs/2606.21562 True supporting representation model representation_organization;execution_state;multimodal_embodied_gui;systems_efficiency experience_skill_policy;systems_efficiency 2 agent-memory
469 2606.21649 2026-06-19 recent-2026-Apr-Jul EvoEmbedding: Evolvable Representations for Long-Context Retrieval and Agentic Memory https://arxiv.org/abs/2606.21649 True supporting representation model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis retrieval_representation;experience_skill_policy 6 agent-memory
470 2606.22030 2026-06-20 recent-2026-Apr-Jul Nous: A Predictive World Model for Long-Term Agent Memory https://arxiv.org/abs/2606.22030 True core experience_learning model representation_organization;update_forgetting;evaluation_diagnosis;systems_efficiency 5 agent-memory;memory-evaluation
471 2606.22263 2026-06-20 recent-2026-Apr-Jul Revelio: Cost-Efficient Agentic Memory Safety Vulnerability Detection For Repository-Scale Codebases https://arxiv.org/abs/2606.22263 True supporting security_privacy model evaluation_diagnosis;security_privacy_trust;systems_efficiency security_governance;systems_efficiency 5 agent-memory
472 2606.22844 2026-06-22 recent-2026-Apr-Jul RaMem: Contextual Reinstatement for Long-term Agentic Memory https://arxiv.org/abs/2606.22844 True core execution_state model retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis 7 agent-memory;long-term-memory;memory-evaluation
473 2606.22877 2026-06-22 recent-2026-Apr-Jul DynamicMem: A Long-Horizon Memory Benchmark in Real-World Settings https://arxiv.org/abs/2606.22877 True supporting security_privacy model retrieval_access;update_forgetting;execution_state;evaluation_diagnosis;security_privacy_trust;systems_efficiency benchmark_diagnosis;execution_multimodal 6 memory-evaluation
474 2606.23127 2026-06-22 recent-2026-Apr-Jul Managing Procedural Memory in LLM Agents: Control, Adaptation, and Evaluation https://arxiv.org/abs/2606.23127 True core evaluation model experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui benchmark_diagnosis;experience_skill_policy 7 procedural-memory
475 2606.23195 2026-06-22 recent-2026-Apr-Jul Memory Contagion: Cross-Temporal Propagation of Evaluator Bias via Agent Memory https://arxiv.org/abs/2606.23195 True supporting security_privacy model retrieval_access;update_forgetting;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui benchmark_diagnosis 4 agent-memory
476 2606.23283 2026-06-22 recent-2026-Apr-Jul Towards Root Memories: Benchmarking and Enhancing Implicit Logical Memory Retrieval for Personalized LLMs https://arxiv.org/abs/2606.23283 True core execution_state model retrieval_access;representation_organization;evaluation_diagnosis;systems_efficiency benchmark_diagnosis;retrieval_representation;personal_shared 5 agent-memory
477 2606.24322 2026-06-23 recent-2026-Apr-Jul Securing LLM-Agent Long-Term Memory Against Poisoning: Non-Malleable, Origin-Bound Authority with Machine-Checked Guarantees https://arxiv.org/abs/2606.24322 True supporting security_privacy model retrieval_access;evaluation_diagnosis;security_privacy_trust security_governance 6 agent-memory;long-term-memory
478 2606.24535 2026-06-23 recent-2026-Apr-Jul Governed Shared Memory for Multi-Agent LLM Systems https://arxiv.org/abs/2606.24535 True core shared_memory model retrieval_access;update_forgetting;evaluation_diagnosis;security_privacy_trust;multi_agent_shared;systems_efficiency security_governance;personal_shared 7 agent-memory
479 2606.24595 2026-06-23 recent-2026-Apr-Jul MEMPROBE: Probing Long-Term Agent Memory via Hidden User-State Recovery https://arxiv.org/abs/2606.24595 True supporting security_privacy model retrieval_access;representation_organization;execution_state;evaluation_diagnosis;security_privacy_trust;systems_efficiency 5 agent-memory;long-term-memory
480 2606.24775 2026-06-23 recent-2026-Apr-Jul Are We Ready For An Agent-Native Memory System? https://arxiv.org/abs/2606.24775 True core update_forgetting model retrieval_access;representation_organization;update_forgetting;execution_state;evaluation_diagnosis;security_privacy_trust;systems_efficiency 6 agent-memory
481 2606.25115 2026-06-23 recent-2026-Apr-Jul Forget to Improve: On-Device LLM-Agent Continual Learning via Budget-Curated Memory https://arxiv.org/abs/2606.25115 True supporting security_privacy model retrieval_access;update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui;systems_efficiency update_forgetting;experience_skill_policy;systems_efficiency 2 agent-memory
482 2606.25161 2026-06-23 recent-2026-Apr-Jul TRUSTMEM: Learning Trustworthy Memory Consolidation for LLM Agents with Long-Term Memory https://arxiv.org/abs/2606.25161 True core update_forgetting model update_forgetting;experience_skill_learning;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui update_forgetting;experience_skill_policy;security_governance 7 agent-memory;long-term-memory
483 2606.25206 2026-06-23 recent-2026-Apr-Jul RAVEN: Long-Horizon Reasoning & Navigation with a Visuo-Spatio-Temporal Memory https://arxiv.org/abs/2606.25206 True core execution_state model retrieval_access;representation_organization;execution_state;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency execution_multimodal 2 agent-memory
484 2606.26627 2026-06-25 recent-2026-Apr-Jul Agents That Know Too Much: A Data-Centric Survey of Privacy in LLM Agents https://arxiv.org/abs/2606.26627 False supporting security_privacy model retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust benchmark_diagnosis;security_governance 2 agent-memory
485 2606.26790 2026-06-25 recent-2026-Apr-Jul OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning https://arxiv.org/abs/2606.26790 False core update_forgetting model retrieval_access;representation_organization;execution_state;experience_skill_learning;multimodal_embodied_gui;systems_efficiency experience_skill_policy 6 procedural-memory
486 2606.27499 2026-06-25 recent-2026-Apr-Jul DMV-Bench: Diagnosing Long-Horizon Multimodal Agents' Visual Memory with Incidental Cue Injection https://arxiv.org/abs/2606.27499 True core execution_state model retrieval_access;execution_state;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui benchmark_diagnosis;execution_multimodal 6 agent-memory
487 2606.28781 2026-06-27 recent-2026-Apr-Jul HyphaeDB: A Living Knowledge Topology for Agent-First Memory https://arxiv.org/abs/2606.28781 True core execution_state model retrieval_access;representation_organization;multi_agent_shared;systems_efficiency systems_efficiency 0 agent-memory
488 2606.28971 2026-06-27 recent-2026-Apr-Jul Self-Evolving Agentic Image Restoration via Deliberate Planning and Intuitive Execution https://arxiv.org/abs/2606.28971 False core update_forgetting model retrieval_access;representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency experience_skill_policy 3 episodic-memory
489 2606.29774 2026-06-29 recent-2026-Apr-Jul Analytic Concept-Centric Memory for Agentic Embodied Manipulation https://arxiv.org/abs/2606.29774 True core update_forgetting model retrieval_access;representation_organization;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui execution_multimodal 5 agent-memory;memory-evaluation
490 2606.29778 2026-06-29 recent-2026-Apr-Jul Mandol: An Agglomerative Agent Memory System for Long-Term Conversations https://arxiv.org/abs/2606.29778 True core execution_state model retrieval_access;representation_organization;update_forgetting;evaluation_diagnosis;systems_efficiency 4 agent-memory
491 2606.29788 2026-06-29 recent-2026-Apr-Jul MemLeak: Diagnosing Information Leaks in Multimodal Agent Memory https://arxiv.org/abs/2606.29788 True core update_forgetting model representation_organization;update_forgetting;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui benchmark_diagnosis;execution_multimodal;security_governance 7 agent-memory
492 2606.29824 2026-06-29 recent-2026-Apr-Jul Neural Procedural Memory: Empowering LLM Agents with Implicit Activation Steering https://arxiv.org/abs/2606.29824 True core update_forgetting model retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui experience_skill_policy 5 agent-memory;procedural-memory
493 2606.29914 2026-06-29 recent-2026-Apr-Jul MemDelta: Controlled Baselines and Hidden Confounds in Agent Memory Evaluation https://arxiv.org/abs/2606.29914 True supporting security_privacy model retrieval_access;update_forgetting;evaluation_diagnosis;systems_efficiency benchmark_diagnosis 7 agent-memory;memory-evaluation
494 2606.29961 2026-06-29 recent-2026-Apr-Jul DuoMem: Towards Capable On-Device Memory Agents via Dual-Space Distillation https://arxiv.org/abs/2606.29961 True core update_forgetting model experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui experience_skill_policy;systems_efficiency 5 agent-memory
495 2606.30296 2026-06-29 recent-2026-Apr-Jul ManimAgent: Self-Evolving Multimodal Agents for Visual Education https://arxiv.org/abs/2606.30296 False core execution_state model retrieval_access;update_forgetting;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency experience_skill_policy;execution_multimodal 6 episodic-memory
496 2606.30566 2026-06-29 recent-2026-Apr-Jul Forensic Trajectory Signatures for Agent Memory Poisoning Detection https://arxiv.org/abs/2606.30566 True core update_forgetting model retrieval_access;execution_state;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui security_governance 4 agent-memory;long-term-memory
497 2606.30639 2026-06-29 recent-2026-Apr-Jul Self-Evolving World Models for LLM Agent Planning https://arxiv.org/abs/2606.30639 False core update_forgetting model retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis experience_skill_policy 4 episodic-memory
498 2606.31046 2026-06-30 recent-2026-Apr-Jul OpenLife: Toward Open-World Artificial Life with Autonomous LLM Agents https://arxiv.org/abs/2606.31046 False core experience_learning model retrieval_access;representation_organization;experience_skill_learning;evaluation_diagnosis;systems_efficiency 2 long-term-memory
499 2606.31612 2026-06-30 recent-2026-Apr-Jul What Memory Do GUI Agents Really Need? From Passive Records to Active Task-Driving States https://arxiv.org/abs/2606.31612 True core update_forgetting model retrieval_access;update_forgetting;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency benchmark_diagnosis;execution_multimodal 3 agent-memory
500 2607.02579 2026-06-30 recent-2026-Apr-Jul When Not to Write Memory: Governing False Promotion from Correlated Agent Traces https://arxiv.org/abs/2607.02579 True core update_forgetting model retrieval_access;update_forgetting;evaluation_diagnosis;security_privacy_trust;systems_efficiency update_forgetting;security_governance 4 agent-memory
501 2607.00454 2026-07-01 recent-2026-Apr-Jul Agri-SAGE: Simulation-Grounded Multi-Agent LLM for Context-Aware Agricultural Advisory Generation https://arxiv.org/abs/2607.00454 False core update_forgetting model retrieval_access;evaluation_diagnosis;multi_agent_shared;multimodal_embodied_gui;systems_efficiency personal_shared 6 episodic-memory
502 2607.01047 2026-07-01 recent-2026-Apr-Jul Conversable Complexity: Agentic LLM Collectives as Interpretable Substrates https://arxiv.org/abs/2607.01047 False core execution_state model retrieval_access;experience_skill_learning;evaluation_diagnosis personal_shared 3 long-term-memory
503 2607.01071 2026-07-01 recent-2026-Apr-Jul MemSyco-Bench: Benchmarking Sycophancy in Agent Memory https://arxiv.org/abs/2607.01071 True core execution_state model retrieval_access;update_forgetting;evaluation_diagnosis;systems_efficiency benchmark_diagnosis 4 agent-memory;memory-evaluation
504 2607.01523 2026-07-01 recent-2026-Apr-Jul Multi-Head Recurrent Memory Agents https://arxiv.org/abs/2607.01523 True core update_forgetting model update_forgetting;evaluation_diagnosis;security_privacy_trust;systems_efficiency 7 agent-memory
505 2607.01709 2026-07-02 recent-2026-Apr-Jul COMFYCLAW: Self-Evolving Skill Harnesses for Image Generation Workflows https://arxiv.org/abs/2607.01709 False core update_forgetting model retrieval_access;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency experience_skill_policy 5 agent-memory
506 2607.01916 2026-07-02 recent-2026-Apr-Jul ContextSniper: AntTrail's Token-Efficient Code Memory for Repository-Level Program Repair https://arxiv.org/abs/2607.01916 True core update_forgetting model retrieval_access;representation_organization;evaluation_diagnosis;systems_efficiency systems_efficiency 6 agent-memory
507 2607.01935 2026-07-02 recent-2026-Apr-Jul A-TMA: Decoupling State-Aware Memory Failures in Long-Term Agent Memory https://arxiv.org/abs/2607.01935 True core update_forgetting model retrieval_access;update_forgetting;evaluation_diagnosis 3 agent-memory;long-term-memory
508 2607.03726 2026-07-04 recent-2026-Apr-Jul SelfMem: Self-Optimizing Memory for AI Agents https://arxiv.org/abs/2607.03726 True core update_forgetting model retrieval_access;execution_state;experience_skill_learning;evaluation_diagnosis;multimodal_embodied_gui;systems_efficiency 7 agent-memory
509 2607.04089 2026-07-05 recent-2026-Apr-Jul PLACEMEM: Toward a Compute-Aware Memory Plane for Lifelong Agents https://arxiv.org/abs/2607.04089 True core update_forgetting model retrieval_access;update_forgetting;evaluation_diagnosis;security_privacy_trust;systems_efficiency 2 agent-memory
510 2607.04391 2026-07-05 recent-2026-Apr-Jul Memory-Orchestrated Semantic System (MOSS): An Auditable Agentic Memory Architecture https://arxiv.org/abs/2607.04391 True core update_forgetting model retrieval_access;representation_organization;systems_efficiency 0 agent-memory
511 2607.05029 2026-07-06 recent-2026-Apr-Jul Your Agent's Memories Are Not Its Own: Forged Reasoning Attacks on LLM Agent Memory and Defenses https://arxiv.org/abs/2607.05029 True core update_forgetting model retrieval_access;evaluation_diagnosis;security_privacy_trust security_governance 6 agent-memory;long-term-memory
512 2607.05577 2026-07-06 recent-2026-Apr-Jul Narrative World Model: Narratology-Grounded Writer Memory for Long-Form Fiction https://arxiv.org/abs/2607.05577 True core update_forgetting model retrieval_access;representation_organization;evaluation_diagnosis 5 agent-memory
513 2607.06595 2026-07-06 recent-2026-Apr-Jul When Agents Remember Too Much: Memory Poisoning Attacks on Large Language Model Agents https://arxiv.org/abs/2607.06595 True core update_forgetting model retrieval_access;execution_state;security_privacy_trust;systems_efficiency security_governance 4 agent-memory;long-term-memory
514 2607.06195 2026-07-07 recent-2026-Apr-Jul LogicHunter: Testing LLM Agent Frameworks with an Agentic Oracle https://arxiv.org/abs/2607.06195 False core update_forgetting model retrieval_access;representation_organization;evaluation_diagnosis;security_privacy_trust;multimodal_embodied_gui 7 memory-evaluation
515 2607.07108 2026-07-08 recent-2026-Apr-Jul Seeing and Reflecting: Multimodal Memory-Enhanced Agent Collaboration for Recommendation https://arxiv.org/abs/2607.07108 True core update_forgetting model representation_organization;update_forgetting;experience_skill_learning;multimodal_embodied_gui execution_multimodal 5 agent-memory
516 2607.08032 2026-07-09 recent-2026-Apr-Jul What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents https://arxiv.org/abs/2607.08032 True core update_forgetting model retrieval_access;update_forgetting;evaluation_diagnosis;systems_efficiency update_forgetting 5 agent-memory
517 2607.08716 2026-07-09 recent-2026-Apr-Jul Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents https://arxiv.org/abs/2607.08716 True core update_forgetting model retrieval_access;representation_organization;execution_state;evaluation_diagnosis;multimodal_embodied_gui execution_multimodal 6 agent-memory
@@ -0,0 +1,66 @@
# Agent Memory field audit
status: completed
date: 2026-07-10
owner: Codex + user
## 触发原因
12 篇锚点讲义被用户判定为无用。问题不是表达,而是样本太少、没有时间对照、没有拆实验归因,也没有解释大量论文在共同解决什么。
## 研究问题
1. 最近六个月相对前六个月,哪些问题出现了可比较的能力进步?
2. 哪些只是新架构、新数据集或更弱 baseline 下的表面增益?
3. 静态召回、更新、执行状态、经验复用、写入治理和安全分别卡在哪里?
4. 一个 memory 设计需要怎样的实验才能支持因果主张?
## 数据修正
- 原论文采集器每个 query 默认只取最新 120 篇。2026-05 到 2026-07 的 `agent memory` 结果已经超过上限,因此旧库的月份分布有截断偏差,不能用于半年趋势。
- 新工具 `tools/research/search_arxiv_memory.py` 使用分页和 5 组查询,覆盖 2025-01-01 至 2026-07-10,得到 516 个唯一候选。
- 词法上界为 379 篇标题中心论文;最近六个月 292 篇,前六个月 61 篇。
- 本地自动 `memory` 标签实际对应 293 篇论文,不是此前记录的 296;三条差异来自非论文条目。
## 流程
1. 用分页 arXiv API 建立可复跑的候选池和摘要数据。
2. 用本地 `ChatGPT-5.6:Terra` 做 516 篇 recall-oriented 初筛,只作为 triage,不承担结论。
3. 用确定性词法规则生成时间窗口、标题议程和 evidence-cue 统计。
4. 下载 32 篇 PDF 并转成文本,定位 introduction、主结果、消融、成本和 limitation。
5. 只在同 benchmark、同论文受控设置或明确固定变量的研究中判断能力变化。
6. 把正结果、负结果、成本和不能外推的范围同时写入证据账本。
## 模型分工
- Ollama 小模型只做摘要级 relevance/problem triage。请求不指定 `num_ctx`,不发送 `keep_alive`
- 曾用 `ChatGPT-5.6:Sol` 测试细粒度抽取,约 3 分钟才处理 12 篇,未继续跑 293 篇;部分结果保存在 `memory-classified.json`,不参与领域结论。
- 规则程序负责可复跑的日期、数量、关键词和窗口统计。
- Codex 负责全文实验核验、跨论文冲突、归因和最终判断。
- 本轮没有中控 GPT-5.5 的 API 信息,因此没有把它写成已执行步骤。
## 产物
- `data/research/agent-memory-expanded.json`: 516 篇分页候选及摘要。
- `data/research/agent-memory-screened.json`: 摘要级初筛结果。
- `data/research/memory-corpus.json`: 本地 293 篇 `memory` 标签论文的完整摘要。
- `data/research/memory-classified.json`: Sol 细粒度抽取的 12/293 篇中止样本。
- `data/research/memory-landscape.json`: 时间窗口、方向和 evidence-cue 统计。
- `data/research/memory-paper-ledger.csv`: 每篇候选的可过滤账本。
- `research/memory/findings.md`: 直接回答问题的研究结论。
- `research/memory/evidence-ledger.md`: 全文证据和边界。
## 有效经验
- 论文数量不能作为进步指标;必须找相同任务或单变量控制。
- 先找强负结果和 baseline audit,再读新架构,能快速发现假增益。
- 摘要可以筛选“可能有证据”的论文,不能支持成本、公平性和失败边界。
- “memory”必须拆成 write、store、retrieve、resolve、use、act 六个阶段,否则论文结果无法比较。
- 同一个系统要分开报告静态 QA、动态更新和 agentic action;三者不能共享一个总分结论。
## 仍有限制
- 516 是查询并集,自动初筛明显偏向高召回;379 是词法上界,不是人工确认核心数。
- 32 篇全文仍不是 379 篇的全量系统综述,但已经覆盖关键 benchmark、受控反例和近期正结果。
- 最近几个月的大量材料是未独立复现的 arXiv preprint。
- 论文之间的模型和 harness 快速变化,跨论文只做问题趋势判断,不做绝对分数排行榜。
@@ -1,6 +1,6 @@
# KC-001Agent Memory 主题卷宗试验 # KC-001Agent Memory 主题卷宗试验
status: running status: failed
date: 2026-07-10 date: 2026-07-10
owner: Codex + user owner: Codex + user
@@ -23,7 +23,7 @@ owner: Codex + user
- 本地 Agent 论文库:974 篇。 - 本地 Agent 论文库:974 篇。
- 时间范围:现有库覆盖的最近一年。 - 时间范围:现有库覆盖的最近一年。
- 候选 memory 证据池:296 篇自动标签论文。 - 候选 memory 证据池:293 篇自动标签论文。此前的 296 把非论文条目算了进去,现已纠正。
- 本轮锚点:12 篇原始论文。 - 本轮锚点:12 篇原始论文。
## 锚点选择规则 ## 锚点选择规则
@@ -123,6 +123,20 @@ EvoMemBench、AutoMEM 诊断和预算研究对认知的贡献不亚于新方法
## 目前的失败与不足 ## 目前的失败与不足
### 用户判定:失败
用户的反馈是“读的论文太少”“认知没有提高”“不是要听课,而是一起研究”。这个判定成立。本轮产物虽然结构完整,但没有回答最重要的研究问题:
- memory 领域当前到底在解决哪些不同问题。
- 半年前的失败今天有没有在可比实验中改善。
- 200 多篇论文分别在做什么,而不是 12 篇锚点说了什么。
- 哪些增益来自 memory,哪些来自模型、embedding、prompt、token 或额外调用。
- 一个新设计需要什么证据才能说服别人。
失败原因不是页面或讲义形式,而是研究采样和归因方式错误:12 篇锚点适合搭概念框架,不足以判断领域进展;跨论文总分不可比,却没有先建立受控比较和时间基线;输出形式像课程,把未充分验证的综合判断写成了结论。
因此本试验不再以“让用户完成 45 分钟学习”为下一步。后续改为 field audit:完整分页采集、问题分层、同 benchmark 受控比较、全文证据账本和失败边界记录。新结果见 `research/memory/findings.md`
- 还没有真实用户学习数据,因此不能证明 45 分钟路径有效。 - 还没有真实用户学习数据,因此不能证明 45 分钟路径有效。
- 12 篇锚点偏 2026 年最新工作,缺少对 2023-2025 经典系统的直接精读,历史演化主要由 survey 补足。 - 12 篇锚点偏 2026 年最新工作,缺少对 2023-2025 经典系统的直接精读,历史演化主要由 survey 补足。
- 定量结果来自不同模型、benchmark 和协议,只能逐篇解释,不能横向排序。 - 定量结果来自不同模型、benchmark 和协议,只能逐篇解释,不能横向排序。
@@ -151,4 +165,3 @@ EvoMemBench、AutoMEM 诊断和预算研究对认知的贡献不亚于新方法
- 两道设计题至少一道达到 2 分以上。 - 两道设计题至少一道达到 2 分以上。
- 一周后复习仍能恢复主要框架,而不是只记住论文名字。 - 一周后复习仍能恢复主要框架,而不是只记住论文名字。
- 用户能指出至少一个讲义结论的证据边界。 - 用户能指出至少一个讲义结论的证据边界。
+8
View File
@@ -0,0 +1,8 @@
# Research
这里保存跨论文、带时间对照和证据边界的研究结果。单篇资料仍归档在 `papers/`,研究结论不能只依赖摘要或论文标题。
## Current audits
- [Memory findings](memory/findings.md): 最近六个月哪些问题真的有进展,哪些仍未解决。
- [Memory evidence ledger](memory/evidence-ledger.md): 全文实验、反例、成本和不能外推的范围。
+37
View File
@@ -0,0 +1,37 @@
# 证据账本
`full` 表示核过实验表、关键消融或 limitation;`context` 表示全文已转文本并做章节定位,但不承担本轮核心结论。
| Date | Paper | Depth | 可支持的判断 | 不能外推的部分 |
| --- | --- | --- | --- | --- |
| 2025-01 | [Zep, 2501.13956](https://arxiv.org/abs/2501.13956) | full | 长对话静态 QA 可用时间图谱大幅缩短上下文和延迟,并提升部分题型 | DMR 已饱和;single-session-assistant 反而下降;不是行动任务 |
| 2025-02 | [A-MEM, 2502.12110](https://arxiv.org/abs/2502.12110) | full | 动态 linked-note 组织在 LoCoMo 上能优于若干早期 memory baseline | 方法、模型和 token 配置并非严格单变量控制 |
| 2025-05 | [Experience-Following, 2505.16067](https://arxiv.org/abs/2505.16067) | full | 经验会影响后续相似任务,错误和错配经验会传播 | 不能证明某种通用写入或删除策略最优 |
| 2025-07 | [MemoryAgentBench, 2507.05257](https://arxiv.org/abs/2507.05257) | full | retrieval、TTL、LRU、forgetting 是不同能力;复杂更新和全局综合仍弱 | 数据集转换和统一 prompt 不能覆盖真实 agent loop |
| 2026-02 | [MemoryArena, 2602.16313](https://arxiv.org/abs/2602.16313) | full | 通用 memory/RAG 在相互依赖的多 session 行动任务上成功率低,额外 memory 延迟更高 | benchmark 本身很难,失败同时含 policy/reasoning 问题 |
| 2026-03 | [Retrieval vs Utilization, 2603.02473](https://arxiv.org/abs/2603.02473) | full | LoCoMo 上 retrieval 方法差异大于 write strategyraw RAG 是强 baseline | 单模型、单 benchmark、固定 top-k=5 |
| 2026-05 | [Cross-Component Interference, 2605.05716](https://arxiv.org/abs/2605.05716) | full | memory 与其他 scaffold 的边际作用可为负,必须做 subset ablation | 只有 HotpotQA/GSM8Ktool 组件含协议因素 |
| 2026-05 | [EvoMemBench, 2605.18421](https://arxiv.org/abs/2605.18421) | full | 15 种方法间不存在跨能力通用最优 memory form | 统一 benchmark 仍不能消除所有实现质量差异 |
| 2026-05 | [DeMem, 2605.10870](https://arxiv.org/abs/2605.10870) | full | 决策充分状态比描述相似性更适合行动记忆;LoCoMo 描述相似性相关很弱 | 主要是自定义决策任务和理论建模 |
| 2026-05 | [MemQ, 2605.08374](https://arxiv.org/abs/2605.08374) | full | provenance DAG credit assignment 在多步任务有增益,单步接近无增益 | 没有处理删除和长期错误积累 |
| 2026-06 | [AutoMEM, 2606.04315](https://arxiv.org/abs/2606.04315) | full | 跨场景无通用赢家;索引会产生 schema losspassive retrieval 会产生 retrieval loss | 新增 DCI harness 与已有系统的工程成熟度不同 |
| 2026-06 | [MAGE, 2606.06090](https://arxiv.org/abs/2606.06090) | full | MemoryArena 同设置下,active execution-state tree 同时提高 SR 并减少 token | 单团队结果;绝对成功率在 Travel 仍只有 0.1519 |
| 2026-06 | [Infini Memory, 2606.10677](https://arxiv.org/abs/2606.10677) | full | topic document 的 maintenance 对结果贡献明显,memory 维护不应被当后台清理 | 系统组件较多,维护和检索仍依赖 LLM |
| 2026-06 | [HORMA, 2606.11680](https://arxiv.org/abs/2606.11680) | full | organize 与 retrieve 可拆分;高能力 manager 比大 retriever 更关键 | 结论依赖其层级 memory 和任务设置 |
| 2026-06 | [Online Budget Study, 2606.15017](https://arxiv.org/abs/2606.15017) | full | budget-matched 时,vanilla agent 在 WebArena 多模型汇总上可胜 online skill/memory | 只研究 online augmentation,不覆盖离线学习 |
| 2026-06 | [TrustMem, 2606.25161](https://arxiv.org/abs/2606.25161) | full | transition-level verifier 和排名训练可降低 omission/corruption/hallucination | verifier 仍是模型;训练、judge 和跨域泛化需要独立核验 |
| 2026-06 | [Supersede, 2606.27472](https://arxiv.org/abs/2606.27472) | full | 当前值维护是独立瓶颈,更强模型和更大 memory 不足;训练信号能推动它 | 训练只有 Qwen2.5-3B 单次运行,16.7% 远非解决 |
| 2026-06 | [MemDelta, 2606.29914](https://arxiv.org/abs/2606.29914) | full | embedding、model behavior 和 write cost 足以翻转架构结论 | Mem0 只在 88 题、2/6 题型上做 matched comparison |
| 2026-06 | [ATMem, 2606.31612](https://arxiv.org/abs/2606.31612) | full | GUI agent 的主动任务状态和选择性调用能提高结果 | 128xH20 训练;更难 DataScope 仍接近失败 |
| 2026-06 | [GovMem, 2607.02579](https://arxiv.org/abs/2607.02579) | full | 自动写入必须检查独立证据、反例、scope 和 provenance;真实轨迹暴露 false promotion | 外部 133 条是 stress slice,安全自动覆盖率为 0 |
| 2026-07 | [A-TMA, 2607.01935](https://arxiv.org/abs/2607.01935) | full | current/historical/transition 角色能缓解 ghost memory | 收益 host-dependentLoCoMo 部分指标不一致 |
| 2026-07 | [AgenticSTS, 2607.02255](https://arxiv.org/abs/2607.02255) | full | typed memory contract 让技能/episode 可消融和复现 | 3/10 到 6/10 不显著;缺 same-code accumulating-context baseline |
| 2026-07 | [FARMA, 2607.05029](https://arxiv.org/abs/2607.05029) | full | 伪造推理记录是不同于事实投毒的写入攻击面 | 50-trial 自定义攻击;0% ASR 防御不等于开放环境稳健 |
## 全文池
本轮全文池共 32 篇:
`2501.13956`, `2502.12110`, `2505.16067`, `2507.02259`, `2507.05257`, `2507.07957`, `2511.20857`, `2512.18746`, `2601.01885`, `2602.16313`, `2602.19320`, `2603.02473`, `2603.07670`, `2603.15666`, `2605.05716`, `2605.08374`, `2605.10870`, `2605.14421`, `2605.18421`, `2606.04315`, `2606.06090`, `2606.10677`, `2606.11680`, `2606.15017`, `2606.25161`, `2606.27472`, `2606.29914`, `2606.31612`, `2607.01935`, `2607.02255`, `2607.02579`, `2607.05029`
其中没有进入上表核心论证的 9 篇暂标为 `context`,不把“下载过 PDF”写成“已得到结论”。
+105
View File
@@ -0,0 +1,105 @@
# 先说结论
截至 2026-07-10,这轮可复核的材料是:5 组分页 arXiv 查询得到 516 篇候选;其中 379 篇是标题含 memory/remember/forget 等词、正文处于 LLM Agent 语境的词法上界;最近六个月有 292 篇,前六个月只有 61 篇。论文数量增加了约 4.8 倍,但这不能解释成能力增加了 4.8 倍。
本轮下载并转成可检索文本的全文是 32 篇。下面的判断主要依靠其中 23 篇的实验表、消融和限制章节,不用标题和摘要投票。
能站住的判断只有四条:
1. **真正进步最大的是诊断和评测,不是通用记忆能力。** 研究开始把写入、检索、使用、当前状态、行动结果和成本拆开测,也开始暴露 embedding、基础模型、上下文长度和额外 LLM 调用造成的假增益。
2. **静态对话事实召回已经是可用工程问题,但没有证据证明复杂 memory 普遍优于强 RAG 或完整上下文。** 在一个 3x3 控制实验中,换检索方法造成 14-23 个准确率点差异,换写入方法只有 3-8 个点;原始文本 RAG 还击败了两种有损写入。
3. **最近半年唯一比较像“能力进步”的,是把长任务记忆从资料库改成执行状态。** MAGE 在同一篇论文、同一 backbone、同一 MemoryArena 协议下,平均比长上下文高 7.8 个成功率点,同时少用 32.9%-71.4% token。它证明了任务状态表示是有效方向,但还只是一个基准上的单篇结果。
4. **更新、遗忘、经验复用和自动写入仍未解决。** 更强模型和更大 memory 都不能稳定消除旧事实污染;经验可能传播错误;保守写入可以降低错误晋升,却把代价转成大量人工复核。
## 具体问题有没有变好
| 问题 | 六个月前能做到什么 | 最近证据 | 判断 |
| --- | --- | --- | --- |
| 静态事实召回 | 图、note、摘要等结构在 LoCoMo/LongMemEval 上可以优于较弱 baselineZep 用约 1.6k 上下文替代 115kLongMemEval 从 55.4% 到 63.8% 或 60.2% 到 71.2% | 控制实验表明检索器比复杂写入更重要;MemDelta 中 verbatim RAG 47.2% 与 full context 49.8% 无显著差异 | 工程上部分成熟;“新结构更聪明”没有普遍证据 |
| 长范围综合和 test-time learning | top-k retrieval 经常拿不到全局信息;长上下文在预算够时领先 | compute-matched 结果显示 book summarization 只有拿到接近完整信息后才明显上升,架构差异次要 | 没解决,瓶颈是信息覆盖阈值 |
| 当前值、更新和选择性遗忘 | MemoryAgentBench 的复杂多跳更新普遍很低,简单 overwrite prompt 无法修复 | Supersede 中 bounded memory 相对 full context 分别为 63% vs 82%、64% vs 91%、77% vs 92%;历史增长 24 倍后 68% 跌到 28%memory 同比扩大仍是 28% | 没解决;现在只是把问题隔离得更清楚 |
| 长任务执行状态 | 通用 memory/RAG 在 MemoryArena 上平均成功率约 0.12-0.15/0.17-0.23Group Travel 几乎全为 0 | MAGE 把 memory 变成可 Grow/Compress/Maintain/Revise 的状态树,平均 +7.8pp SRGUI 的 ATMem 也显示主动任务状态有效 | 有真实但任务特定的进展,需要独立复现 |
| 经验和技能复用 | 相似任务会复用相似经验,但错误经验也会让输出沿相同方向出错 | 32k+ full-factorial 评测中 memory 对 HotpotQA 为负、对 GSM8K 略正;AgenticSTS 的技能层 3/10 到 6/10Fisher p 约 0.37 | 没有通用增益,强依赖任务、模型和 scaffold |
| 自动写入和压缩 | 主要优化“写得短、写得结构化” | TrustMem 开始监督每次 transition;GovMem 把写入改成证据治理,但内部 direct recall 降到 0.448、review burden 升到 0.692,外部 133 条高影响候选中安全自动晋升为 0 | 研究方向变对了,自动写入仍不可靠 |
| 安全和来源 | 主要研究检索语料投毒 | 新工作覆盖持久污染、伪造推理、共享 memory 传播、provenance 和 false promotion | 威胁模型进步明显;防御多为自定义攻击上的单篇结果 |
| 评测可信度 | 常见做法是端到端比一个总分,模型、embedding、token 和写入成本都不同 | MemDelta 只换 embedding 就 +6.2pp,并把 Mem0 相对 RAG 的 +11pp 变成 -1.2pp;相近效果下写入成本约 50 倍 | 这是最近半年最确定的进步 |
## 这些论文实际上在做什么
最近六个月 292 篇“标题中心”候选中,按标题声明的贡献做多标签统计:
| 方向 | 篇数 | 实际工作 |
| --- | ---: | --- |
| retrieval / representation | 65 | 图、层级、索引、rerank、topic document、typed memory |
| experience / skill / learned policy | 65 | 经验提炼、技能库、RL 写入/检索/遗忘策略、自演化 |
| execution / multimodal | 58 | GUI、embodied、video、spatial、long-horizon task state |
| benchmark / diagnosis | 56 | 新 benchmark、stage-wise probe、跨场景和受控 baseline |
| systems / efficiency | 37 | token、延迟、预算、压缩、端侧和 serving |
| security / governance | 32 | poisoning、privacy、provenance、写入 gate、审计 |
| personalization / shared memory | 27 | 用户长期状态、多 Agent 共享和协作 memory |
| update / forgetting 明示在标题 | 22 | 冲突、时序、过期、遗忘、写入和生命周期 |
这些数字可重叠,而且只是研究议程,不是成果计数。数量暴涨主要表示大家把“memory”扩展成了八九个不同问题;不是 292 个方法都在共同推进同一个分数。
## 哪些结果最值得信
### 1. 静态 QA 先做强 retrieval,不要先发明 memory 架构
[Diagnosing Retrieval vs. Utilization](https://arxiv.org/abs/2603.02473) 在 LoCoMo 1540 题上固定 answer model 和 prompt,交叉三种写法与三种检索法。Basic RAG 在 cosine/hybrid 下为 77.9%/81.1%fact extraction 为 72.2%/77.3%episode summary 为 70.1%/73.3%retrieval precision 与最终准确率相关系数为 0.98。这个结论只适用于静态对话 QA 和固定 top-k=5,但它足以否定“复杂写入天然更好”。
[MemDelta](https://arxiv.org/abs/2606.29914) 更进一步:500 题上 cloud embedding RAG 为 53.4%MiniLM RAG 为 47.2%,完整上下文为 49.8%。在可做 matched comparison 的 88 题上,Mem0 72.7%cloud RAG 73.9%p=1.0 且置信区间很宽;Mem0 需要 1000+ LLM 调用、约 120 分钟和 $0.50+ 写入成本,RAG 是 0 次 LLM 调用、约 60 秒和 $0.01。它没有证明 memory 无用,只证明当前很多“架构增益”无法归因。
### 2. 更新问题不是检索一个最新 chunk 那么简单
[MemoryAgentBench](https://arxiv.org/abs/2507.05257) 把能力拆成准确检索、test-time learning、长范围理解和选择性遗忘。GPT-4.1-mini 的默认 single-hop/multi-hop 更新为 36%/5%;强制总选最新后为 40%/4%,保守 overwrite 为 28%/4%。prompt 没有传播多跳依赖上的更新。
[Supersede](https://arxiv.org/abs/2606.27472) 把 full context 与 bounded self-maintained memory 配对比较,证明维护过程本身丢失当前值。其 GRPO 训练把 Qwen2.5-3B 从 9.0% 提到 16.7%,但只有一次训练、绝对结果仍很低。合理表述是“这个失败可被训练信号推动”,不是“已经补上差距”。
[A-TMA](https://arxiv.org/abs/2607.01935) 用 current/historical/transition 角色缓解 ghost memoryGraphiti/Zep 的冲突准确率从 0.480 到 0.720LoCoMo temporal F1 从 0.0295 到 0.1705;作者也报告 host-dependent 和非一致增益。它支持显式状态角色,不支持通用解决方案。
### 3. 行动任务需要的是最小充分状态,不是相似历史
[MemoryArena](https://arxiv.org/abs/2602.16313) 把 memory 放回 agent-environment loop。通用 memory 系统在 Bundled Shopping 全部 0 成功,在 Group Travel 全部 0;RAG 的总体平均成功率最高也只有 0.23。作者观察到 representation mismatch、training mismatch 和额外延迟。
[MAGE](https://arxiv.org/abs/2606.06090) 是目前最值得继续追的正结果。它在同一 Qwen3.6-27B 设置中,Shopping 0.3333 到 0.3933Travel 0.0519 到 0.1519Web Search 0.4842 到 0.5656;移除 Compress/Maintain/Revise 都会下降。还缺跨团队复现、更多模型和更难任务上的绝对成功率。
[ATMem](https://arxiv.org/abs/2606.31612) 在 AndroidWorld 8B 上从基础 47.6,经 SFT/GRPO/结构奖励到 76.6,但训练用了 128 张 H20;在更难的 DataScope 分层任务上绝对成功率仍只有 6.2/6.2/3.1。它证明 active state 有价值,也同时说明代价和剩余差距巨大。
### 4. 写入的本质正在从总结变成决策和治理
[GovMem](https://arxiv.org/abs/2607.02579) 的内部 synthetic 结果把 false promotion 从 0.597 降到 0.040、recall 保持 0.960;但真实项目子集依靠 0.692 review burden,外部 133 条高影响 coding-agent 候选最终没有一条可安全自动晋升。这个负结果比一个漂亮总分更有用:重复出现、测试日志和 Agent 自己的叙述都不能单独构成可复用知识证据。
[Cross-Component Interference](https://arxiv.org/abs/2605.05716) 在 32 个组件子集、32k+ 次评测中发现,HotpotQA 上 tool-only F1 0.233,高于 all-in 的 0.177;最优 proper subset 在所有测试设置中匹配或超过 all-in。它要求每个 memory 设计都必须做 no-memory 和组件组合消融。
## 怎么证明一个 memory 设计不是画图
一份能说服人的实验至少要同时满足:
1. 先说工作负载:信息是否超窗、是否会更新、是否跨任务、是否影响行动、错误写入会不会传播。
2. 指定瓶颈阶段:write preservation、retrieval recall、state resolution、utilization、action outcome 只能选清楚,不能只报端到端总分。
3. 必须有 full context、verbatim RAG、no memory 三个 baseline;做技能复用时还要有 raw trajectory replay。
4. actor model、embedding、chunking、top-k、prompt、可见信息和 token/调用预算固定,只改一个组件。
5. 报预处理时间、LLM 调用、推理 token、延迟和存储;不能只报“检索后上下文更短”。
6. 做 harmful-memory、stale-memory 和 no-memory 消融;memory 可能是负贡献。
7. 至少跨两个任务类型、两个模型、多个 seed;否则结论只能写成“在该 harness 中有效”。
可以把论证压成一句话:**在工作负载 W 中,阶段 B 的失败占主要误差;固定其余变量后,机制 C 把结果从 X 提到 Y,额外成本是 Z,且在边界 Q 外不成立。** 架构图只能解释 C,不能替代 W、B、X、Y、Z 和 Q。
## 对我们自己的直接影响
现在不应该先做一个“统一 Agent Memory 知识图谱”。更合理的最小系统是四个彼此独立、都保留原始证据的平面:
- `archive`:原始论文、对话、轨迹和版本,只追加,不让摘要覆盖证据。
- `current state`:明确哪些事实和任务状态当前有效,保留 supersession 链。
- `skills`:只保存有任务结果和适用范围支撑的程序性经验,允许回滚。
- `governance`:记录来源、反例、写入决定、评测结果和人工复核。
检索先从 raw archive + 强 baseline 做起。只有在确定是 retrieval、state resolution、execution state 或 skill transfer 的哪一种失败后,才增加对应结构。否则我们很容易复现这半年论文里最常见的问题:系统越来越复杂,但不知道增益来自哪里。
## 材料边界
- 516 是 5 组 arXiv 查询的并集,不是人工确认的 516 篇核心论文。
- 379 和 292 是保守词法筛选后的上界,仍可能有误收;标题主题统计可重叠。
- 32 篇做了全文下载和章节定位,23 篇进入证据账本;其余论文目前只用于背景和冲突检索。
- 大多数 2026 工作仍是 arXiv preprint,独立复现很少。这里把“同论文内受控增益”和“跨论文已建立共识”严格分开。
- 跨 benchmark 的绝对分数不能直接排名;这里只比较同协议内结果,或明确写出不可比原因。
+285
View File
@@ -0,0 +1,285 @@
#!/usr/bin/env python3
"""Build auditable landscape counts and evidence candidates for Agent Memory."""
from __future__ import annotations
import argparse
import csv
import json
import re
from collections import Counter, defaultdict
from datetime import date
from pathlib import Path
ROOT = Path(__file__).resolve().parents[2]
THEMES = {
"retrieval_access": r"retriev|recall|search|query|evidence access|memory navigation",
"representation_organization": r"knowledge graph|graph memory|hierarch|structure|representation|index|database|topic document|ontology",
"update_forgetting": r"update|forget|consolidat|supersed|stale|conflict|write path|write-path|memory admission|retention",
"execution_state": r"execution state|task state|workflow state|belief state|long-horizon|trajectory|subgoal|planning",
"experience_skill_learning": r"experience|procedural|skill|reflect|self-evolv|test-time learn|continual learn|reinforcement learn|\brl\b",
"evaluation_diagnosis": r"benchmark|evaluat|diagnos|metric|ablation|empirical study|controlled",
"security_privacy_trust": r"attack|poison|security|privacy|trust|provenance|govern|leak|integrity|adversarial",
"multi_agent_shared": r"multi-agent|multiagent|shared memory|collective memory|collaborative memory",
"multimodal_embodied_gui": r"multimodal|visual|video|robot|embodied|gui|mobile|web agent|navigation",
"systems_efficiency": r"token|latency|cost|efficient|compression|serving|storage|throughput|budget",
}
# Title-only labels describe the paper's declared contribution more conservatively
# than abstract keywords such as "evaluate", which occur in almost every paper.
TITLE_THEMES = {
"benchmark_diagnosis": r"benchmark|evaluat|diagnos|empirical|survey|taxonomy|anatomy|rethinking|what .* need|how far|study of|analysis",
"retrieval_representation": r"retriev|recall|search|graph|hierarch|structure|index|database|ontology|organization|representation|rag\b|topic document",
"update_forgetting": r"update|forget|consolidat|stale|supersed|decay|write memory|not to write|promotion|temporal conflict|belief revision|lifecycle",
"experience_skill_policy": r"experience|skill|procedural|learn|evolv|adapt|reinforcement|\brl\b|credit assignment|distill",
"execution_multimodal": r"execution state|task-driving state|task state|long-horizon|gui|embodied|robot|navigation|web agent|multimodal|video|spatial",
"security_governance": r"attack|poison|security|privacy|trust|govern|provenance|integrity|leak|hijack|vulnerab|unlearn|false promotion|contamination",
"systems_efficiency": r"efficient|cost|token|latency|serving|on-device|edge|compress|scalable|storage|runtime|budget|wire format",
"personal_shared": r"personali|user-aware|user-centric|multi-agent|multiagent|shared memory|collaborative|collective",
}
WINDOWS = {
"previous_six_months": ("2025-07-09", "2026-01-10"),
"recent_six_months": ("2026-01-10", "2026-07-11"),
}
CENTRAL_TITLE = re.compile(r"memory|memori|remember|forget|stateful", re.I)
AGENT_CONTEXT = re.compile(r"agent|large language model|\bllm\b|foundation model", re.I)
HARDWARE_ONLY = re.compile(
r"gpu memory|memory bandwidth|memory footprint|memory-efficient|memory efficient|bounded memory agents on",
re.I,
)
NUMERIC_RESULT = re.compile(r"(?:\d+(?:\.\d+)?\s*%|\+?\d+(?:\.\d+)?\s*(?:pp|points?|×|x))", re.I)
def period(published: str) -> str:
if published < "2025-07-01":
return "2025-H1"
if published < "2026-02-01":
return "baseline-2025H2-Jan2026"
if published < "2026-04-01":
return "transition-2026-Feb-Mar"
return "recent-2026-Apr-Jul"
def central_by_text(record: dict) -> bool:
title = record["title"]
abstract = record["abstract"]
return bool(
CENTRAL_TITLE.search(title)
and AGENT_CONTEXT.search(f"{title} {abstract}")
and not HARDWARE_ONLY.search(title)
)
def theme_labels(record: dict) -> list[str]:
text = f"{record['title']} {record['abstract']}".lower()
return [name for name, pattern in THEMES.items() if re.search(pattern, text, re.I)]
def title_theme_labels(record: dict) -> list[str]:
title = record["title"].lower()
return [name for name, pattern in TITLE_THEMES.items() if re.search(pattern, title, re.I)]
def window_name(published: str) -> str | None:
for name, (start, end) in WINDOWS.items():
if start <= published < end:
return name
return None
def evidence_score(record: dict) -> int:
text = record["abstract"].lower()
score = 0
score += 2 if re.search(r"benchmark|evaluate|evaluation|experiment", text) else 0
score += 2 if re.search(r"baseline|compare|outperform|versus|\bvs\.?\b", text) else 0
score += 2 if NUMERIC_RESULT.search(text) else 0
score += 1 if re.search(r"ablation|controlled|factorial|paired|significan", text) else 0
score += 1 if re.search(r"code is|github|we release|open-source", text) else 0
score += 1 if re.search(r"limitation|does not|not always|far from|fails?", text) else 0
return score
def write_json(path: Path, payload: dict) -> None:
path.parent.mkdir(parents=True, exist_ok=True)
path.write_text(json.dumps(payload, ensure_ascii=False, indent=2) + "\n", encoding="utf-8")
def main() -> int:
parser = argparse.ArgumentParser()
parser.add_argument(
"--input",
type=Path,
default=ROOT / "data" / "research" / "agent-memory-expanded.json",
)
parser.add_argument(
"--screen",
type=Path,
default=ROOT / "data" / "research" / "agent-memory-screened.json",
)
parser.add_argument(
"--output",
type=Path,
default=ROOT / "data" / "research" / "memory-landscape.json",
)
parser.add_argument(
"--csv",
type=Path,
default=ROOT / "data" / "research" / "memory-paper-ledger.csv",
)
args = parser.parse_args()
source = json.loads(args.input.read_text(encoding="utf-8"))
screen = {}
if args.screen.exists():
screened = json.loads(args.screen.read_text(encoding="utf-8"))
screen = {item["arxiv_id"]: item.get("screen") or {} for item in screened.get("papers", [])}
records = []
for paper in source["papers"]:
screened = screen.get(paper["arxiv_id"])
records.append(
{
**paper,
"period": period(paper["published"]),
"central_by_title": central_by_text(paper),
"themes": theme_labels(paper),
"title_themes": title_theme_labels(paper),
"evidence_score": evidence_score(paper),
"screen": screened,
}
)
period_counts: defaultdict[str, Counter] = defaultdict(Counter)
theme_counts: defaultdict[str, Counter] = defaultdict(Counter)
window_counts: defaultdict[str, Counter] = defaultdict(Counter)
title_theme_counts: defaultdict[str, Counter] = defaultdict(Counter)
screen_counts: defaultdict[str, Counter] = defaultdict(Counter)
for record in records:
bucket = record["period"]
period_counts[bucket]["candidates"] += 1
if record["central_by_title"]:
period_counts[bucket]["title_central"] += 1
relevance = (record.get("screen") or {}).get("relevance")
if relevance:
period_counts[bucket][f"screen_{relevance}"] += 1
for theme in record["themes"]:
if record["central_by_title"]:
theme_counts[bucket][theme] += 1
window = window_name(record["published"])
if window:
window_counts[window]["candidates"] += 1
if record["central_by_title"]:
window_counts[window]["title_central"] += 1
for theme in record["title_themes"]:
title_theme_counts[window][theme] += 1
screened = record.get("screen") or {}
if screened:
screen_counts["relevance"][screened.get("relevance", "unknown")] += 1
screen_counts["problem"][screened.get("problem", "unknown")] += 1
screen_counts["source"][screened.get("source", "unknown")] += 1
top_evidence = {}
for theme in THEMES:
candidates = [
record
for record in records
if record["central_by_title"] and theme in record["themes"]
]
candidates.sort(key=lambda item: (item["evidence_score"], item["published"]), reverse=True)
top_evidence[theme] = [
{
"arxiv_id": item["arxiv_id"],
"published": item["published"],
"title": item["title"],
"score": item["evidence_score"],
"url": item["url"],
}
for item in candidates[:20]
]
output = {
"generated_at": date.today().isoformat(),
"source_candidates": len(records),
"title_central": sum(record["central_by_title"] for record in records),
"screened": len(screen),
"windows": {
name: {
"from_inclusive": start,
"to_exclusive": end,
**dict(window_counts[name]),
"title_theme_counts": dict(title_theme_counts[name]),
}
for name, (start, end) in WINDOWS.items()
},
"period_counts": {key: dict(value) for key, value in period_counts.items()},
"theme_counts_title_central": {key: dict(value) for key, value in theme_counts.items()},
"screen_counts": {key: dict(value) for key, value in screen_counts.items()},
"evidence_score_distribution": dict(
Counter(record["evidence_score"] for record in records if record["central_by_title"])
),
"top_evidence_candidates": top_evidence,
}
write_json(args.output, output)
args.csv.parent.mkdir(parents=True, exist_ok=True)
with args.csv.open("w", encoding="utf-8", newline="") as handle:
writer = csv.DictWriter(
handle,
fieldnames=[
"arxiv_id",
"published",
"period",
"title",
"url",
"title_central",
"screen_relevance",
"screen_problem",
"screen_source",
"themes",
"title_themes",
"evidence_score",
"matched_queries",
],
)
writer.writeheader()
for record in records:
screened = record.get("screen") or {}
writer.writerow(
{
"arxiv_id": record["arxiv_id"],
"published": record["published"],
"period": record["period"],
"title": record["title"],
"url": record["url"],
"title_central": record["central_by_title"],
"screen_relevance": screened.get("relevance", ""),
"screen_problem": screened.get("problem", ""),
"screen_source": screened.get("source", ""),
"themes": ";".join(record["themes"]),
"title_themes": ";".join(record["title_themes"]),
"evidence_score": record["evidence_score"],
"matched_queries": ";".join(record["matched_queries"]),
}
)
print(
json.dumps(
{
"source_candidates": output["source_candidates"],
"title_central": output["title_central"],
"screened": output["screened"],
"windows": output["windows"],
"screen_counts": output["screen_counts"],
},
ensure_ascii=False,
indent=2,
)
)
return 0
if __name__ == "__main__":
raise SystemExit(main())
+173
View File
@@ -0,0 +1,173 @@
#!/usr/bin/env python3
"""Classify an Agent-memory abstract corpus into a research evidence ledger."""
from __future__ import annotations
import argparse
import json
import time
import urllib.error
import urllib.request
from datetime import date
from pathlib import Path
ROOT = Path(__file__).resolve().parents[2]
DEFAULT_OLLAMA_URL = "http://192.168.1.10:11434"
SYSTEM_INSTRUCTIONS = """You are building an evidence ledger for a research review of Agent Memory.
Classify each paper from title and abstract only. Be conservative. Do not infer unreported baselines,
results, limitations, or artifacts. A paper is core only when memory itself is the main research object;
supporting means memory is a substantial mechanism or measured failure; peripheral means memory is
incidental or only an implementation detail.
Return one JSON object with a `papers` array in the same order. Each item must contain:
- arxiv_id: exact input id
- relevance: core | supporting | peripheral
- relevance_reason: <= 18 words
- primary_problem: one of retention_context, retrieval_access, organization_representation,
update_consolidation_forgetting, execution_state, experience_skill_learning,
evaluation_measurement, security_trust_privacy, multi_agent_shared_memory,
systems_efficiency, domain_application, theory_foundations, other
- secondary_problems: up to 3 values from the same enum
- research_role: method | benchmark | diagnostic | theory | survey | security | application | infrastructure
- memory_object: facts | events | trajectories | skills | execution_state | model_internal |
shared_state | multimodal | mixed | unclear
- temporal_scope: in_episode | cross_episode | both | unclear
- claimed_gap: one short sentence, or empty
- mechanism: one short sentence, or empty
- benchmarks: explicit names only, as an array
- baselines: explicit names or baseline families only, as an array
- reported_results: explicit numeric claims only, as an array of short strings
- evidence_design: none | case_study | benchmark_comparison | controlled_ablation |
formal_analysis | survey_synthesis
- evidence_strength: none | weak | moderate | strong
- failure_or_boundary: only a boundary explicitly visible in the abstract, or empty
Use compact English. Output JSON only."""
def write_json(path: Path, payload: dict) -> None:
path.parent.mkdir(parents=True, exist_ok=True)
tmp = path.with_suffix(path.suffix + ".tmp")
tmp.write_text(json.dumps(payload, ensure_ascii=False, indent=2) + "\n", encoding="utf-8")
tmp.replace(path)
def ollama_generate(url: str, model: str, prompt: str, timeout: int, retries: int) -> dict:
payload = {
"model": model,
"prompt": prompt,
"stream": False,
"format": "json",
"options": {"temperature": 0, "num_predict": 6000},
}
request = urllib.request.Request(
f"{url.rstrip('/')}/api/generate",
data=json.dumps(payload).encode("utf-8"),
headers={"Content-Type": "application/json"},
method="POST",
)
for attempt in range(retries + 1):
try:
with urllib.request.urlopen(request, timeout=timeout) as response:
body = json.loads(response.read().decode("utf-8"))
return json.loads(body["response"])
except (urllib.error.HTTPError, urllib.error.URLError, TimeoutError, json.JSONDecodeError, KeyError):
if attempt >= retries:
raise
time.sleep(2 ** attempt)
raise RuntimeError("unreachable retry state")
def classify_batch(
records: list[dict], url: str, model: str, timeout: int, retries: int
) -> list[dict]:
compact = [
{"arxiv_id": item["arxiv_id"], "title": item["title"], "abstract": item["abstract"]}
for item in records
]
prompt = f"{SYSTEM_INSTRUCTIONS}\n\nINPUT:\n{json.dumps(compact, ensure_ascii=False)}"
result = ollama_generate(url, model, prompt, timeout=timeout, retries=retries)
classified = result.get("papers") if isinstance(result, dict) else None
if not isinstance(classified, list):
raise ValueError("model response lacks papers array")
expected = [item["arxiv_id"] for item in records]
received = [str(item.get("arxiv_id")) for item in classified]
if received != expected:
raise ValueError(f"model returned unexpected ids: expected={expected}, received={received}")
return classified
def main() -> int:
parser = argparse.ArgumentParser()
parser.add_argument(
"--input", type=Path, default=ROOT / "data" / "research" / "memory-corpus.json"
)
parser.add_argument(
"--output", type=Path, default=ROOT / "data" / "research" / "memory-classified.json"
)
parser.add_argument("--ollama-url", default=DEFAULT_OLLAMA_URL)
parser.add_argument("--model", default="ChatGPT-5.6:Sol")
parser.add_argument("--batch-size", type=int, default=12)
parser.add_argument("--timeout", type=int, default=300)
parser.add_argument("--retries", type=int, default=2)
parser.add_argument("--limit", type=int)
parser.add_argument("--refresh", action="store_true")
args = parser.parse_args()
args.input = args.input.resolve()
args.output = args.output.resolve()
source = json.loads(args.input.read_text(encoding="utf-8"))
records = source["papers"][: args.limit] if args.limit else source["papers"]
completed: dict[str, dict] = {}
if args.output.exists() and not args.refresh:
old = json.loads(args.output.read_text(encoding="utf-8"))
completed = {item["arxiv_id"]: item for item in old.get("papers", [])}
pending = [item for item in records if item["arxiv_id"] not in completed]
for offset in range(0, len(pending), args.batch_size):
batch = pending[offset : offset + args.batch_size]
try:
classified = classify_batch(
batch,
url=args.ollama_url,
model=args.model,
timeout=args.timeout,
retries=args.retries,
)
except Exception:
if len(batch) == 1:
raise
classified = []
for record in batch:
classified.extend(
classify_batch(
[record],
url=args.ollama_url,
model=args.model,
timeout=args.timeout,
retries=args.retries,
)
)
for source_record, classification in zip(batch, classified, strict=True):
completed[source_record["arxiv_id"]] = {**source_record, "analysis": classification}
ordered = [completed[item["arxiv_id"]] for item in records if item["arxiv_id"] in completed]
write_json(
args.output,
{
"generated_at": date.today().isoformat(),
"model": args.model,
"source": str(args.input.relative_to(ROOT)) if args.input.is_relative_to(ROOT) else str(args.input),
"total": len(records),
"completed": len(ordered),
"papers": ordered,
},
)
print(f"classified {len(ordered)}/{len(records)}", flush=True)
return 0
if __name__ == "__main__":
raise SystemExit(main())
+156
View File
@@ -0,0 +1,156 @@
#!/usr/bin/env python3
"""Build an abstract-level research corpus for one local paper topic."""
from __future__ import annotations
import argparse
import json
import re
import time
import urllib.error
import urllib.parse
import urllib.request
import xml.etree.ElementTree as ET
from datetime import date
from pathlib import Path
ROOT = Path(__file__).resolve().parents[2]
API_URL = "https://export.arxiv.org/api/query"
NS = {"atom": "http://www.w3.org/2005/Atom"}
ARXIV_ID_RE = re.compile(r"arxiv\.org/(?:abs|html|pdf)/([0-9]{4}\.[0-9]{4,5})")
def normalize(value: str) -> str:
return re.sub(r"\s+", " ", value).strip()
def extract_arxiv_id(url: str) -> str | None:
match = ARXIV_ID_RE.search(url or "")
return match.group(1) if match else None
def parse_feed(payload: bytes) -> dict[str, dict]:
root = ET.fromstring(payload)
records: dict[str, dict] = {}
for entry in root.findall("atom:entry", NS):
raw_id = entry.findtext("atom:id", default="", namespaces=NS)
paper_id = raw_id.rsplit("/", 1)[-1].split("v", 1)[0]
records[paper_id] = {
"arxiv_id": paper_id,
"title": normalize(entry.findtext("atom:title", default="", namespaces=NS)),
"abstract": normalize(entry.findtext("atom:summary", default="", namespaces=NS)),
"published": entry.findtext("atom:published", default="", namespaces=NS)[:10],
"updated": entry.findtext("atom:updated", default="", namespaces=NS)[:10],
"authors": [
normalize(author.findtext("atom:name", default="", namespaces=NS))
for author in entry.findall("atom:author", NS)
],
"categories": [
node.attrib["term"]
for node in entry.findall("atom:category", NS)
if node.attrib.get("term")
],
"url": f"https://arxiv.org/abs/{paper_id}",
"pdf_url": f"https://arxiv.org/pdf/{paper_id}",
}
return records
def fetch_batch(ids: list[str], retries: int, timeout: int) -> dict[str, dict]:
query = urllib.parse.urlencode({"id_list": ",".join(ids), "max_results": len(ids)})
request = urllib.request.Request(
f"{API_URL}?{query}",
headers={"User-Agent": "agent-kb-research/0.1"},
)
for attempt in range(retries + 1):
try:
with urllib.request.urlopen(request, timeout=timeout) as response:
return parse_feed(response.read())
except (urllib.error.HTTPError, urllib.error.URLError, TimeoutError):
if attempt >= retries:
raise
time.sleep(2 ** attempt)
raise RuntimeError("unreachable retry state")
def write_json(path: Path, payload: dict) -> None:
path.parent.mkdir(parents=True, exist_ok=True)
tmp = path.with_suffix(path.suffix + ".tmp")
tmp.write_text(json.dumps(payload, ensure_ascii=False, indent=2) + "\n", encoding="utf-8")
tmp.replace(path)
def main() -> int:
parser = argparse.ArgumentParser()
parser.add_argument("--topic", default="memory")
parser.add_argument("--index", type=Path, default=ROOT / "data" / "index.json")
parser.add_argument("--output", type=Path)
parser.add_argument("--batch-size", type=int, default=20)
parser.add_argument("--sleep", type=float, default=1.0)
parser.add_argument("--retries", type=int, default=4)
parser.add_argument("--timeout", type=int, default=45)
parser.add_argument("--refresh", action="store_true")
args = parser.parse_args()
output = args.output or ROOT / "data" / "research" / f"{args.topic}-corpus.json"
index = json.loads(args.index.read_text(encoding="utf-8"))
selected: dict[str, dict] = {}
missing_ids: list[dict] = []
for item in index:
meta = item.get("meta") or {}
if item.get("collection") != "papers" or args.topic not in (meta.get("topics") or []):
continue
paper_id = extract_arxiv_id(str(meta.get("url") or ""))
if not paper_id:
missing_ids.append({"path": item.get("path"), "title": item.get("title")})
continue
selected[paper_id] = {
"path": item.get("path"),
"local_title": item.get("title"),
"local_status": meta.get("status"),
"local_topics": meta.get("topics") or [],
"collection_queries": meta.get("collection_queries"),
"collection_score": meta.get("collection_score"),
}
cached: dict[str, dict] = {}
if output.exists() and not args.refresh:
old = json.loads(output.read_text(encoding="utf-8"))
cached = {record["arxiv_id"]: record for record in old.get("papers", [])}
fetched: dict[str, dict] = {}
ids_to_fetch = [paper_id for paper_id in selected if paper_id not in cached]
for offset in range(0, len(ids_to_fetch), args.batch_size):
batch = ids_to_fetch[offset : offset + args.batch_size]
fetched.update(fetch_batch(batch, retries=args.retries, timeout=args.timeout))
print(f"fetched {min(offset + len(batch), len(ids_to_fetch))}/{len(ids_to_fetch)}")
if offset + args.batch_size < len(ids_to_fetch):
time.sleep(args.sleep)
papers = []
unresolved = []
for paper_id, local in selected.items():
remote = fetched.get(paper_id) or cached.get(paper_id)
if not remote:
unresolved.append({"arxiv_id": paper_id, **local})
continue
papers.append({**remote, **local})
papers.sort(key=lambda item: (item.get("published") or "", item["arxiv_id"]))
payload = {
"topic": args.topic,
"generated_at": date.today().isoformat(),
"selected_from_index": len(selected),
"resolved": len(papers),
"missing_arxiv_id": missing_ids,
"unresolved": unresolved,
"papers": papers,
}
write_json(output, payload)
print(json.dumps({key: payload[key] for key in ("selected_from_index", "resolved")}, indent=2))
return 0 if not unresolved else 2
if __name__ == "__main__":
raise SystemExit(main())
+281
View File
@@ -0,0 +1,281 @@
#!/usr/bin/env python3
"""Fast relevance screening for a broad Agent-memory research corpus."""
from __future__ import annotations
import argparse
import json
import re
import time
import urllib.error
import urllib.request
from datetime import date
from pathlib import Path
ROOT = Path(__file__).resolve().parents[2]
PROMPT = """Screen papers for a research review about memory in LLM-based agents.
Use title and abstract only. Return JSON with a `papers` array in input order.
For each paper return:
- arxiv_id: exact input id
- relevance: core if memory is the main research object; supporting if memory is a substantial
mechanism, evaluation dimension, or failure mode; peripheral if memory is incidental, means
GPU/KV memory only, refers to human memory only, or the paper is mainly an unrelated application
- problem: choose one: access, representation, update_forgetting, execution_state, experience_learning,
evaluation, security_privacy, shared_memory, systems_cost, theory, application, unrelated
- reason: at most 12 words
Be conservative and output JSON only."""
RELEVANCE_VALUES = {"core", "supporting", "peripheral"}
PROBLEM_VALUES = {
"access",
"representation",
"update_forgetting",
"execution_state",
"experience_learning",
"evaluation",
"security_privacy",
"shared_memory",
"systems_cost",
"theory",
"application",
"unrelated",
}
PROBLEM_ALIASES = {
"adaptation": "experience_learning",
"continual_learning": "experience_learning",
"episodic": "representation",
"episodic_memory": "representation",
"experience": "experience_learning",
"forgetting": "update_forgetting",
"implicit_personalization": "application",
"memory": "representation",
"privacy": "security_privacy",
"security": "security_privacy",
}
def write_json(path: Path, payload: dict) -> None:
path.parent.mkdir(parents=True, exist_ok=True)
tmp = path.with_suffix(path.suffix + ".tmp")
tmp.write_text(json.dumps(payload, ensure_ascii=False, indent=2) + "\n", encoding="utf-8")
tmp.replace(path)
def generate(url: str, model: str, records: list[dict], timeout: int, retries: int) -> list[dict]:
compact = [
{"arxiv_id": item["arxiv_id"], "title": item["title"], "abstract": item["abstract"]}
for item in records
]
body = {
"model": model,
"prompt": f"{PROMPT}\n\nINPUT:\n{json.dumps(compact, ensure_ascii=False)}",
"stream": False,
"format": "json",
"options": {"temperature": 0, "num_predict": 4000},
}
request = urllib.request.Request(
f"{url.rstrip('/')}/api/generate",
data=json.dumps(body).encode("utf-8"),
headers={"Content-Type": "application/json"},
method="POST",
)
for attempt in range(retries + 1):
try:
with urllib.request.urlopen(request, timeout=timeout) as response:
result = json.loads(response.read().decode("utf-8"))
decoded = json.loads(result["response"])
if isinstance(decoded, list):
parsed = decoded
elif isinstance(decoded, dict) and isinstance(decoded.get("papers"), list):
parsed = decoded["papers"]
elif isinstance(decoded, dict) and isinstance(decoded.get("results"), list):
parsed = decoded["results"]
elif isinstance(decoded, dict) and decoded.get("arxiv_id"):
parsed = [decoded]
else:
raise ValueError("response lacks a recognized result array")
expected = [item["arxiv_id"] for item in records]
by_id = {str(item.get("arxiv_id")): item for item in parsed}
if any(paper_id not in by_id for paper_id in expected):
raise ValueError("response ids do not match input")
return [{**by_id[paper_id], "source": "model"} for paper_id in expected]
except (
urllib.error.HTTPError,
urllib.error.URLError,
TimeoutError,
json.JSONDecodeError,
KeyError,
ValueError,
):
if attempt >= retries:
raise
time.sleep(2 ** attempt)
raise RuntimeError("unreachable retry state")
def heuristic_screen(record: dict) -> dict:
title = record["title"].lower()
text = f"{record['title']} {record['abstract']}".lower()
title_memory = bool(re.search(r"memory|memori|remember|forget|stateful", title))
agent_memory = bool(
re.search(r"agent(?:ic)? memory|memory (?:for|in|of) .*agent|long-term .*agent", text)
)
hardware_only = bool(re.search(r"gpu memory|memory footprint|memory bandwidth|memory efficient", title))
if title_memory and not hardware_only:
relevance = "core"
elif agent_memory:
relevance = "supporting"
else:
relevance = "peripheral"
if re.search(r"attack|poison|privacy|security|trust|provenance|leak", text):
problem = "security_privacy"
elif re.search(r"benchmark|evaluation|diagnos|measure", title):
problem = "evaluation"
elif re.search(r"update|forget|consolidat|stale|supersed|write", text):
problem = "update_forgetting"
elif re.search(r"skill|experience|reflect|self-evolv|continual learn", text):
problem = "experience_learning"
elif re.search(r"execution state|task state|workflow state|long-horizon", text):
problem = "execution_state"
elif re.search(r"graph|hierarch|represent|structure|database|document", text):
problem = "representation"
elif re.search(r"retriev|search|recall|access", text):
problem = "access"
elif re.search(r"multi-agent|shared memory|collective memory", text):
problem = "shared_memory"
elif re.search(r"cost|latency|token|efficient|compress", text):
problem = "systems_cost"
else:
problem = "application" if relevance != "peripheral" else "unrelated"
return {
"arxiv_id": record["arxiv_id"],
"relevance": relevance,
"problem": problem,
"reason": "deterministic fallback after model-format failure",
"source": "heuristic",
}
def normalize_analysis(record: dict, analysis: dict | None) -> dict:
"""Constrain model output to the documented screening schema."""
fallback = heuristic_screen(record)
analysis = analysis if isinstance(analysis, dict) else {}
relevance = str(analysis.get("relevance", "")).strip().lower()
if relevance not in RELEVANCE_VALUES:
relevance = fallback["relevance"]
problem = str(analysis.get("problem", "")).strip().lower()
problem = PROBLEM_ALIASES.get(problem, problem)
if problem not in PROBLEM_VALUES:
problem = fallback["problem"]
reason = str(analysis.get("reason", "")).strip() or fallback["reason"]
source = str(analysis.get("source", "")).strip().lower()
if source not in {"model", "heuristic"}:
source = "model" if analysis else "heuristic"
return {
"arxiv_id": record["arxiv_id"],
"relevance": relevance,
"problem": problem,
"reason": reason,
"source": source,
}
def main() -> int:
parser = argparse.ArgumentParser()
parser.add_argument(
"--input",
type=Path,
default=ROOT / "data" / "research" / "agent-memory-expanded.json",
)
parser.add_argument(
"--output",
type=Path,
default=ROOT / "data" / "research" / "agent-memory-screened.json",
)
parser.add_argument("--ollama-url", default="http://192.168.1.10:11434")
parser.add_argument("--model", default="ChatGPT-5.6:Luna")
parser.add_argument("--batch-size", type=int, default=24)
parser.add_argument("--timeout", type=int, default=180)
parser.add_argument("--retries", type=int, default=2)
parser.add_argument("--refresh", action="store_true")
args = parser.parse_args()
args.input = args.input.resolve()
args.output = args.output.resolve()
source = json.loads(args.input.read_text(encoding="utf-8"))
records = source["papers"]
completed: dict[str, dict] = {}
if args.output.exists() and not args.refresh:
previous = json.loads(args.output.read_text(encoding="utf-8"))
completed = {
item["arxiv_id"]: {
**item,
"screen": normalize_analysis(item, item.get("screen")),
}
for item in previous.get("papers", [])
}
pending = [item for item in records if item["arxiv_id"] not in completed]
for offset in range(0, len(pending), args.batch_size):
batch = pending[offset : offset + args.batch_size]
try:
screened = generate(
args.ollama_url, args.model, batch, timeout=args.timeout, retries=args.retries
)
except Exception:
screened = []
for record in batch:
try:
screened.extend(
generate(
args.ollama_url,
args.model,
[record],
timeout=args.timeout,
retries=args.retries,
)
)
except Exception:
screened.append(heuristic_screen(record))
for record, analysis in zip(batch, screened, strict=True):
completed[record["arxiv_id"]] = {
**record,
"screen": normalize_analysis(record, analysis),
}
ordered = [completed[item["arxiv_id"]] for item in records if item["arxiv_id"] in completed]
write_json(
args.output,
{
"generated_at": date.today().isoformat(),
"model": args.model,
"source": str(args.input.relative_to(ROOT)),
"total": len(records),
"completed": len(ordered),
"papers": ordered,
},
)
print(f"screened {len(ordered)}/{len(records)}", flush=True)
# Rewrites an already complete file after schema normalization as well.
ordered = [completed[item["arxiv_id"]] for item in records if item["arxiv_id"] in completed]
write_json(
args.output,
{
"generated_at": date.today().isoformat(),
"model": args.model,
"source": str(args.input.relative_to(ROOT)),
"total": len(records),
"completed": len(ordered),
"papers": ordered,
},
)
return 0
if __name__ == "__main__":
raise SystemExit(main())
+194
View File
@@ -0,0 +1,194 @@
#!/usr/bin/env python3
"""Collect a paginated, abstract-level Agent-memory research corpus from arXiv."""
from __future__ import annotations
import argparse
import json
import re
import time
import urllib.error
import urllib.parse
import urllib.request
import xml.etree.ElementTree as ET
from collections import defaultdict
from datetime import date
from pathlib import Path
ROOT = Path(__file__).resolve().parents[2]
API_URL = "https://export.arxiv.org/api/query"
NS = {
"atom": "http://www.w3.org/2005/Atom",
"opensearch": "http://a9.com/-/spec/opensearch/1.1/",
}
QUERIES = [
("agent-memory", 'all:"agent memory" OR all:"memory agent" OR all:"memory agents"'),
(
"long-term-memory",
'(all:"long-term memory" OR all:"persistent memory") AND '
'(all:"LLM agent" OR all:"language agent" OR all:"large language model agent")',
),
(
"episodic-memory",
'all:"episodic memory" AND (all:"LLM" OR all:"large language model") AND all:"agent"',
),
(
"procedural-memory",
'(all:"procedural memory" OR all:"skill memory") AND '
'(all:"LLM agent" OR all:"language agent")',
),
(
"memory-evaluation",
'(all:"memory benchmark" OR all:"memory evaluation") AND '
'(all:"LLM agent" OR all:"language agent" OR all:"agent memory")',
),
]
def normalize(value: str) -> str:
return re.sub(r"\s+", " ", value).strip()
def arxiv_id(raw: str) -> str:
return raw.rsplit("/", 1)[-1].split("v", 1)[0]
def date_query(query: str, start: str, end: str) -> str:
return (
f"({query}) AND submittedDate:[{start.replace('-', '')}0000 "
f"TO {end.replace('-', '')}2359]"
)
def fetch_page(
query: str,
start_date: str,
end_date: str,
offset: int,
page_size: int,
retries: int,
timeout: int,
) -> bytes:
params = {
"search_query": date_query(query, start_date, end_date),
"start": offset,
"max_results": page_size,
"sortBy": "submittedDate",
"sortOrder": "ascending",
}
request = urllib.request.Request(
f"{API_URL}?{urllib.parse.urlencode(params)}",
headers={"User-Agent": "agent-kb-research/0.1"},
)
for attempt in range(retries + 1):
try:
with urllib.request.urlopen(request, timeout=timeout) as response:
return response.read()
except (urllib.error.HTTPError, urllib.error.URLError, TimeoutError):
if attempt >= retries:
raise
time.sleep(2 ** attempt)
raise RuntimeError("unreachable retry state")
def parse_page(payload: bytes) -> tuple[int, list[dict]]:
root = ET.fromstring(payload)
total = int(root.findtext("opensearch:totalResults", default="0", namespaces=NS))
records = []
for entry in root.findall("atom:entry", NS):
paper_id = arxiv_id(entry.findtext("atom:id", default="", namespaces=NS))
records.append(
{
"arxiv_id": paper_id,
"title": normalize(entry.findtext("atom:title", default="", namespaces=NS)),
"abstract": normalize(entry.findtext("atom:summary", default="", namespaces=NS)),
"published": entry.findtext("atom:published", default="", namespaces=NS)[:10],
"updated": entry.findtext("atom:updated", default="", namespaces=NS)[:10],
"authors": [
normalize(author.findtext("atom:name", default="", namespaces=NS))
for author in entry.findall("atom:author", NS)
],
"categories": [
node.attrib["term"]
for node in entry.findall("atom:category", NS)
if node.attrib.get("term")
],
"url": f"https://arxiv.org/abs/{paper_id}",
"pdf_url": f"https://arxiv.org/pdf/{paper_id}",
}
)
return total, records
def write_json(path: Path, payload: dict) -> None:
path.parent.mkdir(parents=True, exist_ok=True)
tmp = path.with_suffix(path.suffix + ".tmp")
tmp.write_text(json.dumps(payload, ensure_ascii=False, indent=2) + "\n", encoding="utf-8")
tmp.replace(path)
def main() -> int:
parser = argparse.ArgumentParser()
parser.add_argument("--from-date", default="2025-01-01")
parser.add_argument("--to-date", default=date.today().isoformat())
parser.add_argument("--page-size", type=int, default=100)
parser.add_argument("--max-per-query", type=int, default=2000)
parser.add_argument("--sleep", type=float, default=1.0)
parser.add_argument("--retries", type=int, default=4)
parser.add_argument("--timeout", type=int, default=45)
parser.add_argument(
"--output",
type=Path,
default=ROOT / "data" / "research" / "agent-memory-expanded.json",
)
args = parser.parse_args()
records: dict[str, dict] = {}
matched_queries: defaultdict[str, set[str]] = defaultdict(set)
query_totals = {}
for name, query in QUERIES:
offset = 0
while offset < args.max_per_query:
payload = fetch_page(
query,
args.from_date,
args.to_date,
offset,
args.page_size,
args.retries,
args.timeout,
)
total, page = parse_page(payload)
query_totals[name] = total
for record in page:
records[record["arxiv_id"]] = record
matched_queries[record["arxiv_id"]].add(name)
offset += len(page)
print(f"{name}: {min(offset, total)}/{total}", flush=True)
if not page or offset >= total:
break
time.sleep(args.sleep)
time.sleep(args.sleep)
papers = [
{**record, "matched_queries": sorted(matched_queries[paper_id])}
for paper_id, record in records.items()
]
papers.sort(key=lambda item: (item["published"], item["arxiv_id"]))
output = {
"generated_at": date.today().isoformat(),
"from_date": args.from_date,
"to_date": args.to_date,
"query_totals": query_totals,
"unique_papers": len(papers),
"papers": papers,
}
write_json(args.output, output)
print(json.dumps({"query_totals": query_totals, "unique_papers": len(papers)}, indent=2))
return 0
if __name__ == "__main__":
raise SystemExit(main())