Audit recent Agent memory research
This commit is contained in:
@@ -0,0 +1,66 @@
|
||||
# Agent Memory field audit
|
||||
|
||||
status: completed
|
||||
date: 2026-07-10
|
||||
owner: Codex + user
|
||||
|
||||
## 触发原因
|
||||
|
||||
12 篇锚点讲义被用户判定为无用。问题不是表达,而是样本太少、没有时间对照、没有拆实验归因,也没有解释大量论文在共同解决什么。
|
||||
|
||||
## 研究问题
|
||||
|
||||
1. 最近六个月相对前六个月,哪些问题出现了可比较的能力进步?
|
||||
2. 哪些只是新架构、新数据集或更弱 baseline 下的表面增益?
|
||||
3. 静态召回、更新、执行状态、经验复用、写入治理和安全分别卡在哪里?
|
||||
4. 一个 memory 设计需要怎样的实验才能支持因果主张?
|
||||
|
||||
## 数据修正
|
||||
|
||||
- 原论文采集器每个 query 默认只取最新 120 篇。2026-05 到 2026-07 的 `agent memory` 结果已经超过上限,因此旧库的月份分布有截断偏差,不能用于半年趋势。
|
||||
- 新工具 `tools/research/search_arxiv_memory.py` 使用分页和 5 组查询,覆盖 2025-01-01 至 2026-07-10,得到 516 个唯一候选。
|
||||
- 词法上界为 379 篇标题中心论文;最近六个月 292 篇,前六个月 61 篇。
|
||||
- 本地自动 `memory` 标签实际对应 293 篇论文,不是此前记录的 296;三条差异来自非论文条目。
|
||||
|
||||
## 流程
|
||||
|
||||
1. 用分页 arXiv API 建立可复跑的候选池和摘要数据。
|
||||
2. 用本地 `ChatGPT-5.6:Terra` 做 516 篇 recall-oriented 初筛,只作为 triage,不承担结论。
|
||||
3. 用确定性词法规则生成时间窗口、标题议程和 evidence-cue 统计。
|
||||
4. 下载 32 篇 PDF 并转成文本,定位 introduction、主结果、消融、成本和 limitation。
|
||||
5. 只在同 benchmark、同论文受控设置或明确固定变量的研究中判断能力变化。
|
||||
6. 把正结果、负结果、成本和不能外推的范围同时写入证据账本。
|
||||
|
||||
## 模型分工
|
||||
|
||||
- Ollama 小模型只做摘要级 relevance/problem triage。请求不指定 `num_ctx`,不发送 `keep_alive`。
|
||||
- 曾用 `ChatGPT-5.6:Sol` 测试细粒度抽取,约 3 分钟才处理 12 篇,未继续跑 293 篇;部分结果保存在 `memory-classified.json`,不参与领域结论。
|
||||
- 规则程序负责可复跑的日期、数量、关键词和窗口统计。
|
||||
- Codex 负责全文实验核验、跨论文冲突、归因和最终判断。
|
||||
- 本轮没有中控 GPT-5.5 的 API 信息,因此没有把它写成已执行步骤。
|
||||
|
||||
## 产物
|
||||
|
||||
- `data/research/agent-memory-expanded.json`: 516 篇分页候选及摘要。
|
||||
- `data/research/agent-memory-screened.json`: 摘要级初筛结果。
|
||||
- `data/research/memory-corpus.json`: 本地 293 篇 `memory` 标签论文的完整摘要。
|
||||
- `data/research/memory-classified.json`: Sol 细粒度抽取的 12/293 篇中止样本。
|
||||
- `data/research/memory-landscape.json`: 时间窗口、方向和 evidence-cue 统计。
|
||||
- `data/research/memory-paper-ledger.csv`: 每篇候选的可过滤账本。
|
||||
- `research/memory/findings.md`: 直接回答问题的研究结论。
|
||||
- `research/memory/evidence-ledger.md`: 全文证据和边界。
|
||||
|
||||
## 有效经验
|
||||
|
||||
- 论文数量不能作为进步指标;必须找相同任务或单变量控制。
|
||||
- 先找强负结果和 baseline audit,再读新架构,能快速发现假增益。
|
||||
- 摘要可以筛选“可能有证据”的论文,不能支持成本、公平性和失败边界。
|
||||
- “memory”必须拆成 write、store、retrieve、resolve、use、act 六个阶段,否则论文结果无法比较。
|
||||
- 同一个系统要分开报告静态 QA、动态更新和 agentic action;三者不能共享一个总分结论。
|
||||
|
||||
## 仍有限制
|
||||
|
||||
- 516 是查询并集,自动初筛明显偏向高召回;379 是词法上界,不是人工确认核心数。
|
||||
- 32 篇全文仍不是 379 篇的全量系统综述,但已经覆盖关键 benchmark、受控反例和近期正结果。
|
||||
- 最近几个月的大量材料是未独立复现的 arXiv preprint。
|
||||
- 论文之间的模型和 harness 快速变化,跨论文只做问题趋势判断,不做绝对分数排行榜。
|
||||
@@ -1,6 +1,6 @@
|
||||
# KC-001:Agent Memory 主题卷宗试验
|
||||
|
||||
status: running
|
||||
status: failed
|
||||
date: 2026-07-10
|
||||
owner: Codex + user
|
||||
|
||||
@@ -23,7 +23,7 @@ owner: Codex + user
|
||||
|
||||
- 本地 Agent 论文库:974 篇。
|
||||
- 时间范围:现有库覆盖的最近一年。
|
||||
- 候选 memory 证据池:约 296 篇自动标签论文。
|
||||
- 候选 memory 证据池:293 篇自动标签论文。此前的 296 把非论文条目算了进去,现已纠正。
|
||||
- 本轮锚点:12 篇原始论文。
|
||||
|
||||
## 锚点选择规则
|
||||
@@ -123,6 +123,20 @@ EvoMemBench、AutoMEM 诊断和预算研究对认知的贡献不亚于新方法
|
||||
|
||||
## 目前的失败与不足
|
||||
|
||||
### 用户判定:失败
|
||||
|
||||
用户的反馈是“读的论文太少”“认知没有提高”“不是要听课,而是一起研究”。这个判定成立。本轮产物虽然结构完整,但没有回答最重要的研究问题:
|
||||
|
||||
- memory 领域当前到底在解决哪些不同问题。
|
||||
- 半年前的失败今天有没有在可比实验中改善。
|
||||
- 200 多篇论文分别在做什么,而不是 12 篇锚点说了什么。
|
||||
- 哪些增益来自 memory,哪些来自模型、embedding、prompt、token 或额外调用。
|
||||
- 一个新设计需要什么证据才能说服别人。
|
||||
|
||||
失败原因不是页面或讲义形式,而是研究采样和归因方式错误:12 篇锚点适合搭概念框架,不足以判断领域进展;跨论文总分不可比,却没有先建立受控比较和时间基线;输出形式像课程,把未充分验证的综合判断写成了结论。
|
||||
|
||||
因此本试验不再以“让用户完成 45 分钟学习”为下一步。后续改为 field audit:完整分页采集、问题分层、同 benchmark 受控比较、全文证据账本和失败边界记录。新结果见 `research/memory/findings.md`。
|
||||
|
||||
- 还没有真实用户学习数据,因此不能证明 45 分钟路径有效。
|
||||
- 12 篇锚点偏 2026 年最新工作,缺少对 2023-2025 经典系统的直接精读,历史演化主要由 survey 补足。
|
||||
- 定量结果来自不同模型、benchmark 和协议,只能逐篇解释,不能横向排序。
|
||||
@@ -151,4 +165,3 @@ EvoMemBench、AutoMEM 诊断和预算研究对认知的贡献不亚于新方法
|
||||
- 两道设计题至少一道达到 2 分以上。
|
||||
- 一周后复习仍能恢复主要框架,而不是只记住论文名字。
|
||||
- 用户能指出至少一个讲义结论的证据边界。
|
||||
|
||||
|
||||
Reference in New Issue
Block a user