Audit recent Agent memory research
This commit is contained in:
@@ -1,6 +1,6 @@
|
||||
# KC-001:Agent Memory 主题卷宗试验
|
||||
|
||||
status: running
|
||||
status: failed
|
||||
date: 2026-07-10
|
||||
owner: Codex + user
|
||||
|
||||
@@ -23,7 +23,7 @@ owner: Codex + user
|
||||
|
||||
- 本地 Agent 论文库:974 篇。
|
||||
- 时间范围:现有库覆盖的最近一年。
|
||||
- 候选 memory 证据池:约 296 篇自动标签论文。
|
||||
- 候选 memory 证据池:293 篇自动标签论文。此前的 296 把非论文条目算了进去,现已纠正。
|
||||
- 本轮锚点:12 篇原始论文。
|
||||
|
||||
## 锚点选择规则
|
||||
@@ -123,6 +123,20 @@ EvoMemBench、AutoMEM 诊断和预算研究对认知的贡献不亚于新方法
|
||||
|
||||
## 目前的失败与不足
|
||||
|
||||
### 用户判定:失败
|
||||
|
||||
用户的反馈是“读的论文太少”“认知没有提高”“不是要听课,而是一起研究”。这个判定成立。本轮产物虽然结构完整,但没有回答最重要的研究问题:
|
||||
|
||||
- memory 领域当前到底在解决哪些不同问题。
|
||||
- 半年前的失败今天有没有在可比实验中改善。
|
||||
- 200 多篇论文分别在做什么,而不是 12 篇锚点说了什么。
|
||||
- 哪些增益来自 memory,哪些来自模型、embedding、prompt、token 或额外调用。
|
||||
- 一个新设计需要什么证据才能说服别人。
|
||||
|
||||
失败原因不是页面或讲义形式,而是研究采样和归因方式错误:12 篇锚点适合搭概念框架,不足以判断领域进展;跨论文总分不可比,却没有先建立受控比较和时间基线;输出形式像课程,把未充分验证的综合判断写成了结论。
|
||||
|
||||
因此本试验不再以“让用户完成 45 分钟学习”为下一步。后续改为 field audit:完整分页采集、问题分层、同 benchmark 受控比较、全文证据账本和失败边界记录。新结果见 `research/memory/findings.md`。
|
||||
|
||||
- 还没有真实用户学习数据,因此不能证明 45 分钟路径有效。
|
||||
- 12 篇锚点偏 2026 年最新工作,缺少对 2023-2025 经典系统的直接精读,历史演化主要由 survey 补足。
|
||||
- 定量结果来自不同模型、benchmark 和协议,只能逐篇解释,不能横向排序。
|
||||
@@ -151,4 +165,3 @@ EvoMemBench、AutoMEM 诊断和预算研究对认知的贡献不亚于新方法
|
||||
- 两道设计题至少一道达到 2 分以上。
|
||||
- 一周后复习仍能恢复主要框架,而不是只记住论文名字。
|
||||
- 用户能指出至少一个讲义结论的证据边界。
|
||||
|
||||
|
||||
Reference in New Issue
Block a user