Files
agent/experiments/knowledge-compilation/2026-07-10-agent-memory-pilot.md
2026-07-10 18:52:00 +08:00

168 lines
8.3 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# KC-001Agent Memory 主题卷宗试验
status: failed
date: 2026-07-10
owner: Codex + user
## 目标
验证一个核心假设:相较于论文列表、摘要和图谱,把论文编译成“认知地图 + 压缩讲义 + 证据矩阵 + 主动回忆”是否更能帮助人建立可迁移、可检验的领域认知。
这次不是评估某个 memory 系统,而是评估一种知识加工流程。
## 为什么选 Agent Memory
候选主题包括 evaluation、tool use 和 memory。最终选择 memory 的依据:
- 现有语料中 `agent-memory` primary query 有 103 篇,自动 `memory` 标签约 296 篇,材料足够形成多种方法对照。
- 已有 2 篇人工 skimmed 锚点:memory survey 和 EvoMemBench,可以作为问题框架和反例入口。
- 主题有清晰演化链:context -> retrieval -> organization -> execution state -> procedural memory -> learned control -> governance。
- 它与当前项目“把论文变成长期可调用认知”的目标同构,学习结果可以直接反哺系统设计。
## 输入
- 本地 Agent 论文库:974 篇。
- 时间范围:现有库覆盖的最近一年。
- 候选 memory 证据池:293 篇自动标签论文。此前的 296 把非论文条目算了进去,现已纠正。
- 本轮锚点:12 篇原始论文。
## 锚点选择规则
每篇论文必须承担不同的认知角色,避免堆积同类 SOTA:
1. 一篇统一 taxonomy。
2. 一篇统一 benchmark 或强反例。
3. 一篇决策理论。
4. 至少三种不同表示:主题文档、执行状态、程序记忆。
5. 至少一种 learned control / credit assignment。
6. 一篇成本与 baseline 反例。
7. 写入可靠性和来源治理各一个代表。
本轮 12 篇:
| Role | arXiv | Short name |
| --- | --- | --- |
| taxonomy | 2603.07670 | Memory for Autonomous LLM Agents |
| benchmark | 2605.18421 | EvoMemBench |
| theory | 2605.10870 | DeMem |
| procedural | 2603.15666 | Compiled Memory |
| cross-scenario diagnosis | 2606.04315 | AutoMEM |
| execution state | 2606.06090 | MAGE |
| topic documents | 2606.10677 | Infini Memory |
| organize/retrieve split | 2606.11680 | HORMA |
| transition reliability | 2606.25161 | TrustMem |
| credit assignment | 2605.08374 | MemQ |
| budget control | 2606.15017 | Online Skill/Memory Budget Study |
| provenance governance | 2605.14421 | MemLineage |
## 实际流程
1. 读取本地 corpus summary、reading queue、已有人工笔记和 metadata。
2. 比较 memory、evaluation、tool use 的规模与材料成熟度。
3. 从约 296 篇 memory 标签论文中选择 12 个互补锚点。
4. 通过 arXiv API 校验题目、版本、作者摘要和发布日期。
5. 下载 12 篇原始 PDF,用 `pdftotext -layout` 提取可搜索文本。
6. 对每篇定位 introduction、method、experiment、ablation、limitation 和 conclusion。
7. 先写跨论文问题结构,再把单篇结果放入相应位置,避免让论文目录决定讲义结构。
8. 对所有定量主张建立证据矩阵,并同时记录不能外推的范围。
9. 把综合认知转换成主动回忆、比较、诊断和设计题。
10. 输出 `module.json`,为后续前端学习状态和复习调度保留结构。
## 模型与工具分工
本轮没有调用本地 Ollama 做高层综合。原因不是排斥小模型,而是第一版需要先建立质量基线;主题结构、证据冲突和外推边界由 Codex 直接阅读原文后整理。
后续可交给本地模型的工作:
- 从新增论文抽取 problem/method/benchmark/limitation 候选字段。
- 对锚点论文做章节定位、术语归一和重复检测。
- 基于已经确认的讲义生成低风险复习题候选。
- 检测新论文是否挑战证据矩阵中的既有判断。
仍应由强模型或 Codex 负责的工作:
- 主题边界和锚点选择。
- 跨论文因果解释与方法演化。
- 证据强弱、实验公平性和外推边界。
- 对讲义、测验和系统设计的最终审校。
## 本轮产物
- `learning/agent-memory/README.md`
- `learning/agent-memory/knowledge-map.md`
- `learning/agent-memory/chapter.md`
- `learning/agent-memory/evidence-matrix.md`
- `learning/agent-memory/active-recall.md`
- `learning/agent-memory/module.json`
## 已观察到的方法经验
### 1. 自动标签适合召回,不适合直接形成知识结构
`memory` 标签包含安全、RAG、GUI、推荐等大量邻近论文。它能建立证据池,但不能回答“这个主题最核心的认知冲突是什么”。第一轮必须先选角色互补的锚点。
### 2. 摘要足以筛选,不足以写可信讲义
摘要能说明作者想解决什么,却经常省略最重要的限定:baseline 是否公平、prompt 是否更长、结果是否来自自定义 harness、失败集中在哪个子任务。至少需要阅读实验、消融和 limitation。
### 3. 先搭问题骨架,再放论文
如果按论文逐篇总结,结果仍然是 12 篇摘要。先确定“状态、表示、控制、学习、治理、评估”这些问题,再让论文作为证据进入,才能形成可迁移认知。
### 4. 反例和负结果是讲义主干
EvoMemBench、AutoMEM 诊断和预算研究对认知的贡献不亚于新方法。它们帮助建立三条防误用规则:长上下文必须比较;schema 会造成不可恢复的信息损失;memory 开销必须与 actor budget 公平比较。
### 5. 原图不是第一版的必要条件
作者架构图适合解释单篇系统,但第一轮更需要跨论文统一地图。当前使用重新绘制的 Mermaid 关系图,避免让 12 套符号系统增加认知负担。后续只有在公式推导或结构细节无法重画时,再引用原图局部。
### 6. 测验必须从复述走向设计
只问“某论文提出了什么”测试的是标题记忆。当前题目按概念、比较诊断、系统设计三级组织;是否能为 coding agent 设计 memory,比记住 HORMA 或 MemQ 的名字更能说明掌握程度。
## 目前的失败与不足
### 用户判定:失败
用户的反馈是“读的论文太少”“认知没有提高”“不是要听课,而是一起研究”。这个判定成立。本轮产物虽然结构完整,但没有回答最重要的研究问题:
- memory 领域当前到底在解决哪些不同问题。
- 半年前的失败今天有没有在可比实验中改善。
- 200 多篇论文分别在做什么,而不是 12 篇锚点说了什么。
- 哪些增益来自 memory,哪些来自模型、embedding、prompt、token 或额外调用。
- 一个新设计需要什么证据才能说服别人。
失败原因不是页面或讲义形式,而是研究采样和归因方式错误:12 篇锚点适合搭概念框架,不足以判断领域进展;跨论文总分不可比,却没有先建立受控比较和时间基线;输出形式像课程,把未充分验证的综合判断写成了结论。
因此本试验不再以“让用户完成 45 分钟学习”为下一步。后续改为 field audit:完整分页采集、问题分层、同 benchmark 受控比较、全文证据账本和失败边界记录。新结果见 `research/memory/findings.md`
- 还没有真实用户学习数据,因此不能证明 45 分钟路径有效。
- 12 篇锚点偏 2026 年最新工作,缺少对 2023-2025 经典系统的直接精读,历史演化主要由 survey 补足。
- 定量结果来自不同模型、benchmark 和协议,只能逐篇解释,不能横向排序。
- 还没有把个人答案、卡点和复习历史写入系统。
- 还没有让中控 GPT-5.5 对讲义做独立审稿,当前只有一次研究编辑视角。
- 尚未把新模块接入现有网页。
## 下一轮验证
让用户按 45 分钟入口真实学习一次,并记录:
- 实际花费时间。
- 12 题第一次得分和卡点类型。
- 哪些段落仍像论文综述,哪些确实帮助做出判断。
- 能否闭卷解释“什么时候不应该使用 memory”。
- 能否为自己的 Agent 画出 memory responsibility boundary。
根据反馈决定第二轮重点:缩短讲义、补图、增加例子,或进入交互式学习界面。
## 判定标准
本试验只有满足以下条件才算 `validated`
- 用户能在不看材料时说出至少 4 个可迁移设计原则。
- 主动回忆前 10 题达到 20/30 以上。
- 两道设计题至少一道达到 2 分以上。
- 一周后复习仍能恢复主要框架,而不是只记住论文名字。
- 用户能指出至少一个讲义结论的证据边界。