# KC-001:Agent Memory 主题卷宗试验 status: failed date: 2026-07-10 owner: Codex + user ## 目标 验证一个核心假设:相较于论文列表、摘要和图谱,把论文编译成“认知地图 + 压缩讲义 + 证据矩阵 + 主动回忆”是否更能帮助人建立可迁移、可检验的领域认知。 这次不是评估某个 memory 系统,而是评估一种知识加工流程。 ## 为什么选 Agent Memory 候选主题包括 evaluation、tool use 和 memory。最终选择 memory 的依据: - 现有语料中 `agent-memory` primary query 有 103 篇,自动 `memory` 标签约 296 篇,材料足够形成多种方法对照。 - 已有 2 篇人工 skimmed 锚点:memory survey 和 EvoMemBench,可以作为问题框架和反例入口。 - 主题有清晰演化链:context -> retrieval -> organization -> execution state -> procedural memory -> learned control -> governance。 - 它与当前项目“把论文变成长期可调用认知”的目标同构,学习结果可以直接反哺系统设计。 ## 输入 - 本地 Agent 论文库:974 篇。 - 时间范围:现有库覆盖的最近一年。 - 候选 memory 证据池:293 篇自动标签论文。此前的 296 把非论文条目算了进去,现已纠正。 - 本轮锚点:12 篇原始论文。 ## 锚点选择规则 每篇论文必须承担不同的认知角色,避免堆积同类 SOTA: 1. 一篇统一 taxonomy。 2. 一篇统一 benchmark 或强反例。 3. 一篇决策理论。 4. 至少三种不同表示:主题文档、执行状态、程序记忆。 5. 至少一种 learned control / credit assignment。 6. 一篇成本与 baseline 反例。 7. 写入可靠性和来源治理各一个代表。 本轮 12 篇: | Role | arXiv | Short name | | --- | --- | --- | | taxonomy | 2603.07670 | Memory for Autonomous LLM Agents | | benchmark | 2605.18421 | EvoMemBench | | theory | 2605.10870 | DeMem | | procedural | 2603.15666 | Compiled Memory | | cross-scenario diagnosis | 2606.04315 | AutoMEM | | execution state | 2606.06090 | MAGE | | topic documents | 2606.10677 | Infini Memory | | organize/retrieve split | 2606.11680 | HORMA | | transition reliability | 2606.25161 | TrustMem | | credit assignment | 2605.08374 | MemQ | | budget control | 2606.15017 | Online Skill/Memory Budget Study | | provenance governance | 2605.14421 | MemLineage | ## 实际流程 1. 读取本地 corpus summary、reading queue、已有人工笔记和 metadata。 2. 比较 memory、evaluation、tool use 的规模与材料成熟度。 3. 从约 296 篇 memory 标签论文中选择 12 个互补锚点。 4. 通过 arXiv API 校验题目、版本、作者摘要和发布日期。 5. 下载 12 篇原始 PDF,用 `pdftotext -layout` 提取可搜索文本。 6. 对每篇定位 introduction、method、experiment、ablation、limitation 和 conclusion。 7. 先写跨论文问题结构,再把单篇结果放入相应位置,避免让论文目录决定讲义结构。 8. 对所有定量主张建立证据矩阵,并同时记录不能外推的范围。 9. 把综合认知转换成主动回忆、比较、诊断和设计题。 10. 输出 `module.json`,为后续前端学习状态和复习调度保留结构。 ## 模型与工具分工 本轮没有调用本地 Ollama 做高层综合。原因不是排斥小模型,而是第一版需要先建立质量基线;主题结构、证据冲突和外推边界由 Codex 直接阅读原文后整理。 后续可交给本地模型的工作: - 从新增论文抽取 problem/method/benchmark/limitation 候选字段。 - 对锚点论文做章节定位、术语归一和重复检测。 - 基于已经确认的讲义生成低风险复习题候选。 - 检测新论文是否挑战证据矩阵中的既有判断。 仍应由强模型或 Codex 负责的工作: - 主题边界和锚点选择。 - 跨论文因果解释与方法演化。 - 证据强弱、实验公平性和外推边界。 - 对讲义、测验和系统设计的最终审校。 ## 本轮产物 - `learning/agent-memory/README.md` - `learning/agent-memory/knowledge-map.md` - `learning/agent-memory/chapter.md` - `learning/agent-memory/evidence-matrix.md` - `learning/agent-memory/active-recall.md` - `learning/agent-memory/module.json` ## 已观察到的方法经验 ### 1. 自动标签适合召回,不适合直接形成知识结构 `memory` 标签包含安全、RAG、GUI、推荐等大量邻近论文。它能建立证据池,但不能回答“这个主题最核心的认知冲突是什么”。第一轮必须先选角色互补的锚点。 ### 2. 摘要足以筛选,不足以写可信讲义 摘要能说明作者想解决什么,却经常省略最重要的限定:baseline 是否公平、prompt 是否更长、结果是否来自自定义 harness、失败集中在哪个子任务。至少需要阅读实验、消融和 limitation。 ### 3. 先搭问题骨架,再放论文 如果按论文逐篇总结,结果仍然是 12 篇摘要。先确定“状态、表示、控制、学习、治理、评估”这些问题,再让论文作为证据进入,才能形成可迁移认知。 ### 4. 反例和负结果是讲义主干 EvoMemBench、AutoMEM 诊断和预算研究对认知的贡献不亚于新方法。它们帮助建立三条防误用规则:长上下文必须比较;schema 会造成不可恢复的信息损失;memory 开销必须与 actor budget 公平比较。 ### 5. 原图不是第一版的必要条件 作者架构图适合解释单篇系统,但第一轮更需要跨论文统一地图。当前使用重新绘制的 Mermaid 关系图,避免让 12 套符号系统增加认知负担。后续只有在公式推导或结构细节无法重画时,再引用原图局部。 ### 6. 测验必须从复述走向设计 只问“某论文提出了什么”测试的是标题记忆。当前题目按概念、比较诊断、系统设计三级组织;是否能为 coding agent 设计 memory,比记住 HORMA 或 MemQ 的名字更能说明掌握程度。 ## 目前的失败与不足 ### 用户判定:失败 用户的反馈是“读的论文太少”“认知没有提高”“不是要听课,而是一起研究”。这个判定成立。本轮产物虽然结构完整,但没有回答最重要的研究问题: - memory 领域当前到底在解决哪些不同问题。 - 半年前的失败今天有没有在可比实验中改善。 - 200 多篇论文分别在做什么,而不是 12 篇锚点说了什么。 - 哪些增益来自 memory,哪些来自模型、embedding、prompt、token 或额外调用。 - 一个新设计需要什么证据才能说服别人。 失败原因不是页面或讲义形式,而是研究采样和归因方式错误:12 篇锚点适合搭概念框架,不足以判断领域进展;跨论文总分不可比,却没有先建立受控比较和时间基线;输出形式像课程,把未充分验证的综合判断写成了结论。 因此本试验不再以“让用户完成 45 分钟学习”为下一步。后续改为 field audit:完整分页采集、问题分层、同 benchmark 受控比较、全文证据账本和失败边界记录。新结果见 `research/memory/findings.md`。 - 还没有真实用户学习数据,因此不能证明 45 分钟路径有效。 - 12 篇锚点偏 2026 年最新工作,缺少对 2023-2025 经典系统的直接精读,历史演化主要由 survey 补足。 - 定量结果来自不同模型、benchmark 和协议,只能逐篇解释,不能横向排序。 - 还没有把个人答案、卡点和复习历史写入系统。 - 还没有让中控 GPT-5.5 对讲义做独立审稿,当前只有一次研究编辑视角。 - 尚未把新模块接入现有网页。 ## 下一轮验证 让用户按 45 分钟入口真实学习一次,并记录: - 实际花费时间。 - 12 题第一次得分和卡点类型。 - 哪些段落仍像论文综述,哪些确实帮助做出判断。 - 能否闭卷解释“什么时候不应该使用 memory”。 - 能否为自己的 Agent 画出 memory responsibility boundary。 根据反馈决定第二轮重点:缩短讲义、补图、增加例子,或进入交互式学习界面。 ## 判定标准 本试验只有满足以下条件才算 `validated`: - 用户能在不看材料时说出至少 4 个可迁移设计原则。 - 主动回忆前 10 题达到 20/30 以上。 - 两道设计题至少一道达到 2 分以上。 - 一周后复习仍能恢复主要框架,而不是只记住论文名字。 - 用户能指出至少一个讲义结论的证据边界。