Files
agent/experiments

Experiments

这里记录 Agent 实验:prompt 对比、工具策略、记忆方案、评估方法、模型选择、架构变化。

Experiment Log

ID Hypothesis Status Result Link
KC-001 12 篇主题卷宗足以形成 Agent Memory 领域认知 failed 样本和归因不足,输出像讲课,用户认知没有提高 记录
KC-002 分页语料、受控对比和证据账本能支持领域进展判断 completed 建立 516 篇候选、32 篇全文池和 23 篇证据账本,得到可审计结论 记录
OPS-001 完整仓库交接可以让无会话上下文的 AI 继续工作 completed 增加状态、历史、下一步、完整性检查、模型校验和 systemd 服务管理 记录
EVAL-001 现有运行事件和隔离工作区可扩展为可决策的 Agent 评测体系 completed 形成任务契约、分层评测、独立判分、gain/regression 对照和评分器;尚未运行真实模型 记录
OPS-002 评估结论可以用交互报告展示而不伪装成真实跑分 completed 中文报告、决策演算器、任务筛选、响应式和镜像验证通过,已部署 HTTPS 并注册首页 记录

Experiment Rules

  • 每次实验只改变一个主要变量。
  • 使用固定样本或明确记录样本来源。
  • 先定义指标,再看结果。
  • 记录失败实验,它们通常最有价值。
  • 实验结论要写清楚适用边界。

新实验建议复制 experiment-note