26 lines
2.4 KiB
Markdown
26 lines
2.4 KiB
Markdown
# Experiments
|
|
|
|
这里记录 Agent 实验:prompt 对比、工具策略、记忆方案、评估方法、模型选择、架构变化。
|
|
|
|
## Experiment Log
|
|
|
|
| ID | Hypothesis | Status | Result | Link |
|
|
| --- | --- | --- | --- | --- |
|
|
| KC-001 | 12 篇主题卷宗足以形成 Agent Memory 领域认知 | failed | 样本和归因不足,输出像讲课,用户认知没有提高 | [记录](knowledge-compilation/2026-07-10-agent-memory-pilot.md) |
|
|
| KC-002 | 分页语料、受控对比和证据账本能支持领域进展判断 | completed | 建立 516 篇候选、32 篇全文池和 23 篇证据账本,得到可审计结论 | [记录](knowledge-compilation/2026-07-10-agent-memory-field-audit.md) |
|
|
| KC-003 | 实现 Agent 评测前,先用全文证据明确“完成、验证、恢复”分别是什么 | completed | 建立 40 篇全文池、37 篇证据账本和八条一般结论;暂停 runner 与网页工作等待用户质疑 | [记录](knowledge-compilation/2026-07-27-agent-completion-research-audit.md) |
|
|
| OPS-001 | 完整仓库交接可以让无会话上下文的 AI 继续工作 | completed | 增加状态、历史、下一步、完整性检查、模型校验和 systemd 服务管理 | [记录](operations/2026-07-12-project-handoff-audit.md) |
|
|
| EVAL-001 | 现有运行事件和隔离工作区可扩展为可决策的 Agent 评测体系 | completed | 形成任务契约、分层评测、独立判分、gain/regression 对照和评分器;尚未运行真实模型 | [记录](agent-evaluation/2026-07-27-k1412-agent-evaluation-design.md) |
|
|
| OPS-002 | 评估结论可以用交互报告展示而不伪装成真实跑分 | completed | 中文报告、决策演算器、任务筛选、响应式和镜像验证通过,已部署 HTTPS 并注册首页 | [记录](operations/2026-07-27-agent-eval-site.md) |
|
|
| OPS-003 | 全文研究产物可以先作为网页文档阅读,而不提前设计知识产品 | completed | 完成研究正文、双链模型、37 篇证据索引和旧报告归档,并更新原 HTTPS 部署 | [记录](operations/2026-07-28-completion-research-document.md) |
|
|
|
|
## Experiment Rules
|
|
|
|
- 每次实验只改变一个主要变量。
|
|
- 使用固定样本或明确记录样本来源。
|
|
- 先定义指标,再看结果。
|
|
- 记录失败实验,它们通常最有价值。
|
|
- 实验结论要写清楚适用边界。
|
|
|
|
新实验建议复制 [experiment-note](../templates/experiment-note.md)。
|