Audit Agent completion and recovery research
This commit is contained in:
@@ -0,0 +1,22 @@
|
||||
# Agent Completion, Verification, and Recovery
|
||||
|
||||
这个研究单元回答的不是“哪个 Agent benchmark 分数最高”,而是:
|
||||
|
||||
1. Agent 如何证明任务真的完成;
|
||||
2. evaluator 自己会怎样误判;
|
||||
3. 验证失败后,Agent 是否能发现、定位、恢复并重新证明。
|
||||
|
||||
## Read Order
|
||||
|
||||
1. [研究结论](findings.md):跨论文能够成立的一般结论、系统推论和未知问题。
|
||||
2. [证据账本](evidence-ledger.md):37 篇全文的关键数字、证据强度和外推边界。
|
||||
3. [研究过程记录](../../experiments/knowledge-compilation/2026-07-27-agent-completion-research-audit.md):
|
||||
候选池、审计方法、排除项和本轮没有执行的工作。
|
||||
|
||||
## Boundary
|
||||
|
||||
- 研究结论是当前的证据基线。
|
||||
- “completion certificate / failure object / recovery router” 是跨论文综合出的候选设计,
|
||||
不是已经完成的实现或实验结果。
|
||||
- `research/evaluation/` 是面向 `zk-data-agent` 的工程合同;本单元先约束它应该测什么,
|
||||
不证明当前 runner 已经存在或有效。
|
||||
Reference in New Issue
Block a user