25 lines
1.3 KiB
Markdown
25 lines
1.3 KiB
Markdown
# Agent Evaluation
|
|
|
|
这里研究如何评估真实 Agent 系统,而不是只收集 benchmark 名称。
|
|
|
|
## Current Work
|
|
|
|
- [K1412 Agent Evaluation v1](k1412-agent-evaluation-v1.md): 基于 `zk-data-agent`
|
|
的运行事件、隔离工作区和证据门禁,并结合 Zero 的问题闭环设计评测体系。
|
|
- [Task contracts](../../data/evaluation/k1412-agent-eval-task-contracts-v1.json):
|
|
第一批机器可读任务契约,明确当前 runner 能力和缺口。
|
|
- [Run scorer](../../tools/evaluation/score_agent_runs.py): 汇总结果、假完成、收益、
|
|
回归、延迟、Token、工具失败和安全违规。
|
|
|
|
## Evidence Boundary
|
|
|
|
当前方案的工程判断来自实际代码和文档检查。后续完成了独立的 40 篇全文研究池和 37 篇
|
|
证据审计,见 [Agent completion, verification, and recovery](../completion-verification/README.md)。
|
|
|
|
该研究支持独立验证、假完成、版本 manifest、gain/regression 和重复运行的方向,也对当前
|
|
合同提出修正:应分开 outcome、invariant、procedure 和 semantic residual,增加
|
|
`ambiguous/unverifiable`,并把 failure detection、localization、routing、restoration 和
|
|
re-verification 分开记录。
|
|
|
|
这些是研究约束,不表示 runner、validator 或真实 benchmark 已经完成。
|