Refresh papers and define Agent evaluation

This commit is contained in:
wuyang
2026-07-27 16:28:23 +08:00
parent 8e4ff3779b
commit df475e8d90
180 changed files with 31313 additions and 160 deletions
+17
View File
@@ -0,0 +1,17 @@
# Agent Evaluation
这里研究如何评估真实 Agent 系统,而不是只收集 benchmark 名称。
## Current Work
- [K1412 Agent Evaluation v1](k1412-agent-evaluation-v1.md): 基于 `zk-data-agent`
的运行事件、隔离工作区和证据门禁,并结合 Zero 的问题闭环设计评测体系。
- [Task contracts](../../data/evaluation/k1412-agent-eval-task-contracts-v1.json):
第一批机器可读任务契约,明确当前 runner 能力和缺口。
- [Run scorer](../../tools/evaluation/score_agent_runs.py): 汇总结果、假完成、收益、
回归、延迟、Token、工具失败和安全违规。
## Evidence Boundary
当前方案的工程判断来自实际代码和文档检查。2026-07-09 至 2026-07-27 的新论文只做了
标题和摘要级筛选,尚未构成全文证据审计。