Files
agent/research/evaluation/README.md
T
2026-07-27 16:28:23 +08:00

823 B

Agent Evaluation

这里研究如何评估真实 Agent 系统,而不是只收集 benchmark 名称。

Current Work

  • K1412 Agent Evaluation v1: 基于 zk-data-agent 的运行事件、隔离工作区和证据门禁,并结合 Zero 的问题闭环设计评测体系。
  • Task contracts: 第一批机器可读任务契约,明确当前 runner 能力和缺口。
  • Run scorer: 汇总结果、假完成、收益、 回归、延迟、Token、工具失败和安全违规。

Evidence Boundary

当前方案的工程判断来自实际代码和文档检查。2026-07-09 至 2026-07-27 的新论文只做了 标题和摘要级筛选,尚未构成全文证据审计。