Files
agent/tools/evaluation/README.md
T
2026-07-27 16:28:23 +08:00

674 B
Raw Blame History

Evaluation Tools

score_agent_runs.py

汇总一个或多个 Agent 变体的 JSONL 运行结果:

python3 tools/evaluation/score_agent_runs.py results.jsonl \
  --baseline agent-loop-v3 \
  --variant agent-loop-v4 \
  --format markdown

它会分开报告:

  • strict success 和假完成;
  • provider/infrastructure error
  • gains 和 regressions
  • 成功率/假完成率的 Wilson 95% 区间,以及配对差异的精确检验;
  • 工具失败与恢复;
  • 安全违规;
  • p50/p95、Token 和工具调用。

脚本给出的 promotion/reject 只是一条机械建议,最终决策仍需检查任务覆盖、统计区间和回归轨迹。