Agent 评估 K1412 Research 源仓库
01 / 结论

K1412 Agent Evaluation v1 · 2026.07.27

不评总分,只评一次改动是否该上线。

固定模型、任务、工作区和预算,只改变一个 Agent 行为假设。 用独立验证回答它改善了什么、破坏了什么,以及证据是否足以进入生产。

任务契约
10
跨产物、恢复、上下文、安全与委派
评测层次
6
从确定性单测到生产价值抽样
当前可跑
2
其余任务明确标注 runner 缺口
真实对比
0
不把设计契约伪装成实验结论
01问题一次只改变一个假设
02任务固定夹具、预算和模型
03运行配对、重复、随机顺序
04判分独立 Validator 与轨迹规则
05决定推广、继续或拒绝
02 / 发布决策

先看回归,再谈平均提升

下面是方法演算,不是真实跑分。它使用与仓库评分器一致的配对逻辑和统计口径。

配对运行结果
硬门禁与效率
机械建议

发布候选

30 次配对

新增成功多于回归,且没有安全或假完成阻断项。进入轨迹复核,而不是直接发布。

基线 \ 候选
失败
成功
失败
双方失败5
新增成功6
成功
回归失败1
双方成功18
基线成功率 63.3% 95% CI 45.5%–78.1%
候选成功率 80.0% 95% CI 62.7%–90.5%
配对差异 +5 McNemar p = 0.125
硬门禁通过 安全违规 0 · 新增假完成 0
03 / 评测层次

高层成功不能掩盖底层回归

真实模型评测建立在单测、隔离和伪模型链路之上,不替代它们。

L0

单元与策略门禁

先证明规则本身没有坏

检查参数规范化、完成证据、权限和事件顺序。每次提交运行,不调用真实模型。

模型
不调用
节奏
每次提交
失败动作
阻止进入高层评测
04 / 任务契约

任务描述不是真值

最终状态、命令结果和副作用 Validator 才决定任务是否真的完成。

05 / 相关产物

结论、契约、工具与边界均可追溯

网页是阅读入口,Git 仓库仍是事实源。

python3 tools/evaluation/score_agent_runs.py results.jsonl --baseline v3 --variant v4 --format markdown
06 / 下一步

Implementation order

先让两项任务真实可判,再扩大任务集。

  1. 01

    抽出 LiveEvalRunner从现有单次脚本提取可复用运行器。

  2. 02

    接入独立 Validator先覆盖脚本报告与数据分析两个任务。

  3. 03

    导出 Result JSONL固定模型、Prompt、工具、镜像、预算与版本。

  4. 04

    运行配对 Smoke确定性层全部通过后才调用真实模型。

  5. 05

    复核回归轨迹检查 gains、regressions、both-fail 与假完成。