L0
单元与策略门禁
先证明规则本身没有坏
检查参数规范化、完成证据、权限和事件顺序。每次提交运行,不调用真实模型。
- 模型
- 不调用
- 节奏
- 每次提交
- 失败动作
- 阻止进入高层评测
K1412 Agent Evaluation v1 · 2026.07.27
固定模型、任务、工作区和预算,只改变一个 Agent 行为假设。 用独立验证回答它改善了什么、破坏了什么,以及证据是否足以进入生产。
下面是方法演算,不是真实跑分。它使用与仓库评分器一致的配对逻辑和统计口径。
新增成功多于回归,且没有安全或假完成阻断项。进入轨迹复核,而不是直接发布。
真实模型评测建立在单测、隔离和伪模型链路之上,不替代它们。
单元与策略门禁
检查参数规范化、完成证据、权限和事件顺序。每次提交运行,不调用真实模型。
最终状态、命令结果和副作用 Validator 才决定任务是否真的完成。
没有匹配的任务。
网页是阅读入口,Git 仓库仍是事实源。
python3 tools/evaluation/score_agent_runs.py results.jsonl --baseline v3 --variant v4 --format markdown
Implementation order
抽出 LiveEvalRunner从现有单次脚本提取可复用运行器。
接入独立 Validator先覆盖脚本报告与数据分析两个任务。
导出 Result JSONL固定模型、Prompt、工具、镜像、预算与版本。
运行配对 Smoke确定性层全部通过后才调用真实模型。
复核回归轨迹检查 gains、regressions、both-fail 与假完成。