Files
2026-07-28 00:06:57 +08:00

18 KiB
Raw Permalink Blame History

Agent 完成、验证与恢复:证据账本

last_reviewed: 2026-07-27

账本规则

本轮只把核过全文关键结果、消融或限制章节的论文放入下表。

  • core:直接承担 findings.md 的一般结论。
  • support:提供历史、特定领域或方法学旁证,不单独承担一般结论。
  • context:全文已下载并定位,但本轮没有核到足以改变结论的证据。
  • “证据强”只表示论文内部的对照较直接,不表示已经跨域复现。
  • 所有数字都只在原论文协议内解释,不跨 benchmark 排名。

1. 完成证明与 evaluator 误差

Paper Depth 核过的直接证据 可支持的判断 不能外推的部分
From Confident Closing to Silent Failure, 2606.09863 core tau2 共 9,876 条轨迹;airline/retail 失败轨迹中的 false success 为 45%/48%telecom 为 3%AppWorld 的 1,879 条明确完成声明中有 1,425 条 false success;任一 LLM judge 配置 AUROC 不超过约 0.65/0.54 Agent 自述不能作为完成证据;假完成需要独立状态检查 tau2 域间控制方式混杂,telecom 只有 15 个 false-success 样本;AppWorld 只含会明确自评的架构
tau-bench, 2406.12045 core 最终 reward 结合数据库/动作状态和输出信息;论文明确指出最终状态对 policy compliance 必要但不充分;pass^k 随重复快速下降 结果状态、策略遵守和跨次可靠性应分开 客服域、模拟用户和手写策略不代表所有 Agent 工作流
AppWorld, 2407.18901 core 750 个任务、9 个应用、457 个 API;任务测试要求预期状态变化成立,且预期/允许集合之外无额外变化 完成应同时检查目标效果和 collateral damage,并允许不同实现路径 任务测试人工编写;不能覆盖所有潜在副作用和 UI/多 Agent 场景
OSWorld, 2404.07972 core 369 个任务、302 个初始状态、134 个 evaluator;作者报告约 1,800 人时构建成本,并承认 evaluator 不能发现所有 latent side effects 高质量状态 verifier 昂贵且天然不完备 桌面任务的成本不能直接外推到 API、代码或开放研究任务
ToolSandbox, 2408.04682 core 1,032 个场景、34 个工具;用 milestone DAG 表示必要进展,用 minefield 表示禁止事件,允许部分进度和弹性顺序 评估可以路径有弹性,同时保留必要事件和禁止动作 milestone/minefield 仍需领域专家反复编写;模拟工具会产生自己的错误
AgentRewardBench, 2504.08942 core 1,302 条 web 轨迹、5 个 benchmark、4 个 Agent;官方规则 evaluator precision/recall/F1 为 83.8/55.9/67.1;最佳 LLM judge precision 低于 70% 规则判分偏低召回,LLM 判分偏低精度;不能把任一方当万能 oracle 专家标签自身在抽样上约 89.3% 一致;结果限于 web 轨迹
AJ-Bench, 2604.18240 core 155 个任务、516 条标注轨迹,覆盖 search/data/GUIjudge 使用工具后 Avg@3 明显提高,但不同域 FPR 仍为 8.77%-56.60% environment-aware judge 比纯文本 judge 更好,但仍不能独立作为发布门禁 judge、任务域和标注规模有限;更多 reasoning 不稳定单调增益
GroundEval, 2606.22737 support 定义 evidence path、temporal、access、causal 和 absence contract96 个合成企业问题中,合理回答可获 LLM judge 高分而确定性证据为 0 可用 typed evidence contract 取代“像答案”的文本判断 合成数据、单模型和少量 case study;未做充分 judge 对照
DynamicMCPBench, 2607.20531 core 1,845 个任务、121 个 MCP serverTier-1 按效果确定性判分;750 个任务人工复核 grader agreement 74%;参考答案完全正确仅 79%126 次 live 重放中 36% 相同、33% 漂移、32% 损坏 应按效果而非 gold path 判分;live 环境、参考答案和 grader 本身都需验证 Tier-1 是保守下界,仍会漏掉等价路径;MCP 服务样本不能代表全部生产系统
LLM-as-a-Verifier, 2607.05391 core 连续 logit 分数和重复采样提升 pairwise 与 best-of-N 选择;但失败轨迹的 verifier-progress 相关仍达 0.769 learned verifier 适合候选选择和进度信号,不足以单独证明完成;重复可减方差但不去偏 依赖 logit 访问;主要是候选排序/RL 设置,不是生产发布验证
Beyond Task Completion / PAE, 2603.03116 core tau-bench retail/airline 中加入程序 gate 后,不同模型成功率由 40%-79% 降到 9%-58%;作者人工审计 131 条 airline corrupt successjudge precision 约 93.8%-95.2% 状态成功会掩盖程序违规;“完成”可因必要过程被破坏而无效 单 benchmark,程序 gate 和部分判定依赖 GPT-5 judge;所有违规被同等二元处理
AgentLTL, 2607.02599 core FO-LTL 独立检查轨迹;block/warn 在 7 个模型中改善 5 个、恶化 2 个;soft-block 在 4/7 中最差 正确性和合规性是不同轴;门禁响应策略会制造拒绝或强制终止 主要是合成算术工具和一个 repo-QA 扩展,不能证明开放环境收益
RECEIPT, 2607.18575 core 同一 Claude Opus 自评 27 份 XSS 报告只有 10 个 TP;隔离、浏览器 verdict、可重放 PoC 和角色分离后,作者报告 30/30 TP;消融从 45% 到 100% precision 独立、不可游戏、可重放的 verifier 比 actor 自评可靠 单模型、白盒 XSS 和特定 harness;高 precision 可能伴随未测量的 false negative
Reason Less, Verify More, 2607.07405 core tau2 airline 中确定性前置 gate 把成功从 29.6% 提到 42.0%,独立种子复现约 +12.3ppgate precision 从 5% 到 100% 不等;retail 无正增益 可判定、高价值、工具允许违规的政策适合前置 gate 任务与 gate 同源;只有 cancellation gate 明显承担收益;block 与结构化反馈效应未分离
AgentLens, 2607.06624 support 16 个 Java 场景 × 2 persona;分开评 final result、instruction compliance、pitfalls、tool calls、pleasantness 和 formal verification;两个 judge 在 23% pairwise 比较上选不同赢家,18% 为各自偏向同家族 轨迹质量包含多个非冗余能力;judge 家族偏差和 provider/harness 故障会污染总分 场景很小且 Java-only;正式人类一致性研究尚未完成;QI 是未加权代理分

2. 测试、benchmark 和协议会不会错误认证

Paper Depth 核过的直接证据 可支持的判断 不能外推的部分
Are "Solved Issues" in SWE-bench Really Solved Correctly?, 2503.15223 core 检查 877 个已通过 benchmark 的补丁;补跑全部开发者测试直接发现平均 7.8% 错误;PatchDiff 暴露 29.6% 行为差异,人工审计后估计约 11% plausible patch 不正确 通过有限测试不等于需求完成;应检查测试覆盖和行为差异 差分测试也可能误报;部分 issue 规格本身不充分,人工结论有 uncertain 类
SWE-Bench+, 2410.06992 support 手工筛 251 个 SWE-Agent + GPT-4 通过项;报告 32.67% answer leakage、31.08% 弱测试,过滤后分数 12.47% 降到 3.97% 泄漏和弱测试可显著抬高 coding-agent 分数 判定定义和方法存在较强主观性,作为前述 ICSE 审计的旁证而非主证据
Protocol Validity / HackDetect, 2607.22368 core 审计 15 个 benchmark、2,385 条轨迹;53 条手标样本上 LLM audit F1 为 0.84;发现任务到分数协议可能允许绕过预期能力 benchmark 要证明“目标能力对得分仍然必要”,不能只检查数据和 metric 部分系统只预选可疑样本,不能解释为全体 prevalence;依赖同一类 LLM 审计
The Verification Horizon, 2606.26300 support coding-agent reward 中,过程监控抑制测试篡改/查答案等 hack;报告内部 SWE、前端和长程 reward 的多组改进 verifier 必须随 Agent 能力和攻击面共同演化,最终测试不能覆盖所有过程 hack 大量结果来自 Qwen 内部 benchmark 和训练管线,外部可复核性有限
Baselines Before Architecture, 2607.13085 core XBOW 104 个任务、两次运行;普通 Codex 基线随 GPT-5→5.2→5.5 从 67.3→79.8→92.3,模型匹配后剩余架构增益明显缩小 必须用同模型、同预算的简单基线分离模型能力和架构贡献 公开系统并非完全同预算,且公开安全 benchmark 可能有训练污染
The Regression Tax, 2607.22520 support 5,832 个 office task-condition runskills 带来 553 个 gain、324 个 regression,回归抵消约 59% 增益;Bonferroni 后仅 3/18 显著 新组件必须同时报告 gain 和 regression,平均值会藏住负迁移 主要显著结果集中在一个模型/benchmark;部分原 grader 有 artifact

3. 故障发现、定位和恢复

Paper Depth 核过的直接证据 可支持的判断 不能外推的部分
Hell or High Water, 2508.11027 core 830 题、4,450 个函数;第一工具不可用但保证有最多三步替代路径;多模型从 clean 到 failure 条件下降约 22-30pp53%-66% 失败在工具搜索 外部故障后的替代路径发现是独立能力,显式错误和已知可行路径也不保证恢复 Spider 派生、工具库很大但路径短;结果受 prompt 和工具检索接口影响
ToolMaze, 2606.05806 core controlled DAG 覆盖显式/隐式 × 瞬时/永久故障;有 hint 时平均恢复率为 81.44%、27.68%、38.12%、17.58%;模型规模对 recovery 的拟合斜率远低于 task success 隐式永久故障最难;恢复能力不会随一般任务能力等速增长 程序生成 DAG 和故障模板,不是开放生产环境;规模相关不证明因果
Don't Blindly Trust It, 2606.21409 core HotpotQA/FEVER matched loop;错误或冲突反馈使结果远差于无反馈;首步预测器在 recoverable conflict 上 AUC 跌到 0.516requery 对不同模型可正可负 检出坏反馈只是一层过滤,最终表现受 fallback 能力限制 主要是 QA 和模拟 corruption,只有 GPT-4o 是闭源强模型;calculator 只是 pilot
R2Act, 2607.04623 core 302 个 Kubernetes incident;最强 RAG 的 root service 识别 91.4%-99.7%,恢复动作有效率仅 36.8%-60.3%Qwen live replay 恢复 146/302 诊断、动作有效性和真实状态恢复是三个不同阶段 单一微服务系统和有限故障类型;组织权限/策略未充分覆盖
AgentDebug, 2509.25370 core 200 条失败轨迹;检测 exact step 45%step+module 31.3%,全部精确 24.3%;从定位点重跑在三套任务上提高恢复 定位错误步骤可比从头盲目改写更有效,但自动根因判断仍弱 标注者 κ=0.55;样本和域小,部分图表分母不够清晰
AgentDebugX, 2607.18754 core Who&When 184 条轨迹上 strict agent+step 由 21.7% 提到 28.8%GAIA 73 条失败一次重跑修复 13 条,三个基线为 4-6 条;约 1.6× 单次读取 Token 结构化归因可提高后续恢复,但严格根因定位仍远未解决 所有方法可见参考答案;GAIA 只用一个 policy model,比较的是完整 recipe,未隔离归因效应
CodeRescue, 2607.19338 core 约 27,300 次代码任务尝试;固定 reflect/replan/escalate 恢复率为 27.5/45.3/68.6%router 为 81.7%;可恢复失败中 cheap-only/escalation-only/both 为 28/45/27% 不存在统一最优恢复动作;根据失败上下文和成本路由有直接价值 单次路由决策、代码 benchmark 和特定模型;高成功率不代表安全恢复
VRR-Stop, 2607.17641 core 在 verifier/repair 不匹配 stress 中,固定五轮 repair 从 0.700 降到 0.116VRR-Stop 为 0.72255% 正确计划被破坏 verify-repair loop 必须有停止/保护条件,更多轮次可能主动伤害 巨大差值来自刻意 stress;正常条件下相对 no-repair 的提升较小且 CI 可跨 0
Reflexion, 2303.11366 support HumanEval Rust50 消融:base 60、无测试自反思 52、仅测试 60、测试+反思 68;自生成测试在 MBPP 有更多 false positive 反思依赖可靠外部反馈;无证据自反思会损伤正确答案 较早模型、特定 coding/QA/ALFWorld 设置,不能代表当前 Agent
CRITIC, 2305.11738 support 外部工具反馈在 QA/math/toxicity 有增益;数学中修复 32.2% 初始错误,同时错误修改 14.3%,并使原本正确项下降 4.3% 外部反馈有用,但 correction 不是单调改进,必须复验 多为短程任务,工具质量和 prompt 强烈影响结果
Human-Guided Harm Recovery, 2604.18847 support 775 个场景、20 名标注者、1,130 个计划偏好;在 50 个 OSWorld harm 场景上,人偏好 reward/rubric 重排计划 有伤害后的恢复涉及规范和人类偏好,不能只优化任务成功 假设已有外部 harm classifier;评的是计划偏好,不是客观状态恢复
Self-Healing Agentic Orchestrators, 2606.01416 support 100 个作者构造任务、确定性工具和故障模板中报告 98.8% 成功;live model 部分只有 15 个任务,三种方法最终都 100%;作者明确承认 benchmark 与 recovery policy 可能同源 detect-diagnose-recover-verify 和 bounded budget 是可用系统词汇 不能用其高分证明生产自愈;合成任务、受控故障、弱 baseline 和饱和 live set 外部效度低

4. 变更风险、协作和重复可靠性

Paper Depth 核过的直接证据 可支持的判断 不能外推的部分
SABER, 2512.07850 core tau-bench 中 mutating action 仅占 14%-18%,但与失败强相关;confirmation/reflection/verifier 可提高多数组合,full 组合在部分 retail 设置反而回归 高副作用动作值得前置集中审查;保护组件也需报告回归 mutation 与失败的回归关系可能受路径距离混杂;只研究确认型 safeguard
tau2-bench, 2506.07982 core 新增共享世界状态和用户工具,区分 no-user、oracle-plan 和 dual-controltelecom pass^1 约 34%;用户模拟器 critical error 为 6%retail/airline 为 12%/13% 指导用户、协调共享状态和纯自主执行是不同能力;user simulator 也是误差源 三个客服域,专家-新手差距未显式建模;域扩展仍依赖专家
AgentBoard, 2401.13178 support 1,013 个任务、9 个环境;把 success 与人工定义 progress rate 分开 部分进展有诊断价值,不能只保留二元成功 progress 仍依赖任务作者定义,且模拟环境与当前模型不同
Agent-as-a-Judge, 2410.10934 support DevAI 55 个任务上,Agent judge 可主动读取环境;作者专家评估耗时 58/86.5 小时,Agent judge 与人类对齐约 84%-90% judge 主动取证比只看最终文本更合理,也可降低人工成本 样本小、主观任务多;对齐率不足以支持自动发布

5. 全文池与排除

本轮全文池共 40 篇:

2303.11366, 2304.05128, 2305.11738, 2307.13854, 2310.06770, 2401.13178, 2404.07972, 2406.12045, 2407.18901, 2408.04682, 2410.06992, 2410.10934, 2503.15223, 2504.08942, 2506.07982, 2508.11027, 2509.25370, 2512.07850, 2603.03116, 2604.18240, 2604.18847, 2606.01416, 2606.05806, 2606.09863, 2606.21409, 2606.22737, 2606.26300, 2607.02599, 2607.04623, 2607.05391, 2607.06624, 2607.07405, 2607.13085, 2607.17641, 2607.18575, 2607.18754, 2607.19338, 2607.20531, 2607.22368, 2607.22520

其中 37 篇进入上面的 core/support 账本。三篇只作历史背景:

Paper Depth 不进入核心论证的原因
Self-Debugging, 2304.05128 context 早期代码自调试背景;本轮已有 Reflexion、CRITIC 和更新的恢复对照承担该结论
WebArena, 2307.13854 context 作为交互环境历史锚点;完成证明由 tau/AppWorld/OSWorld 的更直接状态设计承担
SWE-bench, 2310.06770 context 作为 coding benchmark 历史锚点;测试误认证由 2503.15223 的专门审计承担

6. 证据冲突如何处理

本轮没有把论文数量当投票。出现冲突时按下面规则解释:

  1. 同一论文的受控消融优先于跨论文绝对分数。
  2. 真实环境结果优先用于外部边界,合成故障结果只说明机制可能性。
  3. 确定性 validator 的 PASS 只覆盖写入的合同,不等于完整用户满意。
  4. LLM judge 的高 recall 不能抵消高 false-positive 风险。
  5. 有回归的组合不能用平均正增益包装成通用方法。
  6. 作者自建任务、自建 policy、自建 recovery 的闭环证据降级。
  7. 未独立复现的 2026 preprint 只能形成方向判断,不能形成生产保证。