Files
agent/papers/items/2025-vijayvargiya-openagentsafety.md
T

1.7 KiB

Paper: OpenAgentSafety


type: paper title: OpenAgentSafety: A Comprehensive Framework for Evaluating Real-World AI Agent Safety authors: Sanidhya Vijayvargiya, Aditya Bharat Soni, Xuhui Zhou, Zora Zhiruo Wang, Nouha Dziri, Graham Neubig, Maarten Sap year: 2025 venue: ICLR 2026 / IASEAI 2026 url: https://arxiv.org/abs/2507.06134 code_url: source: arxiv collected_at: 2026-07-08 status: skimmed relevance: high topics:

  • agent-evaluation
  • agent-safety
  • tool-use methods:
  • multi-turn-agent-evaluation
  • rule-based-analysis
  • llm-as-judge benchmarks:
  • OpenAgentSafety models:

datasets:

related_concepts:

  • guardrail
  • human-in-the-loop related_jobs:
  • 2026-07-08-baidu-aidu-agent-algorithm-engineer-beijing
  • 2026-07-08-tencent-cloud-ai-agent-test-engineer related_experiments:

One-line Takeaway

Agent safety 评估正在从简单拒答测试转向真实工具、多用户、多轮任务和可扩展评估框架。

Problem

真实 Agent 会调用浏览器、文件系统、shell、消息平台和代码执行环境,传统安全 benchmark 对工具、任务和对抗场景覆盖不足。

Core Idea

OpenAgentSafety 提供模块化框架,用真实工具和多轮任务评估 Agent 在八类风险下的行为,并结合规则分析和 LLM-as-judge。

Evidence

论文报告覆盖 350+ 多轮、多用户任务,并评估五个 LLM 在 agentic 场景下的安全表现。

Useful For Us

  • 可作为 Agent eval harness 的安全维度参考。
  • 与 JD 中的 Agent 评测体系、成功率、稳定性、安全边界直接相关。

Follow-up Experiments

  • 选 10 个高风险工具任务,建立一个本地 mini OpenAgentSafety 风格测试集。