Collect first agent research and market sources
This commit is contained in:
@@ -0,0 +1,64 @@
|
||||
# Paper: OpenAgentSafety
|
||||
|
||||
---
|
||||
type: paper
|
||||
title: OpenAgentSafety: A Comprehensive Framework for Evaluating Real-World AI Agent Safety
|
||||
authors: Sanidhya Vijayvargiya, Aditya Bharat Soni, Xuhui Zhou, Zora Zhiruo Wang, Nouha Dziri, Graham Neubig, Maarten Sap
|
||||
year: 2025
|
||||
venue: ICLR 2026 / IASEAI 2026
|
||||
url: https://arxiv.org/abs/2507.06134
|
||||
code_url:
|
||||
source: arxiv
|
||||
collected_at: 2026-07-08
|
||||
status: skimmed
|
||||
relevance: high
|
||||
topics:
|
||||
- agent-evaluation
|
||||
- agent-safety
|
||||
- tool-use
|
||||
methods:
|
||||
- multi-turn-agent-evaluation
|
||||
- rule-based-analysis
|
||||
- llm-as-judge
|
||||
benchmarks:
|
||||
- OpenAgentSafety
|
||||
models:
|
||||
-
|
||||
datasets:
|
||||
-
|
||||
related_concepts:
|
||||
- guardrail
|
||||
- human-in-the-loop
|
||||
related_jobs:
|
||||
- 2026-07-08-baidu-aidu-agent-algorithm-engineer-beijing
|
||||
- 2026-07-08-tencent-cloud-ai-agent-test-engineer
|
||||
related_experiments:
|
||||
-
|
||||
related_projects:
|
||||
-
|
||||
---
|
||||
|
||||
## One-line Takeaway
|
||||
|
||||
Agent safety 评估正在从简单拒答测试转向真实工具、多用户、多轮任务和可扩展评估框架。
|
||||
|
||||
## Problem
|
||||
|
||||
真实 Agent 会调用浏览器、文件系统、shell、消息平台和代码执行环境,传统安全 benchmark 对工具、任务和对抗场景覆盖不足。
|
||||
|
||||
## Core Idea
|
||||
|
||||
OpenAgentSafety 提供模块化框架,用真实工具和多轮任务评估 Agent 在八类风险下的行为,并结合规则分析和 LLM-as-judge。
|
||||
|
||||
## Evidence
|
||||
|
||||
论文报告覆盖 350+ 多轮、多用户任务,并评估五个 LLM 在 agentic 场景下的安全表现。
|
||||
|
||||
## Useful For Us
|
||||
|
||||
- 可作为 Agent eval harness 的安全维度参考。
|
||||
- 与 JD 中的 Agent 评测体系、成功率、稳定性、安全边界直接相关。
|
||||
|
||||
## Follow-up Experiments
|
||||
|
||||
- 选 10 个高风险工具任务,建立一个本地 mini OpenAgentSafety 风格测试集。
|
||||
Reference in New Issue
Block a user