Collect first agent research and market sources

This commit is contained in:
wuyang
2026-07-08 12:08:24 +08:00
parent 36c2499d3c
commit 1cbc98e432
34 changed files with 3417 additions and 58 deletions
@@ -0,0 +1,64 @@
# Paper: OpenAgentSafety
---
type: paper
title: OpenAgentSafety: A Comprehensive Framework for Evaluating Real-World AI Agent Safety
authors: Sanidhya Vijayvargiya, Aditya Bharat Soni, Xuhui Zhou, Zora Zhiruo Wang, Nouha Dziri, Graham Neubig, Maarten Sap
year: 2025
venue: ICLR 2026 / IASEAI 2026
url: https://arxiv.org/abs/2507.06134
code_url:
source: arxiv
collected_at: 2026-07-08
status: skimmed
relevance: high
topics:
- agent-evaluation
- agent-safety
- tool-use
methods:
- multi-turn-agent-evaluation
- rule-based-analysis
- llm-as-judge
benchmarks:
- OpenAgentSafety
models:
-
datasets:
-
related_concepts:
- guardrail
- human-in-the-loop
related_jobs:
- 2026-07-08-baidu-aidu-agent-algorithm-engineer-beijing
- 2026-07-08-tencent-cloud-ai-agent-test-engineer
related_experiments:
-
related_projects:
-
---
## One-line Takeaway
Agent safety 评估正在从简单拒答测试转向真实工具、多用户、多轮任务和可扩展评估框架。
## Problem
真实 Agent 会调用浏览器、文件系统、shell、消息平台和代码执行环境,传统安全 benchmark 对工具、任务和对抗场景覆盖不足。
## Core Idea
OpenAgentSafety 提供模块化框架,用真实工具和多轮任务评估 Agent 在八类风险下的行为,并结合规则分析和 LLM-as-judge。
## Evidence
论文报告覆盖 350+ 多轮、多用户任务,并评估五个 LLM 在 agentic 场景下的安全表现。
## Useful For Us
- 可作为 Agent eval harness 的安全维度参考。
- 与 JD 中的 Agent 评测体系、成功率、稳定性、安全边界直接相关。
## Follow-up Experiments
- 选 10 个高风险工具任务,建立一个本地 mini OpenAgentSafety 风格测试集。