Files
llm-atlas/research/AGENTS_GROK_LEADS.md
T
2026-07-29 06:54:31 +08:00

121 lines
6.0 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# Agent 专题 · Grok 候选召回
> 生成方式:Grok CLI headless`--no-subagents`
> 日期:2026-07-29
> 角色:只做宽召回与边界提醒,不作为正式事实来源。进入课程的结论必须回到论文、正式技术报告或官方项目文档核验。
## 1. Grok 给出的候选池
### 环境与交互前史
| 年份 | 候选 | 建议定位 |
|---|---|---|
| 2018 | TextWorld | 用文本游戏把“语言模型输出”变成可执行动作 |
| 2019 | Jericho | 交互式小说环境与世界状态 |
| 2021 | ALFWorld | 文本世界与具身环境对齐 |
| 2022 | ScienceWorld | 科学实验式交互环境 |
| 2022 | WebShop | 可扩展、可验证的网页购物环境 |
| 2022 | WebGPT | 浏览、引用、人类反馈与答案生成闭环 |
| 2022 | SayCan | 语言可行性 × 机器人 affordance |
| 2022 | MRKL | LLM 路由外部模块的系统架构 |
| 2022 | PAL | 把程序执行当作外部计算器 |
| 2022 | Code as Policies | 用代码表达可组合机器人策略 |
### Agent 循环、规划、反思与记忆
| 年份 | 候选 | 建议定位 |
|---|---|---|
| 2022/23 | ReAct | reasoning → acting → observation 的经典循环 |
| 2023 | Tree of Thoughts | 搜索式思考;不是默认依赖外部环境的 Agent |
| 2023 | Self-Refine | 单次输出的反馈—改写循环 |
| 2023 | Reflexion | 语言反思写入 episodic memory;不是参数更新 RL |
| 2023 | ReWOO | 规划与观测解耦,减少重复调用 |
| 2023 | LATS | 把推理、行动、规划放进树搜索 |
| 2023 | Generative Agents | 记忆、反思、计划驱动的社会模拟 |
| 2023 | MemGPT | 分层记忆与虚拟上下文管理 |
| 2023 | Voyager | 自动课程、技能库与具身长期学习 |
### 工具学习与接口
| 年份 | 候选 | 建议定位 |
|---|---|---|
| 2023 | Toolformer | 自监督筛选工具调用位置与参数 |
| 2023 | Gorilla / APIBench | API 调用与检索感知的工具模型 |
| 2023 | ToolLLM / ToolBench | 16K+ REST API 的数据生成、检索与搜索 |
| 2024 | τ-bench | 工具—用户—策略三方的多轮任务 |
| 2025 | BFCL | 从 AST/function-call 正确性扩展到多轮 agentic 评测 |
### 多 Agent 与编排
| 年份 | 候选 | 建议定位 |
|---|---|---|
| 2023 | CAMEL | role-playing 通信协议 |
| 2023 | MetaGPT | SOP、角色与文档驱动的软件工作流 |
| 2023 | AutoGen | 可对话 Agent 的组合式编程框架 |
| 2023 | HuggingGPT | 单控制器调度模型工具库;与真正对等多 Agent 区分 |
### Web、桌面与软件工程
| 年份 | 候选 | 建议定位 |
|---|---|---|
| 2023 | Mind2Web | 真实网站离线轨迹与跨站泛化 |
| 2023/24 | WebArena | 可自托管真实网站与执行式验证 |
| 2023/24 | AgentBench | 八类交互环境的综合评测 |
| 2023/24 | SWE-bench | GitHub issue → 可测试补丁的任务集 |
| 2024 | VisualWebArena | 视觉落地的真实网页任务 |
| 2024 | OSWorld | 真实桌面 GUI、多模态观测与执行 |
| 2024 | SWE-agent | Agent-Computer Interface;不要把 harness 提升算成模型提升 |
| 2024 | Agentless | 简单定位—修复—验证流水线,提醒“复杂 Agent 不必然更好” |
| 2024 | ToolSandbox | 有状态、多轮、on-policy 用户模拟与里程碑评测 |
| 2024 | SWE-Gym | 可执行 SWE 训练环境与 verifier 数据 |
### Agent RL、可靠性与安全
| 年份 | 候选 | 建议定位 |
|---|---|---|
| 2024 | AgentDojo | 间接提示注入的可执行工具环境 |
| 2024 | Agent Security Bench | 攻击与防御分类评测 |
| 2025 | RAGEN | 多轮 Agent RL、echo trap 与 StarPO |
| 2025 | τ²-bench | 用户和 Agent 都能改变环境的 dual-control 任务 |
| 2025 | Agent Lightning | Agent 与训练解耦、MDP 抽象与分层 credit assignment |
| 2025 | Long-context multi-turn SWE RL | 长上下文软件 Agent 的多轮强化学习 |
| 2025 | MCPMark | MCP 工具使用的真实压力测试 |
### DeepSeek / Kimi 收束线
| 年份 | 候选 | 建议定位 |
|---|---|---|
| 2025 | DeepSeek-V3.2 | agentic task synthesis、code/search/general agent 与混合 RL |
| 2025 | Kimi K2 | agentic data synthesis、verifiable reward 与工具使用 |
| 2026 | Kimi K2.5 | visual agentic intelligence 与 Agent Swarm |
| 2026 | DeepSeek-V4 | interleaved thinking、agent sandbox、search/code harness |
| 2026 | Kimi K3 | 可组合 white-box harness、AET、cross-scaffold generalization 与 1M Agentic RL |
## 2. 候选池暴露出的五个易混层级
| 层级 | 典型对象 | 不能误写成 |
|---|---|---|
| Model | K2、K3、DeepSeek-V3.2 / V4 | 完整 Agent 产品 |
| Harness | ReAct、SWE-agent、AutoGen | 基座模型能力 |
| Tool contract | function schema、MCP、ACI | 环境任务成功 |
| Environment | WebArena、OSWorld、AgentENV | 方法论文或榜单 |
| Evaluator | tests、final state、pass^k、security cases | 模型自评或字符串相似度 |
## 3. 召回后必须二次核验的点
1. BFCL 使用 ICML 2025 PMLR 论文作为 canonical 来源,不能误用 `2407.21783`
2. K3 的 coding / agent 数字必须同时记录模型、harness、工具、交互步数和上下文预算。
3. SWE-bench 是任务集,SWE-agent 是 ACI/harness;二者不能合成一个“模型分数”。
4. Reflexion 的 “verbal RL” 不更新模型权重。
5. `pass@k` 表示给多次机会能否至少成功一次;`pass^k` 表示连续多次是否都成功。
6. 环境、任务、policy、verifier 和运行预算必须分别建账。
7. 极新的 OSWorld 2.0 等候选先保留在扩展阅读,不能与旧版本结果直接横比。
## 4. 本专题的筛选原则
- 主脉络只保留能回答某个“Agent 为什么会失败”的论文。
- 一个里程碑必须能落到可画的状态变化、接口契约或训练信号。
- 只靠排行榜数字、不说明 harness 与预算的工作不进入核心解释。
- DeepSeek 与 Kimi 报告进入正文,但官方数字明确标成“报告值”,不伪装成本站复测。
- 正文控制在约 45–55 个关键节点;其余进入论文图谱或扩展阅读。