Files
llm-atlas/research/AGENTS_GROK_LEADS.md
T
2026-07-29 06:54:31 +08:00

6.0 KiB
Raw Blame History

Agent 专题 · Grok 候选召回

生成方式:Grok CLI headless--no-subagents 日期:2026-07-29 角色:只做宽召回与边界提醒,不作为正式事实来源。进入课程的结论必须回到论文、正式技术报告或官方项目文档核验。

1. Grok 给出的候选池

环境与交互前史

年份 候选 建议定位
2018 TextWorld 用文本游戏把“语言模型输出”变成可执行动作
2019 Jericho 交互式小说环境与世界状态
2021 ALFWorld 文本世界与具身环境对齐
2022 ScienceWorld 科学实验式交互环境
2022 WebShop 可扩展、可验证的网页购物环境
2022 WebGPT 浏览、引用、人类反馈与答案生成闭环
2022 SayCan 语言可行性 × 机器人 affordance
2022 MRKL LLM 路由外部模块的系统架构
2022 PAL 把程序执行当作外部计算器
2022 Code as Policies 用代码表达可组合机器人策略

Agent 循环、规划、反思与记忆

年份 候选 建议定位
2022/23 ReAct reasoning → acting → observation 的经典循环
2023 Tree of Thoughts 搜索式思考;不是默认依赖外部环境的 Agent
2023 Self-Refine 单次输出的反馈—改写循环
2023 Reflexion 语言反思写入 episodic memory;不是参数更新 RL
2023 ReWOO 规划与观测解耦,减少重复调用
2023 LATS 把推理、行动、规划放进树搜索
2023 Generative Agents 记忆、反思、计划驱动的社会模拟
2023 MemGPT 分层记忆与虚拟上下文管理
2023 Voyager 自动课程、技能库与具身长期学习

工具学习与接口

年份 候选 建议定位
2023 Toolformer 自监督筛选工具调用位置与参数
2023 Gorilla / APIBench API 调用与检索感知的工具模型
2023 ToolLLM / ToolBench 16K+ REST API 的数据生成、检索与搜索
2024 τ-bench 工具—用户—策略三方的多轮任务
2025 BFCL 从 AST/function-call 正确性扩展到多轮 agentic 评测

多 Agent 与编排

年份 候选 建议定位
2023 CAMEL role-playing 通信协议
2023 MetaGPT SOP、角色与文档驱动的软件工作流
2023 AutoGen 可对话 Agent 的组合式编程框架
2023 HuggingGPT 单控制器调度模型工具库;与真正对等多 Agent 区分

Web、桌面与软件工程

年份 候选 建议定位
2023 Mind2Web 真实网站离线轨迹与跨站泛化
2023/24 WebArena 可自托管真实网站与执行式验证
2023/24 AgentBench 八类交互环境的综合评测
2023/24 SWE-bench GitHub issue → 可测试补丁的任务集
2024 VisualWebArena 视觉落地的真实网页任务
2024 OSWorld 真实桌面 GUI、多模态观测与执行
2024 SWE-agent Agent-Computer Interface;不要把 harness 提升算成模型提升
2024 Agentless 简单定位—修复—验证流水线,提醒“复杂 Agent 不必然更好”
2024 ToolSandbox 有状态、多轮、on-policy 用户模拟与里程碑评测
2024 SWE-Gym 可执行 SWE 训练环境与 verifier 数据

Agent RL、可靠性与安全

年份 候选 建议定位
2024 AgentDojo 间接提示注入的可执行工具环境
2024 Agent Security Bench 攻击与防御分类评测
2025 RAGEN 多轮 Agent RL、echo trap 与 StarPO
2025 τ²-bench 用户和 Agent 都能改变环境的 dual-control 任务
2025 Agent Lightning Agent 与训练解耦、MDP 抽象与分层 credit assignment
2025 Long-context multi-turn SWE RL 长上下文软件 Agent 的多轮强化学习
2025 MCPMark MCP 工具使用的真实压力测试

DeepSeek / Kimi 收束线

年份 候选 建议定位
2025 DeepSeek-V3.2 agentic task synthesis、code/search/general agent 与混合 RL
2025 Kimi K2 agentic data synthesis、verifiable reward 与工具使用
2026 Kimi K2.5 visual agentic intelligence 与 Agent Swarm
2026 DeepSeek-V4 interleaved thinking、agent sandbox、search/code harness
2026 Kimi K3 可组合 white-box harness、AET、cross-scaffold generalization 与 1M Agentic RL

2. 候选池暴露出的五个易混层级

层级 典型对象 不能误写成
Model K2、K3、DeepSeek-V3.2 / V4 完整 Agent 产品
Harness ReAct、SWE-agent、AutoGen 基座模型能力
Tool contract function schema、MCP、ACI 环境任务成功
Environment WebArena、OSWorld、AgentENV 方法论文或榜单
Evaluator tests、final state、pass^k、security cases 模型自评或字符串相似度

3. 召回后必须二次核验的点

  1. BFCL 使用 ICML 2025 PMLR 论文作为 canonical 来源,不能误用 2407.21783
  2. K3 的 coding / agent 数字必须同时记录模型、harness、工具、交互步数和上下文预算。
  3. SWE-bench 是任务集,SWE-agent 是 ACI/harness;二者不能合成一个“模型分数”。
  4. Reflexion 的 “verbal RL” 不更新模型权重。
  5. pass@k 表示给多次机会能否至少成功一次;pass^k 表示连续多次是否都成功。
  6. 环境、任务、policy、verifier 和运行预算必须分别建账。
  7. 极新的 OSWorld 2.0 等候选先保留在扩展阅读,不能与旧版本结果直接横比。

4. 本专题的筛选原则

  • 主脉络只保留能回答某个“Agent 为什么会失败”的论文。
  • 一个里程碑必须能落到可画的状态变化、接口契约或训练信号。
  • 只靠排行榜数字、不说明 harness 与预算的工作不进入核心解释。
  • DeepSeek 与 Kimi 报告进入正文,但官方数字明确标成“报告值”,不伪装成本站复测。
  • 正文控制在约 45–55 个关键节点;其余进入论文图谱或扩展阅读。