# Agent 专题 · Grok 候选召回 > 生成方式:Grok CLI headless(`--no-subagents`) > 日期:2026-07-29 > 角色:只做宽召回与边界提醒,不作为正式事实来源。进入课程的结论必须回到论文、正式技术报告或官方项目文档核验。 ## 1. Grok 给出的候选池 ### 环境与交互前史 | 年份 | 候选 | 建议定位 | |---|---|---| | 2018 | TextWorld | 用文本游戏把“语言模型输出”变成可执行动作 | | 2019 | Jericho | 交互式小说环境与世界状态 | | 2021 | ALFWorld | 文本世界与具身环境对齐 | | 2022 | ScienceWorld | 科学实验式交互环境 | | 2022 | WebShop | 可扩展、可验证的网页购物环境 | | 2022 | WebGPT | 浏览、引用、人类反馈与答案生成闭环 | | 2022 | SayCan | 语言可行性 × 机器人 affordance | | 2022 | MRKL | LLM 路由外部模块的系统架构 | | 2022 | PAL | 把程序执行当作外部计算器 | | 2022 | Code as Policies | 用代码表达可组合机器人策略 | ### Agent 循环、规划、反思与记忆 | 年份 | 候选 | 建议定位 | |---|---|---| | 2022/23 | ReAct | reasoning → acting → observation 的经典循环 | | 2023 | Tree of Thoughts | 搜索式思考;不是默认依赖外部环境的 Agent | | 2023 | Self-Refine | 单次输出的反馈—改写循环 | | 2023 | Reflexion | 语言反思写入 episodic memory;不是参数更新 RL | | 2023 | ReWOO | 规划与观测解耦,减少重复调用 | | 2023 | LATS | 把推理、行动、规划放进树搜索 | | 2023 | Generative Agents | 记忆、反思、计划驱动的社会模拟 | | 2023 | MemGPT | 分层记忆与虚拟上下文管理 | | 2023 | Voyager | 自动课程、技能库与具身长期学习 | ### 工具学习与接口 | 年份 | 候选 | 建议定位 | |---|---|---| | 2023 | Toolformer | 自监督筛选工具调用位置与参数 | | 2023 | Gorilla / APIBench | API 调用与检索感知的工具模型 | | 2023 | ToolLLM / ToolBench | 16K+ REST API 的数据生成、检索与搜索 | | 2024 | τ-bench | 工具—用户—策略三方的多轮任务 | | 2025 | BFCL | 从 AST/function-call 正确性扩展到多轮 agentic 评测 | ### 多 Agent 与编排 | 年份 | 候选 | 建议定位 | |---|---|---| | 2023 | CAMEL | role-playing 通信协议 | | 2023 | MetaGPT | SOP、角色与文档驱动的软件工作流 | | 2023 | AutoGen | 可对话 Agent 的组合式编程框架 | | 2023 | HuggingGPT | 单控制器调度模型工具库;与真正对等多 Agent 区分 | ### Web、桌面与软件工程 | 年份 | 候选 | 建议定位 | |---|---|---| | 2023 | Mind2Web | 真实网站离线轨迹与跨站泛化 | | 2023/24 | WebArena | 可自托管真实网站与执行式验证 | | 2023/24 | AgentBench | 八类交互环境的综合评测 | | 2023/24 | SWE-bench | GitHub issue → 可测试补丁的任务集 | | 2024 | VisualWebArena | 视觉落地的真实网页任务 | | 2024 | OSWorld | 真实桌面 GUI、多模态观测与执行 | | 2024 | SWE-agent | Agent-Computer Interface;不要把 harness 提升算成模型提升 | | 2024 | Agentless | 简单定位—修复—验证流水线,提醒“复杂 Agent 不必然更好” | | 2024 | ToolSandbox | 有状态、多轮、on-policy 用户模拟与里程碑评测 | | 2024 | SWE-Gym | 可执行 SWE 训练环境与 verifier 数据 | ### Agent RL、可靠性与安全 | 年份 | 候选 | 建议定位 | |---|---|---| | 2024 | AgentDojo | 间接提示注入的可执行工具环境 | | 2024 | Agent Security Bench | 攻击与防御分类评测 | | 2025 | RAGEN | 多轮 Agent RL、echo trap 与 StarPO | | 2025 | τ²-bench | 用户和 Agent 都能改变环境的 dual-control 任务 | | 2025 | Agent Lightning | Agent 与训练解耦、MDP 抽象与分层 credit assignment | | 2025 | Long-context multi-turn SWE RL | 长上下文软件 Agent 的多轮强化学习 | | 2025 | MCPMark | MCP 工具使用的真实压力测试 | ### DeepSeek / Kimi 收束线 | 年份 | 候选 | 建议定位 | |---|---|---| | 2025 | DeepSeek-V3.2 | agentic task synthesis、code/search/general agent 与混合 RL | | 2025 | Kimi K2 | agentic data synthesis、verifiable reward 与工具使用 | | 2026 | Kimi K2.5 | visual agentic intelligence 与 Agent Swarm | | 2026 | DeepSeek-V4 | interleaved thinking、agent sandbox、search/code harness | | 2026 | Kimi K3 | 可组合 white-box harness、AET、cross-scaffold generalization 与 1M Agentic RL | ## 2. 候选池暴露出的五个易混层级 | 层级 | 典型对象 | 不能误写成 | |---|---|---| | Model | K2、K3、DeepSeek-V3.2 / V4 | 完整 Agent 产品 | | Harness | ReAct、SWE-agent、AutoGen | 基座模型能力 | | Tool contract | function schema、MCP、ACI | 环境任务成功 | | Environment | WebArena、OSWorld、AgentENV | 方法论文或榜单 | | Evaluator | tests、final state、pass^k、security cases | 模型自评或字符串相似度 | ## 3. 召回后必须二次核验的点 1. BFCL 使用 ICML 2025 PMLR 论文作为 canonical 来源,不能误用 `2407.21783`。 2. K3 的 coding / agent 数字必须同时记录模型、harness、工具、交互步数和上下文预算。 3. SWE-bench 是任务集,SWE-agent 是 ACI/harness;二者不能合成一个“模型分数”。 4. Reflexion 的 “verbal RL” 不更新模型权重。 5. `pass@k` 表示给多次机会能否至少成功一次;`pass^k` 表示连续多次是否都成功。 6. 环境、任务、policy、verifier 和运行预算必须分别建账。 7. 极新的 OSWorld 2.0 等候选先保留在扩展阅读,不能与旧版本结果直接横比。 ## 4. 本专题的筛选原则 - 主脉络只保留能回答某个“Agent 为什么会失败”的论文。 - 一个里程碑必须能落到可画的状态变化、接口契约或训练信号。 - 只靠排行榜数字、不说明 harness 与预算的工作不进入核心解释。 - DeepSeek 与 Kimi 报告进入正文,但官方数字明确标成“报告值”,不伪装成本站复测。 - 正文控制在约 45–55 个关键节点;其余进入论文图谱或扩展阅读。