Agent 专题 · Grok 候选召回
生成方式:Grok CLI headless(--no-subagents)
日期:2026-07-29
角色:只做宽召回与边界提醒,不作为正式事实来源。进入课程的结论必须回到论文、正式技术报告或官方项目文档核验。
1. Grok 给出的候选池
环境与交互前史
| 年份 |
候选 |
建议定位 |
| 2018 |
TextWorld |
用文本游戏把“语言模型输出”变成可执行动作 |
| 2019 |
Jericho |
交互式小说环境与世界状态 |
| 2021 |
ALFWorld |
文本世界与具身环境对齐 |
| 2022 |
ScienceWorld |
科学实验式交互环境 |
| 2022 |
WebShop |
可扩展、可验证的网页购物环境 |
| 2022 |
WebGPT |
浏览、引用、人类反馈与答案生成闭环 |
| 2022 |
SayCan |
语言可行性 × 机器人 affordance |
| 2022 |
MRKL |
LLM 路由外部模块的系统架构 |
| 2022 |
PAL |
把程序执行当作外部计算器 |
| 2022 |
Code as Policies |
用代码表达可组合机器人策略 |
Agent 循环、规划、反思与记忆
| 年份 |
候选 |
建议定位 |
| 2022/23 |
ReAct |
reasoning → acting → observation 的经典循环 |
| 2023 |
Tree of Thoughts |
搜索式思考;不是默认依赖外部环境的 Agent |
| 2023 |
Self-Refine |
单次输出的反馈—改写循环 |
| 2023 |
Reflexion |
语言反思写入 episodic memory;不是参数更新 RL |
| 2023 |
ReWOO |
规划与观测解耦,减少重复调用 |
| 2023 |
LATS |
把推理、行动、规划放进树搜索 |
| 2023 |
Generative Agents |
记忆、反思、计划驱动的社会模拟 |
| 2023 |
MemGPT |
分层记忆与虚拟上下文管理 |
| 2023 |
Voyager |
自动课程、技能库与具身长期学习 |
工具学习与接口
| 年份 |
候选 |
建议定位 |
| 2023 |
Toolformer |
自监督筛选工具调用位置与参数 |
| 2023 |
Gorilla / APIBench |
API 调用与检索感知的工具模型 |
| 2023 |
ToolLLM / ToolBench |
16K+ REST API 的数据生成、检索与搜索 |
| 2024 |
τ-bench |
工具—用户—策略三方的多轮任务 |
| 2025 |
BFCL |
从 AST/function-call 正确性扩展到多轮 agentic 评测 |
多 Agent 与编排
| 年份 |
候选 |
建议定位 |
| 2023 |
CAMEL |
role-playing 通信协议 |
| 2023 |
MetaGPT |
SOP、角色与文档驱动的软件工作流 |
| 2023 |
AutoGen |
可对话 Agent 的组合式编程框架 |
| 2023 |
HuggingGPT |
单控制器调度模型工具库;与真正对等多 Agent 区分 |
Web、桌面与软件工程
| 年份 |
候选 |
建议定位 |
| 2023 |
Mind2Web |
真实网站离线轨迹与跨站泛化 |
| 2023/24 |
WebArena |
可自托管真实网站与执行式验证 |
| 2023/24 |
AgentBench |
八类交互环境的综合评测 |
| 2023/24 |
SWE-bench |
GitHub issue → 可测试补丁的任务集 |
| 2024 |
VisualWebArena |
视觉落地的真实网页任务 |
| 2024 |
OSWorld |
真实桌面 GUI、多模态观测与执行 |
| 2024 |
SWE-agent |
Agent-Computer Interface;不要把 harness 提升算成模型提升 |
| 2024 |
Agentless |
简单定位—修复—验证流水线,提醒“复杂 Agent 不必然更好” |
| 2024 |
ToolSandbox |
有状态、多轮、on-policy 用户模拟与里程碑评测 |
| 2024 |
SWE-Gym |
可执行 SWE 训练环境与 verifier 数据 |
Agent RL、可靠性与安全
| 年份 |
候选 |
建议定位 |
| 2024 |
AgentDojo |
间接提示注入的可执行工具环境 |
| 2024 |
Agent Security Bench |
攻击与防御分类评测 |
| 2025 |
RAGEN |
多轮 Agent RL、echo trap 与 StarPO |
| 2025 |
τ²-bench |
用户和 Agent 都能改变环境的 dual-control 任务 |
| 2025 |
Agent Lightning |
Agent 与训练解耦、MDP 抽象与分层 credit assignment |
| 2025 |
Long-context multi-turn SWE RL |
长上下文软件 Agent 的多轮强化学习 |
| 2025 |
MCPMark |
MCP 工具使用的真实压力测试 |
DeepSeek / Kimi 收束线
| 年份 |
候选 |
建议定位 |
| 2025 |
DeepSeek-V3.2 |
agentic task synthesis、code/search/general agent 与混合 RL |
| 2025 |
Kimi K2 |
agentic data synthesis、verifiable reward 与工具使用 |
| 2026 |
Kimi K2.5 |
visual agentic intelligence 与 Agent Swarm |
| 2026 |
DeepSeek-V4 |
interleaved thinking、agent sandbox、search/code harness |
| 2026 |
Kimi K3 |
可组合 white-box harness、AET、cross-scaffold generalization 与 1M Agentic RL |
2. 候选池暴露出的五个易混层级
| 层级 |
典型对象 |
不能误写成 |
| Model |
K2、K3、DeepSeek-V3.2 / V4 |
完整 Agent 产品 |
| Harness |
ReAct、SWE-agent、AutoGen |
基座模型能力 |
| Tool contract |
function schema、MCP、ACI |
环境任务成功 |
| Environment |
WebArena、OSWorld、AgentENV |
方法论文或榜单 |
| Evaluator |
tests、final state、pass^k、security cases |
模型自评或字符串相似度 |
3. 召回后必须二次核验的点
- BFCL 使用 ICML 2025 PMLR 论文作为 canonical 来源,不能误用
2407.21783。
- K3 的 coding / agent 数字必须同时记录模型、harness、工具、交互步数和上下文预算。
- SWE-bench 是任务集,SWE-agent 是 ACI/harness;二者不能合成一个“模型分数”。
- Reflexion 的 “verbal RL” 不更新模型权重。
pass@k 表示给多次机会能否至少成功一次;pass^k 表示连续多次是否都成功。
- 环境、任务、policy、verifier 和运行预算必须分别建账。
- 极新的 OSWorld 2.0 等候选先保留在扩展阅读,不能与旧版本结果直接横比。
4. 本专题的筛选原则
- 主脉络只保留能回答某个“Agent 为什么会失败”的论文。
- 一个里程碑必须能落到可画的状态变化、接口契约或训练信号。
- 只靠排行榜数字、不说明 harness 与预算的工作不进入核心解释。
- DeepSeek 与 Kimi 报告进入正文,但官方数字明确标成“报告值”,不伪装成本站复测。
- 正文控制在约 45–55 个关键节点;其余进入论文图谱或扩展阅读。