feat: publish long-horizon agent chapter

This commit is contained in:
wuyang
2026-07-29 06:54:31 +08:00
parent 6c8c0fb90f
commit 25982cbbb4
25 changed files with 5122 additions and 39 deletions
+120
View File
@@ -0,0 +1,120 @@
# Agent 专题 · Grok 候选召回
> 生成方式:Grok CLI headless`--no-subagents`
> 日期:2026-07-29
> 角色:只做宽召回与边界提醒,不作为正式事实来源。进入课程的结论必须回到论文、正式技术报告或官方项目文档核验。
## 1. Grok 给出的候选池
### 环境与交互前史
| 年份 | 候选 | 建议定位 |
|---|---|---|
| 2018 | TextWorld | 用文本游戏把“语言模型输出”变成可执行动作 |
| 2019 | Jericho | 交互式小说环境与世界状态 |
| 2021 | ALFWorld | 文本世界与具身环境对齐 |
| 2022 | ScienceWorld | 科学实验式交互环境 |
| 2022 | WebShop | 可扩展、可验证的网页购物环境 |
| 2022 | WebGPT | 浏览、引用、人类反馈与答案生成闭环 |
| 2022 | SayCan | 语言可行性 × 机器人 affordance |
| 2022 | MRKL | LLM 路由外部模块的系统架构 |
| 2022 | PAL | 把程序执行当作外部计算器 |
| 2022 | Code as Policies | 用代码表达可组合机器人策略 |
### Agent 循环、规划、反思与记忆
| 年份 | 候选 | 建议定位 |
|---|---|---|
| 2022/23 | ReAct | reasoning → acting → observation 的经典循环 |
| 2023 | Tree of Thoughts | 搜索式思考;不是默认依赖外部环境的 Agent |
| 2023 | Self-Refine | 单次输出的反馈—改写循环 |
| 2023 | Reflexion | 语言反思写入 episodic memory;不是参数更新 RL |
| 2023 | ReWOO | 规划与观测解耦,减少重复调用 |
| 2023 | LATS | 把推理、行动、规划放进树搜索 |
| 2023 | Generative Agents | 记忆、反思、计划驱动的社会模拟 |
| 2023 | MemGPT | 分层记忆与虚拟上下文管理 |
| 2023 | Voyager | 自动课程、技能库与具身长期学习 |
### 工具学习与接口
| 年份 | 候选 | 建议定位 |
|---|---|---|
| 2023 | Toolformer | 自监督筛选工具调用位置与参数 |
| 2023 | Gorilla / APIBench | API 调用与检索感知的工具模型 |
| 2023 | ToolLLM / ToolBench | 16K+ REST API 的数据生成、检索与搜索 |
| 2024 | τ-bench | 工具—用户—策略三方的多轮任务 |
| 2025 | BFCL | 从 AST/function-call 正确性扩展到多轮 agentic 评测 |
### 多 Agent 与编排
| 年份 | 候选 | 建议定位 |
|---|---|---|
| 2023 | CAMEL | role-playing 通信协议 |
| 2023 | MetaGPT | SOP、角色与文档驱动的软件工作流 |
| 2023 | AutoGen | 可对话 Agent 的组合式编程框架 |
| 2023 | HuggingGPT | 单控制器调度模型工具库;与真正对等多 Agent 区分 |
### Web、桌面与软件工程
| 年份 | 候选 | 建议定位 |
|---|---|---|
| 2023 | Mind2Web | 真实网站离线轨迹与跨站泛化 |
| 2023/24 | WebArena | 可自托管真实网站与执行式验证 |
| 2023/24 | AgentBench | 八类交互环境的综合评测 |
| 2023/24 | SWE-bench | GitHub issue → 可测试补丁的任务集 |
| 2024 | VisualWebArena | 视觉落地的真实网页任务 |
| 2024 | OSWorld | 真实桌面 GUI、多模态观测与执行 |
| 2024 | SWE-agent | Agent-Computer Interface;不要把 harness 提升算成模型提升 |
| 2024 | Agentless | 简单定位—修复—验证流水线,提醒“复杂 Agent 不必然更好” |
| 2024 | ToolSandbox | 有状态、多轮、on-policy 用户模拟与里程碑评测 |
| 2024 | SWE-Gym | 可执行 SWE 训练环境与 verifier 数据 |
### Agent RL、可靠性与安全
| 年份 | 候选 | 建议定位 |
|---|---|---|
| 2024 | AgentDojo | 间接提示注入的可执行工具环境 |
| 2024 | Agent Security Bench | 攻击与防御分类评测 |
| 2025 | RAGEN | 多轮 Agent RL、echo trap 与 StarPO |
| 2025 | τ²-bench | 用户和 Agent 都能改变环境的 dual-control 任务 |
| 2025 | Agent Lightning | Agent 与训练解耦、MDP 抽象与分层 credit assignment |
| 2025 | Long-context multi-turn SWE RL | 长上下文软件 Agent 的多轮强化学习 |
| 2025 | MCPMark | MCP 工具使用的真实压力测试 |
### DeepSeek / Kimi 收束线
| 年份 | 候选 | 建议定位 |
|---|---|---|
| 2025 | DeepSeek-V3.2 | agentic task synthesis、code/search/general agent 与混合 RL |
| 2025 | Kimi K2 | agentic data synthesis、verifiable reward 与工具使用 |
| 2026 | Kimi K2.5 | visual agentic intelligence 与 Agent Swarm |
| 2026 | DeepSeek-V4 | interleaved thinking、agent sandbox、search/code harness |
| 2026 | Kimi K3 | 可组合 white-box harness、AET、cross-scaffold generalization 与 1M Agentic RL |
## 2. 候选池暴露出的五个易混层级
| 层级 | 典型对象 | 不能误写成 |
|---|---|---|
| Model | K2、K3、DeepSeek-V3.2 / V4 | 完整 Agent 产品 |
| Harness | ReAct、SWE-agent、AutoGen | 基座模型能力 |
| Tool contract | function schema、MCP、ACI | 环境任务成功 |
| Environment | WebArena、OSWorld、AgentENV | 方法论文或榜单 |
| Evaluator | tests、final state、pass^k、security cases | 模型自评或字符串相似度 |
## 3. 召回后必须二次核验的点
1. BFCL 使用 ICML 2025 PMLR 论文作为 canonical 来源,不能误用 `2407.21783`
2. K3 的 coding / agent 数字必须同时记录模型、harness、工具、交互步数和上下文预算。
3. SWE-bench 是任务集,SWE-agent 是 ACI/harness;二者不能合成一个“模型分数”。
4. Reflexion 的 “verbal RL” 不更新模型权重。
5. `pass@k` 表示给多次机会能否至少成功一次;`pass^k` 表示连续多次是否都成功。
6. 环境、任务、policy、verifier 和运行预算必须分别建账。
7. 极新的 OSWorld 2.0 等候选先保留在扩展阅读,不能与旧版本结果直接横比。
## 4. 本专题的筛选原则
- 主脉络只保留能回答某个“Agent 为什么会失败”的论文。
- 一个里程碑必须能落到可画的状态变化、接口契约或训练信号。
- 只靠排行榜数字、不说明 harness 与预算的工作不进入核心解释。
- DeepSeek 与 Kimi 报告进入正文,但官方数字明确标成“报告值”,不伪装成本站复测。
- 正文控制在约 45–55 个关键节点;其余进入论文图谱或扩展阅读。
File diff suppressed because it is too large Load Diff
+12
View File
@@ -31,3 +31,15 @@ Alignment 首轮缓存位于 `alignment/`(不提交 PDF/TXT):
DeepSeek LLM/V2/V3/R1/V3.2/V4、Kimi K2/K2.5/K3 与 MOPD 复用既有本地缓存。
正式机制、公式、版本边界与 44 节点论文链见 `../ALIGNMENT_RESEARCH.md`Grok 候选线索单独保存在
`../ALIGNMENT_GROK_LEADS.md`,不能直接作为正文证据。
Agent 首轮缓存位于 `agents/`(不提交 PDF/TXT):
- TextWorld、Jericho、ALFWorld、ScienceWorld、WebShop 等可执行环境前史;
- WebGPT、SayCan、ReAct、Toolformer、Reflexion、ToolLLM、WebArena、SWE-agent 与 OSWorld
- τ-bench / τ²-bench、AgentDojo、ToolSandbox、BFCL、RAGEN、Agent Lightning 与 AgentENV
- DeepSeek-V3.2/V4、Kimi K2/K2.5/K3 等模型族报告中的 Agent 数据、harness、验证器与长轨迹系统。
首轮共核验 35 份新增 PDF,其中 BFCL 使用 ICML/PMLR 正式版本;DeepSeek、Kimi 与部分既有节点
复用其他专题缓存。十四张问题账、52 节点论文链、四个交互实验合同与证据边界见
`../AGENTS_RESEARCH.md`Grok Headless 只负责扩展召回,未核验候选永久隔离在
`../AGENTS_GROK_LEADS.md`