feat: publish long-horizon agent chapter

This commit is contained in:
wuyang
2026-07-29 06:54:31 +08:00
parent 6c8c0fb90f
commit 25982cbbb4
25 changed files with 5122 additions and 39 deletions
+7
View File
@@ -97,6 +97,13 @@ CoT、自洽性、搜索、验证器、过程奖励、GRPO、DeepSeekMath、Deep
WebGPT、Toolformer、ReAct、Reflexion、代码 Agent、Computer Use、环境奖励、可验证任务、沙箱、百万 Token 轨迹与 K3 Agentic RL。
首版已完成:以环境、接口、循环、规划、记忆、执行、验证、轨迹、归因、策略分布、系统、
可靠性、评测与安全十四张账,串起 2018–2026 的 52 个一手节点。正文把 model、harness、
tool contract、environment 与 evaluator 拆成五层,覆盖 Web / SWE / 桌面 Agent、pass@k /
pass^k、提示注入与长程 RL;重点追踪 DeepSeek-V3.2/V4 的 Agent 数据与 DSec,以及
Kimi K2→K2.5→K3 的 white-box harness、AET、AgentENV 和百万 Token Agentic RL,并提供
控制循环、工具契约、可靠性与长程 RL 四个独立实验。
### 13. 原生多模态
ViT/CLIP → Flamingo/BLIP-2/LLaVA → 原生多模态与视频;Kimi-VL、MoonViT-V2 和“视觉进入同一主干”的意义。