feat: publish long-horizon agent chapter
This commit is contained in:
@@ -97,6 +97,13 @@ CoT、自洽性、搜索、验证器、过程奖励、GRPO、DeepSeekMath、Deep
|
||||
|
||||
WebGPT、Toolformer、ReAct、Reflexion、代码 Agent、Computer Use、环境奖励、可验证任务、沙箱、百万 Token 轨迹与 K3 Agentic RL。
|
||||
|
||||
首版已完成:以环境、接口、循环、规划、记忆、执行、验证、轨迹、归因、策略分布、系统、
|
||||
可靠性、评测与安全十四张账,串起 2018–2026 的 52 个一手节点。正文把 model、harness、
|
||||
tool contract、environment 与 evaluator 拆成五层,覆盖 Web / SWE / 桌面 Agent、pass@k /
|
||||
pass^k、提示注入与长程 RL;重点追踪 DeepSeek-V3.2/V4 的 Agent 数据与 DSec,以及
|
||||
Kimi K2→K2.5→K3 的 white-box harness、AET、AgentENV 和百万 Token Agentic RL,并提供
|
||||
控制循环、工具契约、可靠性与长程 RL 四个独立实验。
|
||||
|
||||
### 13. 原生多模态
|
||||
|
||||
ViT/CLIP → Flamingo/BLIP-2/LLaVA → 原生多模态与视频;Kimi-VL、MoonViT-V2 和“视觉进入同一主干”的意义。
|
||||
|
||||
Reference in New Issue
Block a user