feat: publish long-horizon agent chapter
This commit is contained in:
File diff suppressed because it is too large
Load Diff
@@ -342,6 +342,7 @@ const toc = [
|
||||
<p>
|
||||
Agent 方面,V3.2 的任务合成管线系统地产生复杂、交互式工具任务,让思考与 tool use 交织。
|
||||
这与 K3 的 white-box harness、知识图谱任务合成和可验证环境形成同期对照:前沿模型竞争正在从静态题库转向训练环境。
|
||||
<a href="/agents/#deepseek-v32">进入 Agent 专题查看 V3.2 的 search/code/general-agent 合成管线 →</a>
|
||||
</p>
|
||||
</section>
|
||||
|
||||
|
||||
+28
-1
@@ -14,6 +14,7 @@ const routes: Record<string, string> = {
|
||||
"long-context": "/long-context/",
|
||||
"post-training/alignment": "/post-training/alignment/",
|
||||
reasoning: "/reasoning/",
|
||||
agents: "/agents/",
|
||||
"training-systems": "/training-systems/",
|
||||
"systems/numerics": "/systems/numerics/",
|
||||
};
|
||||
@@ -91,6 +92,7 @@ const paths = [
|
||||
<a class="button" href="/long-context/">长上下文专题</a>
|
||||
<a class="button" href="/post-training/alignment/">后训练与偏好专题</a>
|
||||
<a class="button" href="/reasoning/">推理专题</a>
|
||||
<a class="button" href="/agents/">Agent 专题</a>
|
||||
<a class="button" href="/training-systems/">训练系统专题</a>
|
||||
<a class="button" href="/systems/numerics/">数值与优化专题</a>
|
||||
</div>
|
||||
@@ -102,7 +104,7 @@ const paths = [
|
||||
<div class="hero-stats">
|
||||
<div><b>16</b><span>核心专题</span></div>
|
||||
<div><b>151</b><span>K3 报告来源</span></div>
|
||||
<div><b>280</b><span>关键论文索引</span></div>
|
||||
<div><b>314</b><span>关键论文索引</span></div>
|
||||
<div><b>47p</b><span>K3 技术报告</span></div>
|
||||
</div>
|
||||
</aside>
|
||||
@@ -116,6 +118,22 @@ const paths = [
|
||||
|
||||
<section class="section compact release-section" id="new-chapters">
|
||||
<div class="release-grid">
|
||||
<a class="release-card agent-release" href="/agents/">
|
||||
<div>
|
||||
<p class="eyebrow"><span>NEW / CHAPTER 12</span> AGENTS · TOOL USE · ENVIRONMENTS</p>
|
||||
<h2>Agent 不是一个循环:格式正确、执行成功和任务完成是三道不同的门</h2>
|
||||
<p>
|
||||
用环境、工具、循环、规划、记忆、执行、验证、轨迹、归因、分布、系统、可靠性、评测与安全十四张账,
|
||||
从 TextWorld、ReAct 和 Toolformer 走到 DeepSeek-V4 DSec 与 Kimi K3 百万 Token Agentic RL。
|
||||
</p>
|
||||
</div>
|
||||
<dl>
|
||||
<div><dt>LINEAGE</dt><dd>2018 → 2026</dd></div>
|
||||
<div><dt>NODES</dt><dd>52 个一手节点</dd></div>
|
||||
<div><dt>LAB</dt><dd>循环 · 契约 · 可靠性 · 长程 RL</dd></div>
|
||||
</dl>
|
||||
<span class="release-arrow" aria-hidden="true">从生成文字进入可验证行动 →</span>
|
||||
</a>
|
||||
<a class="release-card alignment-release" href="/post-training/alignment/">
|
||||
<div>
|
||||
<p class="eyebrow"><span>NEW / CHAPTER 10</span> ALIGNMENT · PREFERENCE</p>
|
||||
@@ -509,6 +527,7 @@ const paths = [
|
||||
transition: transform 180ms ease, border-color 180ms ease;
|
||||
}
|
||||
|
||||
.agent-release,
|
||||
.alignment-release,
|
||||
.transformer-release,
|
||||
.foundation-release,
|
||||
@@ -521,6 +540,14 @@ const paths = [
|
||||
min-height: 510px;
|
||||
}
|
||||
|
||||
.agent-release {
|
||||
background:
|
||||
radial-gradient(circle at 82% 18%, rgba(56, 91, 128, 0.2), transparent 30%),
|
||||
radial-gradient(circle at 62% 74%, rgba(76, 118, 112, 0.16), transparent 28%),
|
||||
repeating-linear-gradient(90deg, transparent 0 58px, rgba(56, 91, 128, 0.04) 58px 59px),
|
||||
var(--paper-raised);
|
||||
}
|
||||
|
||||
.alignment-release {
|
||||
background:
|
||||
radial-gradient(circle at 82% 18%, rgba(134, 76, 76, 0.2), transparent 30%),
|
||||
|
||||
@@ -418,6 +418,7 @@ const toc = [
|
||||
<p>
|
||||
可靠 Agent 的学习单位不是“一条漂亮回答”,而是状态明确、动作可执行、反馈可验证的一整段轨迹。
|
||||
Harness 多样化、持久环境和独立 verifier,分别处理接口过拟合、短视行为和自我宣告成功。
|
||||
<a href="/agents/#k3-whitebox">进入 Agent 专题,完整拆解 white-box harness、AET 与 AgentENV →</a>
|
||||
</p>
|
||||
</div>
|
||||
</section>
|
||||
|
||||
@@ -17,6 +17,7 @@ const workstreams = [
|
||||
{ label: "DeepSeek 专题", value: 71, next: "补 R1 / DAPO 的逐图训练轨迹与复现对照" },
|
||||
{ label: "指令微调与人类偏好", value: 75, next: "加入真实偏好分歧样本、RM 长度偏置与 PPO/DPO 小模型复现" },
|
||||
{ label: "推理与测试时扩展", value: 76, next: "真实模型采样曲线、PRM 案例与逐篇图表精读" },
|
||||
{ label: "工具使用与长程 Agent", value: 74, next: "补真实环境 traces、cross-harness 对照、Agent RL 训练曲线与安全案例" },
|
||||
{ label: "稀疏计算与 MoE", value: 74, next: "补充真实集群 traces 与专家特化案例" },
|
||||
{ label: "长上下文专题", value: 72, next: "加入更多论文逐图笔记与真实模型配置对比" },
|
||||
{ label: "大规模训练系统", value: 71, next: "补真实集群 traces、故障案例与精确 topology 配置" },
|
||||
@@ -45,7 +46,7 @@ const workstreams = [
|
||||
<div><dt>OVERALL</dt><dd>专题平均 {average}%</dd></div>
|
||||
<div><dt>READABLE</dt><dd>{published} 个首版可读专题</dd></div>
|
||||
<div><dt>ACTIVE</dt><dd>{researching} 个研究/写作中</dd></div>
|
||||
<div><dt>UPDATED</dt><dd>2026-07-29 05:59 CST</dd></div>
|
||||
<div><dt>UPDATED</dt><dd>2026-07-29 06:56 CST</dd></div>
|
||||
<div><dt>MODE</dt><dd>持续迭代,不锁死版本</dd></div>
|
||||
</dl>
|
||||
</div>
|
||||
@@ -55,7 +56,7 @@ const workstreams = [
|
||||
<div class="section-heading">
|
||||
<div>
|
||||
<p class="eyebrow"><span>01</span> WORKSTREAMS</p>
|
||||
<h2>十六条工作流同时推进,但不混淆“有页面”和“已核验”</h2>
|
||||
<h2>十七条工作流同时推进,但不混淆“有页面”和“已核验”</h2>
|
||||
</div>
|
||||
<p class="section-lead">
|
||||
内容首版优先打通全局脉络;随后每轮迭代选择一个专题推进到论文/工程层,并做独立事实复核。
|
||||
@@ -92,8 +93,8 @@ const workstreams = [
|
||||
<article><span>✓</span><h3>K3 报告已结构化拆解</h3><p>47 页报告目录、151 条参考来源和架构/后训练/系统主线已经提取。</p></article>
|
||||
<article><span>✓</span><h3>16 专题知识图</h3><p>从语言模型基础到评测安全,包含先修依赖和三条贯穿案例。</p></article>
|
||||
<article><span>✓</span><h3>编辑式网站系统</h3><p>响应式导航、章节模板、侧栏、进度、论文链和证据提示组件。</p></article>
|
||||
<article><span>✓</span><h3>三十五个原创交互视图</h3><p>K3、语言模型前史、Transformer、DeepSeek、长上下文、MoE、推理,以及训练系统、Scaling、数据工程、数值和 Alignment 专题。</p></article>
|
||||
<article><span>✓</span><h3>十二篇首版长文</h3><p>K3、语言模型前史、Transformer、DeepSeek、Scaling、数据工程、长上下文、MoE、后训练、推理、训练系统与数值优化专题。</p></article>
|
||||
<article><span>✓</span><h3>三十九个原创交互视图</h3><p>K3、语言模型前史、Transformer、DeepSeek、长上下文、MoE、推理、Agent,以及训练系统、Scaling、数据工程、数值和 Alignment 专题。</p></article>
|
||||
<article><span>✓</span><h3>十三篇首版长文</h3><p>K3、语言模型前史、Transformer、DeepSeek、Scaling、数据工程、长上下文、MoE、后训练、推理、Agent、训练系统与数值优化专题。</p></article>
|
||||
<article><span>✓</span><h3>语言模型前史深度专题</h3><p>八张独立问题账、33 个正式节点、20 段长文与概率—向量—记忆—对齐四联实验。</p></article>
|
||||
<article><span>✓</span><h3>Transformer 深度专题</h3><p>十张独立问题账、40 个正式节点、21 段正文与 QKV—Mask—多头位置—Block 成本四联实验。</p></article>
|
||||
<article><span>✓</span><h3>Scaling Laws 深度专题</h3><p>九张账、29 个一手节点、DeepSeek/Kimi 双谱系与曲面—部署—复用—涌现四联实验。</p></article>
|
||||
@@ -104,7 +105,8 @@ const workstreams = [
|
||||
<article><span>✓</span><h3>训练系统深度专题</h3><p>九张账、37 个一手节点、DeepSeek/Kimi 双谱系与显存—网格—气泡—通信实验室。</p></article>
|
||||
<article><span>✓</span><h3>数值、优化器与稳定性深度专题</h3><p>十张账、36 个一手节点、K2/K3 与 DeepSeek-V3/V4 双谱系,以及格式—状态—更新—失稳四联实验。</p></article>
|
||||
<article><span>✓</span><h3>指令微调与人类偏好深度专题</h3><p>十二张账、44 个一手节点、DeepSeek/Kimi 后训练双谱系,以及 SFT—RM—PPO/DPO—配方四联实验。</p></article>
|
||||
<article><span>✓</span><h3>280 篇关键论文索引</h3><p>新增人类偏好学习、HH-RLHF、LIMA、RewardBench、RLAIF、KTO、ORPO、SimPO 等 22 个后训练节点。</p></article>
|
||||
<article><span>✓</span><h3>工具使用与长程 Agent 深度专题</h3><p>十四张账、52 个一手节点、DeepSeek/Kimi Agent 双谱系,以及循环—工具契约—可靠性—长程 RL 四联实验。</p></article>
|
||||
<article><span>✓</span><h3>314 篇关键论文索引</h3><p>新增 TextWorld、WebArena、ToolSandbox、AgentDojo、RAGEN、Agent Lightning、AgentENV 等 34 个 Agent 节点。</p></article>
|
||||
<article><span>✓</span><h3>公开仓库与自托管发布</h3><p>源码公开到 git.k1412.top,网站由不可变镜像、Compose Manager 与 HTTPS 交付。</p></article>
|
||||
</div>
|
||||
</section>
|
||||
@@ -129,6 +131,7 @@ const workstreams = [
|
||||
<div><span>P1</span><strong>MoE 二轮深化</strong><p>真实负载 traces → 专家特化可解释性 → 共享专家语义</p><em>案例库 + 集群证据</em></div>
|
||||
<div><span>P1</span><strong>推理二轮深化</strong><p>真实 pass@k 曲线 → PRM 失败案例 → 逐篇图表精读</p><em>案例库 + 真实 traces</em></div>
|
||||
<div><span>P1</span><strong>Alignment 二轮深化</strong><p>真实偏好分歧 → RM 长度偏置 → PPO/DPO 小模型复现</p><em>数据案例 + 可复现实验</em></div>
|
||||
<div><span>P1</span><strong>Agent 二轮深化</strong><p>真实环境 traces → cross-harness ablation → Agent RL 曲线与提示注入案例</p><em>运行证据 + 安全案例库</em></div>
|
||||
<div><span>P2</span><strong>原生多模态</strong><p>ViT/CLIP → connector VLM → Kimi-VL/MoonViT-V2</p><em>视觉 Token 流程图</em></div>
|
||||
</div>
|
||||
</section>
|
||||
@@ -179,6 +182,8 @@ const workstreams = [
|
||||
<div><time>2026-07-29</time><b>NTP、MTP 与多模态永久分角色</b><p>K3 的统一视觉/文本 next-token objective、one MTP layer 与 EAGLE-3 draft bridge 分开记账;DeepSeek MTP 也不写成取代自回归。</p></div>
|
||||
<div><time>2026-07-29</time><b>Transformer 按十张账组织</b><p>信息路径、几何、可见性、多头、位置、局部计算、深度、目标、系统成本与当代映射不再混成一个 Block。</p></div>
|
||||
<div><time>2026-07-29</time><b>Attention 权重与因果解释永久分离</b><p>热力图可描述中间权重和提出假设;因果结论必须补消融、patching 或反事实干预。</p></div>
|
||||
<div><time>2026-07-29</time><b>Agent 按十四张账组织</b><p>模型、harness、工具契约、环境、评测器、可靠性与安全不再被压成一个 Agent 分数。</p></div>
|
||||
<div><time>2026-07-29</time><b>Agent 完成必须回到 final state</b><p>function schema、工具执行、业务状态、策略合规与 pass^k 分层评价;模型自报完成不作为证据。</p></div>
|
||||
</div>
|
||||
</section>
|
||||
|
||||
|
||||
Reference in New Issue
Block a user