--- import BaseLayout from "@/layouts/BaseLayout.astro"; import { chapters, statusLabel } from "@/data/chapters"; const totalPapers = chapters.reduce((sum, chapter) => sum + chapter.papers, 0); const averageProgress = Math.round(chapters.reduce((sum, chapter) => sum + chapter.progress, 0) / chapters.length); const stages = [ { label: "A · 起点", items: ["00", "01"] }, { label: "B · 核心架构", items: ["02", "03", "04", "05"] }, { label: "C · 规模化", items: ["06", "07", "08", "09"] }, { label: "D · 行为与能力", items: ["10", "11", "12", "13"] }, { label: "E · 落地与判断", items: ["14", "15"] }, ]; ---

CURRICULUM / 00 LEARNING GRAPH

先知道自己在哪里,
再决定往哪里深入

16 个专题不是一条必须顺序走完的直线。它们组成有依赖的图: Transformer 是共同地基,MoE/长上下文/训练系统相互牵引,后训练再通向推理与 Agent。

MODULES
16 个专题
PAPER SLOTS
{totalPapers} 篇核心论文位
PATHS
4 条推荐路径
PROGRESS
首版平均 {averageProgress}%
DEPTH
L0 直觉 → L3 工程

01 DEPENDENCY GRAPH

从左到右,是知识依赖,不是历史年份

一篇论文可能跨多个专题。例如 DeepSeek-V3 同时属于 MoE、训练系统、低精度和后训练; K3 则是几乎全部主线的汇流点。

普通节点:专题章节
关键枢纽:被多条路径依赖
→建议先修方向

02 FOUR ROUTES

四条路径,四种不同的“读懂”

路线可以交叉。每条路线的终点不是记住术语,而是具备一项可验证的阅读或设计能力。

ROUTE A · BEGINNER

从零建立架构直觉

01 → 02 → 03 → 04 → 10

  1. 解释 next-token objective
  2. 手算一次 self-attention
  3. 画出 decoder block
  4. 区分 pretrain 与 post-train
ROUTE B · K3 REVERSE

从 47 页 K3 报告反向拆组件

K3 架构 → 07/06/03 → 05/04 → 11/12 → 08/14/15

  1. 沿 32 张问题账解释三维信息流
  2. 用 8 个实验比较 KDA、MLA、AttnRes 与 LatentMoE
  3. 分清 2.78T / 104.2B、2.5× 与 1M 的证据口径
  4. 读懂九专家 MOPD、AgentENV、混合缓存与评测协议
ROUTE C · DEEPSEEK

沿论文看算法—系统协同

04 → 06 → 07 → 09 → 11 → 12

  1. 推导 MLA 缓存压缩
  2. 理解 FP8 scaling
  3. 区分 PPO 与 GRPO
  4. 对照 V4 与 K3 长上下文
ROUTE D · SYSTEMS

跟一个 Token 穿过真实集群

02 → 04 → 08 → 09 → 14 → 15

  1. 做显存与 FLOPs 账本
  2. 选择并行切分
  3. 理解 KV Cache 与调度
  4. 设计评测 harness

03 ALL MODULES

每个专题都有问题、先修、论文和完成标准

“研究中”表示资料已建立但正文未完成;“首版可读”表示已有连贯解释,不代表内容已经停止迭代。

{chapters.map((chapter) => (
{chapter.number} {chapter.kicker}

{chapter.title}

{statusLabel[chapter.status]}

{chapter.question}

{chapter.summary}

{chapter.highlights.map((item) => {item})}
))}

04 DEFINITION OF DONE

什么时候一个专题才算真正完成

完成不是“字数够长”。每个专题必须通过结构、事实、来源、教学、对照和可访问性六道闸门。

01

问题链

旧方法为何失败、新方法改变什么、怎样通向下一篇论文。

02

一手证据

8–20 篇核心论文,数字与结论链接到原始来源。

03

视觉推导

至少两张可缩放图和一个交互实验或逐步动画。

04

贯穿对照

明确回答这项技术在 K3 与 DeepSeek 中怎样出现。