--- import BaseLayout from "@/layouts/BaseLayout.astro"; import ArchitectureExplorer from "@/components/ArchitectureExplorer.astro"; import DeepSeekLineage from "@/components/DeepSeekLineage.astro"; import { chapters, statusLabel } from "@/data/chapters"; const routes: Record = { roadmap: "/roadmap/", "foundations/language-models": "/foundations/language-models/", foundations: "/foundations/", scaling: "/scaling/", "pretraining/data": "/pretraining/data/", moe: "/moe/", "long-context": "/long-context/", reasoning: "/reasoning/", "training-systems": "/training-systems/", "systems/numerics": "/systems/numerics/", }; const paths = [ { id: "beginner", number: "01", label: "零基础", title: "从“下一个词”开始,不先背 Transformer 公式", text: "先建立 Token、概率、向量和训练目标的直觉,再通过可操作的注意力实验进入架构。", steps: ["01 语言模型从哪里来", "02 注意力与 Transformer", "03 表示、位置与残差", "04 Scaling Laws"], time: "8–12 小时", target: "能独立阅读主流 LLM 架构图", }, { id: "k3", number: "02", label: "K3 反向拆解", title: "先看全貌,再沿组件回到每条技术祖先", text: "适合已经用过大模型、想迅速读懂 K3 报告的人。每个组件都能跳回其历史专题。", steps: ["K3 三维信息流", "KDA 与 MLA", "Stable LatentMoE", "1M Agentic RL 与系统"], time: "6–10 小时", target: "能逐节解释 K3 技术报告", }, { id: "deepseek", number: "03", label: "DeepSeek 主线", title: "沿一家公司,看算法—系统协同如何一步步形成", text: "从 DeepSeek LLM 的 dense 基线,到 MoE、MLA、FP8、GRPO、R1、稀疏注意力与百万上下文。", steps: ["DeepSeekMoE", "V2 / MLA", "V3 / FP8 / DualPipe", "Math / GRPO / R1", "V3.2 / V4"], time: "7–11 小时", target: "理解 DeepSeek 论文间的因果关系", }, { id: "systems", number: "04", label: "系统工程", title: "跟着一个 Token 穿过 GPU、网络、缓存与服务集群", text: "适合工程背景读者,从计算与内存账本出发理解并行、低精度、通信和推理服务。", steps: ["08 大规模训练", "09 数值与优化", "14 推理服务", "K3 §5 Infrastructure"], time: "10–16 小时", target: "看懂大模型系统报告与性能数字", }, ]; ---

OPEN COURSE / 2026 LARGE LANGUAGE MODELS

大模型技术全景 从“预测下一个词”到 Kimi K3 的 2.8T 开放前沿

这是一套按问题脉络组织的中文开放课程。我们从最小直觉出发,追踪每篇关键论文究竟解决了什么, 再把注意力、MoE、规模化训练、多模态、推理强化学习与 Agent 系统重新汇入 Kimi K3。

研究范围

表示学习 · Transformer · Scaling · 数据工程 · MoE · 长上下文 · 训练系统 · 数值优化 · 后训练 · 推理 · Agent · 多模态 · 服务与评测

查看实时进度 →

NEW / CHAPTER 02 ATTENTION · TRANSFORMER

Attention 不只是“看哪里”,Transformer 也不只有一种 Block

用信息路径、匹配几何、可见性、多头、位置、局部计算、深度、架构目标、系统成本与当代映射十张账, 从 Bahdanau 软对齐和 2017 原始 encoder–decoder,一路走到 FlashAttention、DeepSeek MLA 与 Kimi K3。

LINEAGE
2014 → 2026
PAPERS
40 个一手节点
LAB
QKV · Mask · 多头位置 · Block 成本

NEW / CHAPTER 01 LANGUAGE MODELING ORIGINS

预测下一个 Token,为什么会走到今天的大模型?

用预测单位、概率信息、上下文、稀疏性、分布式表示、循环记忆、序列转导与系统成本八张账, 从 Shannon、N-gram、Kneser–Ney、Bengio、RNN/LSTM 一路走到 Seq2Seq、Attention 与 K3 / DeepSeek。

LINEAGE
1948 → 2026
PAPERS
33 个一手节点
LAB
概率 · 向量 · 记忆 · 对齐

NEW / CHAPTER 09 PRECISION · OPTIMIZATION · STABILITY

少几个比特为什么省巨资,也可能让训练瞬间崩掉?

用表示、缩放、计算、累加、搬运、更新、参数化、观测、恢复与证据十张账, 从 mixed precision、BF16、FP8 和 MXFP4,一路走到 AdamW、Muon、Kimi K2/K3 与 DeepSeek-V3/V4。

LINEAGE
2014 → 2026
PAPERS
36 个一手节点
LAB
格式 · 状态 · 更新 · 失稳

NEW / CHAPTER 05 DATA & PRE-TRAINING

同样一万亿 Token,可以是完全不同的训练经历

用来源、解析、质量、唯一性、污染、混合、变换、Tokenizer、Packing、课程与模型感知价值十二张账, 从 C4、Pile、DoReMi 和 DCLM 一路走到 DeepSeek 五代数据工程与 Kimi K2→K3 原生多模态。

LINEAGE
2019 → 2026
PAPERS
31 个一手节点
LAB
流水线 · 去重 · 混合 · 改写

NEW / CHAPTER 04 SCALING LAWS

“大一点就会更强”,远远不够指导一次训练

用观测量、模型、数据、算术、配比、配方、外推、经济目标与能力阶段九张账, 从早期经验幂律、Kaplan、Chinchilla 与复现争议,一路走到 DeepSeek scaling study 和 Kimi K3。

LINEAGE
2017 → 2026
PAPERS
29 个一手节点
LAB
曲面 · 部署 · 重复 · 涌现

NEW / CHAPTER 08 LARGE-SCALE TRAINING SYSTEMS

一万张 GPU,为什么仍可能有一半在等?

用模型状态、激活、计算划分、气泡、collective、专家、上下文、数值与可靠性九张账, 从 ZeRO、Megatron 一路走到 DeepSeek DualPipe、Kimi MoonEP 与百万 Token Agentic RL。

LINEAGE
2012 → 2026
PAPERS
37 个一手节点
LAB
显存 · 网格 · 气泡 · 通信

NEW / CHAPTER 11 REASONING & TEST-TIME SCALING

“多想一会儿”,到底把计算花到了哪里?

把推理拆成结果、覆盖、选择、过程、预算、优化、分布与系统八张账, 从 CoT、verifier 与 GRPO 一路走到 DeepSeek-R1、Kimi k1.5 与 K3 MOPD。

LINEAGE
2021 → 2026
PAPERS
30 篇一手来源
LAB
预算 · GRPO · 九教师

NEW / CHAPTER 06 SPARSE EXPERTS

2.8T 参数,不等于每个 Token 跑 2.8T

把 MoE 拆成容量、激活计算、路由、负载、通信与稳定性六张账, 从 Switch、DeepSeekMoE、Loss-Free、LatentMoE 一路走到 K3 Stable LatentMoE。

LINEAGE
1991 → 2026
PAPERS
19 篇一手来源
LAB
8 架构 · 4 平衡策略

CHAPTER 07 LONG CONTEXT

一百万 Token,不是一扇更大的窗

把长上下文拆成计算、缓存、位置、状态容量与系统五张账, 沿 26 篇一手论文走完 FlashAttention、MLA、Delta Rule、KDA、Kimi K3 与 DeepSeek-V4。

LINEAGE
2019 → 2026
VISUALS
10+ 机制图
LAB
8 种策略 · 4 档长度

00 WHY THIS ATLAS

不是论文清单,而是一条能走通的理解路径

大模型知识最难的地方不是资料少,而是资料之间的桥断了:初学解释省略公式,论文省略历史, 系统报告又默认你已经理解模型。LLM Atlas 专门补这些桥。

课程主张

真正理解一项技术,需要同时回答:它解决什么瓶颈、核心机制如何工作、证据是否支持、 工程代价是什么,以及下一篇论文为什么自然会出现。

01 / PROBLEM

从问题开始

先看到旧方法撞上的墙,再引入新名词。KDA、MLA、MoE 都不再是凭空掉下来的缩写。

02 / LAYERS

四层解释

同一概念同时提供直觉、机制、论文和工程四层入口,允许读者在适合自己的深度停留。

03 / VISUAL

图必须能帮助推理

优先重绘可缩放、可交互的架构图;每种颜色固定含义,简化之处明确标出。

04 / EVIDENCE

事实、解释、推断分开

关键结论回到论文和官方实现。榜单写明 harness、工具预算与截止日期,未知就明确说未知。

01 LEARNING PATHS

你不必从第一页顺序读到最后

四条路径共享同一张知识图。点击路径切换,章节之间的先修关系始终可追踪。

{paths.map((path, index) => ( ))}
{paths.map((path, index) => (
{path.label}

{path.title}

{path.text}

    {path.steps.map((step) =>
  1. {step}
  2. )}
))}

02 CURRICULUM MAP

16 个专题,拼成一张完整技术地图

进度条表示内容成熟度,不代表相关领域的重要性。首版先打通全站骨架,再逐章扩写到论文与工程层。

{chapters.map((chapter) => { const href = routes[chapter.slug] ?? `/roadmap/#chapter-${chapter.number}`; return (
{chapter.number} {statusLabel[chapter.status]}

{chapter.title}

{chapter.question}

{chapter.papers} 篇核心论文 {chapter.progress}%
); })}

03 KIMI K3 AS THE CONFLUENCE

K3 把三种信息流和一套庞大系统放进同一模型

K3 报告最好的阅读钥匙,是把架构看成 token、depth、channel 三个方向的信息流; 视觉输入与训练/服务基础设施则包住这三条轴。

进入完整 K3 技术报告导读 →

04 DEEPSEEK SPOTLIGHT

DeepSeek:一条极适合学习“算法—系统协同”的论文主线

从细粒度 MoE、MLA 和 FP8,到 GRPO 与 R1,DeepSeek 的每篇报告都在解决上一代留下的明确约束。 这里会给予它比普通模型谱系更细的篇幅。

阅读 DeepSeek 专题 →

05 OPEN RESEARCH

课程本身也是一项开放研究工程

网站源码、路线、进度和研究规范全部公开。Grok 用来扩展检索线索,最终结论由一手论文和官方实现核验。

P0

一手论文

arXiv、会议、期刊与作者正式技术报告,承载核心机制和实验数字。

P1

官方实现

仓库、模型卡、训练与评测代码,用于确认论文描述如何落到真实系统。

P2

官方说明

实验室博客、系统卡和产品文档;尚无论文的新模型会临时使用并标明状态。

P3+

独立复现

第三方结果用于检验外部有效性;二手文章只发现线索,不承载关键事实。