Files
llm-atlas/ROADMAP.md
T
2026-07-29 08:39:32 +08:00

8.8 KiB
Raw Blame History

LLM Atlas 总体研究地图

最后更新:2026-07-29

组织原则

全站采用“问题链”而不是“名词表”:

现象与直觉 → 最小数学模型 → 旧方案瓶颈 → 关键论文 → 架构图/实验 → 与后继工作的桥 → K3/DeepSeek 中的落点 → 局限与开放问题

难度分为四层:

  • L0 直觉:不要求线性代数,先建立可视化心智模型。
  • L1 机制:理解张量形状、训练目标与计算流程。
  • L2 论文:能读关键公式、消融实验和训练配置。
  • L3 工程:理解并行、通信、显存、精度与服务系统。

16 个专题

00. 导航:先看懂一张大模型地图

学习依赖、术语、读论文方法、证据等级、K3 的全局坐标。

01. 语言模型从哪里来

Shannon → N-gram → GoodTuring / Katz / KneserNey → 神经概率语言模型 → 分布式词表示 → RNN/LSTM → Seq2Seq → Attention 前夜。 用“预测单位、概率信息、上下文、稀疏性、分布式表示、循环记忆、序列转导、评测与成本”八张账, 解释 next-token 目标为什么能持续到 Kimi K3 与 DeepSeek,也明确它没有自动保证事实性、忠实推理与行为对齐。

首版已发布:20 段长文、33 个正式节点、19 组原创机制图,以及概率显微镜、Embedding 几何、 循环记忆衰减、Seq2Seq 瓶颈/Attention 桥四个独立实验。正文显式分开 K3 的统一视觉/文本 NTP、 one MTP layer 与 EAGLE-3 draft bridge,并与 DeepSeek-V3/V4 的顺序 MTP 对照。

02. 注意力与 Transformer

Bahdanau Attention → Self-Attention → 原始 encoderdecoder Transformer → BERT/GPT/T5 家族 → KV/IO 效率 → DeepSeek MLA/CSA-HCA 与 Kimi KDA/AttnRes。逐项拆解 Q/K/V、缩放、Mask、 多头、位置、Residual/Norm、FFN/MoE、训练目标与推理状态。

首版已发布:十张独立问题账、40 个正式一手节点、21 段正文,以及 QKV 手算、Mask 矩阵、 多头/位置、Block/KV 成本四个独立实验。正文明确区分 2017 原作与 decoder-only LLM 也把 Attention 权重观察与因果解释永久分开。

03. 表示层、位置与残差高速公路

BPE/SentencePiece、绝对/相对位置、RoPE/ALiBi、LayerNorm/RMSNorm、Pre-LN、SwiGLU,以及从 ResNet 到 K3 Attention Residuals 的深度信息流。

04. Scaling Laws:规模为什么有效

GPT 系列 → Kaplan scaling laws → Chinchilla compute-optimal → 数据质量与重复 → 推理时计算。区分参数、激活参数、训练 FLOPs 与能力。

05. 数据工程与预训练配方

采集、清洗、去重、质量分类、数据混合、课程学习、合成数据、污染控制;对公开报告中“没有说”的部分也明确标记。

06. 稀疏计算与 MoE

Conditional Computation → Sparsely-Gated MoE → GShard/Switch → DeepSeekMoE → LatentMoE → K3 Stable LatentMoE。重点解释路由、专家特化、负载均衡与通信。

首版已发布:以“容量、激活计算、路由、负载、通信、稳定性”六张账串起 1991–2026 的 19 篇一手论文, 包含 DeepSeekMoE / Loss-Free / LatentMoE / K3 重点推导,以及 8 种架构、4 类平衡策略的交互实验室。

07. 长上下文与高效注意力

稀疏注意力、线性注意力、FlashAttention、MQA/GQA、MLA、状态空间模型、Delta Rule、Kimi Linear/KDA、混合注意力与 1M 上下文。

首版已发布:以“计算、缓存、位置、状态容量、系统”五张账单串起 2019–2026 的 26 篇一手论文, 包含 10+ 张原创机制图和 Full MHA / Flash / GQA / MLA / DSA / KDA / K3 / DeepSeek-V4 交互比较实验。

08. 大规模训练系统

数据/张量/流水线/序列/上下文/专家并行,ZeRO,Megatron,通信重叠,容错;对比 DeepSeek DualPipe/DeepEP 与 K3 MoonEP。

09. 数值精度、优化器与稳定性

Adam/AdamW、Adafactor、μP、MuonFP16/BF16/FP8/MXFP4、量化感知训练、缩放与误差。重点讲 DeepSeek-V3 FP8 与 K3 per-head Muon/MXFP4。

首版已发布:以“表示、缩放、计算、累加、搬运、更新、参数化、观测、恢复、证据经济”十张账串起 2014–2026 的 36 个一手节点;重点拆解 Kimi K2 MuonClip、K3 Per-Head Muon / SiTU-GLU / MXFP4 QAT 以及 DeepSeek-V3 fine-grained FP8 与 V4 hybrid Muon / spike mitigation / FP4 QAT,并提供格式显微镜、 混合精度状态账、优化器几何与失稳控制室四个独立互动实验。

10. 指令微调与人类偏好

Instruction Tuning、SFT、RLHF/PPO、RLAIF、Constitutional AI、DPO 及其后续。解释 base model 如何变成可协作助手。

首版已发布:以目标、监督单位、数据来源、SFT、偏好测量、奖励模型、策略更新、直接偏好、 分布、约束、失效与证据十二张账,串起 2017–2026 的 44 个一手节点。正文明确区分 SFT / RM / PPO / DPO / RLAIF / RLVR 的角色合同,重点追踪 DeepSeek LLM→V2→V3→R1→V3.2→V4 与 Kimi K2→K2.5→K3,并提供 SFT 显微镜、偏好/RM、PPO/DPO 更新和配方比较四个独立实验。

11. 推理模型与测试时扩展

CoT、自洽性、搜索、验证器、过程奖励、GRPO、DeepSeekMath、DeepSeek-R1/R1-Zero、Kimi k1.5、multi-effort RL 与 on-policy distillation。

12. 工具使用与长程 Agent

WebGPT、Toolformer、ReAct、Reflexion、代码 Agent、Computer Use、环境奖励、可验证任务、沙箱、百万 Token 轨迹与 K3 Agentic RL。

首版已完成:以环境、接口、循环、规划、记忆、执行、验证、轨迹、归因、策略分布、系统、 可靠性、评测与安全十四张账,串起 2018–2026 的 52 个一手节点。正文把 model、harness、 tool contract、environment 与 evaluator 拆成五层,覆盖 Web / SWE / 桌面 Agent、pass@k / pass^k、提示注入与长程 RL;重点追踪 DeepSeek-V3.2/V4 的 Agent 数据与 DSec,以及 Kimi K2→K2.5→K3 的 white-box harness、AET、AgentENV 和百万 Token Agentic RL,并提供 控制循环、工具契约、可靠性与长程 RL 四个独立实验。

13. 原生多模态

ViT/CLIP → Flamingo/BLIP-2/LLaVA → 原生多模态与视频;Kimi-VL、MoonViT-V2 和“视觉进入同一主干”的意义。

首版已完成:以语义空间、连接器、视觉 Token、OCR / 文档、视频、融合、理解 / 生成、SFT、RL、 Agent、幻觉、安全、评测、系统、MoE 与产品谱系十六张账,串起 2012–2026 的 55 个一手节点。 正文把像素、视觉塔、压缩 / projector、主干与输出 / 工具拆成五层;重点讲解 DeepSeek-VL/VL2、 Janus、DeepSeek-OCR 三条不同分支,以及 Kimi-VL → K2.5 → K3 从 SigLIP 初始化和独立对齐, 走到 MoonViT-V2 从头共同 next-token prediction 的训练制度变化。配套视觉 Token、connector / native、光学上下文压缩与 vision-in-the-loop 四个独立实验,所有作者报告、教学插值和证据外区域 明确分级。

14. 推理服务与低成本部署

KV Cache、PagedAttention/vLLM、连续批处理、推测解码、Prefill/Decode 解耦、前缀缓存、集群调度;Mooncake 与 K3 KDA-aware serving。

首版已完成:以请求形状、SLO、权重、增长状态、分配、Prefill、Decode、Batch、缓存、Kernel、 推测、量化、并行、MoE、网络、路由、故障与经济性十八本账,串起 2019–2026 的 62 个一手节点。 正文明确区分吞吐与 SLO goodput、标准 KV 公式与 MLA/KDA 状态、PagedAttention 的内存收益与 Transformer FLOPs、作者报告值与教学估算;重点追踪 DeepSeek-V2 MLA → V3 FP8 / MoE 部署 → V3.2 → V4 异构状态,以及 Mooncake → Kimi Linear → K3 的 69 KDA + 24 Gated MLA、page cache、 EAGLE-3 draft、cache-aware affinity 与 token-budget admission。配套显存与 KV、Prefill/Decode、 推测解码、缓存与集群四个独立实验。

15. 评测、安全与“到底强不强”

困惑度到 MMLU/GPQA/HLESWE-bench、OSWorld、BrowseComp;污染、harness、工具预算、LLM-as-a-judge、选择性报告与网络安全边界。

三条贯穿式案例

  1. Kimi K3 解剖:把上述全部专题重新汇总到一张架构与训练系统图。
  2. DeepSeek 技术谱系DeepSeek LLM → DeepSeekMoE → V2/MLA → V3/FP8/MTP/DualPipe → Math/GRPO → R1 → V3.2/DSA → V4 长上下文。
  3. “一个 Token 的旅行”:从文本分词,经注意力、MoE、GPU 集群、后训练,再到线上推理与工具调用。

完成标准

每个专题至少包含:

  • 1 条清晰问题链;
  • 820 篇一手论文;
  • 2 个以上可缩放架构图;
  • 1 个交互演示或逐步动画;
  • 1 个“常见误解”区;
  • 1 个 K3 与 DeepSeek 对照落点;
  • 所有外部事实的可点击来源、研究截止日期与证据等级;
  • 独立技术复核与链接检查。