Files
2026-07-29 06:07:42 +08:00

6.8 KiB
Raw Permalink Blame History

LLM Atlas 总体研究地图

最后更新:2026-07-29

组织原则

全站采用“问题链”而不是“名词表”:

现象与直觉 → 最小数学模型 → 旧方案瓶颈 → 关键论文 → 架构图/实验 → 与后继工作的桥 → K3/DeepSeek 中的落点 → 局限与开放问题

难度分为四层:

  • L0 直觉:不要求线性代数,先建立可视化心智模型。
  • L1 机制:理解张量形状、训练目标与计算流程。
  • L2 论文:能读关键公式、消融实验和训练配置。
  • L3 工程:理解并行、通信、显存、精度与服务系统。

16 个专题

00. 导航:先看懂一张大模型地图

学习依赖、术语、读论文方法、证据等级、K3 的全局坐标。

01. 语言模型从哪里来

Shannon → N-gram → GoodTuring / Katz / KneserNey → 神经概率语言模型 → 分布式词表示 → RNN/LSTM → Seq2Seq → Attention 前夜。 用“预测单位、概率信息、上下文、稀疏性、分布式表示、循环记忆、序列转导、评测与成本”八张账, 解释 next-token 目标为什么能持续到 Kimi K3 与 DeepSeek,也明确它没有自动保证事实性、忠实推理与行为对齐。

首版已发布:20 段长文、33 个正式节点、19 组原创机制图,以及概率显微镜、Embedding 几何、 循环记忆衰减、Seq2Seq 瓶颈/Attention 桥四个独立实验。正文显式分开 K3 的统一视觉/文本 NTP、 one MTP layer 与 EAGLE-3 draft bridge,并与 DeepSeek-V3/V4 的顺序 MTP 对照。

02. 注意力与 Transformer

Bahdanau Attention → Self-Attention → 原始 encoderdecoder Transformer → BERT/GPT/T5 家族 → KV/IO 效率 → DeepSeek MLA/CSA-HCA 与 Kimi KDA/AttnRes。逐项拆解 Q/K/V、缩放、Mask、 多头、位置、Residual/Norm、FFN/MoE、训练目标与推理状态。

首版已发布:十张独立问题账、40 个正式一手节点、21 段正文,以及 QKV 手算、Mask 矩阵、 多头/位置、Block/KV 成本四个独立实验。正文明确区分 2017 原作与 decoder-only LLM 也把 Attention 权重观察与因果解释永久分开。

03. 表示层、位置与残差高速公路

BPE/SentencePiece、绝对/相对位置、RoPE/ALiBi、LayerNorm/RMSNorm、Pre-LN、SwiGLU,以及从 ResNet 到 K3 Attention Residuals 的深度信息流。

04. Scaling Laws:规模为什么有效

GPT 系列 → Kaplan scaling laws → Chinchilla compute-optimal → 数据质量与重复 → 推理时计算。区分参数、激活参数、训练 FLOPs 与能力。

05. 数据工程与预训练配方

采集、清洗、去重、质量分类、数据混合、课程学习、合成数据、污染控制;对公开报告中“没有说”的部分也明确标记。

06. 稀疏计算与 MoE

Conditional Computation → Sparsely-Gated MoE → GShard/Switch → DeepSeekMoE → LatentMoE → K3 Stable LatentMoE。重点解释路由、专家特化、负载均衡与通信。

首版已发布:以“容量、激活计算、路由、负载、通信、稳定性”六张账串起 1991–2026 的 19 篇一手论文, 包含 DeepSeekMoE / Loss-Free / LatentMoE / K3 重点推导,以及 8 种架构、4 类平衡策略的交互实验室。

07. 长上下文与高效注意力

稀疏注意力、线性注意力、FlashAttention、MQA/GQA、MLA、状态空间模型、Delta Rule、Kimi Linear/KDA、混合注意力与 1M 上下文。

首版已发布:以“计算、缓存、位置、状态容量、系统”五张账单串起 2019–2026 的 26 篇一手论文, 包含 10+ 张原创机制图和 Full MHA / Flash / GQA / MLA / DSA / KDA / K3 / DeepSeek-V4 交互比较实验。

08. 大规模训练系统

数据/张量/流水线/序列/上下文/专家并行,ZeRO,Megatron,通信重叠,容错;对比 DeepSeek DualPipe/DeepEP 与 K3 MoonEP。

09. 数值精度、优化器与稳定性

Adam/AdamW、Adafactor、μP、MuonFP16/BF16/FP8/MXFP4、量化感知训练、缩放与误差。重点讲 DeepSeek-V3 FP8 与 K3 per-head Muon/MXFP4。

首版已发布:以“表示、缩放、计算、累加、搬运、更新、参数化、观测、恢复、证据经济”十张账串起 2014–2026 的 36 个一手节点;重点拆解 Kimi K2 MuonClip、K3 Per-Head Muon / SiTU-GLU / MXFP4 QAT 以及 DeepSeek-V3 fine-grained FP8 与 V4 hybrid Muon / spike mitigation / FP4 QAT,并提供格式显微镜、 混合精度状态账、优化器几何与失稳控制室四个独立互动实验。

10. 指令微调与人类偏好

Instruction Tuning、SFT、RLHF/PPO、RLAIF、Constitutional AI、DPO 及其后续。解释 base model 如何变成可协作助手。

首版已发布:以目标、监督单位、数据来源、SFT、偏好测量、奖励模型、策略更新、直接偏好、 分布、约束、失效与证据十二张账,串起 2017–2026 的 44 个一手节点。正文明确区分 SFT / RM / PPO / DPO / RLAIF / RLVR 的角色合同,重点追踪 DeepSeek LLM→V2→V3→R1→V3.2→V4 与 Kimi K2→K2.5→K3,并提供 SFT 显微镜、偏好/RM、PPO/DPO 更新和配方比较四个独立实验。

11. 推理模型与测试时扩展

CoT、自洽性、搜索、验证器、过程奖励、GRPO、DeepSeekMath、DeepSeek-R1/R1-Zero、Kimi k1.5、multi-effort RL 与 on-policy distillation。

12. 工具使用与长程 Agent

WebGPT、Toolformer、ReAct、Reflexion、代码 Agent、Computer Use、环境奖励、可验证任务、沙箱、百万 Token 轨迹与 K3 Agentic RL。

13. 原生多模态

ViT/CLIP → Flamingo/BLIP-2/LLaVA → 原生多模态与视频;Kimi-VL、MoonViT-V2 和“视觉进入同一主干”的意义。

14. 推理服务与低成本部署

KV Cache、PagedAttention/vLLM、连续批处理、推测解码、Prefill/Decode 解耦、前缀缓存、集群调度;Mooncake 与 K3 KDA-aware serving。

15. 评测、安全与“到底强不强”

困惑度到 MMLU/GPQA/HLESWE-bench、OSWorld、BrowseComp;污染、harness、工具预算、LLM-as-a-judge、选择性报告与网络安全边界。

三条贯穿式案例

  1. Kimi K3 解剖:把上述全部专题重新汇总到一张架构与训练系统图。
  2. DeepSeek 技术谱系DeepSeek LLM → DeepSeekMoE → V2/MLA → V3/FP8/MTP/DualPipe → Math/GRPO → R1 → V3.2/DSA → V4 长上下文。
  3. “一个 Token 的旅行”:从文本分词,经注意力、MoE、GPU 集群、后训练,再到线上推理与工具调用。

完成标准

每个专题至少包含:

  • 1 条清晰问题链;
  • 820 篇一手论文;
  • 2 个以上可缩放架构图;
  • 1 个交互演示或逐步动画;
  • 1 个“常见误解”区;
  • 1 个 K3 与 DeepSeek 对照落点;
  • 所有外部事实的可点击来源、研究截止日期与证据等级;
  • 独立技术复核与链接检查。