Files
llm-atlas/ROADMAP.md
T
2026-07-28 21:55:32 +08:00

4.4 KiB
Raw Blame History

LLM Atlas 总体研究地图

最后更新:2026-07-28

组织原则

全站采用“问题链”而不是“名词表”:

现象与直觉 → 最小数学模型 → 旧方案瓶颈 → 关键论文 → 架构图/实验 → 与后继工作的桥 → K3/DeepSeek 中的落点 → 局限与开放问题

难度分为四层:

  • L0 直觉:不要求线性代数,先建立可视化心智模型。
  • L1 机制:理解张量形状、训练目标与计算流程。
  • L2 论文:能读关键公式、消融实验和训练配置。
  • L3 工程:理解并行、通信、显存、精度与服务系统。

16 个专题

00. 导航:先看懂一张大模型地图

学习依赖、术语、读论文方法、证据等级、K3 的全局坐标。

01. 语言模型从哪里来

N-gram → 神经概率语言模型 → 分布式词表示 → RNN/LSTM → Seq2Seq。解释“预测下一个词”为何最终能长成通用模型。

02. 注意力与 Transformer

Bahdanau Attention → Self-Attention → Transformer → decoder-only GPT。逐项拆解 Q/K/V、因果掩码、多头、残差、归一化、FFN。

03. 表示层、位置与残差高速公路

BPE/SentencePiece、绝对/相对位置、RoPE/ALiBi、LayerNorm/RMSNorm、Pre-LN、SwiGLU,以及从 ResNet 到 K3 Attention Residuals 的深度信息流。

04. Scaling Laws:规模为什么有效

GPT 系列 → Kaplan scaling laws → Chinchilla compute-optimal → 数据质量与重复 → 推理时计算。区分参数、激活参数、训练 FLOPs 与能力。

05. 数据工程与预训练配方

采集、清洗、去重、质量分类、数据混合、课程学习、合成数据、污染控制;对公开报告中“没有说”的部分也明确标记。

06. 稀疏计算与 MoE

Conditional Computation → Sparsely-Gated MoE → GShard/Switch → DeepSeekMoE → LatentMoE → K3 Stable LatentMoE。重点解释路由、专家特化、负载均衡与通信。

07. 长上下文与高效注意力

稀疏注意力、线性注意力、FlashAttention、MQA/GQA、MLA、状态空间模型、Delta Rule、Kimi Linear/KDA、混合注意力与 1M 上下文。

08. 大规模训练系统

数据/张量/流水线/序列/上下文/专家并行,ZeRO,Megatron,通信重叠,容错;对比 DeepSeek DualPipe/DeepEP 与 K3 MoonEP。

09. 数值精度、优化器与稳定性

Adam/AdamW、Adafactor、μP、MuonFP16/BF16/FP8/MXFP4、量化感知训练、缩放与误差。重点讲 DeepSeek-V3 FP8 与 K3 per-head Muon/MXFP4。

10. 指令微调与人类偏好

Instruction Tuning、SFT、RLHF/PPO、RLAIF、Constitutional AI、DPO 及其后续。解释 base model 如何变成可协作助手。

11. 推理模型与测试时扩展

CoT、自洽性、搜索、验证器、过程奖励、GRPO、DeepSeekMath、DeepSeek-R1/R1-Zero、Kimi k1.5、multi-effort RL 与 on-policy distillation。

12. 工具使用与长程 Agent

WebGPT、Toolformer、ReAct、Reflexion、代码 Agent、Computer Use、环境奖励、可验证任务、沙箱、百万 Token 轨迹与 K3 Agentic RL。

13. 原生多模态

ViT/CLIP → Flamingo/BLIP-2/LLaVA → 原生多模态与视频;Kimi-VL、MoonViT-V2 和“视觉进入同一主干”的意义。

14. 推理服务与低成本部署

KV Cache、PagedAttention/vLLM、连续批处理、推测解码、Prefill/Decode 解耦、前缀缓存、集群调度;Mooncake 与 K3 KDA-aware serving。

15. 评测、安全与“到底强不强”

困惑度到 MMLU/GPQA/HLESWE-bench、OSWorld、BrowseComp;污染、harness、工具预算、LLM-as-a-judge、选择性报告与网络安全边界。

三条贯穿式案例

  1. Kimi K3 解剖:把上述全部专题重新汇总到一张架构与训练系统图。
  2. DeepSeek 技术谱系DeepSeek LLM → DeepSeekMoE → V2/MLA → V3/FP8/MTP/DualPipe → Math/GRPO → R1 → V3.2/DSA → V4 长上下文。
  3. “一个 Token 的旅行”:从文本分词,经注意力、MoE、GPU 集群、后训练,再到线上推理与工具调用。

完成标准

每个专题至少包含:

  • 1 条清晰问题链;
  • 820 篇一手论文;
  • 2 个以上可缩放架构图;
  • 1 个交互演示或逐步动画;
  • 1 个“常见误解”区;
  • 1 个 K3 与 DeepSeek 对照落点;
  • 所有外部事实的可点击来源、研究截止日期与证据等级;
  • 独立技术复核与链接检查。