4.9 KiB
LLM Atlas 总体研究地图
最后更新:2026-07-28
组织原则
全站采用“问题链”而不是“名词表”:
现象与直觉 → 最小数学模型 → 旧方案瓶颈 → 关键论文 → 架构图/实验 → 与后继工作的桥 → K3/DeepSeek 中的落点 → 局限与开放问题
难度分为四层:
- L0 直觉:不要求线性代数,先建立可视化心智模型。
- L1 机制:理解张量形状、训练目标与计算流程。
- L2 论文:能读关键公式、消融实验和训练配置。
- L3 工程:理解并行、通信、显存、精度与服务系统。
16 个专题
00. 导航:先看懂一张大模型地图
学习依赖、术语、读论文方法、证据等级、K3 的全局坐标。
01. 语言模型从哪里来
N-gram → 神经概率语言模型 → 分布式词表示 → RNN/LSTM → Seq2Seq。解释“预测下一个词”为何最终能长成通用模型。
02. 注意力与 Transformer
Bahdanau Attention → Self-Attention → Transformer → decoder-only GPT。逐项拆解 Q/K/V、因果掩码、多头、残差、归一化、FFN。
03. 表示层、位置与残差高速公路
BPE/SentencePiece、绝对/相对位置、RoPE/ALiBi、LayerNorm/RMSNorm、Pre-LN、SwiGLU,以及从 ResNet 到 K3 Attention Residuals 的深度信息流。
04. Scaling Laws:规模为什么有效
GPT 系列 → Kaplan scaling laws → Chinchilla compute-optimal → 数据质量与重复 → 推理时计算。区分参数、激活参数、训练 FLOPs 与能力。
05. 数据工程与预训练配方
采集、清洗、去重、质量分类、数据混合、课程学习、合成数据、污染控制;对公开报告中“没有说”的部分也明确标记。
06. 稀疏计算与 MoE
Conditional Computation → Sparsely-Gated MoE → GShard/Switch → DeepSeekMoE → LatentMoE → K3 Stable LatentMoE。重点解释路由、专家特化、负载均衡与通信。
首版已发布:以“容量、激活计算、路由、负载、通信、稳定性”六张账串起 1991–2026 的 19 篇一手论文, 包含 DeepSeekMoE / Loss-Free / LatentMoE / K3 重点推导,以及 8 种架构、4 类平衡策略的交互实验室。
07. 长上下文与高效注意力
稀疏注意力、线性注意力、FlashAttention、MQA/GQA、MLA、状态空间模型、Delta Rule、Kimi Linear/KDA、混合注意力与 1M 上下文。
首版已发布:以“计算、缓存、位置、状态容量、系统”五张账单串起 2019–2026 的 26 篇一手论文, 包含 10+ 张原创机制图和 Full MHA / Flash / GQA / MLA / DSA / KDA / K3 / DeepSeek-V4 交互比较实验。
08. 大规模训练系统
数据/张量/流水线/序列/上下文/专家并行,ZeRO,Megatron,通信重叠,容错;对比 DeepSeek DualPipe/DeepEP 与 K3 MoonEP。
09. 数值精度、优化器与稳定性
Adam/AdamW、Adafactor、μP、Muon;FP16/BF16/FP8/MXFP4、量化感知训练、缩放与误差。重点讲 DeepSeek-V3 FP8 与 K3 per-head Muon/MXFP4。
10. 指令微调与人类偏好
Instruction Tuning、SFT、RLHF/PPO、RLAIF、Constitutional AI、DPO 及其后续。解释 base model 如何变成可协作助手。
11. 推理模型与测试时扩展
CoT、自洽性、搜索、验证器、过程奖励、GRPO、DeepSeekMath、DeepSeek-R1/R1-Zero、Kimi k1.5、multi-effort RL 与 on-policy distillation。
12. 工具使用与长程 Agent
WebGPT、Toolformer、ReAct、Reflexion、代码 Agent、Computer Use、环境奖励、可验证任务、沙箱、百万 Token 轨迹与 K3 Agentic RL。
13. 原生多模态
ViT/CLIP → Flamingo/BLIP-2/LLaVA → 原生多模态与视频;Kimi-VL、MoonViT-V2 和“视觉进入同一主干”的意义。
14. 推理服务与低成本部署
KV Cache、PagedAttention/vLLM、连续批处理、推测解码、Prefill/Decode 解耦、前缀缓存、集群调度;Mooncake 与 K3 KDA-aware serving。
15. 评测、安全与“到底强不强”
困惑度到 MMLU/GPQA/HLE,SWE-bench、OSWorld、BrowseComp;污染、harness、工具预算、LLM-as-a-judge、选择性报告与网络安全边界。
三条贯穿式案例
- Kimi K3 解剖:把上述全部专题重新汇总到一张架构与训练系统图。
- DeepSeek 技术谱系:DeepSeek LLM → DeepSeekMoE → V2/MLA → V3/FP8/MTP/DualPipe → Math/GRPO → R1 → V3.2/DSA → V4 长上下文。
- “一个 Token 的旅行”:从文本分词,经注意力、MoE、GPU 集群、后训练,再到线上推理与工具调用。
完成标准
每个专题至少包含:
- 1 条清晰问题链;
- 8–20 篇一手论文;
- 2 个以上可缩放架构图;
- 1 个交互演示或逐步动画;
- 1 个“常见误解”区;
- 1 个 K3 与 DeepSeek 对照落点;
- 所有外部事实的可点击来源、研究截止日期与证据等级;
- 独立技术复核与链接检查。