Files
llm-atlas/ROADMAP.md
T
2026-07-28 22:49:04 +08:00

105 lines
4.6 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# LLM Atlas 总体研究地图
最后更新:2026-07-28
## 组织原则
全站采用“问题链”而不是“名词表”:
> 现象与直觉 → 最小数学模型 → 旧方案瓶颈 → 关键论文 → 架构图/实验 → 与后继工作的桥 → K3/DeepSeek 中的落点 → 局限与开放问题
难度分为四层:
- **L0 直觉**:不要求线性代数,先建立可视化心智模型。
- **L1 机制**:理解张量形状、训练目标与计算流程。
- **L2 论文**:能读关键公式、消融实验和训练配置。
- **L3 工程**:理解并行、通信、显存、精度与服务系统。
## 16 个专题
### 00. 导航:先看懂一张大模型地图
学习依赖、术语、读论文方法、证据等级、K3 的全局坐标。
### 01. 语言模型从哪里来
N-gram → 神经概率语言模型 → 分布式词表示 → RNN/LSTM → Seq2Seq。解释“预测下一个词”为何最终能长成通用模型。
### 02. 注意力与 Transformer
Bahdanau Attention → Self-Attention → Transformer → decoder-only GPT。逐项拆解 Q/K/V、因果掩码、多头、残差、归一化、FFN。
### 03. 表示层、位置与残差高速公路
BPE/SentencePiece、绝对/相对位置、RoPE/ALiBi、LayerNorm/RMSNorm、Pre-LN、SwiGLU,以及从 ResNet 到 K3 Attention Residuals 的深度信息流。
### 04. Scaling Laws:规模为什么有效
GPT 系列 → Kaplan scaling laws → Chinchilla compute-optimal → 数据质量与重复 → 推理时计算。区分参数、激活参数、训练 FLOPs 与能力。
### 05. 数据工程与预训练配方
采集、清洗、去重、质量分类、数据混合、课程学习、合成数据、污染控制;对公开报告中“没有说”的部分也明确标记。
### 06. 稀疏计算与 MoE
Conditional Computation → Sparsely-Gated MoE → GShard/Switch → DeepSeekMoE → LatentMoE → K3 Stable LatentMoE。重点解释路由、专家特化、负载均衡与通信。
### 07. 长上下文与高效注意力
稀疏注意力、线性注意力、FlashAttention、MQA/GQA、MLA、状态空间模型、Delta Rule、Kimi Linear/KDA、混合注意力与 1M 上下文。
首版已发布:以“计算、缓存、位置、状态容量、系统”五张账单串起 2019–2026 的 26 篇一手论文,
包含 10+ 张原创机制图和 Full MHA / Flash / GQA / MLA / DSA / KDA / K3 / DeepSeek-V4 交互比较实验。
### 08. 大规模训练系统
数据/张量/流水线/序列/上下文/专家并行,ZeRO,Megatron,通信重叠,容错;对比 DeepSeek DualPipe/DeepEP 与 K3 MoonEP。
### 09. 数值精度、优化器与稳定性
Adam/AdamW、Adafactor、μP、MuonFP16/BF16/FP8/MXFP4、量化感知训练、缩放与误差。重点讲 DeepSeek-V3 FP8 与 K3 per-head Muon/MXFP4。
### 10. 指令微调与人类偏好
Instruction Tuning、SFT、RLHF/PPO、RLAIF、Constitutional AI、DPO 及其后续。解释 base model 如何变成可协作助手。
### 11. 推理模型与测试时扩展
CoT、自洽性、搜索、验证器、过程奖励、GRPO、DeepSeekMath、DeepSeek-R1/R1-Zero、Kimi k1.5、multi-effort RL 与 on-policy distillation。
### 12. 工具使用与长程 Agent
WebGPT、Toolformer、ReAct、Reflexion、代码 Agent、Computer Use、环境奖励、可验证任务、沙箱、百万 Token 轨迹与 K3 Agentic RL。
### 13. 原生多模态
ViT/CLIP → Flamingo/BLIP-2/LLaVA → 原生多模态与视频;Kimi-VL、MoonViT-V2 和“视觉进入同一主干”的意义。
### 14. 推理服务与低成本部署
KV Cache、PagedAttention/vLLM、连续批处理、推测解码、Prefill/Decode 解耦、前缀缓存、集群调度;Mooncake 与 K3 KDA-aware serving。
### 15. 评测、安全与“到底强不强”
困惑度到 MMLU/GPQA/HLESWE-bench、OSWorld、BrowseComp;污染、harness、工具预算、LLM-as-a-judge、选择性报告与网络安全边界。
## 三条贯穿式案例
1. **Kimi K3 解剖**:把上述全部专题重新汇总到一张架构与训练系统图。
2. **DeepSeek 技术谱系**DeepSeek LLM → DeepSeekMoE → V2/MLA → V3/FP8/MTP/DualPipe → Math/GRPO → R1 → V3.2/DSA → V4 长上下文。
3. **“一个 Token 的旅行”**:从文本分词,经注意力、MoE、GPU 集群、后训练,再到线上推理与工具调用。
## 完成标准
每个专题至少包含:
- 1 条清晰问题链;
- 820 篇一手论文;
- 2 个以上可缩放架构图;
- 1 个交互演示或逐步动画;
- 1 个“常见误解”区;
- 1 个 K3 与 DeepSeek 对照落点;
- 所有外部事实的可点击来源、研究截止日期与证据等级;
- 独立技术复核与链接检查。