130 lines
6.8 KiB
Markdown
130 lines
6.8 KiB
Markdown
# LLM Atlas 总体研究地图
|
||
|
||
最后更新:2026-07-29
|
||
|
||
## 组织原则
|
||
|
||
全站采用“问题链”而不是“名词表”:
|
||
|
||
> 现象与直觉 → 最小数学模型 → 旧方案瓶颈 → 关键论文 → 架构图/实验 → 与后继工作的桥 → K3/DeepSeek 中的落点 → 局限与开放问题
|
||
|
||
难度分为四层:
|
||
|
||
- **L0 直觉**:不要求线性代数,先建立可视化心智模型。
|
||
- **L1 机制**:理解张量形状、训练目标与计算流程。
|
||
- **L2 论文**:能读关键公式、消融实验和训练配置。
|
||
- **L3 工程**:理解并行、通信、显存、精度与服务系统。
|
||
|
||
## 16 个专题
|
||
|
||
### 00. 导航:先看懂一张大模型地图
|
||
|
||
学习依赖、术语、读论文方法、证据等级、K3 的全局坐标。
|
||
|
||
### 01. 语言模型从哪里来
|
||
|
||
Shannon → N-gram → Good–Turing / Katz / Kneser–Ney → 神经概率语言模型 → 分布式词表示 → RNN/LSTM → Seq2Seq → Attention 前夜。
|
||
用“预测单位、概率信息、上下文、稀疏性、分布式表示、循环记忆、序列转导、评测与成本”八张账,
|
||
解释 next-token 目标为什么能持续到 Kimi K3 与 DeepSeek,也明确它没有自动保证事实性、忠实推理与行为对齐。
|
||
|
||
首版已发布:20 段长文、33 个正式节点、19 组原创机制图,以及概率显微镜、Embedding 几何、
|
||
循环记忆衰减、Seq2Seq 瓶颈/Attention 桥四个独立实验。正文显式分开 K3 的统一视觉/文本 NTP、
|
||
one MTP layer 与 EAGLE-3 draft bridge,并与 DeepSeek-V3/V4 的顺序 MTP 对照。
|
||
|
||
### 02. 注意力与 Transformer
|
||
|
||
Bahdanau Attention → Self-Attention → 原始 encoder–decoder Transformer → BERT/GPT/T5 家族 →
|
||
KV/IO 效率 → DeepSeek MLA/CSA-HCA 与 Kimi KDA/AttnRes。逐项拆解 Q/K/V、缩放、Mask、
|
||
多头、位置、Residual/Norm、FFN/MoE、训练目标与推理状态。
|
||
|
||
首版已发布:十张独立问题账、40 个正式一手节点、21 段正文,以及 QKV 手算、Mask 矩阵、
|
||
多头/位置、Block/KV 成本四个独立实验。正文明确区分 2017 原作与 decoder-only LLM,
|
||
也把 Attention 权重观察与因果解释永久分开。
|
||
|
||
### 03. 表示层、位置与残差高速公路
|
||
|
||
BPE/SentencePiece、绝对/相对位置、RoPE/ALiBi、LayerNorm/RMSNorm、Pre-LN、SwiGLU,以及从 ResNet 到 K3 Attention Residuals 的深度信息流。
|
||
|
||
### 04. Scaling Laws:规模为什么有效
|
||
|
||
GPT 系列 → Kaplan scaling laws → Chinchilla compute-optimal → 数据质量与重复 → 推理时计算。区分参数、激活参数、训练 FLOPs 与能力。
|
||
|
||
### 05. 数据工程与预训练配方
|
||
|
||
采集、清洗、去重、质量分类、数据混合、课程学习、合成数据、污染控制;对公开报告中“没有说”的部分也明确标记。
|
||
|
||
### 06. 稀疏计算与 MoE
|
||
|
||
Conditional Computation → Sparsely-Gated MoE → GShard/Switch → DeepSeekMoE → LatentMoE → K3 Stable LatentMoE。重点解释路由、专家特化、负载均衡与通信。
|
||
|
||
首版已发布:以“容量、激活计算、路由、负载、通信、稳定性”六张账串起 1991–2026 的 19 篇一手论文,
|
||
包含 DeepSeekMoE / Loss-Free / LatentMoE / K3 重点推导,以及 8 种架构、4 类平衡策略的交互实验室。
|
||
|
||
### 07. 长上下文与高效注意力
|
||
|
||
稀疏注意力、线性注意力、FlashAttention、MQA/GQA、MLA、状态空间模型、Delta Rule、Kimi Linear/KDA、混合注意力与 1M 上下文。
|
||
|
||
首版已发布:以“计算、缓存、位置、状态容量、系统”五张账单串起 2019–2026 的 26 篇一手论文,
|
||
包含 10+ 张原创机制图和 Full MHA / Flash / GQA / MLA / DSA / KDA / K3 / DeepSeek-V4 交互比较实验。
|
||
|
||
### 08. 大规模训练系统
|
||
|
||
数据/张量/流水线/序列/上下文/专家并行,ZeRO,Megatron,通信重叠,容错;对比 DeepSeek DualPipe/DeepEP 与 K3 MoonEP。
|
||
|
||
### 09. 数值精度、优化器与稳定性
|
||
|
||
Adam/AdamW、Adafactor、μP、Muon;FP16/BF16/FP8/MXFP4、量化感知训练、缩放与误差。重点讲 DeepSeek-V3 FP8 与 K3 per-head Muon/MXFP4。
|
||
|
||
首版已发布:以“表示、缩放、计算、累加、搬运、更新、参数化、观测、恢复、证据经济”十张账串起
|
||
2014–2026 的 36 个一手节点;重点拆解 Kimi K2 MuonClip、K3 Per-Head Muon / SiTU-GLU / MXFP4 QAT,
|
||
以及 DeepSeek-V3 fine-grained FP8 与 V4 hybrid Muon / spike mitigation / FP4 QAT,并提供格式显微镜、
|
||
混合精度状态账、优化器几何与失稳控制室四个独立互动实验。
|
||
|
||
### 10. 指令微调与人类偏好
|
||
|
||
Instruction Tuning、SFT、RLHF/PPO、RLAIF、Constitutional AI、DPO 及其后续。解释 base model 如何变成可协作助手。
|
||
|
||
首版已发布:以目标、监督单位、数据来源、SFT、偏好测量、奖励模型、策略更新、直接偏好、
|
||
分布、约束、失效与证据十二张账,串起 2017–2026 的 44 个一手节点。正文明确区分
|
||
SFT / RM / PPO / DPO / RLAIF / RLVR 的角色合同,重点追踪 DeepSeek LLM→V2→V3→R1→V3.2→V4
|
||
与 Kimi K2→K2.5→K3,并提供 SFT 显微镜、偏好/RM、PPO/DPO 更新和配方比较四个独立实验。
|
||
|
||
### 11. 推理模型与测试时扩展
|
||
|
||
CoT、自洽性、搜索、验证器、过程奖励、GRPO、DeepSeekMath、DeepSeek-R1/R1-Zero、Kimi k1.5、multi-effort RL 与 on-policy distillation。
|
||
|
||
### 12. 工具使用与长程 Agent
|
||
|
||
WebGPT、Toolformer、ReAct、Reflexion、代码 Agent、Computer Use、环境奖励、可验证任务、沙箱、百万 Token 轨迹与 K3 Agentic RL。
|
||
|
||
### 13. 原生多模态
|
||
|
||
ViT/CLIP → Flamingo/BLIP-2/LLaVA → 原生多模态与视频;Kimi-VL、MoonViT-V2 和“视觉进入同一主干”的意义。
|
||
|
||
### 14. 推理服务与低成本部署
|
||
|
||
KV Cache、PagedAttention/vLLM、连续批处理、推测解码、Prefill/Decode 解耦、前缀缓存、集群调度;Mooncake 与 K3 KDA-aware serving。
|
||
|
||
### 15. 评测、安全与“到底强不强”
|
||
|
||
困惑度到 MMLU/GPQA/HLE,SWE-bench、OSWorld、BrowseComp;污染、harness、工具预算、LLM-as-a-judge、选择性报告与网络安全边界。
|
||
|
||
## 三条贯穿式案例
|
||
|
||
1. **Kimi K3 解剖**:把上述全部专题重新汇总到一张架构与训练系统图。
|
||
2. **DeepSeek 技术谱系**:DeepSeek LLM → DeepSeekMoE → V2/MLA → V3/FP8/MTP/DualPipe → Math/GRPO → R1 → V3.2/DSA → V4 长上下文。
|
||
3. **“一个 Token 的旅行”**:从文本分词,经注意力、MoE、GPU 集群、后训练,再到线上推理与工具调用。
|
||
|
||
## 完成标准
|
||
|
||
每个专题至少包含:
|
||
|
||
- 1 条清晰问题链;
|
||
- 8–20 篇一手论文;
|
||
- 2 个以上可缩放架构图;
|
||
- 1 个交互演示或逐步动画;
|
||
- 1 个“常见误解”区;
|
||
- 1 个 K3 与 DeepSeek 对照落点;
|
||
- 所有外部事实的可点击来源、研究截止日期与证据等级;
|
||
- 独立技术复核与链接检查。
|