Files
2026-07-29 06:07:42 +08:00

130 lines
6.8 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# LLM Atlas 总体研究地图
最后更新:2026-07-29
## 组织原则
全站采用“问题链”而不是“名词表”:
> 现象与直觉 → 最小数学模型 → 旧方案瓶颈 → 关键论文 → 架构图/实验 → 与后继工作的桥 → K3/DeepSeek 中的落点 → 局限与开放问题
难度分为四层:
- **L0 直觉**:不要求线性代数,先建立可视化心智模型。
- **L1 机制**:理解张量形状、训练目标与计算流程。
- **L2 论文**:能读关键公式、消融实验和训练配置。
- **L3 工程**:理解并行、通信、显存、精度与服务系统。
## 16 个专题
### 00. 导航:先看懂一张大模型地图
学习依赖、术语、读论文方法、证据等级、K3 的全局坐标。
### 01. 语言模型从哪里来
Shannon → N-gram → GoodTuring / Katz / KneserNey → 神经概率语言模型 → 分布式词表示 → RNN/LSTM → Seq2Seq → Attention 前夜。
用“预测单位、概率信息、上下文、稀疏性、分布式表示、循环记忆、序列转导、评测与成本”八张账,
解释 next-token 目标为什么能持续到 Kimi K3 与 DeepSeek,也明确它没有自动保证事实性、忠实推理与行为对齐。
首版已发布:20 段长文、33 个正式节点、19 组原创机制图,以及概率显微镜、Embedding 几何、
循环记忆衰减、Seq2Seq 瓶颈/Attention 桥四个独立实验。正文显式分开 K3 的统一视觉/文本 NTP、
one MTP layer 与 EAGLE-3 draft bridge,并与 DeepSeek-V3/V4 的顺序 MTP 对照。
### 02. 注意力与 Transformer
Bahdanau Attention → Self-Attention → 原始 encoderdecoder Transformer → BERT/GPT/T5 家族 →
KV/IO 效率 → DeepSeek MLA/CSA-HCA 与 Kimi KDA/AttnRes。逐项拆解 Q/K/V、缩放、Mask、
多头、位置、Residual/Norm、FFN/MoE、训练目标与推理状态。
首版已发布:十张独立问题账、40 个正式一手节点、21 段正文,以及 QKV 手算、Mask 矩阵、
多头/位置、Block/KV 成本四个独立实验。正文明确区分 2017 原作与 decoder-only LLM
也把 Attention 权重观察与因果解释永久分开。
### 03. 表示层、位置与残差高速公路
BPE/SentencePiece、绝对/相对位置、RoPE/ALiBi、LayerNorm/RMSNorm、Pre-LN、SwiGLU,以及从 ResNet 到 K3 Attention Residuals 的深度信息流。
### 04. Scaling Laws:规模为什么有效
GPT 系列 → Kaplan scaling laws → Chinchilla compute-optimal → 数据质量与重复 → 推理时计算。区分参数、激活参数、训练 FLOPs 与能力。
### 05. 数据工程与预训练配方
采集、清洗、去重、质量分类、数据混合、课程学习、合成数据、污染控制;对公开报告中“没有说”的部分也明确标记。
### 06. 稀疏计算与 MoE
Conditional Computation → Sparsely-Gated MoE → GShard/Switch → DeepSeekMoE → LatentMoE → K3 Stable LatentMoE。重点解释路由、专家特化、负载均衡与通信。
首版已发布:以“容量、激活计算、路由、负载、通信、稳定性”六张账串起 1991–2026 的 19 篇一手论文,
包含 DeepSeekMoE / Loss-Free / LatentMoE / K3 重点推导,以及 8 种架构、4 类平衡策略的交互实验室。
### 07. 长上下文与高效注意力
稀疏注意力、线性注意力、FlashAttention、MQA/GQA、MLA、状态空间模型、Delta Rule、Kimi Linear/KDA、混合注意力与 1M 上下文。
首版已发布:以“计算、缓存、位置、状态容量、系统”五张账单串起 2019–2026 的 26 篇一手论文,
包含 10+ 张原创机制图和 Full MHA / Flash / GQA / MLA / DSA / KDA / K3 / DeepSeek-V4 交互比较实验。
### 08. 大规模训练系统
数据/张量/流水线/序列/上下文/专家并行,ZeRO,Megatron,通信重叠,容错;对比 DeepSeek DualPipe/DeepEP 与 K3 MoonEP。
### 09. 数值精度、优化器与稳定性
Adam/AdamW、Adafactor、μP、MuonFP16/BF16/FP8/MXFP4、量化感知训练、缩放与误差。重点讲 DeepSeek-V3 FP8 与 K3 per-head Muon/MXFP4。
首版已发布:以“表示、缩放、计算、累加、搬运、更新、参数化、观测、恢复、证据经济”十张账串起
2014–2026 的 36 个一手节点;重点拆解 Kimi K2 MuonClip、K3 Per-Head Muon / SiTU-GLU / MXFP4 QAT
以及 DeepSeek-V3 fine-grained FP8 与 V4 hybrid Muon / spike mitigation / FP4 QAT,并提供格式显微镜、
混合精度状态账、优化器几何与失稳控制室四个独立互动实验。
### 10. 指令微调与人类偏好
Instruction Tuning、SFT、RLHF/PPO、RLAIF、Constitutional AI、DPO 及其后续。解释 base model 如何变成可协作助手。
首版已发布:以目标、监督单位、数据来源、SFT、偏好测量、奖励模型、策略更新、直接偏好、
分布、约束、失效与证据十二张账,串起 2017–2026 的 44 个一手节点。正文明确区分
SFT / RM / PPO / DPO / RLAIF / RLVR 的角色合同,重点追踪 DeepSeek LLM→V2→V3→R1→V3.2→V4
与 Kimi K2→K2.5→K3,并提供 SFT 显微镜、偏好/RM、PPO/DPO 更新和配方比较四个独立实验。
### 11. 推理模型与测试时扩展
CoT、自洽性、搜索、验证器、过程奖励、GRPO、DeepSeekMath、DeepSeek-R1/R1-Zero、Kimi k1.5、multi-effort RL 与 on-policy distillation。
### 12. 工具使用与长程 Agent
WebGPT、Toolformer、ReAct、Reflexion、代码 Agent、Computer Use、环境奖励、可验证任务、沙箱、百万 Token 轨迹与 K3 Agentic RL。
### 13. 原生多模态
ViT/CLIP → Flamingo/BLIP-2/LLaVA → 原生多模态与视频;Kimi-VL、MoonViT-V2 和“视觉进入同一主干”的意义。
### 14. 推理服务与低成本部署
KV Cache、PagedAttention/vLLM、连续批处理、推测解码、Prefill/Decode 解耦、前缀缓存、集群调度;Mooncake 与 K3 KDA-aware serving。
### 15. 评测、安全与“到底强不强”
困惑度到 MMLU/GPQA/HLESWE-bench、OSWorld、BrowseComp;污染、harness、工具预算、LLM-as-a-judge、选择性报告与网络安全边界。
## 三条贯穿式案例
1. **Kimi K3 解剖**:把上述全部专题重新汇总到一张架构与训练系统图。
2. **DeepSeek 技术谱系**DeepSeek LLM → DeepSeekMoE → V2/MLA → V3/FP8/MTP/DualPipe → Math/GRPO → R1 → V3.2/DSA → V4 长上下文。
3. **“一个 Token 的旅行”**:从文本分词,经注意力、MoE、GPU 集群、后训练,再到线上推理与工具调用。
## 完成标准
每个专题至少包含:
- 1 条清晰问题链;
- 820 篇一手论文;
- 2 个以上可缩放架构图;
- 1 个交互演示或逐步动画;
- 1 个“常见误解”区;
- 1 个 K3 与 DeepSeek 对照落点;
- 所有外部事实的可点击来源、研究截止日期与证据等级;
- 独立技术复核与链接检查。