Files
llm-atlas/research/TRAINING_SYSTEMS_GROK_LEADS.md
2026-07-29 01:03:15 +08:00

568 lines
35 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 大规模 LLM 训练系统研究线索包(Grok Research Leads
> **证据等级:未核验候选线索。** 本文件由 Grok CLI 生成,只用于扩展检索面,不是正式研究账本,也不能直接作为课程事实来源。
> **定位**:课程章节用 **research-leads packet**,非定稿讲义。所有数字与机制均须由主研究流程对照一手论文/官方报告核验后,才能写入正式账本与站点。
> **锚点**Kimi K3arXiv:2607.24653)系统栈 · **高亮 DeepSeek 谱系**V2→V3→V3.2→V4
> **组织原则**:按 **因果账本(causal ledger)** 切分,而非按论文列表堆叠。每条账本回答:先前瓶颈 → 机制 → 可教公式 → 解决什么 → 遗留什么 → 一手 URL → 高风险声明。
> **生成日期**2026-07-29 · 本地一手文本:`research/sources/kimi-k3/`、`research/sources/moe/`、`research/sources/long-context/`
---
## 0. 读包须知
### 0.1 五个必须分开的资源量纲
| 量纲 | 教学定义 | 典型单位 | 常见混淆 |
|---|---|---|---|
| **训练 FLOPs** | 前向+反向算术量(与实现无关的“理论算力需求”) | FLOP / token | 与 GPU 峰值 FLOP/s 混为一谈 |
| **内存容量** | 参数/梯度/优化器/激活/KV 能否放进 HBM | Byte / GPU | 与带宽瓶颈混淆 |
| **带宽** | HBM / NVLink / IB / PCIe 吞吐 | GB/s 或 Gbps | 与延迟混淆 |
| **延迟** | 小消息/同步/调度/气泡时间 | µs–ms | 大消息时仍可能被带宽主导 |
| **实现利用率** | MFU / HFU / 流水线利用率 / 通信隐藏率 | % | 用“理论 FLOPs 很高”代替实测 |
### 0.2 并行度符号(全包统一)
- \(N_{\text{gpu}}\):总 GPU 数
- \(DP, TP, PP, EP, CP\)(或 SP):数据/张量/流水线/专家/上下文并行度
- 通常 \(N_{\text{gpu}} = DP \times TP \times PP \times EP \times CP\)(若某维未启用则取 1;实现上可能有共享/正交约束)
- \(P\):总参数量;\(P_{\text{act}}\)MoE 每 token 激活参数量
- \(B, S, H, L\)global micro-batch 相关 batch、序列长、hidden、层数
- \(b\)bytes/elementBF16=2, FP8=1, FP32=4
- \(K\):每 token 选中的专家数;\(E\):专家总数;\(R\):EP 规模
### 0.3 因果账本索引(九大账本)
| ID | 账本 | 核心矛盾 |
|---|---|---|
| L1 | 模型状态内存 | 参数+梯度+优化器状态的冗余与分片 |
| L2 | 激活内存 | 反向依赖的中间张量 vs 重计算/卸载/并行切分 |
| L3 | 计算划分 | 层内/层间如何切矩阵与序列 |
| L4 | 流水线气泡 | PP 调度空闲 vs 微批与通信重叠 |
| L5 | 集合通信 | AllReduce/AllGather/ReduceScatter/All-to-All 体积与拓扑 |
| L6 | MoE/专家派发 | 负载不均、动态 shape、dispatch/combine |
| L7 | 长上下文状态 | 序列维并行、线性/混合注意力状态、KV 外置 |
| L8 | 数值与优化器状态 | 低精度、Muon/Adam 分片、主权重 |
| L9 | 可靠性/弹性 | 故障、弹性训练、agentic RL 沙箱与长轨迹状态 |
---
## 1. 九大因果账本(主文)
### L1 · 模型状态内存(Parameter / Gradient / Optimizer
| 字段 | 内容 |
|---|---|
| **先前瓶颈** | 朴素 DP:每卡完整 \(P\) 参数 + 梯度 + 优化器;Adam 常见 \(\approx 16P\) bytesBF16 参数/梯度 + FP32 主权重 + 2×FP32 矩)。大模型先 OOM 在“状态”而非激活。 |
| **机制演进** | DDP/AllReduce → ZeRO-1/2/3 分片 → FSDP 单元化 → PP 下 Pipeline ZeRO-2 + CPU/NVMe offloadK3 |
| **可教方程** | 朴素 DP 每卡模型状态 \(\approx (2+2+K_{\text{opt}})\,P\,b_{\text{eff}}\)ZeRO-3\(\approx (2+2+K_{\text{opt}})\,P\,b_{\text{eff}}/DP\)。Adam 常取 \(K_{\text{opt}}=12\)(两矩 FP32+ 主权重 FP32 等,**具体字节必须按实现表核对**。 |
| **解决** | 模型规模可随设备数近似线性扩展;FSDP 与框架深度集成。 |
| **未解** | 分片引入 AllGather/ReduceScatter;与 TP/EP 正交时通信图复杂;offload 把瓶颈从容量推到 PCIe/NVMe 带宽。 |
| **一手 URL** | ZeRO https://arxiv.org/abs/1910.02054 · FSDP https://arxiv.org/abs/2304.11277 |
| **高风险声明** | “16P 公式”依赖精度与是否存主权重;K3 “Pipeline ZeRO-2 + CPU 梯度分片”细节以报告 §5.2.2 为准。 |
### L2 · 激活内存(Activation / Checkpoint / Offload
| 字段 | 内容 |
|---|---|
| **先前瓶颈** | 反向需要前向激活;长序列下激活 \(\propto B\cdot S\cdot H\cdot L\) 超过参数状态。 |
| **机制演进** | Gradient checkpointing → Selective recomputeMegatron)→ Sequence/Context parallel 切激活 → 统一激活管理器(策略可插拔:recompute / quant / offload)→ 跨 PP 远程激活 offloadK3 Mooncake |
| **可教方程** | 粗估激活(每层、无 checkpoint):\(\mathcal{O}(B S H)\) 量级;attention 另有 \(\mathcal{O}(B H S^2)\) 或 Flash 下 \(\mathcal{O}(B H S)\) 工作集。**课程应用“量级 + 重计算比例”而非单一闭式。** |
| **解决** | 用时间换空间;SP/CP 把序列维激活摊到多卡;FP8 激活缓存(V3)显著降存。 |
| **未解** | 重计算增加 FLOPs 与调度复杂度;远程 offload 引入跨卡带宽竞争;与 DualPipe 双向流水线的峰值激活耦合。 |
| **一手 URL** | Checkpointing 经典:https://arxiv.org/abs/1604.06174 · Selective recompute+SPhttps://arxiv.org/abs/2205.05198 · V3 内存节:https://arxiv.org/abs/2412.19437 · K3 §5.2.2 |
| **高风险声明** | “FlashAttention 消除激活内存”是错误表述——它降低注意力中间写回 HBM 的峰值,不等于整网激活为零。 |
### L3 · 计算划分(TP / 3D / 层内切分)
| 字段 | 内容 |
|---|---|
| **先前瓶颈** | 单层权重无法装入单卡;纯 PP 气泡大;纯 DP 状态冗余。 |
| **机制演进** | Megatron 层内 TP(列/行并行)→ 与 PP+DP 组成 3D mesh → 与 SP 绑定 → MoE 时 TP 可被 EP+内存优化替代(V3 声称可无昂贵 TP) |
| **可教方程** | Linear 列并行:\(Y=XW\)\(W\) 按列切 \(TP\) 份,前向 AllReduce 或与后层 row-parallel 配对;通信体积 \(\propto B S H \cdot b\) 每层对。 |
| **解决** | 层内并行通信多为机内 NVLink 友好;与 PP 正交。 |
| **未解** | TP 度受节点内 GPU 数限制;过大 TP 通信/计算比变差;与 EP all-to-all 叠加时 SM 争用。 |
| **一手 URL** | Megatron-LM https://arxiv.org/abs/1909.08053 · 3D 规模训练 https://arxiv.org/abs/2104.04473 |
| **高风险声明** | V3 “without costly TP” 指其配置下可不依赖大 TP,**非**断言 TP 已过时。 |
### L4 · 流水线气泡(PP Bubbles / Schedules
| 字段 | 内容 |
|---|---|
| **先前瓶颈** | GPipe 同步 F-then-B:气泡 \(\propto (PP-1)\);微批不足时利用率崩溃。 |
| **机制演进** | GPipe → PipeDream/1F1B → interleaved 1F1B → ZeroBubble(拆 W/B)→ Chimera 双向 → **DualPipe**V3,双向 + 前反向与 all-to-all 重叠)→ K3 interleaved 1F1B + 激活跨 rank 均衡 |
| **可教方程(V3 Table 2 形式,须原表核对)** | 1F1B 气泡 \(\propto (PP-1)(F+B)\)ZB1P \(\propto (PP-1)(F+B-2W)\)DualPipe \(\propto (PP/2-1)(F\&B + B - 3W)\),参数副本 2×,激活 \(\sim PP+1\)。 |
| **解决** | 降低空闲;DualPipe 专门对 MoE all-to-all 做 chunk 级重叠。 |
| **未解** | DualPipe 参数双份;调度实现复杂;与 EP 负载不均交互;多模态 encoder 仍可能暴露在关键路径(K3 用 bubble 填充 ViT)。 |
| **一手 URL** | GPipe https://arxiv.org/abs/1811.06965 · PipeDream https://arxiv.org/abs/1806.03377 · ZeroBubble https://arxiv.org/abs/2401.10241 · DualPipeV3 内)https://arxiv.org/abs/2412.19437 · 实现 https://github.com/deepseek-ai/DualPipe |
| **高风险声明** | DualPipe 气泡公式符号 \(F\&B\) 含义(重叠后的墙钟)易被误读为简单相加;必须对照 Figure 4–5。 |
### L5 · 集合通信(Collectives
| 字段 | 内容 |
|---|---|
| **先前瓶颈** | 大规模 AllReduce 成为 DP 上限;MoE All-to-All 跨节点更糟。 |
| **机制演进** | Ring/Tree AllReduce → hierarchical → ReduceScatter+AllGatherZeRO/FSDP)→ IB+NVLink 分层 all-to-allDeepEP/V3)→ 通信-计算 overlap + 少 SM 通信核 → MoonEP 静态 shape + 固定缓冲 |
| **可教方程** | AllReduce 体积(ring\(\approx 2\frac{N-1}{N}M\)ZeRO-3 参数 AllGather 体积与分片策略相关;MoE dispatch 粗估 \(\propto B S K \cdot d_{\text{expert}} \cdot b\) 跨 EP 组。 |
| **解决** | 分层拓扑利用 NVLink/IB 差;overlap 使“通信时间”从墙钟中消失(条件:算力足够)。 |
| **未解** | 小消息延迟主导;拓扑不匹配时 hybrid mesh 次优;overlap 依赖手写 schedule。 |
| **一手 URL** | Horovod/Baidu ring 背景可读 https://arxiv.org/abs/1802.05799 · DeepEP https://github.com/deepseek-ai/DeepEP · V3 §3.2.2 |
| **高风险声明** | V3 “near-zero all-to-all overhead” 是 **在 DualPipe 重叠 + 恒定 compute/comm 比** 条件下的工程主张,非通信体积为零。 |
### L6 · MoE / 专家派发(Expert Parallelism
| 字段 | 内容 |
|---|---|
| **先前瓶颈** | 稠密扩展不经济;稀疏后出现路由不均、动态 shape、all-to-all、辅损干扰主损。 |
| **机制演进** | GShard/Switch → DeepSpeed-MoE / Tutel → MegaBlocks(块稀疏)→ DeepSeekMoE 细粒度 → aux-loss-free → DeepEP → **MoonEP 动态冗余专家 + 完美均衡** |
| **可教方程** | 每 token 激活参数 \(P_{\text{act}} \ll P\);理想每 rank token 数 \(S\times K\)MoonEP 强制);冗余专家上界 \(E/R\) per rankK3 证明,附录 E)。DeepEP 最坏缓冲 \(S\times K\times R\) vs MoonEP 固定 \(S\times K\)。 |
| **解决** | 容量扩展;MoonEP 消除负载不均与动态 shape 导致的 host syncfused permute/unpermute 零拷贝。 |
| **未解** | 冗余专家迁移/预取开销;规划近优非精确最优;与多模态视觉负载叠加;路由质量 vs 系统均衡的张力。 |
| **一手 URL** | GShard https://arxiv.org/abs/2006.16668 · Switch https://arxiv.org/abs/2101.03961 · MegaBlocks https://arxiv.org/abs/2211.15841 · DeepSpeed-MoE https://arxiv.org/abs/2201.05596 · DeepSeekMoE https://arxiv.org/abs/2401.06066 · V2 https://arxiv.org/abs/2405.04434 · V3 https://arxiv.org/abs/2412.19437 · LatentMoE https://arxiv.org/abs/2601.18089 · K3 MoonEP https://arxiv.org/abs/2607.24653 · https://github.com/MoonshotAI/MoonEP |
| **高风险声明** | K3 “perfect balance” 指 **每 rank token 数相同**,不表示每 expert 内 token 均匀;rank 内仍需 workload-aware GEMM 调度。 |
### L7 · 长上下文状态(Context / Sequence Parallel · Hybrid State
| 字段 | 内容 |
|---|---|
| **先前瓶颈** | Softmax 注意力算存 \(\propto S^2\);单卡序列装不下;线性注意力有固定状态但并行模式不同。 |
| **机制演进** | Megatron SP(与 TP 共)→ Ring Attention → DeepSpeed-Ulysses → USP 统一 → CP 成为独立轴 → MLA 压 KV → DSA 稀疏选 → KDA CP + hybrid KDA/MLA 双缓存管理 |
| **可教方程** | Ring:块在环上传递,通信 \(\propto\) 块数;Ulysses:序列切 + head 维 all-to-all,通信与 head 数相关。KDA:状态尺寸与 \(S\) 解耦(固定 recurrent state);MLA KV 仍 \(\propto S\)。 |
| **解决** | 百万级训练可行;混合架构下“全局层 + 高效层”协同。 |
| **未解** | Hybrid 前缀缓存一致性;CP 与 EP/PP 组合的 mesh 搜索;视觉长序列 encoder 不均衡(K3 dynamic CP)。 |
| **一手 URL** | Megatron SP https://arxiv.org/abs/2205.05198 · Ring https://arxiv.org/abs/2310.01889 · Ulysses https://arxiv.org/abs/2309.14509 · USP https://arxiv.org/abs/2405.07719 · MLA/V2 https://arxiv.org/abs/2405.04434 · KDA https://arxiv.org/abs/2510.26692 · V3.2 DSA https://arxiv.org/abs/2512.02556 · V4 https://arxiv.org/abs/2606.19348 · K3 §5.1 |
| **高风险声明** | “1M context” 训练/推理/RL 代价结构完全不同;不可用推理 demo 反推训练 MFU。 |
### L8 · 数值与优化器状态(Precision / Optimizer
| 字段 | 内容 |
|---|---|
| **先前瓶颈** | BF16 仍吃带宽与存储;Adam 状态巨大;新优化器(Muon)需要整矩阵正交化通信。 |
| **机制演进** | Mixed precision → FP8 训练(V3 fine-grained)→ 优化器状态 BF16/分片 → Muon/MuonClip → **Per-head Muon** + P2P 正交化(K3)→ 部署侧 MXFP4 QAT |
| **可教方程** | 低精度收益:算力峰值↑、激活/权重存储↓;误差需用 scale/tile 策略控制。Muon 正交化:朴素 all-gather 全参 vs P2P 只取本地拥有分片。 |
| **解决** | V3 级 FP8 大规模验证;K3 降 Muon 通信与峰值内存。 |
| **未解** | FP8 对部分算子仍需高精度;QAT 与训练精度路径不同;Muon 与 Adam 的可复现对比依赖实现。 |
| **一手 URL** | FP8 formats https://arxiv.org/abs/2209.05433 · V3 FP8 §3.3 https://arxiv.org/abs/2412.19437 · Muon scalable https://arxiv.org/abs/2502.16982 · K2 https://arxiv.org/abs/2507.20534 · K3 §2.5/§5.2.2 · MX https://arxiv.org/abs/2310.10537 |
| **高风险声明** | “FP8 训练 = 无精度损失”不成立;V3 报告给的是相对 loss error 量级,需读附录 B。 |
### L9 · 可靠性 / 弹性 / Agentic RL 状态
| 字段 | 内容 |
|---|---|
| **先前瓶颈** | 大规模训练故障率;长轨迹 RL 的 KV/环境状态比模型权重更“重”;容器隔离不足。 |
| **机制演进** | 检查点/弹性(经典)→ 分离式 vs **co-located RL** → partial rollout → external KV pool + NVMe 腾挪训练状态 → auto-throttling → AgentENV microVMcheckpoint/fork/pause |
| **可教方程** | 不讲单一公式;强调 **状态对象**policy 权重、优化器、KV/KDA state、sandbox 脏页、未完成 trajectory。墙钟 = max(训练步, rollout, 环境)。 |
| **解决** | 数百卡级 1M agentic RL 可行(K3 主张);沙箱高密度与可恢复。 |
| **未解** | 训练/rollout 资源争用;KV 写回策略权衡;安全与高保真探索的张力;数字(沙箱次数等)需原表核对。 |
| **一手 URL** | K3 §5.3 https://arxiv.org/abs/2607.24653 · AgentENV https://github.com/kvcache-ai/AgentENV · Firecracker 背景(报告引用) |
| **高风险声明** | “few hundred GPUs” 每实验、checkpoint 133ms/49ms、51M+ sandboxes 等均为 **作者报告数字**,课程必须标注来源章节。 |
---
## 2. 必讲谱系(因果链,非编年堆叠)
```
数据并行 + AllReduce
Megatron 张量并行 (层内)
GPipe → PipeDream/1F1B → ZeroBubble / interleaved
ZeRO 分片阶段 → FSDP
Sequence Parallel (与 TP 协同降激活)
3D Parallel (DP×TP×PP mesh)
Expert Parallel + MegaBlocks + DeepSpeed-MoE
Context Parallel / Ring Attention / Ulysses (/USP)
CommunicationComputation Overlap(通用工程)
DeepSeek-V3: DualPipe + DeepEP + FP8 + 细粒度 MoE
Kimi K2 / K2.5 RL 与 infra 积淀
Kimi K3: MoonEP + 静态 shape + 冗余专家 + fused permute
+ 1M co-located agentic RL + external KV + NVMe
+ adaptive throttling + AgentENV
```
### 2.1 谱系节点卡片(精简)
| 节点 | 先前瓶颈 | 机制一句话 | 一手 URL |
|---|---|---|---|
| DP/AllReduce | 单卡算力不够 | 复制模型,梯度同步 | 经典 DDP/Horovod 文献;PyTorch DDP 文档 |
| Megatron TP | 层太大 | 矩阵切分 + 成对通信 | https://arxiv.org/abs/1909.08053 |
| GPipe | 深度装不下 | 层切 + 微批流水 | https://arxiv.org/abs/1811.06965 |
| PipeDream/1F1B | GPipe 气泡 | 交错 F/B | https://arxiv.org/abs/1806.03377 |
| ZeRO | DP 状态冗余 | 分片 OS/G/P | https://arxiv.org/abs/1910.02054 |
| FSDP | ZeRO 工业化 | 单元化分片 + 框架集成 | https://arxiv.org/abs/2304.11277 |
| Sequence Parallel | TP 区外激活仍大 | 序列维切 Norm/Dropout 等 | https://arxiv.org/abs/2205.05198 |
| 3D Parallel | 单轴不够 | mesh 组合 | https://arxiv.org/abs/2104.04473 |
| EP / MegaBlocks / DS-MoE | 稠密不经济 | 专家分卡 + 块稀疏核 | MegaBlocks https://arxiv.org/abs/2211.15841 · DS-MoE https://arxiv.org/abs/2201.05596 |
| CP/Ring/Ulysses | 长序列 | 序列并行注意力 | Ring https://arxiv.org/abs/2310.01889 · Ulysses https://arxiv.org/abs/2309.14509 |
| Overlap | 通信墙钟暴露 | 双流/双流水/手写 schedule | 多源;V3 DualPipe 为高峰 |
| DualPipe/DeepEP | MoE+PP 通信比≈1 | 双向 PP + 定制 all-to-all | https://arxiv.org/abs/2412.19437 · https://github.com/deepseek-ai/DeepEP |
| MoonEP + 1M RL | EP 不均 + 长轨迹状态 | 冗余专家完美均衡 + 外置 KV/沙箱 | https://arxiv.org/abs/2607.24653 |
---
## 3. 20172026 候选一手文献时间线(≥45)
> 标注 **[TR]** 技术报告,**[SYS]** 系统论文,**[ARCH]** 架构/算法但系统相关,**[LIB]** 官方库/核。
> 状态:`候选` = 章节可引用但须下载核对;`本地已有` = `research/sources/` 已有 PDF/TXT。
| # | 年 | 条目 | 类型 | URL | 账本 |
|---|---|---|---|---|---|
| 1 | 2017 | Attention Is All You Need | ARCH | https://arxiv.org/abs/1706.03762 | L3/L7 基线 |
| 2 | 2016/17 | Gradient Checkpointing (Training Deep Nets with Sublinear Memory) | SYS | https://arxiv.org/abs/1604.06174 | L2 |
| 3 | 2018 | GPipe | SYS | https://arxiv.org/abs/1811.06965 | L4 |
| 4 | 2018 | PipeDream | SYS | https://arxiv.org/abs/1806.03377 | L4 |
| 5 | 2018 | Megatron-LM (intra-layer MP) | SYS | https://arxiv.org/abs/1909.08053 | L3 |
| 6 | 2019 | ZeRO | SYS | https://arxiv.org/abs/1910.02054 | L1 |
| 7 | 2019 | Mesh-TensorFlow / 相关模型并行 | SYS | https://arxiv.org/abs/1811.02084 | L3 |
| 8 | 2019 | Mixed Precision Training | SYS | https://arxiv.org/abs/1710.03740 | L8 |
| 9 | 2020 | GShard | ARCH/SYS | https://arxiv.org/abs/2006.16668 | L6 · 本地 moe |
| 10 | 2020 | GPT-3(规模叙事) | TR | https://arxiv.org/abs/2005.14165 | 动机 |
| 11 | 2020 | ZeRO-Offload | SYS | https://arxiv.org/abs/2101.06840 | L1/L9 |
| 12 | 2021 | Switch Transformer | ARCH | https://arxiv.org/abs/2101.03961 | L6 · 本地 |
| 13 | 2021 | Efficient Large-Scale LM Training (Megatron 3D) | SYS | https://arxiv.org/abs/2104.04473 | L3/L4/L5 |
| 14 | 2021 | ZeRO-Infinity | SYS | https://arxiv.org/abs/2104.07857 | L1/L9 |
| 15 | 2021 | Chimera (bidirectional PP) | SYS | https://arxiv.org/abs/2107.06925 | L4 |
| 16 | 2021 | FairScale / FSDP 早期实践 | SYS | 文档+后继论文 | L1 |
| 17 | 2022 | DeepSpeed-MoE | SYS | https://arxiv.org/abs/2201.05596 | L6 |
| 18 | 2022 | Reducing Activation Recomputation (SP + selective) | SYS | https://arxiv.org/abs/2205.05198 | L2/L3 |
| 19 | 2022 | FlashAttention | SYS | https://arxiv.org/abs/2205.14135 | L2/L7 · 本地 |
| 20 | 2022 | Pathways / 相关大规模编排(可选) | SYS | https://arxiv.org/abs/2203.12533 | L9 |
| 21 | 2022 | Overlap 相关:Varuna / 等(可选对比) | SYS | https://arxiv.org/abs/2111.04007 | L4/L5 |
| 22 | 2022 | Tutel MoE system | SYS | https://arxiv.org/abs/2206.03382 | L6 |
| 23 | 2022/23 | MegaBlocks | SYS | https://arxiv.org/abs/2211.15841 | L6 |
| 24 | 2023 | PyTorch FSDP Experiences | SYS | https://arxiv.org/abs/2304.11277 | L1 |
| 25 | 2023 | FlashAttention-2 | SYS | https://arxiv.org/abs/2307.08691 | L2/L7 |
| 26 | 2023 | DeepSpeed-Ulysses | SYS | https://arxiv.org/abs/2309.14509 | L7 |
| 27 | 2023 | Ring Attention | SYS | https://arxiv.org/abs/2310.01889 | L7 |
| 28 | 2023 | Zero Bubble PP | SYS | https://arxiv.org/abs/2401.10241 | L4 |
| 29 | 2023 | FP8 Formats for Deep Learning | SYS | https://arxiv.org/abs/2209.05433 | L8 |
| 30 | 2024 | DeepSeekMoE | ARCH | https://arxiv.org/abs/2401.06066 | L6 · 本地 |
| 31 | 2024 | DeepSeek-V2MLA + DeepSeekMoE | TR | https://arxiv.org/abs/2405.04434 | L6/L7 · 本地 |
| 32 | 2024 | USP Unified Sequence Parallelism | SYS | https://arxiv.org/abs/2405.07719 | L7 |
| 33 | 2024 | DeepSeek-V3 | TR | https://arxiv.org/abs/2412.19437 | L4/L5/L6/L8 · 本地 |
| 34 | 2024 | Aux-loss-free balancingV3 内 + 相关) | ARCH | V3 报告内 | L6 |
| 35 | 2024 | Llama 3 Herd(规模系统侧写) | TR | https://arxiv.org/abs/2407.21783 | 对比 |
| 36 | 2024 | OCP Microscaling (MX) | SYS | https://arxiv.org/abs/2310.10537 | L8 |
| 37 | 2025 | DeepEP library | LIB | https://github.com/deepseek-ai/DeepEP | L5/L6 |
| 38 | 2025 | DualPipe library | LIB | https://github.com/deepseek-ai/DualPipe | L4 |
| 39 | 2025 | DeepSeek-R1 | TR | https://arxiv.org/abs/2501.12948 | L9 RL 背景 · 本地 reasoning |
| 40 | 2025 | Kimi K2 | TR | https://arxiv.org/abs/2507.20534 | 前驱 · 本地 |
| 41 | 2025 | Muon is Scalable for LLM Training | ARCH | https://arxiv.org/abs/2502.16982 | L8 |
| 42 | 2025 | Kimi Linear / KDA | ARCH | https://arxiv.org/abs/2510.26692 | L7 · 本地 |
| 43 | 2025 | DeepSeek-V3.2DSA 等) | TR | https://arxiv.org/abs/2512.02556 | L7 · 本地 |
| 44 | 2025/26 | LatentMoE | ARCH | https://arxiv.org/abs/2601.18089 | L6 · 本地 |
| 45 | 2026 | Kimi K2.5 | TR | https://arxiv.org/abs/2602.02276 | 多模态/RL infra · 本地 |
| 46 | 2026 | Attention Residuals | ARCH | https://arxiv.org/abs/2603.15031 | L2/L3(深度连接) |
| 47 | 2026 | DeepSeek-V4 | TR | https://arxiv.org/abs/2606.19348 | L7 · 本地 |
| 48 | 2026 | Kimi K3 | TR | https://arxiv.org/abs/2607.24653 | L1L9 锚点 · 本地 |
| 49 | 2026 | MoonEP | LIB | https://github.com/MoonshotAI/MoonEP | L6 |
| 50 | 2026 | AgentENV | LIB | https://github.com/kvcache-ai/AgentENV | L9 |
**补强候选(可选扩到 60+**ByteScheduler、TeraPipe、Alpa、Mobius、FlexFlow、MiCS、AMP、DistFlashAttn、LoongTrain、Echo/UltraEPK3 对比引用)、Mooncake Transfer Engine、SonicMoE、Firecracker 论文、OSWorld/SWE-bench 环境论文(RL 环境侧)。
---
## 4. DeepSeek 谱系特写(V2 → V4
### 4.1 DeepSeek-V2 — 经济稀疏 + MLA
| 项 | 线索 |
|---|---|
| **一手** | https://arxiv.org/abs/2405.04434 · 本地 `2405.04434` |
| **系统相关点** | MLA 降 KVDeepSeekMoE 细粒度专家;训练/推理成本叙事 |
| **高风险数字** | 236B total / 21B act128K context;训练成本对比须回表 |
| **未解决(留给 V3** | 跨节点 EP 通信墙;更大规模 FP8;PP+MoE 重叠 |
### 4.2 DeepSeek-V3 — DualPipe / DeepEP / FP8 峰值
| 项 | 线索 |
|---|---|
| **一手** | https://arxiv.org/abs/2412.19437 · 本地 `2412.19437` |
| **DualPipe** | 前/后向 chunk 拆为 attention · dispatch · MLP · combine;双向灌微批;与 ZeroBubble 的 W 分离结合;**通信隐藏是目标函数** |
| **DeepEP / 跨节点 A2A** | IB 跨节点 + NVLink 节点内转发;限制每 token 最多 4 nodes 等 **拓扑共设计**(数字须核原文) |
| **内存** | 无昂贵 TP 的可行性主张;EMA on CPUMTP 共享 embed/head |
| **FP8** | fine-grained tile quant;激活 FP8 缓存;关键路径保持高精度 |
| **高风险** | 2.788M H800 GPU hours、相对 loss error、NVLink 160GB/s vs IB 50GB/s、comm:comp≈1:1 等 |
| **遗留** | EP 负载动态 shape;冗余专家/静态 shape 未做“完美均衡”;长上下文算法侧留给 V3.2/V4 |
### 4.3 DeepSeek-V3.2 — 稀疏注意力与系统接口
| 项 | 线索 |
|---|---|
| **一手** | https://arxiv.org/abs/2512.02556 · 本地 `2512.02556` · HF PDF 镜像亦常见 |
| **系统含义** | DSA + indexer 改变 attention 算子形状与 KV 访问模式;训练/推理内核与 CP 策略需重估 |
| **高风险** | “frontier open” 基准数字;与 V3 训练栈差异是否充分披露 |
### 4.4 DeepSeek-V4 — 百万上下文效率
| 项 | 线索 |
|---|---|
| **一手** | https://arxiv.org/abs/2606.19348 · 本地 `2606.19348` |
| **系统含义** | 1M 上下文下 KV/算力效率(CSA 等);MoE 规模再扩(Pro/Flash 参数量 **须核表** |
| **与 K3 对照教学** | 两边都打 1M,但 **注意力混合策略、EP 库、RL infra** 路径不同——适合做“同目标异栈”对比课 |
### 4.5 DeepSeek → Kimi 系统对照(备课用)
| 维度 | DeepSeek-V3 栈 | Kimi K3 栈 |
|---|---|---|
| PP | DualPipe 双向 + 重叠 | interleaved 1F1B + 远程激活均衡 + bubble 填 ViT |
| EP 通信 | DeepEP 风格 all-to-all | MoonEP:冗余专家 + 完美 token 均衡 |
| Shape | 动态 expert token | **静态** \(S\times K\) |
| 缓冲 | 最坏 \(S\times K\times R\)K3 对比叙述) | 固定 \(S\times K\) |
| 精度 | FP8 训练验证 | 训练 FP8 激活策略 + 部署 MXFP4 QAT |
| 长上下文 | MLA / 后继 DSA / V4 | KDA+Gated MLA hybrid + KCP |
| 后训练 | R1 等 | co-located 1M agentic RL + AgentENV |
---
## 5. Kimi K3 系统特写(MoonEP 与 1M RL
**一手**https://arxiv.org/abs/2607.24653 · 本地 `research/sources/kimi-k3/k3_tech_report.txt` §5
### 5.1 MoonEP(§5.2.1
| 子题 | 线索(待核) |
|---|---|
| **动机** | EP rank 间 token 不均 → 吞吐下降;动态 shape → 显存碎片 + **每层 host-device sync** |
| **机制** | 在线规划 **dynamic redundant experts**;前向预取;反向本地 reduce buffer 再归还 home rank |
| **理论** | 存在均衡方案且每 rank 冗余专家 \(\le E/R\);界近乎紧(附录 E |
| **通信** | fused **permute/unpermute**;规划核预计算 destination;零拷贝 view |
| **静态 shape** | 每 rank 恰 \(S\times K\) tokens → 无需 per-layer 同步取 shape |
| **对比** | DeepEP 流程兼容但加规划/迁移;ECHO/UltraEP 固定 cap 可能规划失败 |
| **遗留** | rank 内 expert 倾斜仍需 GEMM scheduler;规划近似 |
| **开源** | https://github.com/MoonshotAI/MoonEP |
### 5.2 内存高效训练(§5.2.2
- 统一激活管理器:recompute / quant / offload 可组合策略
- MoE:改写 permuted probs 梯度依赖(SonicMoE 启发);dispatch 重计算重叠
- Block AttnRescheckpoint 包装使激活与标准 residual 同阶
- 跨 PP 远程 offloadMooncake)均衡 interleaved 1F1B 激活倾斜
- Pipeline ZeRO-2 + CPU 梯度分片
- Muon:P2P 取分片做正交化,避免全参 all-gather
### 5.3 多模态 encoder(§5.2.3
- Dynamic CP:大图 patch 维切分 + gather-KV
- ViT 算力塞进 PP bubbles(继承/扩展 K2.5 DEP
### 5.4 1M Agentic RL(§5.3)— 专章必讲
| 机制 | 解决的瓶颈 | 高风险数字/表述 |
|---|---|---|
| **Co-located RL** | 分离式集群切换与冗余副本 | “few hundred GPUs”/实验 |
| **Partial rollouts** | 超长轨迹尾延迟 | 与前缀命中交互 |
| **External KV pool** | 1M 多步前缀未命中极贵 | 写回 vs write-through |
| **KDA+MLA 生命周期对齐** | 双缓存必须联合恢复 | 实现复杂度 |
| **NVMe offload 训练状态** | 给 CPU DRAM 腾 KV 池 | 与训练步交替 |
| **Adaptive throttling** | 固定并发早期浪费/后期抢占 | 信号:active/queued/KV util |
| **Gradient-buffer reuse** | 参考模型前向显存 | 与 ZeRO-2 双缓冲预取 |
| **AgentENV** | 容器隔离不够、长生命环境 | 133ms/49ms ckpt6.5× overcommit51,219,741 sandboxes / 1,505,678 images |
| **开源** | — | https://github.com/kvcache-ai/AgentENV |
### 5.5 与 K2 / K2.5 的系统衔接
| 模型 | URL | 系统备课点 |
|---|---|---|
| Kimi K2 | https://arxiv.org/abs/2507.20534 | 1T MoE、agentic 基座、MuonClip、大规模 post-train |
| Kimi K2.5 | https://arxiv.org/abs/2602.02276 | 原生多模态、Agent Swarm、DEP 等 encoder 调度 |
| Kimi K3 | https://arxiv.org/abs/2607.24653 | 2.8T、MoonEP、1M RL 状态栈 |
---
## 6. 建议原创图(8–10 张)
| # | 图名 | 教学功能 | 关键元素 |
|---|---|---|---|
| D1 | **九账本因果地图** | 全章导航 | 账本节点 + 依赖箭头 + DeepSeek/K3 高亮 |
| D2 | **单卡内存栈爆炸图** | L1+L2 | 参数/梯度/优化器/激活/临时工作区;ZeRO 前后对比 |
| D3 | **3D mesh + EP/CP 扩展** | L3/L6/L7 | 五维并行立方体;合法组合约束脚注 |
| D4 | **PP 调度对比条带图** | L4 | GPipe / 1F1B / ZeroBubble / DualPipe 并排时间轴 |
| D5 | **通信体积 vs 拓扑** | L5 | AllReduce / AG+RS / All-to-AllNVLink vs IB 分层 |
| D6 | **MoE dispatch 数据路径** | L6 | token→router→dispatch→experts→combineDeepEP vs MoonEP 缓冲尺寸标注 |
| D7 | **MoonEP 冗余专家规划示意** | L6 | 不均路由 → 冗余副本放置 → 每 rank \(S\times K\) |
| D8 | **DualPipe 四段重叠** | L4/L5 | Attention∥comm、dispatch、MLP、combine;双向微批 |
| D9 | **Hybrid KDAMLA 双状态** | L7 | 固定 KDA state + 增长 MLA KVCP 切分方式 |
| D10 | **1M Agentic RL 状态机** | L9 | GPU KV ↔ CPU external pool ↔ NVMe 训练状态;AgentENV pause/forkthrottling 反馈环 |
---
## 7. 确定性交互实验(Training Systems Lab
### 7.1 目标
让读者 **选择配置 → 得到可复现的粗估**(非性能承诺)。强调:**理论 FLOPs ≠ 内存是否装下 ≠ 带宽是否够 ≠ 延迟是否隐藏 ≠ 实测 MFU**。
### 7.2 输入控件
| 输入 | 范围/选项(建议默认) |
|---|---|
| 模型规模 \(P\) | 7B / 70B / 405B / 671B(MoE) / 2.8T(MoE) 预设 + 自定义 |
| MoE | dense 或 \(E, K, P_{\text{act}}\) |
| GPU 数 \(N\) | 88192 |
| 并行度 | DP, TP, PP, EP, CP(自动检查乘积 = \(N\) |
| 精度 | BF16 / FP8 激活 / FP8 权重训练(简化开关) |
| 序列长 \(S\) | 2K1M(对数滑条) |
| micro-batch / global batch | 分离 |
| 优化器 | AdamW / Muon(状态字节系数不同) |
| Overlap | off / partial / aggressive(仅影响 **有效通信时间模型** |
| Checkpoint | none / full / selective |
| Offload | none / CPU / NVMe(容量可行但带宽惩罚) |
### 7.3 确定性估算输出(公式层,实现时固定版本号)
**A. 每卡内存(容量)**
\[
M_{\text{param}} = \frac{P}{TP\cdot PP\cdot f_{\text{EP-shard}}}\, b_w,\quad
M_{\text{grad}} \sim M_{\text{param 等价分片}},\quad
M_{\text{opt}} = \frac{c_{\text{opt}} P}{DP\cdot \ldots}\,
\]
\[
M_{\text{act}} = g(B_{\text{local}}, S/CP, H, L, \text{ckpt}, b_{\text{act}})
\]
MoE 时 \(f_{\text{EP-shard}}\) 与专家放置有关;MoonEP 模式下额外显示 **冗余专家槽 \(\sim E/R\)** 的参数副本上界(教学提示)。
**B. 通信体积(每步,量级)**
- DP:梯度 ReduceScatter/AllReduce \(\propto P/DP\) 量级
- TP:每层 \(\propto B S H\)
- PP:激活/梯度 P2P \(\propto B S H \cdot\) 边界层
- EPall-to-all \(\propto B S K d\)
- CPRing/Ulysses 不同模型切换
**C. 流水线利用率(简化)**
\[
U_{\text{pipe}} = \frac{T_{\text{compute}}}{T_{\text{compute}}+T_{\text{bubble}}+T_{\text{exposed-comm}}}
\]
DualPipe 模式切换气泡系数表(来自 V3 Table 2 的 **符号化** 实现,不写死 GPU 秒)。
**D. 瓶颈判定(规则引擎,可解释)**
按以下优先级输出 **likely bottleneck**
1. \(M_{\text{total}} >\) HBM → **容量**
2. 否则若 \(T_{\text{comm,exposed}} > T_{\text{compute}}\) → **通信/延迟**
3. 否则若 offload 带宽项主导 → **PCIe/NVMe 带宽**
4. 否则若 \(U_{\text{pipe}} < 0.5\) → **流水线气泡**
5. 否则 → **算力(FLOPs)受限**(仍可低 MFU 若 kernel 差——标注“本 lab 不模拟 kernel 效率”)
**E. 明确不承诺**
- 不输出真实 tokens/s
- 不替代 NCCL 实测
- 所有常数放入 `LAB_CONSTANTS_VERSION` JSON,便于勘误
### 7.4 UI 分栏
1. **FLOPs 面板**:理论训练 FLOPs/token、全局步 FLOPs
2. **Memory 面板**:四栈条形图(param/grad/opt/act
3. **Comm 面板**:各集合通信体积与粗估时间(带宽假设可调)
4. **Utilization 面板**:气泡、暴露通信、overlap 后有效值
5. **Verdict**:单一瓶颈标签 + 反事实(“若把 CP×2 …”)
### 7.5 验收用例(确定性黄金集)
| 场景 | 期望 verdict 类型 |
|---|---|
| 70B, 8 GPU, DP=8, S=2k, Adam | 可能装下,瓶颈算力/通信视 batch |
| 70B, 8 GPU, DP=8, S=128k, 无 CP | 激活容量或 OOM |
| 671B MoE, 无 EP, 试图单节点 | 参数容量失败 |
| V3-like:大 EP + DualPipe overlap on | 暴露通信 ↓,瓶颈可能转算力 |
| K3-like2.8T + MoonEP 静态 shape | 显示冗余专家内存上界;EP 不均项关闭 |
| 1M + co-located RL 开关 | 额外 KV DRAM/NVMe 面板,不与纯预训练内存合并欺骗 |
---
## 8. 三十项高风险声明检查清单
> 写进讲义前逐条对照一手来源,勾选。
1. [ ] K3**2.8T total / 104B activated**
2. [ ] K31M context;训练延拓阶段(8K→…→1M)路径
3. [ ] K316 of 896 routed experts;是否含 shared experts 计数
4. [ ] K3:约 **2.5×** scaling efficiency vs K2 的定义(数据?损失?下游?)
5. [ ] K3KDA:MLA = 3:1 及层数 69/24
6. [ ] MoonEP:每 rank 恰 **\(S\times K\)** tokens
7. [ ] MoonEP:冗余专家上界 **\(E/R\)** 证明条件
8. [ ] MoonEP vs DeepEP 缓冲 **\(S\times K\times R\) vs \(S\times K\)**
9. [ ] fused permute/unpermute “zero-copy” 的实现边界
10. [ ] 静态 shape 消除 per-layer host sync 的表述是否绝对
11. [ ] Pipeline ZeRO-2 + CPU 梯度分片细节
12. [ ] P2P Muon 正交化通信量相对 all-gather 的定量
13. [ ] 远程激活 offloadMooncake)与 PP rank 均衡幅度
14. [ ] Co-located 1M RL “few hundred GPUs”
15. [ ] External KV write-back 策略与 KDA 对齐
16. [ ] NVMe offload 训练状态的时序(train↔rollout
17. [ ] Auto-throttling 所用运行时信号列表
18. [ ] AgentENV checkpoint **133 ms** / resume **49 ms**
19. [ ] 内存 overcommit **6.5×**
20. [ ] 沙箱总数 **51,219,741** / images **1,505,678**
21. [ ] V3671B / 37B act
22. [ ] V3DualPipe 气泡公式与 Table 2 全符号
23. [ ] V3:参数 2× 副本的内存影响被 EP 稀释的论证
24. [ ] V3:跨节点 all-to-all “near-zero overhead” 条件
25. [ ] V3NVLink **160 GB/s**、IB **50 GB/s**、每 token ≤4 nodes
26. [ ] V3FP8 相对 BF16 loss error 数值
27. [ ] V3:训练 GPU-hours(如 2.788M H800)口径
28. [ ] V3:“无需 costly TP” 的配置前提
29. [ ] V2236B/21B、MLA 压缩率数字
30. [ ] V3.2/V4DSA/CSA 与 1M 效率数字;V4 Pro/Flash 参数量表
---
## 9. 章节叙事建议(仍非正文)
1. **先讲资源五量纲**,再讲并行轴,避免一上来背 DP/TP/PP。
2. 每个谱系节点用 **“瓶颈→机制→公式→未解”** 四格,对应账本 L1–L9。
3. DeepSeek-V3 作为 **通信-计算重叠与 FP8 的高峰课**K3 作为 **EP 完美均衡 + 长轨迹状态栈的高峰课**
4. Lab 放在 DualPipe/MoonEP 之后,用同一套符号回放。
5. 所有营销式数字进 **检查清单**,默认脚注 “作者报告,待核”。
---
## 10. 本地源与下一步核验动作
| 源 | 路径 |
|---|---|
| K3 TR | `research/sources/kimi-k3/k3_tech_report.{pdf,txt}` |
| V3 | `research/sources/moe/2412.19437.*` |
| V2 | `research/sources/long-context/2405.04434.*` |
| V3.2 / V4 / KDA | `research/sources/long-context/` |
| 方法约束 | `research/METHODOLOGY.md` · `research/GROK_RESEARCH_ROADMAP.md` M15 |
**建议下一步(写作前)**
1. 精读 K3 §5 与附录 E,抽出 MoonEP 伪代码级步骤。
2. 精读 V3 §3.23.3,重绘 DualPipe 时间图与 Table 2。
3. 补下缺失系统 PDFZeRO、Megatron 3D、GPipe、Ring、Ulysses、FSDP、MegaBlocks。
4. 实现 Lab 常数表 v0,用黄金场景锁定确定性输出。
5. 将本包中每条“高风险”映射到站点脚注 ID。
---
*本文件为 research leads only:不替代一手论文,不直接作为站点事实来源。*