research: map large-scale training systems
This commit is contained in:
+10
-2
@@ -14,6 +14,7 @@
|
||||
| 推理与测试时扩展 | 完成首版 | 76% | 真实模型采样曲线、PRM 案例与逐篇图表精读 |
|
||||
| 稀疏计算与 MoE | 完成首版 | 74% | 真实负载 traces 与专家特化案例 |
|
||||
| 长上下文专题 | 完成首版 | 72% | 真实模型配置、内核细节与失败案例 |
|
||||
| 大规模训练系统 | 研究完成首轮 | 38% | 实现内存—并行—流水线—通信四页签实验室 |
|
||||
| 引用与事实检查 | 进行中 | 54% | 自动化外链复查与来源等级扩展 |
|
||||
| 开源仓库 | 已完成首版 | 100% | 持续提交研究与网站迭代 |
|
||||
| k1412 部署 | 已完成首版 | 100% | 每轮发布保留不可变镜像与回滚点 |
|
||||
@@ -40,14 +41,17 @@
|
||||
- [x] 分清 K3 partial rollout 的 off-policy 稳定化与 MOPD 的 student on-policy 逐 Token 蒸馏。
|
||||
- [x] 完成推理首版:八张账、30 篇一手论文链、DeepSeek/Kimi 双主线与预算—GRPO—MOPD 三页签实验室。
|
||||
- [x] 推理首版以提交 `dce94b2`、不可变镜像 `20260728T164043Z-dce94b2` 发布;NAS/VPS/HTTPS/生产 Chrome 全链路通过。
|
||||
- [x] Astro 类型检查、生产构建、9 个内部路由和桌面/移动端视觉检查通过。
|
||||
- [x] 训练系统专题完成首轮证据账本:九张资源账、37 个一手节点、DeepSeek-V2/V3/V4 与 Kimi K2/K2.5/K3 系统谱系。
|
||||
- [x] 缓存并核验 18 篇训练系统核心论文,逐项校正 ZeRO 字节账、pipeline bubble、collective 口径、context parallel 与 MoonEP 上界。
|
||||
- [x] 将 Grok 产物降级为明确标注的未核验 leads;正式账本只采用回查一手论文后的结论。
|
||||
- [x] Astro 类型检查、生产构建、10 个内部路由和桌面/移动端视觉检查通过。
|
||||
- [x] 创建 `wuyang/llm-atlas` 公开仓库,匿名 API 确认 `private: false`。
|
||||
- [x] 本地生产镜像通过健康检查与全部 9 个页面路由烟雾测试。
|
||||
- [x] 通过 Unraid Compose Manager、Nginx Proxy Manager 与 HTTPS 发布首版。
|
||||
|
||||
## 正在进行
|
||||
|
||||
- [ ] 大规模训练系统:ZeRO / Megatron → Expert/Context Parallel → DualPipe / MoonEP。
|
||||
- [ ] 大规模训练系统:实现四页签实验室与 ZeRO / Megatron → Expert/Context Parallel → DualPipe / MoonEP 长文。
|
||||
- [ ] 推理专题二轮:真实 pass@k 曲线、PRM 失败案例与逐篇图表精读。
|
||||
- [ ] 长上下文专题的真实模型配置对比、内核细节与失败案例二轮深化。
|
||||
- [ ] MoE 专题的真实集群 traces、专家特化案例与二轮外部证据。
|
||||
@@ -71,6 +75,10 @@
|
||||
| 2026-07-29 | K3 partial rollout RL 与 MOPD 在正文中强制并排 | 前者显式容忍跨迭代 stale trajectory,后者由当前 student 采样并接收稠密 teacher signal |
|
||||
| 2026-07-29 | 推理首版用 30 篇一手论文和三页签实验闭环 | 分开演示预算分配、GRPO 聚合偏置和 K3 九教师 MOPD,不合成伪“总分” |
|
||||
| 2026-07-29 | 推理首版发布到既有 `llm-atlas` 生产链路 | Compose Manager、NPM host 31 / cert 41、10 路由与公网交互均复核通过 |
|
||||
| 2026-07-29 | 训练系统按模型状态、激活、计算划分、气泡、collective、EP、CP、数值、可靠性九张账组织 | 任何优化都必须说明节省哪种资源、把成本移到哪里 |
|
||||
| 2026-07-29 | 并行度不再机械写成 `DP×TP×PP×EP×CP` | 先定义 device mesh、group overlap 与作用范围,再核算 world size |
|
||||
| 2026-07-29 | DeepSeek “近零通信”统一解释为特定 overlap 下的 exposed critical-path time | 防止把隐藏通信误写成没有传输字节 |
|
||||
| 2026-07-29 | Grok 训练系统包只保留为 `TRAINING_SYSTEMS_GROK_LEADS.md` | 候选论文、数字和公式不得越过一手证据账本直接进入站点 |
|
||||
|
||||
## 未决问题
|
||||
|
||||
|
||||
@@ -0,0 +1,567 @@
|
||||
# 大规模 LLM 训练系统研究线索包(Grok Research Leads)
|
||||
|
||||
> **证据等级:未核验候选线索。** 本文件由 Grok CLI 生成,只用于扩展检索面,不是正式研究账本,也不能直接作为课程事实来源。
|
||||
> **定位**:课程章节用 **research-leads packet**,非定稿讲义。所有数字与机制均须由主研究流程对照一手论文/官方报告核验后,才能写入正式账本与站点。
|
||||
> **锚点**:Kimi K3(arXiv:2607.24653)系统栈 · **高亮 DeepSeek 谱系**(V2→V3→V3.2→V4)
|
||||
> **组织原则**:按 **因果账本(causal ledger)** 切分,而非按论文列表堆叠。每条账本回答:先前瓶颈 → 机制 → 可教公式 → 解决什么 → 遗留什么 → 一手 URL → 高风险声明。
|
||||
> **生成日期**:2026-07-29 · 本地一手文本:`research/sources/kimi-k3/`、`research/sources/moe/`、`research/sources/long-context/`
|
||||
|
||||
---
|
||||
|
||||
## 0. 读包须知
|
||||
|
||||
### 0.1 五个必须分开的资源量纲
|
||||
|
||||
| 量纲 | 教学定义 | 典型单位 | 常见混淆 |
|
||||
|---|---|---|---|
|
||||
| **训练 FLOPs** | 前向+反向算术量(与实现无关的“理论算力需求”) | FLOP / token | 与 GPU 峰值 FLOP/s 混为一谈 |
|
||||
| **内存容量** | 参数/梯度/优化器/激活/KV 能否放进 HBM | Byte / GPU | 与带宽瓶颈混淆 |
|
||||
| **带宽** | HBM / NVLink / IB / PCIe 吞吐 | GB/s 或 Gbps | 与延迟混淆 |
|
||||
| **延迟** | 小消息/同步/调度/气泡时间 | µs–ms | 大消息时仍可能被带宽主导 |
|
||||
| **实现利用率** | MFU / HFU / 流水线利用率 / 通信隐藏率 | % | 用“理论 FLOPs 很高”代替实测 |
|
||||
|
||||
### 0.2 并行度符号(全包统一)
|
||||
|
||||
- \(N_{\text{gpu}}\):总 GPU 数
|
||||
- \(DP, TP, PP, EP, CP\)(或 SP):数据/张量/流水线/专家/上下文并行度
|
||||
- 通常 \(N_{\text{gpu}} = DP \times TP \times PP \times EP \times CP\)(若某维未启用则取 1;实现上可能有共享/正交约束)
|
||||
- \(P\):总参数量;\(P_{\text{act}}\):MoE 每 token 激活参数量
|
||||
- \(B, S, H, L\):global micro-batch 相关 batch、序列长、hidden、层数
|
||||
- \(b\):bytes/element(BF16=2, FP8=1, FP32=4)
|
||||
- \(K\):每 token 选中的专家数;\(E\):专家总数;\(R\):EP 规模
|
||||
|
||||
### 0.3 因果账本索引(九大账本)
|
||||
|
||||
| ID | 账本 | 核心矛盾 |
|
||||
|---|---|---|
|
||||
| L1 | 模型状态内存 | 参数+梯度+优化器状态的冗余与分片 |
|
||||
| L2 | 激活内存 | 反向依赖的中间张量 vs 重计算/卸载/并行切分 |
|
||||
| L3 | 计算划分 | 层内/层间如何切矩阵与序列 |
|
||||
| L4 | 流水线气泡 | PP 调度空闲 vs 微批与通信重叠 |
|
||||
| L5 | 集合通信 | AllReduce/AllGather/ReduceScatter/All-to-All 体积与拓扑 |
|
||||
| L6 | MoE/专家派发 | 负载不均、动态 shape、dispatch/combine |
|
||||
| L7 | 长上下文状态 | 序列维并行、线性/混合注意力状态、KV 外置 |
|
||||
| L8 | 数值与优化器状态 | 低精度、Muon/Adam 分片、主权重 |
|
||||
| L9 | 可靠性/弹性 | 故障、弹性训练、agentic RL 沙箱与长轨迹状态 |
|
||||
|
||||
---
|
||||
|
||||
## 1. 九大因果账本(主文)
|
||||
|
||||
### L1 · 模型状态内存(Parameter / Gradient / Optimizer)
|
||||
|
||||
| 字段 | 内容 |
|
||||
|---|---|
|
||||
| **先前瓶颈** | 朴素 DP:每卡完整 \(P\) 参数 + 梯度 + 优化器;Adam 常见 \(\approx 16P\) bytes(BF16 参数/梯度 + FP32 主权重 + 2×FP32 矩)。大模型先 OOM 在“状态”而非激活。 |
|
||||
| **机制演进** | DDP/AllReduce → ZeRO-1/2/3 分片 → FSDP 单元化 → PP 下 Pipeline ZeRO-2 + CPU/NVMe offload(K3) |
|
||||
| **可教方程** | 朴素 DP 每卡模型状态 \(\approx (2+2+K_{\text{opt}})\,P\,b_{\text{eff}}\);ZeRO-3:\(\approx (2+2+K_{\text{opt}})\,P\,b_{\text{eff}}/DP\)。Adam 常取 \(K_{\text{opt}}=12\)(两矩 FP32)+ 主权重 FP32 等,**具体字节必须按实现表核对**。 |
|
||||
| **解决** | 模型规模可随设备数近似线性扩展;FSDP 与框架深度集成。 |
|
||||
| **未解** | 分片引入 AllGather/ReduceScatter;与 TP/EP 正交时通信图复杂;offload 把瓶颈从容量推到 PCIe/NVMe 带宽。 |
|
||||
| **一手 URL** | ZeRO https://arxiv.org/abs/1910.02054 · FSDP https://arxiv.org/abs/2304.11277 |
|
||||
| **高风险声明** | “16P 公式”依赖精度与是否存主权重;K3 “Pipeline ZeRO-2 + CPU 梯度分片”细节以报告 §5.2.2 为准。 |
|
||||
|
||||
### L2 · 激活内存(Activation / Checkpoint / Offload)
|
||||
|
||||
| 字段 | 内容 |
|
||||
|---|---|
|
||||
| **先前瓶颈** | 反向需要前向激活;长序列下激活 \(\propto B\cdot S\cdot H\cdot L\) 超过参数状态。 |
|
||||
| **机制演进** | Gradient checkpointing → Selective recompute(Megatron)→ Sequence/Context parallel 切激活 → 统一激活管理器(策略可插拔:recompute / quant / offload)→ 跨 PP 远程激活 offload(K3 Mooncake) |
|
||||
| **可教方程** | 粗估激活(每层、无 checkpoint):\(\mathcal{O}(B S H)\) 量级;attention 另有 \(\mathcal{O}(B H S^2)\) 或 Flash 下 \(\mathcal{O}(B H S)\) 工作集。**课程应用“量级 + 重计算比例”而非单一闭式。** |
|
||||
| **解决** | 用时间换空间;SP/CP 把序列维激活摊到多卡;FP8 激活缓存(V3)显著降存。 |
|
||||
| **未解** | 重计算增加 FLOPs 与调度复杂度;远程 offload 引入跨卡带宽竞争;与 DualPipe 双向流水线的峰值激活耦合。 |
|
||||
| **一手 URL** | Checkpointing 经典:https://arxiv.org/abs/1604.06174 · Selective recompute+SP:https://arxiv.org/abs/2205.05198 · V3 内存节:https://arxiv.org/abs/2412.19437 · K3 §5.2.2 |
|
||||
| **高风险声明** | “FlashAttention 消除激活内存”是错误表述——它降低注意力中间写回 HBM 的峰值,不等于整网激活为零。 |
|
||||
|
||||
### L3 · 计算划分(TP / 3D / 层内切分)
|
||||
|
||||
| 字段 | 内容 |
|
||||
|---|---|
|
||||
| **先前瓶颈** | 单层权重无法装入单卡;纯 PP 气泡大;纯 DP 状态冗余。 |
|
||||
| **机制演进** | Megatron 层内 TP(列/行并行)→ 与 PP+DP 组成 3D mesh → 与 SP 绑定 → MoE 时 TP 可被 EP+内存优化替代(V3 声称可无昂贵 TP) |
|
||||
| **可教方程** | Linear 列并行:\(Y=XW\),\(W\) 按列切 \(TP\) 份,前向 AllReduce 或与后层 row-parallel 配对;通信体积 \(\propto B S H \cdot b\) 每层对。 |
|
||||
| **解决** | 层内并行通信多为机内 NVLink 友好;与 PP 正交。 |
|
||||
| **未解** | TP 度受节点内 GPU 数限制;过大 TP 通信/计算比变差;与 EP all-to-all 叠加时 SM 争用。 |
|
||||
| **一手 URL** | Megatron-LM https://arxiv.org/abs/1909.08053 · 3D 规模训练 https://arxiv.org/abs/2104.04473 |
|
||||
| **高风险声明** | V3 “without costly TP” 指其配置下可不依赖大 TP,**非**断言 TP 已过时。 |
|
||||
|
||||
### L4 · 流水线气泡(PP Bubbles / Schedules)
|
||||
|
||||
| 字段 | 内容 |
|
||||
|---|---|
|
||||
| **先前瓶颈** | GPipe 同步 F-then-B:气泡 \(\propto (PP-1)\);微批不足时利用率崩溃。 |
|
||||
| **机制演进** | GPipe → PipeDream/1F1B → interleaved 1F1B → ZeroBubble(拆 W/B)→ Chimera 双向 → **DualPipe**(V3,双向 + 前反向与 all-to-all 重叠)→ K3 interleaved 1F1B + 激活跨 rank 均衡 |
|
||||
| **可教方程(V3 Table 2 形式,须原表核对)** | 1F1B 气泡 \(\propto (PP-1)(F+B)\);ZB1P \(\propto (PP-1)(F+B-2W)\);DualPipe \(\propto (PP/2-1)(F\&B + B - 3W)\),参数副本 2×,激活 \(\sim PP+1\)。 |
|
||||
| **解决** | 降低空闲;DualPipe 专门对 MoE all-to-all 做 chunk 级重叠。 |
|
||||
| **未解** | DualPipe 参数双份;调度实现复杂;与 EP 负载不均交互;多模态 encoder 仍可能暴露在关键路径(K3 用 bubble 填充 ViT)。 |
|
||||
| **一手 URL** | GPipe https://arxiv.org/abs/1811.06965 · PipeDream https://arxiv.org/abs/1806.03377 · ZeroBubble https://arxiv.org/abs/2401.10241 · DualPipe(V3 内)https://arxiv.org/abs/2412.19437 · 实现 https://github.com/deepseek-ai/DualPipe |
|
||||
| **高风险声明** | DualPipe 气泡公式符号 \(F\&B\) 含义(重叠后的墙钟)易被误读为简单相加;必须对照 Figure 4–5。 |
|
||||
|
||||
### L5 · 集合通信(Collectives)
|
||||
|
||||
| 字段 | 内容 |
|
||||
|---|---|
|
||||
| **先前瓶颈** | 大规模 AllReduce 成为 DP 上限;MoE All-to-All 跨节点更糟。 |
|
||||
| **机制演进** | Ring/Tree AllReduce → hierarchical → ReduceScatter+AllGather(ZeRO/FSDP)→ IB+NVLink 分层 all-to-all(DeepEP/V3)→ 通信-计算 overlap + 少 SM 通信核 → MoonEP 静态 shape + 固定缓冲 |
|
||||
| **可教方程** | AllReduce 体积(ring)\(\approx 2\frac{N-1}{N}M\);ZeRO-3 参数 AllGather 体积与分片策略相关;MoE dispatch 粗估 \(\propto B S K \cdot d_{\text{expert}} \cdot b\) 跨 EP 组。 |
|
||||
| **解决** | 分层拓扑利用 NVLink/IB 差;overlap 使“通信时间”从墙钟中消失(条件:算力足够)。 |
|
||||
| **未解** | 小消息延迟主导;拓扑不匹配时 hybrid mesh 次优;overlap 依赖手写 schedule。 |
|
||||
| **一手 URL** | Horovod/Baidu ring 背景可读 https://arxiv.org/abs/1802.05799 · DeepEP https://github.com/deepseek-ai/DeepEP · V3 §3.2.2 |
|
||||
| **高风险声明** | V3 “near-zero all-to-all overhead” 是 **在 DualPipe 重叠 + 恒定 compute/comm 比** 条件下的工程主张,非通信体积为零。 |
|
||||
|
||||
### L6 · MoE / 专家派发(Expert Parallelism)
|
||||
|
||||
| 字段 | 内容 |
|
||||
|---|---|
|
||||
| **先前瓶颈** | 稠密扩展不经济;稀疏后出现路由不均、动态 shape、all-to-all、辅损干扰主损。 |
|
||||
| **机制演进** | GShard/Switch → DeepSpeed-MoE / Tutel → MegaBlocks(块稀疏)→ DeepSeekMoE 细粒度 → aux-loss-free → DeepEP → **MoonEP 动态冗余专家 + 完美均衡** |
|
||||
| **可教方程** | 每 token 激活参数 \(P_{\text{act}} \ll P\);理想每 rank token 数 \(S\times K\)(MoonEP 强制);冗余专家上界 \(E/R\) per rank(K3 证明,附录 E)。DeepEP 最坏缓冲 \(S\times K\times R\) vs MoonEP 固定 \(S\times K\)。 |
|
||||
| **解决** | 容量扩展;MoonEP 消除负载不均与动态 shape 导致的 host sync;fused permute/unpermute 零拷贝。 |
|
||||
| **未解** | 冗余专家迁移/预取开销;规划近优非精确最优;与多模态视觉负载叠加;路由质量 vs 系统均衡的张力。 |
|
||||
| **一手 URL** | GShard https://arxiv.org/abs/2006.16668 · Switch https://arxiv.org/abs/2101.03961 · MegaBlocks https://arxiv.org/abs/2211.15841 · DeepSpeed-MoE https://arxiv.org/abs/2201.05596 · DeepSeekMoE https://arxiv.org/abs/2401.06066 · V2 https://arxiv.org/abs/2405.04434 · V3 https://arxiv.org/abs/2412.19437 · LatentMoE https://arxiv.org/abs/2601.18089 · K3 MoonEP https://arxiv.org/abs/2607.24653 · https://github.com/MoonshotAI/MoonEP |
|
||||
| **高风险声明** | K3 “perfect balance” 指 **每 rank token 数相同**,不表示每 expert 内 token 均匀;rank 内仍需 workload-aware GEMM 调度。 |
|
||||
|
||||
### L7 · 长上下文状态(Context / Sequence Parallel · Hybrid State)
|
||||
|
||||
| 字段 | 内容 |
|
||||
|---|---|
|
||||
| **先前瓶颈** | Softmax 注意力算存 \(\propto S^2\);单卡序列装不下;线性注意力有固定状态但并行模式不同。 |
|
||||
| **机制演进** | Megatron SP(与 TP 共)→ Ring Attention → DeepSpeed-Ulysses → USP 统一 → CP 成为独立轴 → MLA 压 KV → DSA 稀疏选 → KDA CP + hybrid KDA/MLA 双缓存管理 |
|
||||
| **可教方程** | Ring:块在环上传递,通信 \(\propto\) 块数;Ulysses:序列切 + head 维 all-to-all,通信与 head 数相关。KDA:状态尺寸与 \(S\) 解耦(固定 recurrent state);MLA KV 仍 \(\propto S\)。 |
|
||||
| **解决** | 百万级训练可行;混合架构下“全局层 + 高效层”协同。 |
|
||||
| **未解** | Hybrid 前缀缓存一致性;CP 与 EP/PP 组合的 mesh 搜索;视觉长序列 encoder 不均衡(K3 dynamic CP)。 |
|
||||
| **一手 URL** | Megatron SP https://arxiv.org/abs/2205.05198 · Ring https://arxiv.org/abs/2310.01889 · Ulysses https://arxiv.org/abs/2309.14509 · USP https://arxiv.org/abs/2405.07719 · MLA/V2 https://arxiv.org/abs/2405.04434 · KDA https://arxiv.org/abs/2510.26692 · V3.2 DSA https://arxiv.org/abs/2512.02556 · V4 https://arxiv.org/abs/2606.19348 · K3 §5.1 |
|
||||
| **高风险声明** | “1M context” 训练/推理/RL 代价结构完全不同;不可用推理 demo 反推训练 MFU。 |
|
||||
|
||||
### L8 · 数值与优化器状态(Precision / Optimizer)
|
||||
|
||||
| 字段 | 内容 |
|
||||
|---|---|
|
||||
| **先前瓶颈** | BF16 仍吃带宽与存储;Adam 状态巨大;新优化器(Muon)需要整矩阵正交化通信。 |
|
||||
| **机制演进** | Mixed precision → FP8 训练(V3 fine-grained)→ 优化器状态 BF16/分片 → Muon/MuonClip → **Per-head Muon** + P2P 正交化(K3)→ 部署侧 MXFP4 QAT |
|
||||
| **可教方程** | 低精度收益:算力峰值↑、激活/权重存储↓;误差需用 scale/tile 策略控制。Muon 正交化:朴素 all-gather 全参 vs P2P 只取本地拥有分片。 |
|
||||
| **解决** | V3 级 FP8 大规模验证;K3 降 Muon 通信与峰值内存。 |
|
||||
| **未解** | FP8 对部分算子仍需高精度;QAT 与训练精度路径不同;Muon 与 Adam 的可复现对比依赖实现。 |
|
||||
| **一手 URL** | FP8 formats https://arxiv.org/abs/2209.05433 · V3 FP8 §3.3 https://arxiv.org/abs/2412.19437 · Muon scalable https://arxiv.org/abs/2502.16982 · K2 https://arxiv.org/abs/2507.20534 · K3 §2.5/§5.2.2 · MX https://arxiv.org/abs/2310.10537 |
|
||||
| **高风险声明** | “FP8 训练 = 无精度损失”不成立;V3 报告给的是相对 loss error 量级,需读附录 B。 |
|
||||
|
||||
### L9 · 可靠性 / 弹性 / Agentic RL 状态
|
||||
|
||||
| 字段 | 内容 |
|
||||
|---|---|
|
||||
| **先前瓶颈** | 大规模训练故障率;长轨迹 RL 的 KV/环境状态比模型权重更“重”;容器隔离不足。 |
|
||||
| **机制演进** | 检查点/弹性(经典)→ 分离式 vs **co-located RL** → partial rollout → external KV pool + NVMe 腾挪训练状态 → auto-throttling → AgentENV microVM(checkpoint/fork/pause) |
|
||||
| **可教方程** | 不讲单一公式;强调 **状态对象**:policy 权重、优化器、KV/KDA state、sandbox 脏页、未完成 trajectory。墙钟 = max(训练步, rollout, 环境)。 |
|
||||
| **解决** | 数百卡级 1M agentic RL 可行(K3 主张);沙箱高密度与可恢复。 |
|
||||
| **未解** | 训练/rollout 资源争用;KV 写回策略权衡;安全与高保真探索的张力;数字(沙箱次数等)需原表核对。 |
|
||||
| **一手 URL** | K3 §5.3 https://arxiv.org/abs/2607.24653 · AgentENV https://github.com/kvcache-ai/AgentENV · Firecracker 背景(报告引用) |
|
||||
| **高风险声明** | “few hundred GPUs” 每实验、checkpoint 133ms/49ms、51M+ sandboxes 等均为 **作者报告数字**,课程必须标注来源章节。 |
|
||||
|
||||
---
|
||||
|
||||
## 2. 必讲谱系(因果链,非编年堆叠)
|
||||
|
||||
```
|
||||
数据并行 + AllReduce
|
||||
│
|
||||
▼
|
||||
Megatron 张量并行 (层内)
|
||||
│
|
||||
▼
|
||||
GPipe → PipeDream/1F1B → ZeroBubble / interleaved
|
||||
│
|
||||
▼
|
||||
ZeRO 分片阶段 → FSDP
|
||||
│
|
||||
▼
|
||||
Sequence Parallel (与 TP 协同降激活)
|
||||
│
|
||||
▼
|
||||
3D Parallel (DP×TP×PP mesh)
|
||||
│
|
||||
▼
|
||||
Expert Parallel + MegaBlocks + DeepSpeed-MoE
|
||||
│
|
||||
▼
|
||||
Context Parallel / Ring Attention / Ulysses (/USP)
|
||||
│
|
||||
▼
|
||||
Communication–Computation Overlap(通用工程)
|
||||
│
|
||||
▼
|
||||
DeepSeek-V3: DualPipe + DeepEP + FP8 + 细粒度 MoE
|
||||
│
|
||||
▼
|
||||
Kimi K2 / K2.5 RL 与 infra 积淀
|
||||
│
|
||||
▼
|
||||
Kimi K3: MoonEP + 静态 shape + 冗余专家 + fused permute
|
||||
+ 1M co-located agentic RL + external KV + NVMe
|
||||
+ adaptive throttling + AgentENV
|
||||
```
|
||||
|
||||
### 2.1 谱系节点卡片(精简)
|
||||
|
||||
| 节点 | 先前瓶颈 | 机制一句话 | 一手 URL |
|
||||
|---|---|---|---|
|
||||
| DP/AllReduce | 单卡算力不够 | 复制模型,梯度同步 | 经典 DDP/Horovod 文献;PyTorch DDP 文档 |
|
||||
| Megatron TP | 层太大 | 矩阵切分 + 成对通信 | https://arxiv.org/abs/1909.08053 |
|
||||
| GPipe | 深度装不下 | 层切 + 微批流水 | https://arxiv.org/abs/1811.06965 |
|
||||
| PipeDream/1F1B | GPipe 气泡 | 交错 F/B | https://arxiv.org/abs/1806.03377 |
|
||||
| ZeRO | DP 状态冗余 | 分片 OS/G/P | https://arxiv.org/abs/1910.02054 |
|
||||
| FSDP | ZeRO 工业化 | 单元化分片 + 框架集成 | https://arxiv.org/abs/2304.11277 |
|
||||
| Sequence Parallel | TP 区外激活仍大 | 序列维切 Norm/Dropout 等 | https://arxiv.org/abs/2205.05198 |
|
||||
| 3D Parallel | 单轴不够 | mesh 组合 | https://arxiv.org/abs/2104.04473 |
|
||||
| EP / MegaBlocks / DS-MoE | 稠密不经济 | 专家分卡 + 块稀疏核 | MegaBlocks https://arxiv.org/abs/2211.15841 · DS-MoE https://arxiv.org/abs/2201.05596 |
|
||||
| CP/Ring/Ulysses | 长序列 | 序列并行注意力 | Ring https://arxiv.org/abs/2310.01889 · Ulysses https://arxiv.org/abs/2309.14509 |
|
||||
| Overlap | 通信墙钟暴露 | 双流/双流水/手写 schedule | 多源;V3 DualPipe 为高峰 |
|
||||
| DualPipe/DeepEP | MoE+PP 通信比≈1 | 双向 PP + 定制 all-to-all | https://arxiv.org/abs/2412.19437 · https://github.com/deepseek-ai/DeepEP |
|
||||
| MoonEP + 1M RL | EP 不均 + 长轨迹状态 | 冗余专家完美均衡 + 外置 KV/沙箱 | https://arxiv.org/abs/2607.24653 |
|
||||
|
||||
---
|
||||
|
||||
## 3. 2017–2026 候选一手文献时间线(≥45)
|
||||
|
||||
> 标注 **[TR]** 技术报告,**[SYS]** 系统论文,**[ARCH]** 架构/算法但系统相关,**[LIB]** 官方库/核。
|
||||
> 状态:`候选` = 章节可引用但须下载核对;`本地已有` = `research/sources/` 已有 PDF/TXT。
|
||||
|
||||
| # | 年 | 条目 | 类型 | URL | 账本 |
|
||||
|---|---|---|---|---|---|
|
||||
| 1 | 2017 | Attention Is All You Need | ARCH | https://arxiv.org/abs/1706.03762 | L3/L7 基线 |
|
||||
| 2 | 2016/17 | Gradient Checkpointing (Training Deep Nets with Sublinear Memory) | SYS | https://arxiv.org/abs/1604.06174 | L2 |
|
||||
| 3 | 2018 | GPipe | SYS | https://arxiv.org/abs/1811.06965 | L4 |
|
||||
| 4 | 2018 | PipeDream | SYS | https://arxiv.org/abs/1806.03377 | L4 |
|
||||
| 5 | 2018 | Megatron-LM (intra-layer MP) | SYS | https://arxiv.org/abs/1909.08053 | L3 |
|
||||
| 6 | 2019 | ZeRO | SYS | https://arxiv.org/abs/1910.02054 | L1 |
|
||||
| 7 | 2019 | Mesh-TensorFlow / 相关模型并行 | SYS | https://arxiv.org/abs/1811.02084 | L3 |
|
||||
| 8 | 2019 | Mixed Precision Training | SYS | https://arxiv.org/abs/1710.03740 | L8 |
|
||||
| 9 | 2020 | GShard | ARCH/SYS | https://arxiv.org/abs/2006.16668 | L6 · 本地 moe |
|
||||
| 10 | 2020 | GPT-3(规模叙事) | TR | https://arxiv.org/abs/2005.14165 | 动机 |
|
||||
| 11 | 2020 | ZeRO-Offload | SYS | https://arxiv.org/abs/2101.06840 | L1/L9 |
|
||||
| 12 | 2021 | Switch Transformer | ARCH | https://arxiv.org/abs/2101.03961 | L6 · 本地 |
|
||||
| 13 | 2021 | Efficient Large-Scale LM Training (Megatron 3D) | SYS | https://arxiv.org/abs/2104.04473 | L3/L4/L5 |
|
||||
| 14 | 2021 | ZeRO-Infinity | SYS | https://arxiv.org/abs/2104.07857 | L1/L9 |
|
||||
| 15 | 2021 | Chimera (bidirectional PP) | SYS | https://arxiv.org/abs/2107.06925 | L4 |
|
||||
| 16 | 2021 | FairScale / FSDP 早期实践 | SYS | 文档+后继论文 | L1 |
|
||||
| 17 | 2022 | DeepSpeed-MoE | SYS | https://arxiv.org/abs/2201.05596 | L6 |
|
||||
| 18 | 2022 | Reducing Activation Recomputation (SP + selective) | SYS | https://arxiv.org/abs/2205.05198 | L2/L3 |
|
||||
| 19 | 2022 | FlashAttention | SYS | https://arxiv.org/abs/2205.14135 | L2/L7 · 本地 |
|
||||
| 20 | 2022 | Pathways / 相关大规模编排(可选) | SYS | https://arxiv.org/abs/2203.12533 | L9 |
|
||||
| 21 | 2022 | Overlap 相关:Varuna / 等(可选对比) | SYS | https://arxiv.org/abs/2111.04007 | L4/L5 |
|
||||
| 22 | 2022 | Tutel MoE system | SYS | https://arxiv.org/abs/2206.03382 | L6 |
|
||||
| 23 | 2022/23 | MegaBlocks | SYS | https://arxiv.org/abs/2211.15841 | L6 |
|
||||
| 24 | 2023 | PyTorch FSDP Experiences | SYS | https://arxiv.org/abs/2304.11277 | L1 |
|
||||
| 25 | 2023 | FlashAttention-2 | SYS | https://arxiv.org/abs/2307.08691 | L2/L7 |
|
||||
| 26 | 2023 | DeepSpeed-Ulysses | SYS | https://arxiv.org/abs/2309.14509 | L7 |
|
||||
| 27 | 2023 | Ring Attention | SYS | https://arxiv.org/abs/2310.01889 | L7 |
|
||||
| 28 | 2023 | Zero Bubble PP | SYS | https://arxiv.org/abs/2401.10241 | L4 |
|
||||
| 29 | 2023 | FP8 Formats for Deep Learning | SYS | https://arxiv.org/abs/2209.05433 | L8 |
|
||||
| 30 | 2024 | DeepSeekMoE | ARCH | https://arxiv.org/abs/2401.06066 | L6 · 本地 |
|
||||
| 31 | 2024 | DeepSeek-V2(MLA + DeepSeekMoE) | TR | https://arxiv.org/abs/2405.04434 | L6/L7 · 本地 |
|
||||
| 32 | 2024 | USP Unified Sequence Parallelism | SYS | https://arxiv.org/abs/2405.07719 | L7 |
|
||||
| 33 | 2024 | DeepSeek-V3 | TR | https://arxiv.org/abs/2412.19437 | L4/L5/L6/L8 · 本地 |
|
||||
| 34 | 2024 | Aux-loss-free balancing(V3 内 + 相关) | ARCH | V3 报告内 | L6 |
|
||||
| 35 | 2024 | Llama 3 Herd(规模系统侧写) | TR | https://arxiv.org/abs/2407.21783 | 对比 |
|
||||
| 36 | 2024 | OCP Microscaling (MX) | SYS | https://arxiv.org/abs/2310.10537 | L8 |
|
||||
| 37 | 2025 | DeepEP library | LIB | https://github.com/deepseek-ai/DeepEP | L5/L6 |
|
||||
| 38 | 2025 | DualPipe library | LIB | https://github.com/deepseek-ai/DualPipe | L4 |
|
||||
| 39 | 2025 | DeepSeek-R1 | TR | https://arxiv.org/abs/2501.12948 | L9 RL 背景 · 本地 reasoning |
|
||||
| 40 | 2025 | Kimi K2 | TR | https://arxiv.org/abs/2507.20534 | 前驱 · 本地 |
|
||||
| 41 | 2025 | Muon is Scalable for LLM Training | ARCH | https://arxiv.org/abs/2502.16982 | L8 |
|
||||
| 42 | 2025 | Kimi Linear / KDA | ARCH | https://arxiv.org/abs/2510.26692 | L7 · 本地 |
|
||||
| 43 | 2025 | DeepSeek-V3.2(DSA 等) | TR | https://arxiv.org/abs/2512.02556 | L7 · 本地 |
|
||||
| 44 | 2025/26 | LatentMoE | ARCH | https://arxiv.org/abs/2601.18089 | L6 · 本地 |
|
||||
| 45 | 2026 | Kimi K2.5 | TR | https://arxiv.org/abs/2602.02276 | 多模态/RL infra · 本地 |
|
||||
| 46 | 2026 | Attention Residuals | ARCH | https://arxiv.org/abs/2603.15031 | L2/L3(深度连接) |
|
||||
| 47 | 2026 | DeepSeek-V4 | TR | https://arxiv.org/abs/2606.19348 | L7 · 本地 |
|
||||
| 48 | 2026 | Kimi K3 | TR | https://arxiv.org/abs/2607.24653 | L1–L9 锚点 · 本地 |
|
||||
| 49 | 2026 | MoonEP | LIB | https://github.com/MoonshotAI/MoonEP | L6 |
|
||||
| 50 | 2026 | AgentENV | LIB | https://github.com/kvcache-ai/AgentENV | L9 |
|
||||
|
||||
**补强候选(可选扩到 60+)**:ByteScheduler、TeraPipe、Alpa、Mobius、FlexFlow、MiCS、AMP、DistFlashAttn、LoongTrain、Echo/UltraEP(K3 对比引用)、Mooncake Transfer Engine、SonicMoE、Firecracker 论文、OSWorld/SWE-bench 环境论文(RL 环境侧)。
|
||||
|
||||
---
|
||||
|
||||
## 4. DeepSeek 谱系特写(V2 → V4)
|
||||
|
||||
### 4.1 DeepSeek-V2 — 经济稀疏 + MLA
|
||||
|
||||
| 项 | 线索 |
|
||||
|---|---|
|
||||
| **一手** | https://arxiv.org/abs/2405.04434 · 本地 `2405.04434` |
|
||||
| **系统相关点** | MLA 降 KV;DeepSeekMoE 细粒度专家;训练/推理成本叙事 |
|
||||
| **高风险数字** | 236B total / 21B act;128K context;训练成本对比须回表 |
|
||||
| **未解决(留给 V3)** | 跨节点 EP 通信墙;更大规模 FP8;PP+MoE 重叠 |
|
||||
|
||||
### 4.2 DeepSeek-V3 — DualPipe / DeepEP / FP8 峰值
|
||||
|
||||
| 项 | 线索 |
|
||||
|---|---|
|
||||
| **一手** | https://arxiv.org/abs/2412.19437 · 本地 `2412.19437` |
|
||||
| **DualPipe** | 前/后向 chunk 拆为 attention · dispatch · MLP · combine;双向灌微批;与 ZeroBubble 的 W 分离结合;**通信隐藏是目标函数** |
|
||||
| **DeepEP / 跨节点 A2A** | IB 跨节点 + NVLink 节点内转发;限制每 token 最多 4 nodes 等 **拓扑共设计**(数字须核原文) |
|
||||
| **内存** | 无昂贵 TP 的可行性主张;EMA on CPU;MTP 共享 embed/head |
|
||||
| **FP8** | fine-grained tile quant;激活 FP8 缓存;关键路径保持高精度 |
|
||||
| **高风险** | 2.788M H800 GPU hours、相对 loss error、NVLink 160GB/s vs IB 50GB/s、comm:comp≈1:1 等 |
|
||||
| **遗留** | EP 负载动态 shape;冗余专家/静态 shape 未做“完美均衡”;长上下文算法侧留给 V3.2/V4 |
|
||||
|
||||
### 4.3 DeepSeek-V3.2 — 稀疏注意力与系统接口
|
||||
|
||||
| 项 | 线索 |
|
||||
|---|---|
|
||||
| **一手** | https://arxiv.org/abs/2512.02556 · 本地 `2512.02556` · HF PDF 镜像亦常见 |
|
||||
| **系统含义** | DSA + indexer 改变 attention 算子形状与 KV 访问模式;训练/推理内核与 CP 策略需重估 |
|
||||
| **高风险** | “frontier open” 基准数字;与 V3 训练栈差异是否充分披露 |
|
||||
|
||||
### 4.4 DeepSeek-V4 — 百万上下文效率
|
||||
|
||||
| 项 | 线索 |
|
||||
|---|---|
|
||||
| **一手** | https://arxiv.org/abs/2606.19348 · 本地 `2606.19348` |
|
||||
| **系统含义** | 1M 上下文下 KV/算力效率(CSA 等);MoE 规模再扩(Pro/Flash 参数量 **须核表**) |
|
||||
| **与 K3 对照教学** | 两边都打 1M,但 **注意力混合策略、EP 库、RL infra** 路径不同——适合做“同目标异栈”对比课 |
|
||||
|
||||
### 4.5 DeepSeek → Kimi 系统对照(备课用)
|
||||
|
||||
| 维度 | DeepSeek-V3 栈 | Kimi K3 栈 |
|
||||
|---|---|---|
|
||||
| PP | DualPipe 双向 + 重叠 | interleaved 1F1B + 远程激活均衡 + bubble 填 ViT |
|
||||
| EP 通信 | DeepEP 风格 all-to-all | MoonEP:冗余专家 + 完美 token 均衡 |
|
||||
| Shape | 动态 expert token | **静态** \(S\times K\) |
|
||||
| 缓冲 | 最坏 \(S\times K\times R\)(K3 对比叙述) | 固定 \(S\times K\) |
|
||||
| 精度 | FP8 训练验证 | 训练 FP8 激活策略 + 部署 MXFP4 QAT |
|
||||
| 长上下文 | MLA / 后继 DSA / V4 | KDA+Gated MLA hybrid + KCP |
|
||||
| 后训练 | R1 等 | co-located 1M agentic RL + AgentENV |
|
||||
|
||||
---
|
||||
|
||||
## 5. Kimi K3 系统特写(MoonEP 与 1M RL)
|
||||
|
||||
**一手**:https://arxiv.org/abs/2607.24653 · 本地 `research/sources/kimi-k3/k3_tech_report.txt` §5
|
||||
|
||||
### 5.1 MoonEP(§5.2.1)
|
||||
|
||||
| 子题 | 线索(待核) |
|
||||
|---|---|
|
||||
| **动机** | EP rank 间 token 不均 → 吞吐下降;动态 shape → 显存碎片 + **每层 host-device sync** |
|
||||
| **机制** | 在线规划 **dynamic redundant experts**;前向预取;反向本地 reduce buffer 再归还 home rank |
|
||||
| **理论** | 存在均衡方案且每 rank 冗余专家 \(\le E/R\);界近乎紧(附录 E) |
|
||||
| **通信** | fused **permute/unpermute**;规划核预计算 destination;零拷贝 view |
|
||||
| **静态 shape** | 每 rank 恰 \(S\times K\) tokens → 无需 per-layer 同步取 shape |
|
||||
| **对比** | DeepEP 流程兼容但加规划/迁移;ECHO/UltraEP 固定 cap 可能规划失败 |
|
||||
| **遗留** | rank 内 expert 倾斜仍需 GEMM scheduler;规划近似 |
|
||||
| **开源** | https://github.com/MoonshotAI/MoonEP |
|
||||
|
||||
### 5.2 内存高效训练(§5.2.2)
|
||||
|
||||
- 统一激活管理器:recompute / quant / offload 可组合策略
|
||||
- MoE:改写 permuted probs 梯度依赖(SonicMoE 启发);dispatch 重计算重叠
|
||||
- Block AttnRes:checkpoint 包装使激活与标准 residual 同阶
|
||||
- 跨 PP 远程 offload(Mooncake)均衡 interleaved 1F1B 激活倾斜
|
||||
- Pipeline ZeRO-2 + CPU 梯度分片
|
||||
- Muon:P2P 取分片做正交化,避免全参 all-gather
|
||||
|
||||
### 5.3 多模态 encoder(§5.2.3)
|
||||
|
||||
- Dynamic CP:大图 patch 维切分 + gather-KV
|
||||
- ViT 算力塞进 PP bubbles(继承/扩展 K2.5 DEP)
|
||||
|
||||
### 5.4 1M Agentic RL(§5.3)— 专章必讲
|
||||
|
||||
| 机制 | 解决的瓶颈 | 高风险数字/表述 |
|
||||
|---|---|---|
|
||||
| **Co-located RL** | 分离式集群切换与冗余副本 | “few hundred GPUs”/实验 |
|
||||
| **Partial rollouts** | 超长轨迹尾延迟 | 与前缀命中交互 |
|
||||
| **External KV pool** | 1M 多步前缀未命中极贵 | 写回 vs write-through |
|
||||
| **KDA+MLA 生命周期对齐** | 双缓存必须联合恢复 | 实现复杂度 |
|
||||
| **NVMe offload 训练状态** | 给 CPU DRAM 腾 KV 池 | 与训练步交替 |
|
||||
| **Adaptive throttling** | 固定并发早期浪费/后期抢占 | 信号:active/queued/KV util |
|
||||
| **Gradient-buffer reuse** | 参考模型前向显存 | 与 ZeRO-2 双缓冲预取 |
|
||||
| **AgentENV** | 容器隔离不够、长生命环境 | 133ms/49ms ckpt;6.5× overcommit;51,219,741 sandboxes / 1,505,678 images |
|
||||
| **开源** | — | https://github.com/kvcache-ai/AgentENV |
|
||||
|
||||
### 5.5 与 K2 / K2.5 的系统衔接
|
||||
|
||||
| 模型 | URL | 系统备课点 |
|
||||
|---|---|---|
|
||||
| Kimi K2 | https://arxiv.org/abs/2507.20534 | 1T MoE、agentic 基座、MuonClip、大规模 post-train |
|
||||
| Kimi K2.5 | https://arxiv.org/abs/2602.02276 | 原生多模态、Agent Swarm、DEP 等 encoder 调度 |
|
||||
| Kimi K3 | https://arxiv.org/abs/2607.24653 | 2.8T、MoonEP、1M RL 状态栈 |
|
||||
|
||||
---
|
||||
|
||||
## 6. 建议原创图(8–10 张)
|
||||
|
||||
| # | 图名 | 教学功能 | 关键元素 |
|
||||
|---|---|---|---|
|
||||
| D1 | **九账本因果地图** | 全章导航 | 账本节点 + 依赖箭头 + DeepSeek/K3 高亮 |
|
||||
| D2 | **单卡内存栈爆炸图** | L1+L2 | 参数/梯度/优化器/激活/临时工作区;ZeRO 前后对比 |
|
||||
| D3 | **3D mesh + EP/CP 扩展** | L3/L6/L7 | 五维并行立方体;合法组合约束脚注 |
|
||||
| D4 | **PP 调度对比条带图** | L4 | GPipe / 1F1B / ZeroBubble / DualPipe 并排时间轴 |
|
||||
| D5 | **通信体积 vs 拓扑** | L5 | AllReduce / AG+RS / All-to-All;NVLink vs IB 分层 |
|
||||
| D6 | **MoE dispatch 数据路径** | L6 | token→router→dispatch→experts→combine;DeepEP vs MoonEP 缓冲尺寸标注 |
|
||||
| D7 | **MoonEP 冗余专家规划示意** | L6 | 不均路由 → 冗余副本放置 → 每 rank \(S\times K\) |
|
||||
| D8 | **DualPipe 四段重叠** | L4/L5 | Attention∥comm、dispatch、MLP、combine;双向微批 |
|
||||
| D9 | **Hybrid KDA–MLA 双状态** | L7 | 固定 KDA state + 增长 MLA KV;CP 切分方式 |
|
||||
| D10 | **1M Agentic RL 状态机** | L9 | GPU KV ↔ CPU external pool ↔ NVMe 训练状态;AgentENV pause/fork;throttling 反馈环 |
|
||||
|
||||
---
|
||||
|
||||
## 7. 确定性交互实验(Training Systems Lab)
|
||||
|
||||
### 7.1 目标
|
||||
|
||||
让读者 **选择配置 → 得到可复现的粗估**(非性能承诺)。强调:**理论 FLOPs ≠ 内存是否装下 ≠ 带宽是否够 ≠ 延迟是否隐藏 ≠ 实测 MFU**。
|
||||
|
||||
### 7.2 输入控件
|
||||
|
||||
| 输入 | 范围/选项(建议默认) |
|
||||
|---|---|
|
||||
| 模型规模 \(P\) | 7B / 70B / 405B / 671B(MoE) / 2.8T(MoE) 预设 + 自定义 |
|
||||
| MoE | dense 或 \(E, K, P_{\text{act}}\) |
|
||||
| GPU 数 \(N\) | 8–8192 |
|
||||
| 并行度 | DP, TP, PP, EP, CP(自动检查乘积 = \(N\)) |
|
||||
| 精度 | BF16 / FP8 激活 / FP8 权重训练(简化开关) |
|
||||
| 序列长 \(S\) | 2K–1M(对数滑条) |
|
||||
| micro-batch / global batch | 分离 |
|
||||
| 优化器 | AdamW / Muon(状态字节系数不同) |
|
||||
| Overlap | off / partial / aggressive(仅影响 **有效通信时间模型**) |
|
||||
| Checkpoint | none / full / selective |
|
||||
| Offload | none / CPU / NVMe(容量可行但带宽惩罚) |
|
||||
|
||||
### 7.3 确定性估算输出(公式层,实现时固定版本号)
|
||||
|
||||
**A. 每卡内存(容量)**
|
||||
|
||||
\[
|
||||
M_{\text{param}} = \frac{P}{TP\cdot PP\cdot f_{\text{EP-shard}}}\, b_w,\quad
|
||||
M_{\text{grad}} \sim M_{\text{param 等价分片}},\quad
|
||||
M_{\text{opt}} = \frac{c_{\text{opt}} P}{DP\cdot \ldots}\,
|
||||
\]
|
||||
|
||||
\[
|
||||
M_{\text{act}} = g(B_{\text{local}}, S/CP, H, L, \text{ckpt}, b_{\text{act}})
|
||||
\]
|
||||
|
||||
MoE 时 \(f_{\text{EP-shard}}\) 与专家放置有关;MoonEP 模式下额外显示 **冗余专家槽 \(\sim E/R\)** 的参数副本上界(教学提示)。
|
||||
|
||||
**B. 通信体积(每步,量级)**
|
||||
|
||||
- DP:梯度 ReduceScatter/AllReduce \(\propto P/DP\) 量级
|
||||
- TP:每层 \(\propto B S H\)
|
||||
- PP:激活/梯度 P2P \(\propto B S H \cdot\) 边界层
|
||||
- EP:all-to-all \(\propto B S K d\)
|
||||
- CP:Ring/Ulysses 不同模型切换
|
||||
|
||||
**C. 流水线利用率(简化)**
|
||||
|
||||
\[
|
||||
U_{\text{pipe}} = \frac{T_{\text{compute}}}{T_{\text{compute}}+T_{\text{bubble}}+T_{\text{exposed-comm}}}
|
||||
\]
|
||||
|
||||
DualPipe 模式切换气泡系数表(来自 V3 Table 2 的 **符号化** 实现,不写死 GPU 秒)。
|
||||
|
||||
**D. 瓶颈判定(规则引擎,可解释)**
|
||||
|
||||
按以下优先级输出 **likely bottleneck**:
|
||||
|
||||
1. \(M_{\text{total}} >\) HBM → **容量**
|
||||
2. 否则若 \(T_{\text{comm,exposed}} > T_{\text{compute}}\) → **通信/延迟**
|
||||
3. 否则若 offload 带宽项主导 → **PCIe/NVMe 带宽**
|
||||
4. 否则若 \(U_{\text{pipe}} < 0.5\) → **流水线气泡**
|
||||
5. 否则 → **算力(FLOPs)受限**(仍可低 MFU 若 kernel 差——标注“本 lab 不模拟 kernel 效率”)
|
||||
|
||||
**E. 明确不承诺**
|
||||
|
||||
- 不输出真实 tokens/s
|
||||
- 不替代 NCCL 实测
|
||||
- 所有常数放入 `LAB_CONSTANTS_VERSION` JSON,便于勘误
|
||||
|
||||
### 7.4 UI 分栏
|
||||
|
||||
1. **FLOPs 面板**:理论训练 FLOPs/token、全局步 FLOPs
|
||||
2. **Memory 面板**:四栈条形图(param/grad/opt/act)
|
||||
3. **Comm 面板**:各集合通信体积与粗估时间(带宽假设可调)
|
||||
4. **Utilization 面板**:气泡、暴露通信、overlap 后有效值
|
||||
5. **Verdict**:单一瓶颈标签 + 反事实(“若把 CP×2 …”)
|
||||
|
||||
### 7.5 验收用例(确定性黄金集)
|
||||
|
||||
| 场景 | 期望 verdict 类型 |
|
||||
|---|---|
|
||||
| 70B, 8 GPU, DP=8, S=2k, Adam | 可能装下,瓶颈算力/通信视 batch |
|
||||
| 70B, 8 GPU, DP=8, S=128k, 无 CP | 激活容量或 OOM |
|
||||
| 671B MoE, 无 EP, 试图单节点 | 参数容量失败 |
|
||||
| V3-like:大 EP + DualPipe overlap on | 暴露通信 ↓,瓶颈可能转算力 |
|
||||
| K3-like:2.8T + MoonEP 静态 shape | 显示冗余专家内存上界;EP 不均项关闭 |
|
||||
| 1M + co-located RL 开关 | 额外 KV DRAM/NVMe 面板,不与纯预训练内存合并欺骗 |
|
||||
|
||||
---
|
||||
|
||||
## 8. 三十项高风险声明检查清单
|
||||
|
||||
> 写进讲义前逐条对照一手来源,勾选。
|
||||
|
||||
1. [ ] K3:**2.8T total / 104B activated**
|
||||
2. [ ] K3:1M context;训练延拓阶段(8K→…→1M)路径
|
||||
3. [ ] K3:16 of 896 routed experts;是否含 shared experts 计数
|
||||
4. [ ] K3:约 **2.5×** scaling efficiency vs K2 的定义(数据?损失?下游?)
|
||||
5. [ ] K3:KDA:MLA = 3:1 及层数 69/24
|
||||
6. [ ] MoonEP:每 rank 恰 **\(S\times K\)** tokens
|
||||
7. [ ] MoonEP:冗余专家上界 **\(E/R\)** 证明条件
|
||||
8. [ ] MoonEP vs DeepEP 缓冲 **\(S\times K\times R\) vs \(S\times K\)**
|
||||
9. [ ] fused permute/unpermute “zero-copy” 的实现边界
|
||||
10. [ ] 静态 shape 消除 per-layer host sync 的表述是否绝对
|
||||
11. [ ] Pipeline ZeRO-2 + CPU 梯度分片细节
|
||||
12. [ ] P2P Muon 正交化通信量相对 all-gather 的定量
|
||||
13. [ ] 远程激活 offload(Mooncake)与 PP rank 均衡幅度
|
||||
14. [ ] Co-located 1M RL “few hundred GPUs”
|
||||
15. [ ] External KV write-back 策略与 KDA 对齐
|
||||
16. [ ] NVMe offload 训练状态的时序(train↔rollout)
|
||||
17. [ ] Auto-throttling 所用运行时信号列表
|
||||
18. [ ] AgentENV checkpoint **133 ms** / resume **49 ms**
|
||||
19. [ ] 内存 overcommit **6.5×**
|
||||
20. [ ] 沙箱总数 **51,219,741** / images **1,505,678**
|
||||
21. [ ] V3:671B / 37B act
|
||||
22. [ ] V3:DualPipe 气泡公式与 Table 2 全符号
|
||||
23. [ ] V3:参数 2× 副本的内存影响被 EP 稀释的论证
|
||||
24. [ ] V3:跨节点 all-to-all “near-zero overhead” 条件
|
||||
25. [ ] V3:NVLink **160 GB/s**、IB **50 GB/s**、每 token ≤4 nodes
|
||||
26. [ ] V3:FP8 相对 BF16 loss error 数值
|
||||
27. [ ] V3:训练 GPU-hours(如 2.788M H800)口径
|
||||
28. [ ] V3:“无需 costly TP” 的配置前提
|
||||
29. [ ] V2:236B/21B、MLA 压缩率数字
|
||||
30. [ ] V3.2/V4:DSA/CSA 与 1M 效率数字;V4 Pro/Flash 参数量表
|
||||
|
||||
---
|
||||
|
||||
## 9. 章节叙事建议(仍非正文)
|
||||
|
||||
1. **先讲资源五量纲**,再讲并行轴,避免一上来背 DP/TP/PP。
|
||||
2. 每个谱系节点用 **“瓶颈→机制→公式→未解”** 四格,对应账本 L1–L9。
|
||||
3. DeepSeek-V3 作为 **通信-计算重叠与 FP8 的高峰课**;K3 作为 **EP 完美均衡 + 长轨迹状态栈的高峰课**。
|
||||
4. Lab 放在 DualPipe/MoonEP 之后,用同一套符号回放。
|
||||
5. 所有营销式数字进 **检查清单**,默认脚注 “作者报告,待核”。
|
||||
|
||||
---
|
||||
|
||||
## 10. 本地源与下一步核验动作
|
||||
|
||||
| 源 | 路径 |
|
||||
|---|---|
|
||||
| K3 TR | `research/sources/kimi-k3/k3_tech_report.{pdf,txt}` |
|
||||
| V3 | `research/sources/moe/2412.19437.*` |
|
||||
| V2 | `research/sources/long-context/2405.04434.*` |
|
||||
| V3.2 / V4 / KDA | `research/sources/long-context/` |
|
||||
| 方法约束 | `research/METHODOLOGY.md` · `research/GROK_RESEARCH_ROADMAP.md` M15 |
|
||||
|
||||
**建议下一步(写作前)**:
|
||||
|
||||
1. 精读 K3 §5 与附录 E,抽出 MoonEP 伪代码级步骤。
|
||||
2. 精读 V3 §3.2–3.3,重绘 DualPipe 时间图与 Table 2。
|
||||
3. 补下缺失系统 PDF:ZeRO、Megatron 3D、GPipe、Ring、Ulysses、FSDP、MegaBlocks。
|
||||
4. 实现 Lab 常数表 v0,用黄金场景锁定确定性输出。
|
||||
5. 将本包中每条“高风险”映射到站点脚注 ID。
|
||||
|
||||
---
|
||||
|
||||
*本文件为 research leads only:不替代一手论文,不直接作为站点事实来源。*
|
||||
File diff suppressed because it is too large
Load Diff
Reference in New Issue
Block a user