Files
llm-atlas/research/TRAINING_SYSTEMS_GROK_LEADS.md
2026-07-29 01:03:15 +08:00

35 KiB
Raw Permalink Blame History

大规模 LLM 训练系统研究线索包(Grok Research Leads

证据等级:未核验候选线索。 本文件由 Grok CLI 生成,只用于扩展检索面,不是正式研究账本,也不能直接作为课程事实来源。
定位:课程章节用 research-leads packet,非定稿讲义。所有数字与机制均须由主研究流程对照一手论文/官方报告核验后,才能写入正式账本与站点。
锚点Kimi K3arXiv:2607.24653)系统栈 · 高亮 DeepSeek 谱系V2→V3→V3.2→V4
组织原则:按 因果账本(causal ledger 切分,而非按论文列表堆叠。每条账本回答:先前瓶颈 → 机制 → 可教公式 → 解决什么 → 遗留什么 → 一手 URL → 高风险声明。
生成日期2026-07-29 · 本地一手文本:research/sources/kimi-k3/research/sources/moe/research/sources/long-context/


0. 读包须知

0.1 五个必须分开的资源量纲

量纲 教学定义 典型单位 常见混淆
训练 FLOPs 前向+反向算术量(与实现无关的“理论算力需求”) FLOP / token 与 GPU 峰值 FLOP/s 混为一谈
内存容量 参数/梯度/优化器/激活/KV 能否放进 HBM Byte / GPU 与带宽瓶颈混淆
带宽 HBM / NVLink / IB / PCIe 吞吐 GB/s 或 Gbps 与延迟混淆
延迟 小消息/同步/调度/气泡时间 µsms 大消息时仍可能被带宽主导
实现利用率 MFU / HFU / 流水线利用率 / 通信隐藏率 % 用“理论 FLOPs 很高”代替实测

0.2 并行度符号(全包统一)

  • (N_{\text{gpu}}):总 GPU 数
  • (DP, TP, PP, EP, CP)(或 SP):数据/张量/流水线/专家/上下文并行度
  • 通常 (N_{\text{gpu}} = DP \times TP \times PP \times EP \times CP)(若某维未启用则取 1;实现上可能有共享/正交约束)
  • (P):总参数量;(P_{\text{act}})MoE 每 token 激活参数量
  • (B, S, H, L)global micro-batch 相关 batch、序列长、hidden、层数
  • (b)bytes/elementBF16=2, FP8=1, FP32=4
  • (K):每 token 选中的专家数;(E):专家总数;(R):EP 规模

0.3 因果账本索引(九大账本)

ID 账本 核心矛盾
L1 模型状态内存 参数+梯度+优化器状态的冗余与分片
L2 激活内存 反向依赖的中间张量 vs 重计算/卸载/并行切分
L3 计算划分 层内/层间如何切矩阵与序列
L4 流水线气泡 PP 调度空闲 vs 微批与通信重叠
L5 集合通信 AllReduce/AllGather/ReduceScatter/All-to-All 体积与拓扑
L6 MoE/专家派发 负载不均、动态 shape、dispatch/combine
L7 长上下文状态 序列维并行、线性/混合注意力状态、KV 外置
L8 数值与优化器状态 低精度、Muon/Adam 分片、主权重
L9 可靠性/弹性 故障、弹性训练、agentic RL 沙箱与长轨迹状态

1. 九大因果账本(主文)

L1 · 模型状态内存(Parameter / Gradient / Optimizer

字段 内容
先前瓶颈 朴素 DP:每卡完整 (P) 参数 + 梯度 + 优化器;Adam 常见 (\approx 16P) bytesBF16 参数/梯度 + FP32 主权重 + 2×FP32 矩)。大模型先 OOM 在“状态”而非激活。
机制演进 DDP/AllReduce → ZeRO-1/2/3 分片 → FSDP 单元化 → PP 下 Pipeline ZeRO-2 + CPU/NVMe offloadK3
可教方程 朴素 DP 每卡模型状态 (\approx (2+2+K_{\text{opt}}),P,b_{\text{eff}})ZeRO-3(\approx (2+2+K_{\text{opt}}),P,b_{\text{eff}}/DP)。Adam 常取 (K_{\text{opt}}=12)(两矩 FP32+ 主权重 FP32 等,具体字节必须按实现表核对
解决 模型规模可随设备数近似线性扩展;FSDP 与框架深度集成。
未解 分片引入 AllGather/ReduceScatter;与 TP/EP 正交时通信图复杂;offload 把瓶颈从容量推到 PCIe/NVMe 带宽。
一手 URL ZeRO https://arxiv.org/abs/1910.02054 · FSDP https://arxiv.org/abs/2304.11277
高风险声明 “16P 公式”依赖精度与是否存主权重;K3 “Pipeline ZeRO-2 + CPU 梯度分片”细节以报告 §5.2.2 为准。

L2 · 激活内存(Activation / Checkpoint / Offload

字段 内容
先前瓶颈 反向需要前向激活;长序列下激活 (\propto B\cdot S\cdot H\cdot L) 超过参数状态。
机制演进 Gradient checkpointing → Selective recomputeMegatron)→ Sequence/Context parallel 切激活 → 统一激活管理器(策略可插拔:recompute / quant / offload)→ 跨 PP 远程激活 offloadK3 Mooncake
可教方程 粗估激活(每层、无 checkpoint):(\mathcal{O}(B S H)) 量级;attention 另有 (\mathcal{O}(B H S^2)) 或 Flash 下 (\mathcal{O}(B H S)) 工作集。课程应用“量级 + 重计算比例”而非单一闭式。
解决 用时间换空间;SP/CP 把序列维激活摊到多卡;FP8 激活缓存(V3)显著降存。
未解 重计算增加 FLOPs 与调度复杂度;远程 offload 引入跨卡带宽竞争;与 DualPipe 双向流水线的峰值激活耦合。
一手 URL Checkpointing 经典:https://arxiv.org/abs/1604.06174 · Selective recompute+SPhttps://arxiv.org/abs/2205.05198 · V3 内存节:https://arxiv.org/abs/2412.19437 · K3 §5.2.2
高风险声明 “FlashAttention 消除激活内存”是错误表述——它降低注意力中间写回 HBM 的峰值,不等于整网激活为零。

L3 · 计算划分(TP / 3D / 层内切分)

字段 内容
先前瓶颈 单层权重无法装入单卡;纯 PP 气泡大;纯 DP 状态冗余。
机制演进 Megatron 层内 TP(列/行并行)→ 与 PP+DP 组成 3D mesh → 与 SP 绑定 → MoE 时 TP 可被 EP+内存优化替代(V3 声称可无昂贵 TP)
可教方程 Linear 列并行:(Y=XW)(W) 按列切 (TP) 份,前向 AllReduce 或与后层 row-parallel 配对;通信体积 (\propto B S H \cdot b) 每层对。
解决 层内并行通信多为机内 NVLink 友好;与 PP 正交。
未解 TP 度受节点内 GPU 数限制;过大 TP 通信/计算比变差;与 EP all-to-all 叠加时 SM 争用。
一手 URL Megatron-LM https://arxiv.org/abs/1909.08053 · 3D 规模训练 https://arxiv.org/abs/2104.04473
高风险声明 V3 “without costly TP” 指其配置下可不依赖大 TP,断言 TP 已过时。

L4 · 流水线气泡(PP Bubbles / Schedules

字段 内容
先前瓶颈 GPipe 同步 F-then-B:气泡 (\propto (PP-1));微批不足时利用率崩溃。
机制演进 GPipe → PipeDream/1F1B → interleaved 1F1B → ZeroBubble(拆 W/B)→ Chimera 双向 → DualPipeV3,双向 + 前反向与 all-to-all 重叠)→ K3 interleaved 1F1B + 激活跨 rank 均衡
可教方程(V3 Table 2 形式,须原表核对) 1F1B 气泡 (\propto (PP-1)(F+B))ZB1P (\propto (PP-1)(F+B-2W))DualPipe (\propto (PP/2-1)(F&B + B - 3W)),参数副本 2×,激活 (\sim PP+1)。
解决 降低空闲;DualPipe 专门对 MoE all-to-all 做 chunk 级重叠。
未解 DualPipe 参数双份;调度实现复杂;与 EP 负载不均交互;多模态 encoder 仍可能暴露在关键路径(K3 用 bubble 填充 ViT)。
一手 URL GPipe https://arxiv.org/abs/1811.06965 · PipeDream https://arxiv.org/abs/1806.03377 · ZeroBubble https://arxiv.org/abs/2401.10241 · DualPipeV3 内)https://arxiv.org/abs/2412.19437 · 实现 https://github.com/deepseek-ai/DualPipe
高风险声明 DualPipe 气泡公式符号 (F&B) 含义(重叠后的墙钟)易被误读为简单相加;必须对照 Figure 4–5。

L5 · 集合通信(Collectives

字段 内容
先前瓶颈 大规模 AllReduce 成为 DP 上限;MoE All-to-All 跨节点更糟。
机制演进 Ring/Tree AllReduce → hierarchical → ReduceScatter+AllGatherZeRO/FSDP)→ IB+NVLink 分层 all-to-allDeepEP/V3)→ 通信-计算 overlap + 少 SM 通信核 → MoonEP 静态 shape + 固定缓冲
可教方程 AllReduce 体积(ring(\approx 2\frac{N-1}{N}M)ZeRO-3 参数 AllGather 体积与分片策略相关;MoE dispatch 粗估 (\propto B S K \cdot d_{\text{expert}} \cdot b) 跨 EP 组。
解决 分层拓扑利用 NVLink/IB 差;overlap 使“通信时间”从墙钟中消失(条件:算力足够)。
未解 小消息延迟主导;拓扑不匹配时 hybrid mesh 次优;overlap 依赖手写 schedule。
一手 URL Horovod/Baidu ring 背景可读 https://arxiv.org/abs/1802.05799 · DeepEP https://github.com/deepseek-ai/DeepEP · V3 §3.2.2
高风险声明 V3 “near-zero all-to-all overhead” 是 在 DualPipe 重叠 + 恒定 compute/comm 比 条件下的工程主张,非通信体积为零。

L6 · MoE / 专家派发(Expert Parallelism

字段 内容
先前瓶颈 稠密扩展不经济;稀疏后出现路由不均、动态 shape、all-to-all、辅损干扰主损。
机制演进 GShard/Switch → DeepSpeed-MoE / Tutel → MegaBlocks(块稀疏)→ DeepSeekMoE 细粒度 → aux-loss-free → DeepEP → MoonEP 动态冗余专家 + 完美均衡
可教方程 每 token 激活参数 (P_{\text{act}} \ll P);理想每 rank token 数 (S\times K)MoonEP 强制);冗余专家上界 (E/R) per rankK3 证明,附录 E)。DeepEP 最坏缓冲 (S\times K\times R) vs MoonEP 固定 (S\times K)。
解决 容量扩展;MoonEP 消除负载不均与动态 shape 导致的 host syncfused permute/unpermute 零拷贝。
未解 冗余专家迁移/预取开销;规划近优非精确最优;与多模态视觉负载叠加;路由质量 vs 系统均衡的张力。
一手 URL GShard https://arxiv.org/abs/2006.16668 · Switch https://arxiv.org/abs/2101.03961 · MegaBlocks https://arxiv.org/abs/2211.15841 · DeepSpeed-MoE https://arxiv.org/abs/2201.05596 · DeepSeekMoE https://arxiv.org/abs/2401.06066 · V2 https://arxiv.org/abs/2405.04434 · V3 https://arxiv.org/abs/2412.19437 · LatentMoE https://arxiv.org/abs/2601.18089 · K3 MoonEP https://arxiv.org/abs/2607.24653 · https://github.com/MoonshotAI/MoonEP
高风险声明 K3 “perfect balance” 指 每 rank token 数相同,不表示每 expert 内 token 均匀;rank 内仍需 workload-aware GEMM 调度。

L7 · 长上下文状态(Context / Sequence Parallel · Hybrid State

字段 内容
先前瓶颈 Softmax 注意力算存 (\propto S^2);单卡序列装不下;线性注意力有固定状态但并行模式不同。
机制演进 Megatron SP(与 TP 共)→ Ring Attention → DeepSpeed-Ulysses → USP 统一 → CP 成为独立轴 → MLA 压 KV → DSA 稀疏选 → KDA CP + hybrid KDA/MLA 双缓存管理
可教方程 Ring:块在环上传递,通信 (\propto) 块数;Ulysses:序列切 + head 维 all-to-all,通信与 head 数相关。KDA:状态尺寸与 (S) 解耦(固定 recurrent state);MLA KV 仍 (\propto S)。
解决 百万级训练可行;混合架构下“全局层 + 高效层”协同。
未解 Hybrid 前缀缓存一致性;CP 与 EP/PP 组合的 mesh 搜索;视觉长序列 encoder 不均衡(K3 dynamic CP)。
一手 URL Megatron SP https://arxiv.org/abs/2205.05198 · Ring https://arxiv.org/abs/2310.01889 · Ulysses https://arxiv.org/abs/2309.14509 · USP https://arxiv.org/abs/2405.07719 · MLA/V2 https://arxiv.org/abs/2405.04434 · KDA https://arxiv.org/abs/2510.26692 · V3.2 DSA https://arxiv.org/abs/2512.02556 · V4 https://arxiv.org/abs/2606.19348 · K3 §5.1
高风险声明 “1M context” 训练/推理/RL 代价结构完全不同;不可用推理 demo 反推训练 MFU。

L8 · 数值与优化器状态(Precision / Optimizer

字段 内容
先前瓶颈 BF16 仍吃带宽与存储;Adam 状态巨大;新优化器(Muon)需要整矩阵正交化通信。
机制演进 Mixed precision → FP8 训练(V3 fine-grained)→ 优化器状态 BF16/分片 → Muon/MuonClip → Per-head Muon + P2P 正交化(K3)→ 部署侧 MXFP4 QAT
可教方程 低精度收益:算力峰值↑、激活/权重存储↓;误差需用 scale/tile 策略控制。Muon 正交化:朴素 all-gather 全参 vs P2P 只取本地拥有分片。
解决 V3 级 FP8 大规模验证;K3 降 Muon 通信与峰值内存。
未解 FP8 对部分算子仍需高精度;QAT 与训练精度路径不同;Muon 与 Adam 的可复现对比依赖实现。
一手 URL FP8 formats https://arxiv.org/abs/2209.05433 · V3 FP8 §3.3 https://arxiv.org/abs/2412.19437 · Muon scalable https://arxiv.org/abs/2502.16982 · K2 https://arxiv.org/abs/2507.20534 · K3 §2.5/§5.2.2 · MX https://arxiv.org/abs/2310.10537
高风险声明 “FP8 训练 = 无精度损失”不成立;V3 报告给的是相对 loss error 量级,需读附录 B。

L9 · 可靠性 / 弹性 / Agentic RL 状态

字段 内容
先前瓶颈 大规模训练故障率;长轨迹 RL 的 KV/环境状态比模型权重更“重”;容器隔离不足。
机制演进 检查点/弹性(经典)→ 分离式 vs co-located RL → partial rollout → external KV pool + NVMe 腾挪训练状态 → auto-throttling → AgentENV microVMcheckpoint/fork/pause
可教方程 不讲单一公式;强调 状态对象policy 权重、优化器、KV/KDA state、sandbox 脏页、未完成 trajectory。墙钟 = max(训练步, rollout, 环境)。
解决 数百卡级 1M agentic RL 可行(K3 主张);沙箱高密度与可恢复。
未解 训练/rollout 资源争用;KV 写回策略权衡;安全与高保真探索的张力;数字(沙箱次数等)需原表核对。
一手 URL K3 §5.3 https://arxiv.org/abs/2607.24653 · AgentENV https://github.com/kvcache-ai/AgentENV · Firecracker 背景(报告引用)
高风险声明 “few hundred GPUs” 每实验、checkpoint 133ms/49ms、51M+ sandboxes 等均为 作者报告数字,课程必须标注来源章节。

2. 必讲谱系(因果链,非编年堆叠)

数据并行 + AllReduce
        │
        ▼
Megatron 张量并行 (层内)
        │
        ▼
GPipe → PipeDream/1F1B → ZeroBubble / interleaved
        │
        ▼
ZeRO 分片阶段 → FSDP
        │
        ▼
Sequence Parallel (与 TP 协同降激活)
        │
        ▼
3D Parallel (DP×TP×PP mesh)
        │
        ▼
Expert Parallel + MegaBlocks + DeepSpeed-MoE
        │
        ▼
Context Parallel / Ring Attention / Ulysses (/USP)
        │
        ▼
CommunicationComputation Overlap(通用工程)
        │
        ▼
DeepSeek-V3: DualPipe + DeepEP + FP8 + 细粒度 MoE
        │
        ▼
Kimi K2 / K2.5 RL 与 infra 积淀
        │
        ▼
Kimi K3: MoonEP + 静态 shape + 冗余专家 + fused permute
        + 1M co-located agentic RL + external KV + NVMe
        + adaptive throttling + AgentENV

2.1 谱系节点卡片(精简)

节点 先前瓶颈 机制一句话 一手 URL
DP/AllReduce 单卡算力不够 复制模型,梯度同步 经典 DDP/Horovod 文献;PyTorch DDP 文档
Megatron TP 层太大 矩阵切分 + 成对通信 https://arxiv.org/abs/1909.08053
GPipe 深度装不下 层切 + 微批流水 https://arxiv.org/abs/1811.06965
PipeDream/1F1B GPipe 气泡 交错 F/B https://arxiv.org/abs/1806.03377
ZeRO DP 状态冗余 分片 OS/G/P https://arxiv.org/abs/1910.02054
FSDP ZeRO 工业化 单元化分片 + 框架集成 https://arxiv.org/abs/2304.11277
Sequence Parallel TP 区外激活仍大 序列维切 Norm/Dropout 等 https://arxiv.org/abs/2205.05198
3D Parallel 单轴不够 mesh 组合 https://arxiv.org/abs/2104.04473
EP / MegaBlocks / DS-MoE 稠密不经济 专家分卡 + 块稀疏核 MegaBlocks https://arxiv.org/abs/2211.15841 · DS-MoE https://arxiv.org/abs/2201.05596
CP/Ring/Ulysses 长序列 序列并行注意力 Ring https://arxiv.org/abs/2310.01889 · Ulysses https://arxiv.org/abs/2309.14509
Overlap 通信墙钟暴露 双流/双流水/手写 schedule 多源;V3 DualPipe 为高峰
DualPipe/DeepEP MoE+PP 通信比≈1 双向 PP + 定制 all-to-all https://arxiv.org/abs/2412.19437 · https://github.com/deepseek-ai/DeepEP
MoonEP + 1M RL EP 不均 + 长轨迹状态 冗余专家完美均衡 + 外置 KV/沙箱 https://arxiv.org/abs/2607.24653

3. 2017–2026 候选一手文献时间线(≥45)

标注 [TR] 技术报告,[SYS] 系统论文,[ARCH] 架构/算法但系统相关,[LIB] 官方库/核。
状态:候选 = 章节可引用但须下载核对;本地已有 = research/sources/ 已有 PDF/TXT。

# 条目 类型 URL 账本
1 2017 Attention Is All You Need ARCH https://arxiv.org/abs/1706.03762 L3/L7 基线
2 2016/17 Gradient Checkpointing (Training Deep Nets with Sublinear Memory) SYS https://arxiv.org/abs/1604.06174 L2
3 2018 GPipe SYS https://arxiv.org/abs/1811.06965 L4
4 2018 PipeDream SYS https://arxiv.org/abs/1806.03377 L4
5 2018 Megatron-LM (intra-layer MP) SYS https://arxiv.org/abs/1909.08053 L3
6 2019 ZeRO SYS https://arxiv.org/abs/1910.02054 L1
7 2019 Mesh-TensorFlow / 相关模型并行 SYS https://arxiv.org/abs/1811.02084 L3
8 2019 Mixed Precision Training SYS https://arxiv.org/abs/1710.03740 L8
9 2020 GShard ARCH/SYS https://arxiv.org/abs/2006.16668 L6 · 本地 moe
10 2020 GPT-3(规模叙事) TR https://arxiv.org/abs/2005.14165 动机
11 2020 ZeRO-Offload SYS https://arxiv.org/abs/2101.06840 L1/L9
12 2021 Switch Transformer ARCH https://arxiv.org/abs/2101.03961 L6 · 本地
13 2021 Efficient Large-Scale LM Training (Megatron 3D) SYS https://arxiv.org/abs/2104.04473 L3/L4/L5
14 2021 ZeRO-Infinity SYS https://arxiv.org/abs/2104.07857 L1/L9
15 2021 Chimera (bidirectional PP) SYS https://arxiv.org/abs/2107.06925 L4
16 2021 FairScale / FSDP 早期实践 SYS 文档+后继论文 L1
17 2022 DeepSpeed-MoE SYS https://arxiv.org/abs/2201.05596 L6
18 2022 Reducing Activation Recomputation (SP + selective) SYS https://arxiv.org/abs/2205.05198 L2/L3
19 2022 FlashAttention SYS https://arxiv.org/abs/2205.14135 L2/L7 · 本地
20 2022 Pathways / 相关大规模编排(可选) SYS https://arxiv.org/abs/2203.12533 L9
21 2022 Overlap 相关:Varuna / 等(可选对比) SYS https://arxiv.org/abs/2111.04007 L4/L5
22 2022 Tutel MoE system SYS https://arxiv.org/abs/2206.03382 L6
23 2022/23 MegaBlocks SYS https://arxiv.org/abs/2211.15841 L6
24 2023 PyTorch FSDP Experiences SYS https://arxiv.org/abs/2304.11277 L1
25 2023 FlashAttention-2 SYS https://arxiv.org/abs/2307.08691 L2/L7
26 2023 DeepSpeed-Ulysses SYS https://arxiv.org/abs/2309.14509 L7
27 2023 Ring Attention SYS https://arxiv.org/abs/2310.01889 L7
28 2023 Zero Bubble PP SYS https://arxiv.org/abs/2401.10241 L4
29 2023 FP8 Formats for Deep Learning SYS https://arxiv.org/abs/2209.05433 L8
30 2024 DeepSeekMoE ARCH https://arxiv.org/abs/2401.06066 L6 · 本地
31 2024 DeepSeek-V2MLA + DeepSeekMoE TR https://arxiv.org/abs/2405.04434 L6/L7 · 本地
32 2024 USP Unified Sequence Parallelism SYS https://arxiv.org/abs/2405.07719 L7
33 2024 DeepSeek-V3 TR https://arxiv.org/abs/2412.19437 L4/L5/L6/L8 · 本地
34 2024 Aux-loss-free balancingV3 内 + 相关) ARCH V3 报告内 L6
35 2024 Llama 3 Herd(规模系统侧写) TR https://arxiv.org/abs/2407.21783 对比
36 2024 OCP Microscaling (MX) SYS https://arxiv.org/abs/2310.10537 L8
37 2025 DeepEP library LIB https://github.com/deepseek-ai/DeepEP L5/L6
38 2025 DualPipe library LIB https://github.com/deepseek-ai/DualPipe L4
39 2025 DeepSeek-R1 TR https://arxiv.org/abs/2501.12948 L9 RL 背景 · 本地 reasoning
40 2025 Kimi K2 TR https://arxiv.org/abs/2507.20534 前驱 · 本地
41 2025 Muon is Scalable for LLM Training ARCH https://arxiv.org/abs/2502.16982 L8
42 2025 Kimi Linear / KDA ARCH https://arxiv.org/abs/2510.26692 L7 · 本地
43 2025 DeepSeek-V3.2DSA 等) TR https://arxiv.org/abs/2512.02556 L7 · 本地
44 2025/26 LatentMoE ARCH https://arxiv.org/abs/2601.18089 L6 · 本地
45 2026 Kimi K2.5 TR https://arxiv.org/abs/2602.02276 多模态/RL infra · 本地
46 2026 Attention Residuals ARCH https://arxiv.org/abs/2603.15031 L2/L3(深度连接)
47 2026 DeepSeek-V4 TR https://arxiv.org/abs/2606.19348 L7 · 本地
48 2026 Kimi K3 TR https://arxiv.org/abs/2607.24653 L1L9 锚点 · 本地
49 2026 MoonEP LIB https://github.com/MoonshotAI/MoonEP L6
50 2026 AgentENV LIB https://github.com/kvcache-ai/AgentENV L9

补强候选(可选扩到 60+ByteScheduler、TeraPipe、Alpa、Mobius、FlexFlow、MiCS、AMP、DistFlashAttn、LoongTrain、Echo/UltraEPK3 对比引用)、Mooncake Transfer Engine、SonicMoE、Firecracker 论文、OSWorld/SWE-bench 环境论文(RL 环境侧)。


4. DeepSeek 谱系特写(V2 → V4

4.1 DeepSeek-V2 — 经济稀疏 + MLA

线索
一手 https://arxiv.org/abs/2405.04434 · 本地 2405.04434
系统相关点 MLA 降 KVDeepSeekMoE 细粒度专家;训练/推理成本叙事
高风险数字 236B total / 21B act128K context;训练成本对比须回表
未解决(留给 V3 跨节点 EP 通信墙;更大规模 FP8;PP+MoE 重叠

4.2 DeepSeek-V3 — DualPipe / DeepEP / FP8 峰值

线索
一手 https://arxiv.org/abs/2412.19437 · 本地 2412.19437
DualPipe 前/后向 chunk 拆为 attention · dispatch · MLP · combine;双向灌微批;与 ZeroBubble 的 W 分离结合;通信隐藏是目标函数
DeepEP / 跨节点 A2A IB 跨节点 + NVLink 节点内转发;限制每 token 最多 4 nodes 等 拓扑共设计(数字须核原文)
内存 无昂贵 TP 的可行性主张;EMA on CPUMTP 共享 embed/head
FP8 fine-grained tile quant;激活 FP8 缓存;关键路径保持高精度
高风险 2.788M H800 GPU hours、相对 loss error、NVLink 160GB/s vs IB 50GB/s、comm:comp≈1:1 等
遗留 EP 负载动态 shape;冗余专家/静态 shape 未做“完美均衡”;长上下文算法侧留给 V3.2/V4

4.3 DeepSeek-V3.2 — 稀疏注意力与系统接口

线索
一手 https://arxiv.org/abs/2512.02556 · 本地 2512.02556 · HF PDF 镜像亦常见
系统含义 DSA + indexer 改变 attention 算子形状与 KV 访问模式;训练/推理内核与 CP 策略需重估
高风险 “frontier open” 基准数字;与 V3 训练栈差异是否充分披露

4.4 DeepSeek-V4 — 百万上下文效率

线索
一手 https://arxiv.org/abs/2606.19348 · 本地 2606.19348
系统含义 1M 上下文下 KV/算力效率(CSA 等);MoE 规模再扩(Pro/Flash 参数量 须核表
与 K3 对照教学 两边都打 1M,但 注意力混合策略、EP 库、RL infra 路径不同——适合做“同目标异栈”对比课

4.5 DeepSeek → Kimi 系统对照(备课用)

维度 DeepSeek-V3 栈 Kimi K3 栈
PP DualPipe 双向 + 重叠 interleaved 1F1B + 远程激活均衡 + bubble 填 ViT
EP 通信 DeepEP 风格 all-to-all MoonEP:冗余专家 + 完美 token 均衡
Shape 动态 expert token 静态 (S\times K)
缓冲 最坏 (S\times K\times R)K3 对比叙述) 固定 (S\times K)
精度 FP8 训练验证 训练 FP8 激活策略 + 部署 MXFP4 QAT
长上下文 MLA / 后继 DSA / V4 KDA+Gated MLA hybrid + KCP
后训练 R1 等 co-located 1M agentic RL + AgentENV

5. Kimi K3 系统特写(MoonEP 与 1M RL

一手https://arxiv.org/abs/2607.24653 · 本地 research/sources/kimi-k3/k3_tech_report.txt §5

5.1 MoonEP(§5.2.1

子题 线索(待核)
动机 EP rank 间 token 不均 → 吞吐下降;动态 shape → 显存碎片 + 每层 host-device sync
机制 在线规划 dynamic redundant experts;前向预取;反向本地 reduce buffer 再归还 home rank
理论 存在均衡方案且每 rank 冗余专家 (\le E/R);界近乎紧(附录 E)
通信 fused permute/unpermute;规划核预计算 destination;零拷贝 view
静态 shape 每 rank 恰 (S\times K) tokens → 无需 per-layer 同步取 shape
对比 DeepEP 流程兼容但加规划/迁移;ECHO/UltraEP 固定 cap 可能规划失败
遗留 rank 内 expert 倾斜仍需 GEMM scheduler;规划近似
开源 https://github.com/MoonshotAI/MoonEP

5.2 内存高效训练(§5.2.2

  • 统一激活管理器:recompute / quant / offload 可组合策略
  • MoE:改写 permuted probs 梯度依赖(SonicMoE 启发);dispatch 重计算重叠
  • Block AttnRescheckpoint 包装使激活与标准 residual 同阶
  • 跨 PP 远程 offloadMooncake)均衡 interleaved 1F1B 激活倾斜
  • Pipeline ZeRO-2 + CPU 梯度分片
  • Muon:P2P 取分片做正交化,避免全参 all-gather

5.3 多模态 encoder(§5.2.3

  • Dynamic CP:大图 patch 维切分 + gather-KV
  • ViT 算力塞进 PP bubbles(继承/扩展 K2.5 DEP

5.4 1M Agentic RL(§5.3)— 专章必讲

机制 解决的瓶颈 高风险数字/表述
Co-located RL 分离式集群切换与冗余副本 “few hundred GPUs”/实验
Partial rollouts 超长轨迹尾延迟 与前缀命中交互
External KV pool 1M 多步前缀未命中极贵 写回 vs write-through
KDA+MLA 生命周期对齐 双缓存必须联合恢复 实现复杂度
NVMe offload 训练状态 给 CPU DRAM 腾 KV 池 与训练步交替
Adaptive throttling 固定并发早期浪费/后期抢占 信号:active/queued/KV util
Gradient-buffer reuse 参考模型前向显存 与 ZeRO-2 双缓冲预取
AgentENV 容器隔离不够、长生命环境 133ms/49ms ckpt6.5× overcommit51,219,741 sandboxes / 1,505,678 images
开源 https://github.com/kvcache-ai/AgentENV

5.5 与 K2 / K2.5 的系统衔接

模型 URL 系统备课点
Kimi K2 https://arxiv.org/abs/2507.20534 1T MoE、agentic 基座、MuonClip、大规模 post-train
Kimi K2.5 https://arxiv.org/abs/2602.02276 原生多模态、Agent Swarm、DEP 等 encoder 调度
Kimi K3 https://arxiv.org/abs/2607.24653 2.8T、MoonEP、1M RL 状态栈

6. 建议原创图(810 张)

# 图名 教学功能 关键元素
D1 九账本因果地图 全章导航 账本节点 + 依赖箭头 + DeepSeek/K3 高亮
D2 单卡内存栈爆炸图 L1+L2 参数/梯度/优化器/激活/临时工作区;ZeRO 前后对比
D3 3D mesh + EP/CP 扩展 L3/L6/L7 五维并行立方体;合法组合约束脚注
D4 PP 调度对比条带图 L4 GPipe / 1F1B / ZeroBubble / DualPipe 并排时间轴
D5 通信体积 vs 拓扑 L5 AllReduce / AG+RS / All-to-AllNVLink vs IB 分层
D6 MoE dispatch 数据路径 L6 token→router→dispatch→experts→combineDeepEP vs MoonEP 缓冲尺寸标注
D7 MoonEP 冗余专家规划示意 L6 不均路由 → 冗余副本放置 → 每 rank (S\times K)
D8 DualPipe 四段重叠 L4/L5 Attention∥comm、dispatch、MLP、combine;双向微批
D9 Hybrid KDAMLA 双状态 L7 固定 KDA state + 增长 MLA KVCP 切分方式
D10 1M Agentic RL 状态机 L9 GPU KV ↔ CPU external pool ↔ NVMe 训练状态;AgentENV pause/forkthrottling 反馈环

7. 确定性交互实验(Training Systems Lab

7.1 目标

让读者 选择配置 → 得到可复现的粗估(非性能承诺)。强调:理论 FLOPs ≠ 内存是否装下 ≠ 带宽是否够 ≠ 延迟是否隐藏 ≠ 实测 MFU

7.2 输入控件

输入 范围/选项(建议默认)
模型规模 (P) 7B / 70B / 405B / 671B(MoE) / 2.8T(MoE) 预设 + 自定义
MoE dense 或 (E, K, P_{\text{act}})
GPU 数 (N) 88192
并行度 DP, TP, PP, EP, CP(自动检查乘积 = (N)
精度 BF16 / FP8 激活 / FP8 权重训练(简化开关)
序列长 (S) 2K1M(对数滑条)
micro-batch / global batch 分离
优化器 AdamW / Muon(状态字节系数不同)
Overlap off / partial / aggressive(仅影响 有效通信时间模型
Checkpoint none / full / selective
Offload none / CPU / NVMe(容量可行但带宽惩罚)

7.3 确定性估算输出(公式层,实现时固定版本号)

A. 每卡内存(容量)

[ M_{\text{param}} = \frac{P}{TP\cdot PP\cdot f_{\text{EP-shard}}}, b_w,\quad M_{\text{grad}} \sim M_{\text{param 等价分片}},\quad M_{\text{opt}} = \frac{c_{\text{opt}} P}{DP\cdot \ldots}, ]

[ M_{\text{act}} = g(B_{\text{local}}, S/CP, H, L, \text{ckpt}, b_{\text{act}}) ]

MoE 时 (f_{\text{EP-shard}}) 与专家放置有关;MoonEP 模式下额外显示 冗余专家槽 (\sim E/R) 的参数副本上界(教学提示)。

B. 通信体积(每步,量级)

  • DP:梯度 ReduceScatter/AllReduce (\propto P/DP) 量级
  • TP:每层 (\propto B S H)
  • PP:激活/梯度 P2P (\propto B S H \cdot) 边界层
  • EPall-to-all (\propto B S K d)
  • CPRing/Ulysses 不同模型切换

C. 流水线利用率(简化)

[ U_{\text{pipe}} = \frac{T_{\text{compute}}}{T_{\text{compute}}+T_{\text{bubble}}+T_{\text{exposed-comm}}} ]

DualPipe 模式切换气泡系数表(来自 V3 Table 2 的 符号化 实现,不写死 GPU 秒)。

D. 瓶颈判定(规则引擎,可解释)

按以下优先级输出 likely bottleneck

  1. (M_{\text{total}} >) HBM → 容量
  2. 否则若 (T_{\text{comm,exposed}} > T_{\text{compute}}) → 通信/延迟
  3. 否则若 offload 带宽项主导 → PCIe/NVMe 带宽
  4. 否则若 (U_{\text{pipe}} < 0.5) → 流水线气泡
  5. 否则 → 算力(FLOPs)受限(仍可低 MFU 若 kernel 差——标注“本 lab 不模拟 kernel 效率”)

E. 明确不承诺

  • 不输出真实 tokens/s
  • 不替代 NCCL 实测
  • 所有常数放入 LAB_CONSTANTS_VERSION JSON,便于勘误

7.4 UI 分栏

  1. FLOPs 面板:理论训练 FLOPs/token、全局步 FLOPs
  2. Memory 面板:四栈条形图(param/grad/opt/act
  3. Comm 面板:各集合通信体积与粗估时间(带宽假设可调)
  4. Utilization 面板:气泡、暴露通信、overlap 后有效值
  5. Verdict:单一瓶颈标签 + 反事实(“若把 CP×2 …”)

7.5 验收用例(确定性黄金集)

场景 期望 verdict 类型
70B, 8 GPU, DP=8, S=2k, Adam 可能装下,瓶颈算力/通信视 batch
70B, 8 GPU, DP=8, S=128k, 无 CP 激活容量或 OOM
671B MoE, 无 EP, 试图单节点 参数容量失败
V3-like:大 EP + DualPipe overlap on 暴露通信 ↓,瓶颈可能转算力
K3-like2.8T + MoonEP 静态 shape 显示冗余专家内存上界;EP 不均项关闭
1M + co-located RL 开关 额外 KV DRAM/NVMe 面板,不与纯预训练内存合并欺骗

8. 三十项高风险声明检查清单

写进讲义前逐条对照一手来源,勾选。

  1. K32.8T total / 104B activated
  2. K31M context;训练延拓阶段(8K→…→1M)路径
  3. K316 of 896 routed experts;是否含 shared experts 计数
  4. K3:约 2.5× scaling efficiency vs K2 的定义(数据?损失?下游?)
  5. K3KDA:MLA = 3:1 及层数 69/24
  6. MoonEP:每 rank 恰 (S\times K) tokens
  7. MoonEP:冗余专家上界 (E/R) 证明条件
  8. MoonEP vs DeepEP 缓冲 (S\times K\times R) vs (S\times K)
  9. fused permute/unpermute “zero-copy” 的实现边界
  10. 静态 shape 消除 per-layer host sync 的表述是否绝对
  11. Pipeline ZeRO-2 + CPU 梯度分片细节
  12. P2P Muon 正交化通信量相对 all-gather 的定量
  13. 远程激活 offloadMooncake)与 PP rank 均衡幅度
  14. Co-located 1M RL “few hundred GPUs”
  15. External KV write-back 策略与 KDA 对齐
  16. NVMe offload 训练状态的时序(train↔rollout
  17. Auto-throttling 所用运行时信号列表
  18. AgentENV checkpoint 133 ms / resume 49 ms
  19. 内存 overcommit 6.5×
  20. 沙箱总数 51,219,741 / images 1,505,678
  21. V3671B / 37B act
  22. V3DualPipe 气泡公式与 Table 2 全符号
  23. V3:参数 2× 副本的内存影响被 EP 稀释的论证
  24. V3:跨节点 all-to-all “near-zero overhead” 条件
  25. V3NVLink 160 GB/s、IB 50 GB/s、每 token ≤4 nodes
  26. V3FP8 相对 BF16 loss error 数值
  27. V3:训练 GPU-hours(如 2.788M H800)口径
  28. V3:“无需 costly TP” 的配置前提
  29. V2236B/21B、MLA 压缩率数字
  30. V3.2/V4DSA/CSA 与 1M 效率数字;V4 Pro/Flash 参数量表

9. 章节叙事建议(仍非正文)

  1. 先讲资源五量纲,再讲并行轴,避免一上来背 DP/TP/PP。
  2. 每个谱系节点用 “瓶颈→机制→公式→未解” 四格,对应账本 L1L9。
  3. DeepSeek-V3 作为 通信-计算重叠与 FP8 的高峰课K3 作为 EP 完美均衡 + 长轨迹状态栈的高峰课
  4. Lab 放在 DualPipe/MoonEP 之后,用同一套符号回放。
  5. 所有营销式数字进 检查清单,默认脚注 “作者报告,待核”。

10. 本地源与下一步核验动作

路径
K3 TR research/sources/kimi-k3/k3_tech_report.{pdf,txt}
V3 research/sources/moe/2412.19437.*
V2 research/sources/long-context/2405.04434.*
V3.2 / V4 / KDA research/sources/long-context/
方法约束 research/METHODOLOGY.md · research/GROK_RESEARCH_ROADMAP.md M15

建议下一步(写作前)

  1. 精读 K3 §5 与附录 E,抽出 MoonEP 伪代码级步骤。
  2. 精读 V3 §3.23.3,重绘 DualPipe 时间图与 Table 2。
  3. 补下缺失系统 PDFZeRO、Megatron 3D、GPipe、Ring、Ulysses、FSDP、MegaBlocks。
  4. 实现 Lab 常数表 v0,用黄金场景锁定确定性输出。
  5. 将本包中每条“高风险”映射到站点脚注 ID。

本文件为 research leads only:不替代一手论文,不直接作为站点事实来源。