Files
llm-atlas/research/TRAINING_SYSTEMS_GROK_LEADS.md
T
2026-07-29 01:03:15 +08:00

35 KiB
Raw Blame History

大规模 LLM 训练系统研究线索包(Grok Research Leads)

证据等级:未核验候选线索。 本文件由 Grok CLI 生成,只用于扩展检索面,不是正式研究账本,也不能直接作为课程事实来源。
定位:课程章节用 research-leads packet,非定稿讲义。所有数字与机制均须由主研究流程对照一手论文/官方报告核验后,才能写入正式账本与站点。
锚点:Kimi K3(arXiv:2607.24653)系统栈 · 高亮 DeepSeek 谱系(V2→V3→V3.2→V4)
组织原则:按 因果账本(causal ledger) 切分,而非按论文列表堆叠。每条账本回答:先前瓶颈 → 机制 → 可教公式 → 解决什么 → 遗留什么 → 一手 URL → 高风险声明。
生成日期:2026-07-29 · 本地一手文本:research/sources/kimi-k3/、research/sources/moe/、research/sources/long-context/


0. 读包须知

0.1 五个必须分开的资源量纲

量纲 教学定义 典型单位 常见混淆
训练 FLOPs 前向+反向算术量(与实现无关的“理论算力需求”) FLOP / token 与 GPU 峰值 FLOP/s 混为一谈
内存容量 参数/梯度/优化器/激活/KV 能否放进 HBM Byte / GPU 与带宽瓶颈混淆
带宽 HBM / NVLink / IB / PCIe 吞吐 GB/s 或 Gbps 与延迟混淆
延迟 小消息/同步/调度/气泡时间 µs–ms 大消息时仍可能被带宽主导
实现利用率 MFU / HFU / 流水线利用率 / 通信隐藏率 % 用“理论 FLOPs 很高”代替实测

0.2 并行度符号(全包统一)

  • (N_{\text{gpu}}):总 GPU 数
  • (DP, TP, PP, EP, CP)(或 SP):数据/张量/流水线/专家/上下文并行度
  • 通常 (N_{\text{gpu}} = DP \times TP \times PP \times EP \times CP)(若某维未启用则取 1;实现上可能有共享/正交约束)
  • (P):总参数量;(P_{\text{act}}):MoE 每 token 激活参数量
  • (B, S, H, L):global micro-batch 相关 batch、序列长、hidden、层数
  • (b):bytes/element(BF16=2, FP8=1, FP32=4)
  • (K):每 token 选中的专家数;(E):专家总数;(R):EP 规模

0.3 因果账本索引(九大账本)

ID 账本 核心矛盾
L1 模型状态内存 参数+梯度+优化器状态的冗余与分片
L2 激活内存 反向依赖的中间张量 vs 重计算/卸载/并行切分
L3 计算划分 层内/层间如何切矩阵与序列
L4 流水线气泡 PP 调度空闲 vs 微批与通信重叠
L5 集合通信 AllReduce/AllGather/ReduceScatter/All-to-All 体积与拓扑
L6 MoE/专家派发 负载不均、动态 shape、dispatch/combine
L7 长上下文状态 序列维并行、线性/混合注意力状态、KV 外置
L8 数值与优化器状态 低精度、Muon/Adam 分片、主权重
L9 可靠性/弹性 故障、弹性训练、agentic RL 沙箱与长轨迹状态

1. 九大因果账本(主文)

L1 · 模型状态内存(Parameter / Gradient / Optimizer)

字段 内容
先前瓶颈 朴素 DP:每卡完整 (P) 参数 + 梯度 + 优化器;Adam 常见 (\approx 16P) bytes(BF16 参数/梯度 + FP32 主权重 + 2×FP32 矩)。大模型先 OOM 在“状态”而非激活。
机制演进 DDP/AllReduce → ZeRO-1/2/3 分片 → FSDP 单元化 → PP 下 Pipeline ZeRO-2 + CPU/NVMe offload(K3)
可教方程 朴素 DP 每卡模型状态 (\approx (2+2+K_{\text{opt}}),P,b_{\text{eff}});ZeRO-3:(\approx (2+2+K_{\text{opt}}),P,b_{\text{eff}}/DP)。Adam 常取 (K_{\text{opt}}=12)(两矩 FP32)+ 主权重 FP32 等,具体字节必须按实现表核对。
解决 模型规模可随设备数近似线性扩展;FSDP 与框架深度集成。
未解 分片引入 AllGather/ReduceScatter;与 TP/EP 正交时通信图复杂;offload 把瓶颈从容量推到 PCIe/NVMe 带宽。
一手 URL ZeRO https://arxiv.org/abs/1910.02054 · FSDP https://arxiv.org/abs/2304.11277
高风险声明 “16P 公式”依赖精度与是否存主权重;K3 “Pipeline ZeRO-2 + CPU 梯度分片”细节以报告 §5.2.2 为准。

L2 · 激活内存(Activation / Checkpoint / Offload)

字段 内容
先前瓶颈 反向需要前向激活;长序列下激活 (\propto B\cdot S\cdot H\cdot L) 超过参数状态。
机制演进 Gradient checkpointing → Selective recompute(Megatron)→ Sequence/Context parallel 切激活 → 统一激活管理器(策略可插拔:recompute / quant / offload)→ 跨 PP 远程激活 offload(K3 Mooncake)
可教方程 粗估激活(每层、无 checkpoint):(\mathcal{O}(B S H)) 量级;attention 另有 (\mathcal{O}(B H S^2)) 或 Flash 下 (\mathcal{O}(B H S)) 工作集。课程应用“量级 + 重计算比例”而非单一闭式。
解决 用时间换空间;SP/CP 把序列维激活摊到多卡;FP8 激活缓存(V3)显著降存。
未解 重计算增加 FLOPs 与调度复杂度;远程 offload 引入跨卡带宽竞争;与 DualPipe 双向流水线的峰值激活耦合。
一手 URL Checkpointing 经典:https://arxiv.org/abs/1604.06174 · Selective recompute+SP:https://arxiv.org/abs/2205.05198 · V3 内存节:https://arxiv.org/abs/2412.19437 · K3 §5.2.2
高风险声明 “FlashAttention 消除激活内存”是错误表述——它降低注意力中间写回 HBM 的峰值,不等于整网激活为零。

L3 · 计算划分(TP / 3D / 层内切分)

字段 内容
先前瓶颈 单层权重无法装入单卡;纯 PP 气泡大;纯 DP 状态冗余。
机制演进 Megatron 层内 TP(列/行并行)→ 与 PP+DP 组成 3D mesh → 与 SP 绑定 → MoE 时 TP 可被 EP+内存优化替代(V3 声称可无昂贵 TP)
可教方程 Linear 列并行:(Y=XW),(W) 按列切 (TP) 份,前向 AllReduce 或与后层 row-parallel 配对;通信体积 (\propto B S H \cdot b) 每层对。
解决 层内并行通信多为机内 NVLink 友好;与 PP 正交。
未解 TP 度受节点内 GPU 数限制;过大 TP 通信/计算比变差;与 EP all-to-all 叠加时 SM 争用。
一手 URL Megatron-LM https://arxiv.org/abs/1909.08053 · 3D 规模训练 https://arxiv.org/abs/2104.04473
高风险声明 V3 “without costly TP” 指其配置下可不依赖大 TP,非断言 TP 已过时。

L4 · 流水线气泡(PP Bubbles / Schedules)

字段 内容
先前瓶颈 GPipe 同步 F-then-B:气泡 (\propto (PP-1));微批不足时利用率崩溃。
机制演进 GPipe → PipeDream/1F1B → interleaved 1F1B → ZeroBubble(拆 W/B)→ Chimera 双向 → DualPipe(V3,双向 + 前反向与 all-to-all 重叠)→ K3 interleaved 1F1B + 激活跨 rank 均衡
可教方程(V3 Table 2 形式,须原表核对) 1F1B 气泡 (\propto (PP-1)(F+B));ZB1P (\propto (PP-1)(F+B-2W));DualPipe (\propto (PP/2-1)(F&B + B - 3W)),参数副本 2×,激活 (\sim PP+1)。
解决 降低空闲;DualPipe 专门对 MoE all-to-all 做 chunk 级重叠。
未解 DualPipe 参数双份;调度实现复杂;与 EP 负载不均交互;多模态 encoder 仍可能暴露在关键路径(K3 用 bubble 填充 ViT)。
一手 URL GPipe https://arxiv.org/abs/1811.06965 · PipeDream https://arxiv.org/abs/1806.03377 · ZeroBubble https://arxiv.org/abs/2401.10241 · DualPipe(V3 内)https://arxiv.org/abs/2412.19437 · 实现 https://github.com/deepseek-ai/DualPipe
高风险声明 DualPipe 气泡公式符号 (F&B) 含义(重叠后的墙钟)易被误读为简单相加;必须对照 Figure 4–5。

L5 · 集合通信(Collectives)

字段 内容
先前瓶颈 大规模 AllReduce 成为 DP 上限;MoE All-to-All 跨节点更糟。
机制演进 Ring/Tree AllReduce → hierarchical → ReduceScatter+AllGather(ZeRO/FSDP)→ IB+NVLink 分层 all-to-all(DeepEP/V3)→ 通信-计算 overlap + 少 SM 通信核 → MoonEP 静态 shape + 固定缓冲
可教方程 AllReduce 体积(ring)(\approx 2\frac{N-1}{N}M);ZeRO-3 参数 AllGather 体积与分片策略相关;MoE dispatch 粗估 (\propto B S K \cdot d_{\text{expert}} \cdot b) 跨 EP 组。
解决 分层拓扑利用 NVLink/IB 差;overlap 使“通信时间”从墙钟中消失(条件:算力足够)。
未解 小消息延迟主导;拓扑不匹配时 hybrid mesh 次优;overlap 依赖手写 schedule。
一手 URL Horovod/Baidu ring 背景可读 https://arxiv.org/abs/1802.05799 · DeepEP https://github.com/deepseek-ai/DeepEP · V3 §3.2.2
高风险声明 V3 “near-zero all-to-all overhead” 是 在 DualPipe 重叠 + 恒定 compute/comm 比 条件下的工程主张,非通信体积为零。

L6 · MoE / 专家派发(Expert Parallelism)

字段 内容
先前瓶颈 稠密扩展不经济;稀疏后出现路由不均、动态 shape、all-to-all、辅损干扰主损。
机制演进 GShard/Switch → DeepSpeed-MoE / Tutel → MegaBlocks(块稀疏)→ DeepSeekMoE 细粒度 → aux-loss-free → DeepEP → MoonEP 动态冗余专家 + 完美均衡
可教方程 每 token 激活参数 (P_{\text{act}} \ll P);理想每 rank token 数 (S\times K)(MoonEP 强制);冗余专家上界 (E/R) per rank(K3 证明,附录 E)。DeepEP 最坏缓冲 (S\times K\times R) vs MoonEP 固定 (S\times K)。
解决 容量扩展;MoonEP 消除负载不均与动态 shape 导致的 host sync;fused permute/unpermute 零拷贝。
未解 冗余专家迁移/预取开销;规划近优非精确最优;与多模态视觉负载叠加;路由质量 vs 系统均衡的张力。
一手 URL GShard https://arxiv.org/abs/2006.16668 · Switch https://arxiv.org/abs/2101.03961 · MegaBlocks https://arxiv.org/abs/2211.15841 · DeepSpeed-MoE https://arxiv.org/abs/2201.05596 · DeepSeekMoE https://arxiv.org/abs/2401.06066 · V2 https://arxiv.org/abs/2405.04434 · V3 https://arxiv.org/abs/2412.19437 · LatentMoE https://arxiv.org/abs/2601.18089 · K3 MoonEP https://arxiv.org/abs/2607.24653 · https://github.com/MoonshotAI/MoonEP
高风险声明 K3 “perfect balance” 指 每 rank token 数相同,不表示每 expert 内 token 均匀;rank 内仍需 workload-aware GEMM 调度。

L7 · 长上下文状态(Context / Sequence Parallel · Hybrid State)

字段 内容
先前瓶颈 Softmax 注意力算存 (\propto S^2);单卡序列装不下;线性注意力有固定状态但并行模式不同。
机制演进 Megatron SP(与 TP 共)→ Ring Attention → DeepSpeed-Ulysses → USP 统一 → CP 成为独立轴 → MLA 压 KV → DSA 稀疏选 → KDA CP + hybrid KDA/MLA 双缓存管理
可教方程 Ring:块在环上传递,通信 (\propto) 块数;Ulysses:序列切 + head 维 all-to-all,通信与 head 数相关。KDA:状态尺寸与 (S) 解耦(固定 recurrent state);MLA KV 仍 (\propto S)。
解决 百万级训练可行;混合架构下“全局层 + 高效层”协同。
未解 Hybrid 前缀缓存一致性;CP 与 EP/PP 组合的 mesh 搜索;视觉长序列 encoder 不均衡(K3 dynamic CP)。
一手 URL Megatron SP https://arxiv.org/abs/2205.05198 · Ring https://arxiv.org/abs/2310.01889 · Ulysses https://arxiv.org/abs/2309.14509 · USP https://arxiv.org/abs/2405.07719 · MLA/V2 https://arxiv.org/abs/2405.04434 · KDA https://arxiv.org/abs/2510.26692 · V3.2 DSA https://arxiv.org/abs/2512.02556 · V4 https://arxiv.org/abs/2606.19348 · K3 §5.1
高风险声明 “1M context” 训练/推理/RL 代价结构完全不同;不可用推理 demo 反推训练 MFU。

L8 · 数值与优化器状态(Precision / Optimizer)

字段 内容
先前瓶颈 BF16 仍吃带宽与存储;Adam 状态巨大;新优化器(Muon)需要整矩阵正交化通信。
机制演进 Mixed precision → FP8 训练(V3 fine-grained)→ 优化器状态 BF16/分片 → Muon/MuonClip → Per-head Muon + P2P 正交化(K3)→ 部署侧 MXFP4 QAT
可教方程 低精度收益:算力峰值↑、激活/权重存储↓;误差需用 scale/tile 策略控制。Muon 正交化:朴素 all-gather 全参 vs P2P 只取本地拥有分片。
解决 V3 级 FP8 大规模验证;K3 降 Muon 通信与峰值内存。
未解 FP8 对部分算子仍需高精度;QAT 与训练精度路径不同;Muon 与 Adam 的可复现对比依赖实现。
一手 URL FP8 formats https://arxiv.org/abs/2209.05433 · V3 FP8 §3.3 https://arxiv.org/abs/2412.19437 · Muon scalable https://arxiv.org/abs/2502.16982 · K2 https://arxiv.org/abs/2507.20534 · K3 §2.5/§5.2.2 · MX https://arxiv.org/abs/2310.10537
高风险声明 “FP8 训练 = 无精度损失”不成立;V3 报告给的是相对 loss error 量级,需读附录 B。

L9 · 可靠性 / 弹性 / Agentic RL 状态

字段 内容
先前瓶颈 大规模训练故障率;长轨迹 RL 的 KV/环境状态比模型权重更“重”;容器隔离不足。
机制演进 检查点/弹性(经典)→ 分离式 vs co-located RL → partial rollout → external KV pool + NVMe 腾挪训练状态 → auto-throttling → AgentENV microVM(checkpoint/fork/pause)
可教方程 不讲单一公式;强调 状态对象:policy 权重、优化器、KV/KDA state、sandbox 脏页、未完成 trajectory。墙钟 = max(训练步, rollout, 环境)。
解决 数百卡级 1M agentic RL 可行(K3 主张);沙箱高密度与可恢复。
未解 训练/rollout 资源争用;KV 写回策略权衡;安全与高保真探索的张力;数字(沙箱次数等)需原表核对。
一手 URL K3 §5.3 https://arxiv.org/abs/2607.24653 · AgentENV https://github.com/kvcache-ai/AgentENV · Firecracker 背景(报告引用)
高风险声明 “few hundred GPUs” 每实验、checkpoint 133ms/49ms、51M+ sandboxes 等均为 作者报告数字,课程必须标注来源章节。

2. 必讲谱系(因果链,非编年堆叠)

数据并行 + AllReduce
        │
        ▼
Megatron 张量并行 (层内)
        │
        ▼
GPipe → PipeDream/1F1B → ZeroBubble / interleaved
        │
        ▼
ZeRO 分片阶段 → FSDP
        │
        ▼
Sequence Parallel (与 TP 协同降激活)
        │
        ▼
3D Parallel (DP×TP×PP mesh)
        │
        ▼
Expert Parallel + MegaBlocks + DeepSpeed-MoE
        │
        ▼
Context Parallel / Ring Attention / Ulysses (/USP)
        │
        ▼
Communication–Computation Overlap(通用工程)
        │
        ▼
DeepSeek-V3: DualPipe + DeepEP + FP8 + 细粒度 MoE
        │
        ▼
Kimi K2 / K2.5 RL 与 infra 积淀
        │
        ▼
Kimi K3: MoonEP + 静态 shape + 冗余专家 + fused permute
        + 1M co-located agentic RL + external KV + NVMe
        + adaptive throttling + AgentENV

2.1 谱系节点卡片(精简)

节点 先前瓶颈 机制一句话 一手 URL
DP/AllReduce 单卡算力不够 复制模型,梯度同步 经典 DDP/Horovod 文献;PyTorch DDP 文档
Megatron TP 层太大 矩阵切分 + 成对通信 https://arxiv.org/abs/1909.08053
GPipe 深度装不下 层切 + 微批流水 https://arxiv.org/abs/1811.06965
PipeDream/1F1B GPipe 气泡 交错 F/B https://arxiv.org/abs/1806.03377
ZeRO DP 状态冗余 分片 OS/G/P https://arxiv.org/abs/1910.02054
FSDP ZeRO 工业化 单元化分片 + 框架集成 https://arxiv.org/abs/2304.11277
Sequence Parallel TP 区外激活仍大 序列维切 Norm/Dropout 等 https://arxiv.org/abs/2205.05198
3D Parallel 单轴不够 mesh 组合 https://arxiv.org/abs/2104.04473
EP / MegaBlocks / DS-MoE 稠密不经济 专家分卡 + 块稀疏核 MegaBlocks https://arxiv.org/abs/2211.15841 · DS-MoE https://arxiv.org/abs/2201.05596
CP/Ring/Ulysses 长序列 序列并行注意力 Ring https://arxiv.org/abs/2310.01889 · Ulysses https://arxiv.org/abs/2309.14509
Overlap 通信墙钟暴露 双流/双流水/手写 schedule 多源;V3 DualPipe 为高峰
DualPipe/DeepEP MoE+PP 通信比≈1 双向 PP + 定制 all-to-all https://arxiv.org/abs/2412.19437 · https://github.com/deepseek-ai/DeepEP
MoonEP + 1M RL EP 不均 + 长轨迹状态 冗余专家完美均衡 + 外置 KV/沙箱 https://arxiv.org/abs/2607.24653

3. 2017–2026 候选一手文献时间线(≥45)

标注 [TR] 技术报告,[SYS] 系统论文,[ARCH] 架构/算法但系统相关,[LIB] 官方库/核。
状态:候选 = 章节可引用但须下载核对;本地已有 = research/sources/ 已有 PDF/TXT。

# 年 条目 类型 URL 账本
1 2017 Attention Is All You Need ARCH https://arxiv.org/abs/1706.03762 L3/L7 基线
2 2016/17 Gradient Checkpointing (Training Deep Nets with Sublinear Memory) SYS https://arxiv.org/abs/1604.06174 L2
3 2018 GPipe SYS https://arxiv.org/abs/1811.06965 L4
4 2018 PipeDream SYS https://arxiv.org/abs/1806.03377 L4
5 2018 Megatron-LM (intra-layer MP) SYS https://arxiv.org/abs/1909.08053 L3
6 2019 ZeRO SYS https://arxiv.org/abs/1910.02054 L1
7 2019 Mesh-TensorFlow / 相关模型并行 SYS https://arxiv.org/abs/1811.02084 L3
8 2019 Mixed Precision Training SYS https://arxiv.org/abs/1710.03740 L8
9 2020 GShard ARCH/SYS https://arxiv.org/abs/2006.16668 L6 · 本地 moe
10 2020 GPT-3(规模叙事) TR https://arxiv.org/abs/2005.14165 动机
11 2020 ZeRO-Offload SYS https://arxiv.org/abs/2101.06840 L1/L9
12 2021 Switch Transformer ARCH https://arxiv.org/abs/2101.03961 L6 · 本地
13 2021 Efficient Large-Scale LM Training (Megatron 3D) SYS https://arxiv.org/abs/2104.04473 L3/L4/L5
14 2021 ZeRO-Infinity SYS https://arxiv.org/abs/2104.07857 L1/L9
15 2021 Chimera (bidirectional PP) SYS https://arxiv.org/abs/2107.06925 L4
16 2021 FairScale / FSDP 早期实践 SYS 文档+后继论文 L1
17 2022 DeepSpeed-MoE SYS https://arxiv.org/abs/2201.05596 L6
18 2022 Reducing Activation Recomputation (SP + selective) SYS https://arxiv.org/abs/2205.05198 L2/L3
19 2022 FlashAttention SYS https://arxiv.org/abs/2205.14135 L2/L7 · 本地
20 2022 Pathways / 相关大规模编排(可选) SYS https://arxiv.org/abs/2203.12533 L9
21 2022 Overlap 相关:Varuna / 等(可选对比) SYS https://arxiv.org/abs/2111.04007 L4/L5
22 2022 Tutel MoE system SYS https://arxiv.org/abs/2206.03382 L6
23 2022/23 MegaBlocks SYS https://arxiv.org/abs/2211.15841 L6
24 2023 PyTorch FSDP Experiences SYS https://arxiv.org/abs/2304.11277 L1
25 2023 FlashAttention-2 SYS https://arxiv.org/abs/2307.08691 L2/L7
26 2023 DeepSpeed-Ulysses SYS https://arxiv.org/abs/2309.14509 L7
27 2023 Ring Attention SYS https://arxiv.org/abs/2310.01889 L7
28 2023 Zero Bubble PP SYS https://arxiv.org/abs/2401.10241 L4
29 2023 FP8 Formats for Deep Learning SYS https://arxiv.org/abs/2209.05433 L8
30 2024 DeepSeekMoE ARCH https://arxiv.org/abs/2401.06066 L6 · 本地
31 2024 DeepSeek-V2(MLA + DeepSeekMoE) TR https://arxiv.org/abs/2405.04434 L6/L7 · 本地
32 2024 USP Unified Sequence Parallelism SYS https://arxiv.org/abs/2405.07719 L7
33 2024 DeepSeek-V3 TR https://arxiv.org/abs/2412.19437 L4/L5/L6/L8 · 本地
34 2024 Aux-loss-free balancing(V3 内 + 相关) ARCH V3 报告内 L6
35 2024 Llama 3 Herd(规模系统侧写) TR https://arxiv.org/abs/2407.21783 对比
36 2024 OCP Microscaling (MX) SYS https://arxiv.org/abs/2310.10537 L8
37 2025 DeepEP library LIB https://github.com/deepseek-ai/DeepEP L5/L6
38 2025 DualPipe library LIB https://github.com/deepseek-ai/DualPipe L4
39 2025 DeepSeek-R1 TR https://arxiv.org/abs/2501.12948 L9 RL 背景 · 本地 reasoning
40 2025 Kimi K2 TR https://arxiv.org/abs/2507.20534 前驱 · 本地
41 2025 Muon is Scalable for LLM Training ARCH https://arxiv.org/abs/2502.16982 L8
42 2025 Kimi Linear / KDA ARCH https://arxiv.org/abs/2510.26692 L7 · 本地
43 2025 DeepSeek-V3.2(DSA 等) TR https://arxiv.org/abs/2512.02556 L7 · 本地
44 2025/26 LatentMoE ARCH https://arxiv.org/abs/2601.18089 L6 · 本地
45 2026 Kimi K2.5 TR https://arxiv.org/abs/2602.02276 多模态/RL infra · 本地
46 2026 Attention Residuals ARCH https://arxiv.org/abs/2603.15031 L2/L3(深度连接)
47 2026 DeepSeek-V4 TR https://arxiv.org/abs/2606.19348 L7 · 本地
48 2026 Kimi K3 TR https://arxiv.org/abs/2607.24653 L1–L9 锚点 · 本地
49 2026 MoonEP LIB https://github.com/MoonshotAI/MoonEP L6
50 2026 AgentENV LIB https://github.com/kvcache-ai/AgentENV L9

补强候选(可选扩到 60+):ByteScheduler、TeraPipe、Alpa、Mobius、FlexFlow、MiCS、AMP、DistFlashAttn、LoongTrain、Echo/UltraEP(K3 对比引用)、Mooncake Transfer Engine、SonicMoE、Firecracker 论文、OSWorld/SWE-bench 环境论文(RL 环境侧)。


4. DeepSeek 谱系特写(V2 → V4)

4.1 DeepSeek-V2 — 经济稀疏 + MLA

项 线索
一手 https://arxiv.org/abs/2405.04434 · 本地 2405.04434
系统相关点 MLA 降 KV;DeepSeekMoE 细粒度专家;训练/推理成本叙事
高风险数字 236B total / 21B act;128K context;训练成本对比须回表
未解决(留给 V3) 跨节点 EP 通信墙;更大规模 FP8;PP+MoE 重叠

4.2 DeepSeek-V3 — DualPipe / DeepEP / FP8 峰值

项 线索
一手 https://arxiv.org/abs/2412.19437 · 本地 2412.19437
DualPipe 前/后向 chunk 拆为 attention · dispatch · MLP · combine;双向灌微批;与 ZeroBubble 的 W 分离结合;通信隐藏是目标函数
DeepEP / 跨节点 A2A IB 跨节点 + NVLink 节点内转发;限制每 token 最多 4 nodes 等 拓扑共设计(数字须核原文)
内存 无昂贵 TP 的可行性主张;EMA on CPU;MTP 共享 embed/head
FP8 fine-grained tile quant;激活 FP8 缓存;关键路径保持高精度
高风险 2.788M H800 GPU hours、相对 loss error、NVLink 160GB/s vs IB 50GB/s、comm:comp≈1:1 等
遗留 EP 负载动态 shape;冗余专家/静态 shape 未做“完美均衡”;长上下文算法侧留给 V3.2/V4

4.3 DeepSeek-V3.2 — 稀疏注意力与系统接口

项 线索
一手 https://arxiv.org/abs/2512.02556 · 本地 2512.02556 · HF PDF 镜像亦常见
系统含义 DSA + indexer 改变 attention 算子形状与 KV 访问模式;训练/推理内核与 CP 策略需重估
高风险 “frontier open” 基准数字;与 V3 训练栈差异是否充分披露

4.4 DeepSeek-V4 — 百万上下文效率

项 线索
一手 https://arxiv.org/abs/2606.19348 · 本地 2606.19348
系统含义 1M 上下文下 KV/算力效率(CSA 等);MoE 规模再扩(Pro/Flash 参数量 须核表)
与 K3 对照教学 两边都打 1M,但 注意力混合策略、EP 库、RL infra 路径不同——适合做“同目标异栈”对比课

4.5 DeepSeek → Kimi 系统对照(备课用)

维度 DeepSeek-V3 栈 Kimi K3 栈
PP DualPipe 双向 + 重叠 interleaved 1F1B + 远程激活均衡 + bubble 填 ViT
EP 通信 DeepEP 风格 all-to-all MoonEP:冗余专家 + 完美 token 均衡
Shape 动态 expert token 静态 (S\times K)
缓冲 最坏 (S\times K\times R)(K3 对比叙述) 固定 (S\times K)
精度 FP8 训练验证 训练 FP8 激活策略 + 部署 MXFP4 QAT
长上下文 MLA / 后继 DSA / V4 KDA+Gated MLA hybrid + KCP
后训练 R1 等 co-located 1M agentic RL + AgentENV

5. Kimi K3 系统特写(MoonEP 与 1M RL)

一手:https://arxiv.org/abs/2607.24653 · 本地 research/sources/kimi-k3/k3_tech_report.txt §5

5.1 MoonEP(§5.2.1)

子题 线索(待核)
动机 EP rank 间 token 不均 → 吞吐下降;动态 shape → 显存碎片 + 每层 host-device sync
机制 在线规划 dynamic redundant experts;前向预取;反向本地 reduce buffer 再归还 home rank
理论 存在均衡方案且每 rank 冗余专家 (\le E/R);界近乎紧(附录 E)
通信 fused permute/unpermute;规划核预计算 destination;零拷贝 view
静态 shape 每 rank 恰 (S\times K) tokens → 无需 per-layer 同步取 shape
对比 DeepEP 流程兼容但加规划/迁移;ECHO/UltraEP 固定 cap 可能规划失败
遗留 rank 内 expert 倾斜仍需 GEMM scheduler;规划近似
开源 https://github.com/MoonshotAI/MoonEP

5.2 内存高效训练(§5.2.2)

  • 统一激活管理器:recompute / quant / offload 可组合策略
  • MoE:改写 permuted probs 梯度依赖(SonicMoE 启发);dispatch 重计算重叠
  • Block AttnRes:checkpoint 包装使激活与标准 residual 同阶
  • 跨 PP 远程 offload(Mooncake)均衡 interleaved 1F1B 激活倾斜
  • Pipeline ZeRO-2 + CPU 梯度分片
  • Muon:P2P 取分片做正交化,避免全参 all-gather

5.3 多模态 encoder(§5.2.3)

  • Dynamic CP:大图 patch 维切分 + gather-KV
  • ViT 算力塞进 PP bubbles(继承/扩展 K2.5 DEP)

5.4 1M Agentic RL(§5.3)— 专章必讲

机制 解决的瓶颈 高风险数字/表述
Co-located RL 分离式集群切换与冗余副本 “few hundred GPUs”/实验
Partial rollouts 超长轨迹尾延迟 与前缀命中交互
External KV pool 1M 多步前缀未命中极贵 写回 vs write-through
KDA+MLA 生命周期对齐 双缓存必须联合恢复 实现复杂度
NVMe offload 训练状态 给 CPU DRAM 腾 KV 池 与训练步交替
Adaptive throttling 固定并发早期浪费/后期抢占 信号:active/queued/KV util
Gradient-buffer reuse 参考模型前向显存 与 ZeRO-2 双缓冲预取
AgentENV 容器隔离不够、长生命环境 133ms/49ms ckpt;6.5× overcommit;51,219,741 sandboxes / 1,505,678 images
开源 — https://github.com/kvcache-ai/AgentENV

5.5 与 K2 / K2.5 的系统衔接

模型 URL 系统备课点
Kimi K2 https://arxiv.org/abs/2507.20534 1T MoE、agentic 基座、MuonClip、大规模 post-train
Kimi K2.5 https://arxiv.org/abs/2602.02276 原生多模态、Agent Swarm、DEP 等 encoder 调度
Kimi K3 https://arxiv.org/abs/2607.24653 2.8T、MoonEP、1M RL 状态栈

6. 建议原创图(8–10 张)

# 图名 教学功能 关键元素
D1 九账本因果地图 全章导航 账本节点 + 依赖箭头 + DeepSeek/K3 高亮
D2 单卡内存栈爆炸图 L1+L2 参数/梯度/优化器/激活/临时工作区;ZeRO 前后对比
D3 3D mesh + EP/CP 扩展 L3/L6/L7 五维并行立方体;合法组合约束脚注
D4 PP 调度对比条带图 L4 GPipe / 1F1B / ZeroBubble / DualPipe 并排时间轴
D5 通信体积 vs 拓扑 L5 AllReduce / AG+RS / All-to-All;NVLink vs IB 分层
D6 MoE dispatch 数据路径 L6 token→router→dispatch→experts→combine;DeepEP vs MoonEP 缓冲尺寸标注
D7 MoonEP 冗余专家规划示意 L6 不均路由 → 冗余副本放置 → 每 rank (S\times K)
D8 DualPipe 四段重叠 L4/L5 Attention∥comm、dispatch、MLP、combine;双向微批
D9 Hybrid KDA–MLA 双状态 L7 固定 KDA state + 增长 MLA KV;CP 切分方式
D10 1M Agentic RL 状态机 L9 GPU KV ↔ CPU external pool ↔ NVMe 训练状态;AgentENV pause/fork;throttling 反馈环

7. 确定性交互实验(Training Systems Lab)

7.1 目标

让读者 选择配置 → 得到可复现的粗估(非性能承诺)。强调:理论 FLOPs ≠ 内存是否装下 ≠ 带宽是否够 ≠ 延迟是否隐藏 ≠ 实测 MFU。

7.2 输入控件

输入 范围/选项(建议默认)
模型规模 (P) 7B / 70B / 405B / 671B(MoE) / 2.8T(MoE) 预设 + 自定义
MoE dense 或 (E, K, P_{\text{act}})
GPU 数 (N) 8–8192
并行度 DP, TP, PP, EP, CP(自动检查乘积 = (N))
精度 BF16 / FP8 激活 / FP8 权重训练(简化开关)
序列长 (S) 2K–1M(对数滑条)
micro-batch / global batch 分离
优化器 AdamW / Muon(状态字节系数不同)
Overlap off / partial / aggressive(仅影响 有效通信时间模型)
Checkpoint none / full / selective
Offload none / CPU / NVMe(容量可行但带宽惩罚)

7.3 确定性估算输出(公式层,实现时固定版本号)

A. 每卡内存(容量)

[ M_{\text{param}} = \frac{P}{TP\cdot PP\cdot f_{\text{EP-shard}}}, b_w,\quad M_{\text{grad}} \sim M_{\text{param 等价分片}},\quad M_{\text{opt}} = \frac{c_{\text{opt}} P}{DP\cdot \ldots}, ]

[ M_{\text{act}} = g(B_{\text{local}}, S/CP, H, L, \text{ckpt}, b_{\text{act}}) ]

MoE 时 (f_{\text{EP-shard}}) 与专家放置有关;MoonEP 模式下额外显示 冗余专家槽 (\sim E/R) 的参数副本上界(教学提示)。

B. 通信体积(每步,量级)

  • DP:梯度 ReduceScatter/AllReduce (\propto P/DP) 量级
  • TP:每层 (\propto B S H)
  • PP:激活/梯度 P2P (\propto B S H \cdot) 边界层
  • EP:all-to-all (\propto B S K d)
  • CP:Ring/Ulysses 不同模型切换

C. 流水线利用率(简化)

[ U_{\text{pipe}} = \frac{T_{\text{compute}}}{T_{\text{compute}}+T_{\text{bubble}}+T_{\text{exposed-comm}}} ]

DualPipe 模式切换气泡系数表(来自 V3 Table 2 的 符号化 实现,不写死 GPU 秒)。

D. 瓶颈判定(规则引擎,可解释)

按以下优先级输出 likely bottleneck:

  1. (M_{\text{total}} >) HBM → 容量
  2. 否则若 (T_{\text{comm,exposed}} > T_{\text{compute}}) → 通信/延迟
  3. 否则若 offload 带宽项主导 → PCIe/NVMe 带宽
  4. 否则若 (U_{\text{pipe}} < 0.5) → 流水线气泡
  5. 否则 → 算力(FLOPs)受限(仍可低 MFU 若 kernel 差——标注“本 lab 不模拟 kernel 效率”)

E. 明确不承诺

  • 不输出真实 tokens/s
  • 不替代 NCCL 实测
  • 所有常数放入 LAB_CONSTANTS_VERSION JSON,便于勘误

7.4 UI 分栏

  1. FLOPs 面板:理论训练 FLOPs/token、全局步 FLOPs
  2. Memory 面板:四栈条形图(param/grad/opt/act)
  3. Comm 面板:各集合通信体积与粗估时间(带宽假设可调)
  4. Utilization 面板:气泡、暴露通信、overlap 后有效值
  5. Verdict:单一瓶颈标签 + 反事实(“若把 CP×2 …”)

7.5 验收用例(确定性黄金集)

场景 期望 verdict 类型
70B, 8 GPU, DP=8, S=2k, Adam 可能装下,瓶颈算力/通信视 batch
70B, 8 GPU, DP=8, S=128k, 无 CP 激活容量或 OOM
671B MoE, 无 EP, 试图单节点 参数容量失败
V3-like:大 EP + DualPipe overlap on 暴露通信 ↓,瓶颈可能转算力
K3-like:2.8T + MoonEP 静态 shape 显示冗余专家内存上界;EP 不均项关闭
1M + co-located RL 开关 额外 KV DRAM/NVMe 面板,不与纯预训练内存合并欺骗

8. 三十项高风险声明检查清单

写进讲义前逐条对照一手来源,勾选。

  1. K3:2.8T total / 104B activated
  2. K3:1M context;训练延拓阶段(8K→…→1M)路径
  3. K3:16 of 896 routed experts;是否含 shared experts 计数
  4. K3:约 2.5× scaling efficiency vs K2 的定义(数据?损失?下游?)
  5. K3:KDA:MLA = 3:1 及层数 69/24
  6. MoonEP:每 rank 恰 (S\times K) tokens
  7. MoonEP:冗余专家上界 (E/R) 证明条件
  8. MoonEP vs DeepEP 缓冲 (S\times K\times R) vs (S\times K)
  9. fused permute/unpermute “zero-copy” 的实现边界
  10. 静态 shape 消除 per-layer host sync 的表述是否绝对
  11. Pipeline ZeRO-2 + CPU 梯度分片细节
  12. P2P Muon 正交化通信量相对 all-gather 的定量
  13. 远程激活 offload(Mooncake)与 PP rank 均衡幅度
  14. Co-located 1M RL “few hundred GPUs”
  15. External KV write-back 策略与 KDA 对齐
  16. NVMe offload 训练状态的时序(train↔rollout)
  17. Auto-throttling 所用运行时信号列表
  18. AgentENV checkpoint 133 ms / resume 49 ms
  19. 内存 overcommit 6.5×
  20. 沙箱总数 51,219,741 / images 1,505,678
  21. V3:671B / 37B act
  22. V3:DualPipe 气泡公式与 Table 2 全符号
  23. V3:参数 2× 副本的内存影响被 EP 稀释的论证
  24. V3:跨节点 all-to-all “near-zero overhead” 条件
  25. V3:NVLink 160 GB/s、IB 50 GB/s、每 token ≤4 nodes
  26. V3:FP8 相对 BF16 loss error 数值
  27. V3:训练 GPU-hours(如 2.788M H800)口径
  28. V3:“无需 costly TP” 的配置前提
  29. V2:236B/21B、MLA 压缩率数字
  30. V3.2/V4:DSA/CSA 与 1M 效率数字;V4 Pro/Flash 参数量表

9. 章节叙事建议(仍非正文)

  1. 先讲资源五量纲,再讲并行轴,避免一上来背 DP/TP/PP。
  2. 每个谱系节点用 “瓶颈→机制→公式→未解” 四格,对应账本 L1–L9。
  3. DeepSeek-V3 作为 通信-计算重叠与 FP8 的高峰课;K3 作为 EP 完美均衡 + 长轨迹状态栈的高峰课。
  4. Lab 放在 DualPipe/MoonEP 之后,用同一套符号回放。
  5. 所有营销式数字进 检查清单,默认脚注 “作者报告,待核”。

10. 本地源与下一步核验动作

源 路径
K3 TR research/sources/kimi-k3/k3_tech_report.{pdf,txt}
V3 research/sources/moe/2412.19437.*
V2 research/sources/long-context/2405.04434.*
V3.2 / V4 / KDA research/sources/long-context/
方法约束 research/METHODOLOGY.md · research/GROK_RESEARCH_ROADMAP.md M15

建议下一步(写作前):

  1. 精读 K3 §5 与附录 E,抽出 MoonEP 伪代码级步骤。
  2. 精读 V3 §3.2–3.3,重绘 DualPipe 时间图与 Table 2。
  3. 补下缺失系统 PDF:ZeRO、Megatron 3D、GPipe、Ring、Ulysses、FSDP、MegaBlocks。
  4. 实现 Lab 常数表 v0,用黄金场景锁定确定性输出。
  5. 将本包中每条“高风险”映射到站点脚注 ID。

本文件为 research leads only:不替代一手论文,不直接作为站点事实来源。