大规模 LLM 训练系统研究线索包(Grok Research Leads)
证据等级:未核验候选线索。 本文件由 Grok CLI 生成,只用于扩展检索面,不是正式研究账本,也不能直接作为课程事实来源。
定位:课程章节用 research-leads packet,非定稿讲义。所有数字与机制均须由主研究流程对照一手论文/官方报告核验后,才能写入正式账本与站点。
锚点:Kimi K3(arXiv:2607.24653)系统栈 · 高亮 DeepSeek 谱系(V2→V3→V3.2→V4)
组织原则:按 因果账本(causal ledger) 切分,而非按论文列表堆叠。每条账本回答:先前瓶颈 → 机制 → 可教公式 → 解决什么 → 遗留什么 → 一手 URL → 高风险声明。
生成日期:2026-07-29 · 本地一手文本:research/sources/kimi-k3/、research/sources/moe/、research/sources/long-context/
0. 读包须知
0.1 五个必须分开的资源量纲
| 量纲 |
教学定义 |
典型单位 |
常见混淆 |
| 训练 FLOPs |
前向+反向算术量(与实现无关的“理论算力需求”) |
FLOP / token |
与 GPU 峰值 FLOP/s 混为一谈 |
| 内存容量 |
参数/梯度/优化器/激活/KV 能否放进 HBM |
Byte / GPU |
与带宽瓶颈混淆 |
| 带宽 |
HBM / NVLink / IB / PCIe 吞吐 |
GB/s 或 Gbps |
与延迟混淆 |
| 延迟 |
小消息/同步/调度/气泡时间 |
µs–ms |
大消息时仍可能被带宽主导 |
| 实现利用率 |
MFU / HFU / 流水线利用率 / 通信隐藏率 |
% |
用“理论 FLOPs 很高”代替实测 |
0.2 并行度符号(全包统一)
- (N_{\text{gpu}}):总 GPU 数
- (DP, TP, PP, EP, CP)(或 SP):数据/张量/流水线/专家/上下文并行度
- 通常 (N_{\text{gpu}} = DP \times TP \times PP \times EP \times CP)(若某维未启用则取 1;实现上可能有共享/正交约束)
- (P):总参数量;(P_{\text{act}}):MoE 每 token 激活参数量
- (B, S, H, L):global micro-batch 相关 batch、序列长、hidden、层数
- (b):bytes/element(BF16=2, FP8=1, FP32=4)
- (K):每 token 选中的专家数;(E):专家总数;(R):EP 规模
0.3 因果账本索引(九大账本)
| ID |
账本 |
核心矛盾 |
| L1 |
模型状态内存 |
参数+梯度+优化器状态的冗余与分片 |
| L2 |
激活内存 |
反向依赖的中间张量 vs 重计算/卸载/并行切分 |
| L3 |
计算划分 |
层内/层间如何切矩阵与序列 |
| L4 |
流水线气泡 |
PP 调度空闲 vs 微批与通信重叠 |
| L5 |
集合通信 |
AllReduce/AllGather/ReduceScatter/All-to-All 体积与拓扑 |
| L6 |
MoE/专家派发 |
负载不均、动态 shape、dispatch/combine |
| L7 |
长上下文状态 |
序列维并行、线性/混合注意力状态、KV 外置 |
| L8 |
数值与优化器状态 |
低精度、Muon/Adam 分片、主权重 |
| L9 |
可靠性/弹性 |
故障、弹性训练、agentic RL 沙箱与长轨迹状态 |
1. 九大因果账本(主文)
L1 · 模型状态内存(Parameter / Gradient / Optimizer)
| 字段 |
内容 |
| 先前瓶颈 |
朴素 DP:每卡完整 (P) 参数 + 梯度 + 优化器;Adam 常见 (\approx 16P) bytes(BF16 参数/梯度 + FP32 主权重 + 2×FP32 矩)。大模型先 OOM 在“状态”而非激活。 |
| 机制演进 |
DDP/AllReduce → ZeRO-1/2/3 分片 → FSDP 单元化 → PP 下 Pipeline ZeRO-2 + CPU/NVMe offload(K3) |
| 可教方程 |
朴素 DP 每卡模型状态 (\approx (2+2+K_{\text{opt}}),P,b_{\text{eff}});ZeRO-3:(\approx (2+2+K_{\text{opt}}),P,b_{\text{eff}}/DP)。Adam 常取 (K_{\text{opt}}=12)(两矩 FP32)+ 主权重 FP32 等,具体字节必须按实现表核对。 |
| 解决 |
模型规模可随设备数近似线性扩展;FSDP 与框架深度集成。 |
| 未解 |
分片引入 AllGather/ReduceScatter;与 TP/EP 正交时通信图复杂;offload 把瓶颈从容量推到 PCIe/NVMe 带宽。 |
| 一手 URL |
ZeRO https://arxiv.org/abs/1910.02054 · FSDP https://arxiv.org/abs/2304.11277 |
| 高风险声明 |
“16P 公式”依赖精度与是否存主权重;K3 “Pipeline ZeRO-2 + CPU 梯度分片”细节以报告 §5.2.2 为准。 |
L2 · 激活内存(Activation / Checkpoint / Offload)
| 字段 |
内容 |
| 先前瓶颈 |
反向需要前向激活;长序列下激活 (\propto B\cdot S\cdot H\cdot L) 超过参数状态。 |
| 机制演进 |
Gradient checkpointing → Selective recompute(Megatron)→ Sequence/Context parallel 切激活 → 统一激活管理器(策略可插拔:recompute / quant / offload)→ 跨 PP 远程激活 offload(K3 Mooncake) |
| 可教方程 |
粗估激活(每层、无 checkpoint):(\mathcal{O}(B S H)) 量级;attention 另有 (\mathcal{O}(B H S^2)) 或 Flash 下 (\mathcal{O}(B H S)) 工作集。课程应用“量级 + 重计算比例”而非单一闭式。 |
| 解决 |
用时间换空间;SP/CP 把序列维激活摊到多卡;FP8 激活缓存(V3)显著降存。 |
| 未解 |
重计算增加 FLOPs 与调度复杂度;远程 offload 引入跨卡带宽竞争;与 DualPipe 双向流水线的峰值激活耦合。 |
| 一手 URL |
Checkpointing 经典:https://arxiv.org/abs/1604.06174 · Selective recompute+SP:https://arxiv.org/abs/2205.05198 · V3 内存节:https://arxiv.org/abs/2412.19437 · K3 §5.2.2 |
| 高风险声明 |
“FlashAttention 消除激活内存”是错误表述——它降低注意力中间写回 HBM 的峰值,不等于整网激活为零。 |
L3 · 计算划分(TP / 3D / 层内切分)
| 字段 |
内容 |
| 先前瓶颈 |
单层权重无法装入单卡;纯 PP 气泡大;纯 DP 状态冗余。 |
| 机制演进 |
Megatron 层内 TP(列/行并行)→ 与 PP+DP 组成 3D mesh → 与 SP 绑定 → MoE 时 TP 可被 EP+内存优化替代(V3 声称可无昂贵 TP) |
| 可教方程 |
Linear 列并行:(Y=XW),(W) 按列切 (TP) 份,前向 AllReduce 或与后层 row-parallel 配对;通信体积 (\propto B S H \cdot b) 每层对。 |
| 解决 |
层内并行通信多为机内 NVLink 友好;与 PP 正交。 |
| 未解 |
TP 度受节点内 GPU 数限制;过大 TP 通信/计算比变差;与 EP all-to-all 叠加时 SM 争用。 |
| 一手 URL |
Megatron-LM https://arxiv.org/abs/1909.08053 · 3D 规模训练 https://arxiv.org/abs/2104.04473 |
| 高风险声明 |
V3 “without costly TP” 指其配置下可不依赖大 TP,非断言 TP 已过时。 |
L4 · 流水线气泡(PP Bubbles / Schedules)
L5 · 集合通信(Collectives)
| 字段 |
内容 |
| 先前瓶颈 |
大规模 AllReduce 成为 DP 上限;MoE All-to-All 跨节点更糟。 |
| 机制演进 |
Ring/Tree AllReduce → hierarchical → ReduceScatter+AllGather(ZeRO/FSDP)→ IB+NVLink 分层 all-to-all(DeepEP/V3)→ 通信-计算 overlap + 少 SM 通信核 → MoonEP 静态 shape + 固定缓冲 |
| 可教方程 |
AllReduce 体积(ring)(\approx 2\frac{N-1}{N}M);ZeRO-3 参数 AllGather 体积与分片策略相关;MoE dispatch 粗估 (\propto B S K \cdot d_{\text{expert}} \cdot b) 跨 EP 组。 |
| 解决 |
分层拓扑利用 NVLink/IB 差;overlap 使“通信时间”从墙钟中消失(条件:算力足够)。 |
| 未解 |
小消息延迟主导;拓扑不匹配时 hybrid mesh 次优;overlap 依赖手写 schedule。 |
| 一手 URL |
Horovod/Baidu ring 背景可读 https://arxiv.org/abs/1802.05799 · DeepEP https://github.com/deepseek-ai/DeepEP · V3 §3.2.2 |
| 高风险声明 |
V3 “near-zero all-to-all overhead” 是 在 DualPipe 重叠 + 恒定 compute/comm 比 条件下的工程主张,非通信体积为零。 |
L6 · MoE / 专家派发(Expert Parallelism)
L7 · 长上下文状态(Context / Sequence Parallel · Hybrid State)
L8 · 数值与优化器状态(Precision / Optimizer)
L9 · 可靠性 / 弹性 / Agentic RL 状态
| 字段 |
内容 |
| 先前瓶颈 |
大规模训练故障率;长轨迹 RL 的 KV/环境状态比模型权重更“重”;容器隔离不足。 |
| 机制演进 |
检查点/弹性(经典)→ 分离式 vs co-located RL → partial rollout → external KV pool + NVMe 腾挪训练状态 → auto-throttling → AgentENV microVM(checkpoint/fork/pause) |
| 可教方程 |
不讲单一公式;强调 状态对象:policy 权重、优化器、KV/KDA state、sandbox 脏页、未完成 trajectory。墙钟 = max(训练步, rollout, 环境)。 |
| 解决 |
数百卡级 1M agentic RL 可行(K3 主张);沙箱高密度与可恢复。 |
| 未解 |
训练/rollout 资源争用;KV 写回策略权衡;安全与高保真探索的张力;数字(沙箱次数等)需原表核对。 |
| 一手 URL |
K3 §5.3 https://arxiv.org/abs/2607.24653 · AgentENV https://github.com/kvcache-ai/AgentENV · Firecracker 背景(报告引用) |
| 高风险声明 |
“few hundred GPUs” 每实验、checkpoint 133ms/49ms、51M+ sandboxes 等均为 作者报告数字,课程必须标注来源章节。 |
2. 必讲谱系(因果链,非编年堆叠)
2.1 谱系节点卡片(精简)
3. 2017–2026 候选一手文献时间线(≥45)
标注 [TR] 技术报告,[SYS] 系统论文,[ARCH] 架构/算法但系统相关,[LIB] 官方库/核。
状态:候选 = 章节可引用但须下载核对;本地已有 = research/sources/ 已有 PDF/TXT。
补强候选(可选扩到 60+):ByteScheduler、TeraPipe、Alpa、Mobius、FlexFlow、MiCS、AMP、DistFlashAttn、LoongTrain、Echo/UltraEP(K3 对比引用)、Mooncake Transfer Engine、SonicMoE、Firecracker 论文、OSWorld/SWE-bench 环境论文(RL 环境侧)。
4. DeepSeek 谱系特写(V2 → V4)
4.1 DeepSeek-V2 — 经济稀疏 + MLA
| 项 |
线索 |
| 一手 |
https://arxiv.org/abs/2405.04434 · 本地 2405.04434 |
| 系统相关点 |
MLA 降 KV;DeepSeekMoE 细粒度专家;训练/推理成本叙事 |
| 高风险数字 |
236B total / 21B act;128K context;训练成本对比须回表 |
| 未解决(留给 V3) |
跨节点 EP 通信墙;更大规模 FP8;PP+MoE 重叠 |
4.2 DeepSeek-V3 — DualPipe / DeepEP / FP8 峰值
| 项 |
线索 |
| 一手 |
https://arxiv.org/abs/2412.19437 · 本地 2412.19437 |
| DualPipe |
前/后向 chunk 拆为 attention · dispatch · MLP · combine;双向灌微批;与 ZeroBubble 的 W 分离结合;通信隐藏是目标函数 |
| DeepEP / 跨节点 A2A |
IB 跨节点 + NVLink 节点内转发;限制每 token 最多 4 nodes 等 拓扑共设计(数字须核原文) |
| 内存 |
无昂贵 TP 的可行性主张;EMA on CPU;MTP 共享 embed/head |
| FP8 |
fine-grained tile quant;激活 FP8 缓存;关键路径保持高精度 |
| 高风险 |
2.788M H800 GPU hours、相对 loss error、NVLink 160GB/s vs IB 50GB/s、comm:comp≈1:1 等 |
| 遗留 |
EP 负载动态 shape;冗余专家/静态 shape 未做“完美均衡”;长上下文算法侧留给 V3.2/V4 |
4.3 DeepSeek-V3.2 — 稀疏注意力与系统接口
| 项 |
线索 |
| 一手 |
https://arxiv.org/abs/2512.02556 · 本地 2512.02556 · HF PDF 镜像亦常见 |
| 系统含义 |
DSA + indexer 改变 attention 算子形状与 KV 访问模式;训练/推理内核与 CP 策略需重估 |
| 高风险 |
“frontier open” 基准数字;与 V3 训练栈差异是否充分披露 |
4.4 DeepSeek-V4 — 百万上下文效率
| 项 |
线索 |
| 一手 |
https://arxiv.org/abs/2606.19348 · 本地 2606.19348 |
| 系统含义 |
1M 上下文下 KV/算力效率(CSA 等);MoE 规模再扩(Pro/Flash 参数量 须核表) |
| 与 K3 对照教学 |
两边都打 1M,但 注意力混合策略、EP 库、RL infra 路径不同——适合做“同目标异栈”对比课 |
4.5 DeepSeek → Kimi 系统对照(备课用)
| 维度 |
DeepSeek-V3 栈 |
Kimi K3 栈 |
| PP |
DualPipe 双向 + 重叠 |
interleaved 1F1B + 远程激活均衡 + bubble 填 ViT |
| EP 通信 |
DeepEP 风格 all-to-all |
MoonEP:冗余专家 + 完美 token 均衡 |
| Shape |
动态 expert token |
静态 (S\times K) |
| 缓冲 |
最坏 (S\times K\times R)(K3 对比叙述) |
固定 (S\times K) |
| 精度 |
FP8 训练验证 |
训练 FP8 激活策略 + 部署 MXFP4 QAT |
| 长上下文 |
MLA / 后继 DSA / V4 |
KDA+Gated MLA hybrid + KCP |
| 后训练 |
R1 等 |
co-located 1M agentic RL + AgentENV |
5. Kimi K3 系统特写(MoonEP 与 1M RL)
一手:https://arxiv.org/abs/2607.24653 · 本地 research/sources/kimi-k3/k3_tech_report.txt §5
5.1 MoonEP(§5.2.1)
| 子题 |
线索(待核) |
| 动机 |
EP rank 间 token 不均 → 吞吐下降;动态 shape → 显存碎片 + 每层 host-device sync |
| 机制 |
在线规划 dynamic redundant experts;前向预取;反向本地 reduce buffer 再归还 home rank |
| 理论 |
存在均衡方案且每 rank 冗余专家 (\le E/R);界近乎紧(附录 E) |
| 通信 |
fused permute/unpermute;规划核预计算 destination;零拷贝 view |
| 静态 shape |
每 rank 恰 (S\times K) tokens → 无需 per-layer 同步取 shape |
| 对比 |
DeepEP 流程兼容但加规划/迁移;ECHO/UltraEP 固定 cap 可能规划失败 |
| 遗留 |
rank 内 expert 倾斜仍需 GEMM scheduler;规划近似 |
| 开源 |
https://github.com/MoonshotAI/MoonEP |
5.2 内存高效训练(§5.2.2)
- 统一激活管理器:recompute / quant / offload 可组合策略
- MoE:改写 permuted probs 梯度依赖(SonicMoE 启发);dispatch 重计算重叠
- Block AttnRes:checkpoint 包装使激活与标准 residual 同阶
- 跨 PP 远程 offload(Mooncake)均衡 interleaved 1F1B 激活倾斜
- Pipeline ZeRO-2 + CPU 梯度分片
- Muon:P2P 取分片做正交化,避免全参 all-gather
5.3 多模态 encoder(§5.2.3)
- Dynamic CP:大图 patch 维切分 + gather-KV
- ViT 算力塞进 PP bubbles(继承/扩展 K2.5 DEP)
5.4 1M Agentic RL(§5.3)— 专章必讲
| 机制 |
解决的瓶颈 |
高风险数字/表述 |
| Co-located RL |
分离式集群切换与冗余副本 |
“few hundred GPUs”/实验 |
| Partial rollouts |
超长轨迹尾延迟 |
与前缀命中交互 |
| External KV pool |
1M 多步前缀未命中极贵 |
写回 vs write-through |
| KDA+MLA 生命周期对齐 |
双缓存必须联合恢复 |
实现复杂度 |
| NVMe offload 训练状态 |
给 CPU DRAM 腾 KV 池 |
与训练步交替 |
| Adaptive throttling |
固定并发早期浪费/后期抢占 |
信号:active/queued/KV util |
| Gradient-buffer reuse |
参考模型前向显存 |
与 ZeRO-2 双缓冲预取 |
| AgentENV |
容器隔离不够、长生命环境 |
133ms/49ms ckpt;6.5× overcommit;51,219,741 sandboxes / 1,505,678 images |
| 开源 |
— |
https://github.com/kvcache-ai/AgentENV |
5.5 与 K2 / K2.5 的系统衔接
6. 建议原创图(8–10 张)
| # |
图名 |
教学功能 |
关键元素 |
| D1 |
九账本因果地图 |
全章导航 |
账本节点 + 依赖箭头 + DeepSeek/K3 高亮 |
| D2 |
单卡内存栈爆炸图 |
L1+L2 |
参数/梯度/优化器/激活/临时工作区;ZeRO 前后对比 |
| D3 |
3D mesh + EP/CP 扩展 |
L3/L6/L7 |
五维并行立方体;合法组合约束脚注 |
| D4 |
PP 调度对比条带图 |
L4 |
GPipe / 1F1B / ZeroBubble / DualPipe 并排时间轴 |
| D5 |
通信体积 vs 拓扑 |
L5 |
AllReduce / AG+RS / All-to-All;NVLink vs IB 分层 |
| D6 |
MoE dispatch 数据路径 |
L6 |
token→router→dispatch→experts→combine;DeepEP vs MoonEP 缓冲尺寸标注 |
| D7 |
MoonEP 冗余专家规划示意 |
L6 |
不均路由 → 冗余副本放置 → 每 rank (S\times K) |
| D8 |
DualPipe 四段重叠 |
L4/L5 |
Attention∥comm、dispatch、MLP、combine;双向微批 |
| D9 |
Hybrid KDA–MLA 双状态 |
L7 |
固定 KDA state + 增长 MLA KV;CP 切分方式 |
| D10 |
1M Agentic RL 状态机 |
L9 |
GPU KV ↔ CPU external pool ↔ NVMe 训练状态;AgentENV pause/fork;throttling 反馈环 |
7. 确定性交互实验(Training Systems Lab)
7.1 目标
让读者 选择配置 → 得到可复现的粗估(非性能承诺)。强调:理论 FLOPs ≠ 内存是否装下 ≠ 带宽是否够 ≠ 延迟是否隐藏 ≠ 实测 MFU。
7.2 输入控件
| 输入 |
范围/选项(建议默认) |
| 模型规模 (P) |
7B / 70B / 405B / 671B(MoE) / 2.8T(MoE) 预设 + 自定义 |
| MoE |
dense 或 (E, K, P_{\text{act}}) |
| GPU 数 (N) |
8–8192 |
| 并行度 |
DP, TP, PP, EP, CP(自动检查乘积 = (N)) |
| 精度 |
BF16 / FP8 激活 / FP8 权重训练(简化开关) |
| 序列长 (S) |
2K–1M(对数滑条) |
| micro-batch / global batch |
分离 |
| 优化器 |
AdamW / Muon(状态字节系数不同) |
| Overlap |
off / partial / aggressive(仅影响 有效通信时间模型) |
| Checkpoint |
none / full / selective |
| Offload |
none / CPU / NVMe(容量可行但带宽惩罚) |
7.3 确定性估算输出(公式层,实现时固定版本号)
A. 每卡内存(容量)
[
M_{\text{param}} = \frac{P}{TP\cdot PP\cdot f_{\text{EP-shard}}}, b_w,\quad
M_{\text{grad}} \sim M_{\text{param 等价分片}},\quad
M_{\text{opt}} = \frac{c_{\text{opt}} P}{DP\cdot \ldots},
]
[
M_{\text{act}} = g(B_{\text{local}}, S/CP, H, L, \text{ckpt}, b_{\text{act}})
]
MoE 时 (f_{\text{EP-shard}}) 与专家放置有关;MoonEP 模式下额外显示 冗余专家槽 (\sim E/R) 的参数副本上界(教学提示)。
B. 通信体积(每步,量级)
- DP:梯度 ReduceScatter/AllReduce (\propto P/DP) 量级
- TP:每层 (\propto B S H)
- PP:激活/梯度 P2P (\propto B S H \cdot) 边界层
- EP:all-to-all (\propto B S K d)
- CP:Ring/Ulysses 不同模型切换
C. 流水线利用率(简化)
[
U_{\text{pipe}} = \frac{T_{\text{compute}}}{T_{\text{compute}}+T_{\text{bubble}}+T_{\text{exposed-comm}}}
]
DualPipe 模式切换气泡系数表(来自 V3 Table 2 的 符号化 实现,不写死 GPU 秒)。
D. 瓶颈判定(规则引擎,可解释)
按以下优先级输出 likely bottleneck:
- (M_{\text{total}} >) HBM → 容量
- 否则若 (T_{\text{comm,exposed}} > T_{\text{compute}}) → 通信/延迟
- 否则若 offload 带宽项主导 → PCIe/NVMe 带宽
- 否则若 (U_{\text{pipe}} < 0.5) → 流水线气泡
- 否则 → 算力(FLOPs)受限(仍可低 MFU 若 kernel 差——标注“本 lab 不模拟 kernel 效率”)
E. 明确不承诺
- 不输出真实 tokens/s
- 不替代 NCCL 实测
- 所有常数放入
LAB_CONSTANTS_VERSION JSON,便于勘误
7.4 UI 分栏
- FLOPs 面板:理论训练 FLOPs/token、全局步 FLOPs
- Memory 面板:四栈条形图(param/grad/opt/act)
- Comm 面板:各集合通信体积与粗估时间(带宽假设可调)
- Utilization 面板:气泡、暴露通信、overlap 后有效值
- Verdict:单一瓶颈标签 + 反事实(“若把 CP×2 …”)
7.5 验收用例(确定性黄金集)
| 场景 |
期望 verdict 类型 |
| 70B, 8 GPU, DP=8, S=2k, Adam |
可能装下,瓶颈算力/通信视 batch |
| 70B, 8 GPU, DP=8, S=128k, 无 CP |
激活容量或 OOM |
| 671B MoE, 无 EP, 试图单节点 |
参数容量失败 |
| V3-like:大 EP + DualPipe overlap on |
暴露通信 ↓,瓶颈可能转算力 |
| K3-like:2.8T + MoonEP 静态 shape |
显示冗余专家内存上界;EP 不均项关闭 |
| 1M + co-located RL 开关 |
额外 KV DRAM/NVMe 面板,不与纯预训练内存合并欺骗 |
8. 三十项高风险声明检查清单
写进讲义前逐条对照一手来源,勾选。
- K3:2.8T total / 104B activated
- K3:1M context;训练延拓阶段(8K→…→1M)路径
- K3:16 of 896 routed experts;是否含 shared experts 计数
- K3:约 2.5× scaling efficiency vs K2 的定义(数据?损失?下游?)
- K3:KDA:MLA = 3:1 及层数 69/24
- MoonEP:每 rank 恰 (S\times K) tokens
- MoonEP:冗余专家上界 (E/R) 证明条件
- MoonEP vs DeepEP 缓冲 (S\times K\times R) vs (S\times K)
- fused permute/unpermute “zero-copy” 的实现边界
- 静态 shape 消除 per-layer host sync 的表述是否绝对
- Pipeline ZeRO-2 + CPU 梯度分片细节
- P2P Muon 正交化通信量相对 all-gather 的定量
- 远程激活 offload(Mooncake)与 PP rank 均衡幅度
- Co-located 1M RL “few hundred GPUs”
- External KV write-back 策略与 KDA 对齐
- NVMe offload 训练状态的时序(train↔rollout)
- Auto-throttling 所用运行时信号列表
- AgentENV checkpoint 133 ms / resume 49 ms
- 内存 overcommit 6.5×
- 沙箱总数 51,219,741 / images 1,505,678
- V3:671B / 37B act
- V3:DualPipe 气泡公式与 Table 2 全符号
- V3:参数 2× 副本的内存影响被 EP 稀释的论证
- V3:跨节点 all-to-all “near-zero overhead” 条件
- V3:NVLink 160 GB/s、IB 50 GB/s、每 token ≤4 nodes
- V3:FP8 相对 BF16 loss error 数值
- V3:训练 GPU-hours(如 2.788M H800)口径
- V3:“无需 costly TP” 的配置前提
- V2:236B/21B、MLA 压缩率数字
- V3.2/V4:DSA/CSA 与 1M 效率数字;V4 Pro/Flash 参数量表
9. 章节叙事建议(仍非正文)
- 先讲资源五量纲,再讲并行轴,避免一上来背 DP/TP/PP。
- 每个谱系节点用 “瓶颈→机制→公式→未解” 四格,对应账本 L1–L9。
- DeepSeek-V3 作为 通信-计算重叠与 FP8 的高峰课;K3 作为 EP 完美均衡 + 长轨迹状态栈的高峰课。
- Lab 放在 DualPipe/MoonEP 之后,用同一套符号回放。
- 所有营销式数字进 检查清单,默认脚注 “作者报告,待核”。
10. 本地源与下一步核验动作
| 源 |
路径 |
| K3 TR |
research/sources/kimi-k3/k3_tech_report.{pdf,txt} |
| V3 |
research/sources/moe/2412.19437.* |
| V2 |
research/sources/long-context/2405.04434.* |
| V3.2 / V4 / KDA |
research/sources/long-context/ |
| 方法约束 |
research/METHODOLOGY.md · research/GROK_RESEARCH_ROADMAP.md M15 |
建议下一步(写作前):
- 精读 K3 §5 与附录 E,抽出 MoonEP 伪代码级步骤。
- 精读 V3 §3.2–3.3,重绘 DualPipe 时间图与 Table 2。
- 补下缺失系统 PDF:ZeRO、Megatron 3D、GPipe、Ring、Ulysses、FSDP、MegaBlocks。
- 实现 Lab 常数表 v0,用黄金场景锁定确定性输出。
- 将本包中每条“高风险”映射到站点脚注 ID。
本文件为 research leads only:不替代一手论文,不直接作为站点事实来源。