长期驻留或按层 gather
INTERACTIVE / TRAINING SYSTEMS LAB
++ 四个实验都是确定性教学模型,不是任何厂商集群 benchmark。它们分别核算容量、设备分组、气泡和通信, + 刻意不压成一个容易误导的“系统总分”。 +
+MEMORY LEDGER
++ 先把 total parameters 经模型并行折算成每个 DP replica 的近似 shard,再按 ZeRO 阶段切 optimizer、 + gradient 和 parameter。MoE 的 shared/dense 路径并不均匀,故这里的 model-shard factor 只是容量规划近似。 +
+FP16 参数 + FP16 梯度 + FP32 master / momentum / variance;不含临时 buffer。
+可以放入 80 GB HBM,并留有运行缓冲。
+长期驻留或按层 gather
ZeRO-2 reduce-scatter
FP32 三份状态
重计算与卸载之后
需要在 backward 前取回
ZeRO 论文体积口径近似
卸载让 HBM 变小,却把 PCIe / RDMA 带宽和 prefetch 时机加入关键路径。
+PARALLEL MESH
++ 三种 group semantics 分开演示 dense PTD-P、MoE PP×EP×DP 和长上下文 TP×PP×CP×DP。 + 这比把五种缩写无条件相乘更接近真实训练配置。 +
+可用 8 nodes × 8 GPU = 64 GPU,网格完整。
+每层每 micro-batch 的高频 AllReduce,优先留在 NVLink 域。
+相邻 stage 传 activation / gradient,可跨节点但会产生 bubble。
+每 optimizer step 聚合 gradient,频率低于 TP。
+同一个 rank 属于多个 communication groups;“组重叠”不表示这些 group 都是独立 mesh 乘数。
+PIPELINE SCHEDULER
++ 时间轴按等时 slot 简化,只用于展示依赖关系。真实 stage 的 attention、MLP、dispatch、通信和 ViT + 时间并不相等;DualPipe 还需要两份参数,ZeroBubble 则依赖 weight-gradient 能否延后。 +
+理想等时 slot 教学估算
空闲时间相对有效计算
每 stage 的近似上界
DualPipe 为 2×
增加 micro-batches 能摊薄气泡,但 global batch、激活与优化器语义也会一起变化。
+COMMUNICATION & EXPERT DISPATCH
++ 左侧先用 ring 体积和 α–β 模型估 collective;右侧再把 MoE 的 dispatch / combine 与 rank imbalance + 分开。网络时间是可解释估算,不含拥塞、协议效率和 kernel contention。 +
+为不可预知目的地预留 `S×K×R` 路径;最忙 rank 决定 makespan。
+`S×K` fixed buffer;每 rank 冗余 expert slots 上界为 E/R = 4。
+因此 K3 还需要 workload-aware expert-GEMM scheduler;static rank shape 不是所有 kernel 自动同速。
+NEW / CHAPTER 08 LARGE-SCALE TRAINING SYSTEMS
++ 用模型状态、激活、计算划分、气泡、collective、专家、上下文、数值与可靠性九张账, + 从 ZeRO、Megatron 一路走到 DeepSeek DualPipe、Kimi MoonEP 与百万 Token Agentic RL。 +
+NEW / CHAPTER 11 REASONING & TEST-TIME SCALING
@@ -384,9 +402,20 @@ const paths = [ transition: transform 180ms ease, border-color 180ms ease; } + .training-release, .reasoning-release { grid-column: 1 / -1; min-height: 510px; + } + + .training-release { + background: + radial-gradient(circle at 82% 18%, rgba(66, 111, 101, 0.19), transparent 30%), + repeating-linear-gradient(90deg, transparent 0 88px, rgba(94, 125, 117, 0.055) 88px 89px), + var(--paper-raised); + } + + .reasoning-release { background: radial-gradient(circle at 82% 18%, rgba(56, 91, 128, 0.17), transparent 30%), radial-gradient(circle at 63% 72%, rgba(150, 93, 58, 0.11), transparent 28%), @@ -455,6 +484,7 @@ const paths = [ padding-bottom: 76px; } + .training-release, .reasoning-release { grid-column: auto; } diff --git a/src/pages/moe/index.astro b/src/pages/moe/index.astro index fa31435..5168ab4 100644 --- a/src/pages/moe/index.astro +++ b/src/pages/moe/index.astro @@ -683,7 +683,7 @@ const paperChain = [ diff --git a/src/pages/progress/index.astro b/src/pages/progress/index.astro index f87a16a..5e107ed 100644 --- a/src/pages/progress/index.astro +++ b/src/pages/progress/index.astro @@ -15,6 +15,7 @@ const workstreams = [ { label: "推理与测试时扩展", value: 76, next: "真实模型采样曲线、PRM 案例与逐篇图表精读" }, { label: "稀疏计算与 MoE", value: 74, next: "补充真实集群 traces 与专家特化案例" }, { label: "长上下文专题", value: 72, next: "加入更多论文逐图笔记与真实模型配置对比" }, + { label: "大规模训练系统", value: 71, next: "补真实集群 traces、故障案例与精确 topology 配置" }, { label: "引用与事实检查", value: 54, next: "自动化外链复查与来源等级扩展" }, { label: "开源与部署", value: 100, next: "每轮保留不可变镜像、提交与回滚点" }, ]; @@ -39,7 +40,7 @@ const workstreams = [01 WORKSTREAMS
-
内容首版优先打通全局脉络;随后每轮迭代选择一个专题推进到论文/工程层,并做独立事实复核。
@@ -86,12 +87,13 @@ const workstreams = [
47 页报告目录、151 条参考来源和架构/后训练/系统主线已经提取。 从语言模型基础到评测安全,包含先修依赖和三条贯穿案例。 响应式导航、章节模板、侧栏、进度、论文链和证据提示组件。 K3、注意力、DeepSeek、长上下文、MoE,以及推理预算/GRPO/MOPD 三页签实验。 K3 导读、Transformer 基础、DeepSeek 谱系、长上下文、MoE 与推理专题。 K3、注意力、DeepSeek、长上下文、MoE、推理三页签,以及训练系统四页签实验。 K3 导读、Transformer 基础、DeepSeek 谱系、长上下文、MoE、推理与训练系统专题。 五张成本账、26 篇一手论文、10+ 机制图与 8 策略交互实验室。 六张账、19 篇一手论文、DeepSeek/K3 主线与路由—容量—通信交互实验室。 八张账、30 篇一手论文链、DeepSeek/Kimi 双主线与三页签互动实验室。 覆盖 12 个专题,支持全文搜索、标签筛选与 Kimi/DeepSeek 聚光主线。 九张账、37 个一手节点、DeepSeek/Kimi 双谱系与显存—网格—气泡—通信实验室。 覆盖 12 个专题,支持全文搜索、标签筛选与 Kimi/DeepSeek 聚光主线。 源码公开到 git.k1412.top,网站由不可变镜像、Compose Manager 与 HTTPS 交付。K3 报告已结构化拆解
16 专题知识图
编辑式网站系统
八个原创交互视图
六篇首版长文
十二个原创交互视图
七篇首版长文
长上下文深度专题
MoE 深度专题
推理深度专题
146 篇关键论文索引
训练系统深度专题
166 篇关键论文索引
公开仓库与自托管发布
ZeRO / Megatron → Expert/Context Parallel → DualPipe / MoonEP
显存与通信计算器真实集群 traces → 故障恢复 → 精确 topology / kernel 配置
案例库 + 实测边界真实模型配置 → 内核细节 → 长上下文评测与失败案例
配置比较器 + 逐图论文笔记真实负载 traces → 专家特化可解释性 → 共享专家语义
案例库 + 集群证据真实 pass@k 曲线 → PRM 失败案例 → 逐篇图表精读
案例库 + 真实 traces代码 MIT,原创文字与图 CC BY-SA 4.0。
源码公开到 git.k1412.top,网站部署到 k1412 私有基础设施。
把答案、覆盖、选择、过程、预算、优化、分布与系统证据分开核算。
把模型状态、激活、并行、气泡、通信、专家、上下文、数值与可靠性分开核算。
下面 30 篇构成本专题首版主干。课程中的机制、公式与数字优先回到这些一手来源; - 更完整的 146 篇跨专题索引位于论文库。 + 更完整的 166 篇跨专题索引位于论文库。
SYSTEMS / 12 LARGE-SCALE TRAINING
++ 大模型训练不是“卡越多越快”。参数要有地方放,激活要活到反向,矩阵和层要正确切分, + 数据必须穿过真实网络,气泡、负载不均与故障还会把理论算力变成等待。 +
+00 NINE LEDGERS
++ “模型放不下”可能是参数、Adam 状态、激活或临时通信 buffer;“扩展效率低”可能是 GEMM 太小、 + 网络太慢、最忙专家拖尾或 pipeline 没填满。只有先拆账,才知道优化是在消灭成本,还是把它搬到另一层。 +
+ +{question}
+气泡、长尾、故障恢复、环境等待
+NVLink、IB/RoCE、PCIe、存储 I/O
+HBM、CPU DRAM、remote GPU、NVMe
+Tensor Core、CUDA Core、kernel launch
++ GPU 算力是厨师;HBM 是手边案台;跨卡网络是传菜通道;pipeline bubble 是厨师在等上一道工序。 + 增加厨师,如果案台太小、传菜口拥堵或订单全堵在某个专家窗口,仍然不会线性提速。 +
+01 ONE TRAINING STEP
++ 一个同步训练 step 并不是一次“模型运行”。它包含数据进入、forward、保存或处理 activation、 + backward、梯度聚合、optimizer update,以及下一步开始前必须完成的同步。不同状态只在特定时间被需要。 +
+ +读入并 pack Token / 图像 / 视频
storage → CPU → GPU按 layer 产生 activation 与 loss
parameter + compute逆序消费 activation,产生 gradient
recompute / prefetch跨 replica 聚合或分片 gradient
collective用 optimizer states 更新参数
master weights+ 如果一个状态当前不需要,就不必在每张 GPU 上完整常驻。区别在于:ZeRO 把状态放到其他 rank, + checkpointing 把中间量变成未来的重计算,offload 则把它放到更慢的存储层。 +
+02 MODEL-STATE MEMORY
++ ZeRO + 用 FP16/FP32 mixed-precision Adam 说明:前反向权重和梯度各 2 字节,更新还保留 FP32 master parameter、 + momentum 与 variance,各 4 字节。于是基线是 16P,而不是 2P。 +
+ +{role}
++ 这条式子依赖具体 dtype 与状态实现。BF16 gradient、FP32 accumulation、EMA、FP8 scale、flat buffer、 + Muon state 或 fused optimizer 都会改变账单。正确做法是逐张量列 byte ledger。 +
+{traffic}
++ ZeRO 论文把 ReduceScatter 与 AllGather 各近似为 P 的数据移动,所以普通 DP 与 ZeRO-2 都约为 2P, + ZeRO-3 约为 3P。严格 ring 每 rank 的单向发送量还要乘 `(N−1)/N`。不同口径不能直接相除。 +
+03 ACTIVATION LIFECYCLE
++ 增大 DP 只切 batch,不会切开一个超长样本的 activation。标准注意力如果显式保存 `S×S` matrix, + 还会出现平方级中间量。因而 7B 长上下文训练可能比更大参数的短上下文配置更早撞上 HBM。 +
+ +{move.body}
+ 新账单:{move.debt} +Backward 直接读取;activation memory 随层数线性增长。
+只留边界 checkpoint;Backward 经过某段时重跑该段 forward。
+分段 checkpoint 把 n 层 feature-map memory 从 O(n) 降到 O(√n);递归可继续换内存。
+优先重算 memory-heavy、compute-light 中间量,并用 Megatron SP 分片原本复制的 element-wise activation。
+用 SRAM tiling 与 online softmax 避免把完整 S×S attention matrix 写回 HBM;dense attention FLOPs 仍是平方级。
+把 recompute、FP8、local / remote offload 变成 tensor 粒度的可组合 storage policy。
+04 PARALLEL AXES
++ 如果只背缩写,很容易把“更多 GPU”误解成同一种扩展。判断任何配置时,先问: + 每张 GPU 持有什么、每次通信发生在哪个频率、哪个维度真的独立。 +
+ +{body}
+ {comm} ++ 只有互相正交的 device-mesh axes 才连乘。Megatron SP 与 TP 共组;EP 常只作用于 MoE layer; + dense attention、shared expert 和 context group 还可能用另一套 process groups。先画 rank membership。 +
+05 COLLECTIVE COMMUNICATION
+小消息、同步、协议与 kernel launch 更敏感。
+大 tensor 搬运由链路吞吐主导。
+只减关键路径时间,不减物理传输字节。
+消息大,但能被一整个 batch 的计算摊薄。
高频,强依赖节点内低延迟高带宽。
点对点;stage 越多,消息与 bubble 越复杂。
All-to-All;payload 与 top-k、路由宽度和负载相关。
06 PIPELINE BUBBLES
+理想平衡 stage、忽略通信。
m 个 micro-batches 的有效计算。
GPipe / non-interleaved flush 的简化式。
{wave.gain}
留下的债:{wave.debt}两部分绑成一个调度单元,必须一起完成。
+先让前一 stage 继续反传,再把 W 放进之后的空隙。
++ V3 把 forward/backward chunk 拆成 attention、dispatch、MLP、combine,再把 input-grad / weight-grad 分开; + 双向注入 micro-batches,并手动划分通信与计算使用的 SM。通信字节仍真实经过 IB/NVLink, + 只是多数传输在该配置下被相邻计算覆盖,不再暴露在关键路径。 +
+ 边界:DualPipe 需要两份参数,并比表中的 1F1B 多一个 stage-normalized activation 单位。 +07 EXPERT PARALLEL
++ 逻辑 payload 近似随 `tokens × top-k × routed width × bytes` 增长;但 end-to-end time 还受 capacity、 + padding、路由 metadata、跨节点比例和最忙 rank makespan 影响。MoE 专题 + 已详细解释模型路由,本章只聚焦执行系统。 +
+ +路由、自动分片与跨设备 expert execution 成为一体。
不同专家数、capacity、硬件下切换执行策略。
不靠固定 capacity padding / dropping,但真实不均衡工作仍存在。
高吞吐与低延迟 kernel;不单独保证每 rank token load 相同。
每 rank 本地 S Tokens,每 Token 选择 K experts。
+remote tokens 最多来自一个 source rank。
+每个 source rank 本地最多 E/R experts。
+固定 buffer,消除逐层 shape host sync。
++ 每 rank 总 assignments 相同以后,rank 内不同 experts 仍可一多一少。K3 还需要 workload-aware scheduler + 平衡 SM makespan。MoonEP 的 `S×K` vs DeepEP `S×K×R` 也只适用于报告定义的 worst-case copy-free buffer 对照。 +
+08 CONTEXT PARALLEL
+把 sequence shard 转成 head shard;attention 后再转回来。
+每 rank 固定本地 Q,在线累积对全局 K/V 的精确 softmax。
++ KDA 是 recurrent linear attention:每 rank 从本地 Token 计算 fixed-size transition/state fragments, + 一次 AllGather 后用 prefix scan 恢复 incoming state。它不搬完整历史 KV,但只覆盖 KDA 分支; + K3 的 MLA 与视觉 encoder 仍有各自 CP。 +
+09 NUMERICS & OPTIMIZER
+权重与 activation 占多少 HBM。
Tensor Core 使用何种格式。
大量乘加与 reduction 是否丢失小量。
优化器状态和参数更新精度。
+ 主要 compute-intensive GEMM 使用 FP8;敏感操作保留更高精度;tile/block scaling 管动态范围; + WGrad FP8 也让相关 activation 可按 FP8 保存。 +
++ 部分 MoE / SwiGLU 输入压成 FP8-E4M3,scale 为 FP32;K2 明确没有用 FP8 compute, + 因为前期研究观察到潜在性能退化风险。 +
++ Newton–Schulz orthogonalization 需要完整矩阵;K3 不全量 AllGather,而让 owner rank + P2P 获取自己更新所需 shards,并按 model chunk pipeline。 +
+10 DEEPSEEK SYSTEMS LINEAGE
+{body}
少 activated parameters;但跨节点 expert traffic 重。
限制 IB fan-out,再在节点内经 NVLink 转发。
warp specialization 与动态任务分配;这是报告集群的实测配置。
把 A2A 与 attention / MLP / backward 重排进同一时间轴。
+ V3 借助大 EP、ZeRO-1、selective recomputation 与 FP8 把状态放下,避免高频 TP 通信。 + 换硬件、batch、专家布局或上下文长度后,最优并行配置可能改变。 +
+11 KIMI SYSTEMS LINEAGE
+{body}
+ K2 是 1T total-parameter MoE。报告指出,DualPipe 的额外状态会迫使系统增加 PP 或 EP: + 更大 PP 增加 bubble,更大 EP 提高通信与负载成本。因此团队保留 16 PP / 16 EP / ZeRO-1, + 用更多 warmup micro-batches 覆盖 EP communication,并让 WGrad 与 PP communication 并行。 +
+ +在线冗余 expert 规划 → rank perfect balance → static shape
recompute + block FP8 + local/remote offload
GPU double buffer → DP reduce → CPU shards
只取 locally owned matrices 的远端 shards
大图切 patch;大部分 ViT compute 放入 text PP 空隙
12 INTERACTIVE LAB
++ 推荐依次尝试:在显存账中把 70B 切到 ZeRO-3;在 device mesh 选择“故意冲突”; + 在 pipeline 中比较 1F1B 与 DualPipe 的参数副本;最后把通信 overlap 拉到 95%,观察 bytes 不变、exposed time 下降。 +
+13 MILLION-TOKEN AGENTIC RL
+Policy update;model、optimizer 与 gradient 占 GPU/CPU。
训练布局转成 inference layout;K2 用 checkpoint engine。
百万 Token KV、tool latency、partial trajectory 与 sandbox。
Reference / judge forward;权重可能无法常驻 GPU。
active decode blocks 留在 GPU;idle reusable prefix 才进入 external pool,KDA state 与 MLA KV 一起管理。
+一个 VPP slot 当前 forward,另一个 prefetch 下一 chunk;真实 backward 前再被 gradient 覆盖。
+AgentENV 用 Firecracker microVM,支持 incremental checkpoint、resume、fork 与 snapshot。
+报告最低延迟
报告最低延迟
真实 workload 报告
K3 训练与评估累计
+ 系统数字高度依赖镜像、内存 dirty rate、存储层和并发形态。课程保留原始口径,不把最小延迟或最高 overcommit 外推到其他环境。 +
+14 CONFIGURATION PLAYBOOK
+先算精确 byte ledger;考虑 ZeRO/FSDP、TP/PP/EP 或 optimizer offload。
减 micro-batch;selective recompute、FlashAttention、SP/CP、压缩或 offload。
检查 GEMM shape、kernel fusion、micro-batch、低精度和 launch overhead。
先定位 collective、频率和拓扑;再谈减少体积、换 group、chunk 或 overlap。
增加 m、virtual chunks、B/W split 或双向 schedule,同时重算 activation 与参数副本。
分开 router balance、rank placement、redundant experts 与 rank 内 GEMM scheduling。
按 attention 类型选择 Ulysses、Ring、USP 或 recurrent-state CP;不要只增 DP。
计算 checkpoint 恢复时间、数据确定性、world-size reshard 与环境状态恢复。
↳ PRIMARY-SOURCE CHAIN
++ 这不是按引用数排序的“必读榜”,而是一条问题链。建议先读带有当前瓶颈的节点: + 容量读 ZeRO;层内切分读 Megatron;气泡读 GPipe / ZeroBubble;MoE 执行读 MegaBlocks / DeepEP / MoonEP; + 长序列读 Ulysses / Ring / USP;最后回到 DeepSeek 与 Kimi 的整机协同。 +
+ +{note}
+ + ))} ++ 本页机制和数字回查论文、官方技术报告或作者仓库;图均为课程原创简化示意。 + 性能提升只属于论文的模型、集群和基线,不作跨系统排行榜。 +
+