按 expert width 折算,不含 attention
INTERACTIVE / DEEPSEEK SYSTEM ATLAS
这里混合精确计数与显式 toy model:参数组合和 KV 元素按公式计算;通信、bubble 与梯度权重只展示方向。 每个面板都标出证据边界,不能拿来替代真实 checkpoint 或集群复跑。
切换架构或自定义专家配置,分开观察总容量、激活计算和跨设备通信;组合数只是可选路径,不是能力分数。
按 expert width 折算,不含 attention
每 Token 的教学 FFN 单位
只表示可组合路径,不代表专长质量
教学指标;不是 GB/s 实测
V3 每层含 1 个 shared 与 256 个 routed experts,每 Token 激活 8 个 routed;理论稀疏计算仍需要 expert dispatch/combine 与负载均衡。
所有方案都与当前 MHA 基线比较;MLA 的缓存必须包含 joint latent 和 decoupled RoPE key,不能只报 latent。
完整 K 与 V,所有 heads 分开缓存。
Query heads 分组共享 K/V。
joint latent + decoupled RoPE key。
qᵀ(WUKc) = (WUKᵀq)ᵀc
固定线性上投影可吸收到 query/output 权重,不必先物化完整多头 content K/V。
qRᵀ R(j−i) kR
RoPE 是位置相关运算,无法作为固定矩阵吸收;因此 key 的小位置分支仍要缓存。
当前 L × T × B × bytes
同一配置,不是报告基线
由当前滑条计算
V2 报告相对 DeepSeek 67B
元素公式是精确账;GiB 只按所选 dtype 计算,没有加入 allocator、page、quantization metadata 或 kernel workspace。
调度台只显示方向:bubble 与通信是 toy schedule;精度角色和 MTP 生命周期来自 V3 报告。
只由 stages / micro-batches 构造
重叠假设后的教学比例
V3 把主要 GEMM、缩放、累加、master state、敏感算子和通信分别设计;“混合精度”才是完整对象。
主 NTP + 一层 V3-style MTP
推理可丢弃额外 module
草稿仍需验证,不取代主模型
V3 的顺序 MTP 首先增加训练信号;报告明确推理可直接丢弃,也可复用于 speculative decoding。
本台没有复跑 DualPipe 或 FP8 kernel;它只阻止把三个独立机制压成“V3 训练便宜”一句话。
DAPO 与 Dr.GRPO 是 R1 之后的公开研究,不是 DeepSeek 已披露的 R1 内部配方;这里用 toy weight 暴露目标函数偏差。
奖励按组均值和标准差归一;response-level loss 再按各自长度平均,可能改变长短回答的 Token 权重。
R1-Zero 从 V3 Base 直接进行规则奖励 GRPO;“无 reasoning SFT”不等于“无预训练知识”。
优势公式与论文定义对齐;权重只用来显示归一和长度方向,没有 policy ratio、真实 token probability、KL 或 optimizer。