feat: trace DeepSeek V2-Lite real routes

This commit is contained in:
wuyang
2026-07-29 14:18:45 +08:00
parent a97653af69
commit e86420556f
14 changed files with 25897 additions and 34 deletions
+30 -3
View File
@@ -1,7 +1,7 @@
# DeepSeek 技术谱系二轮正式研究账本
# DeepSeek 技术谱系正式研究账本(含三轮真实权重执行)
> 研究截止:2026-07-29
> 课程角色:DeepSeek 聚光专题二轮;与 MoE、长上下文、训练系统、数值、推理、Agent、评测专题互相链接,但不替代各专题完整推导。
> 课程角色:DeepSeek 聚光专题三轮;与 MoE、长上下文、训练系统、数值、推理、Agent、评测专题互相链接,但不替代各专题完整推导。
> 证据规则:正文事实只来自一手论文、作者官方仓库和 Kimi K3 官方报告;Grok 产物仅见 `DEEPSEEK_GROK_LEADS.md`,不承担证据。
> 简化规则:所有二维图、成本滑条和训练曲线若非论文复跑,必须标“教学模型”。
@@ -557,7 +557,7 @@ total bytes = per-token-layer · L · T · B · bytes
- 至少 24 张问题账;
- 至少 20 个正文目录;
- 60 个一手/官方阅读节点;
- 四个独立可操作实验;
- 八个独立可操作实验:四个公式/教学实验 + 四个真实工件实验;
- DeepSeekMath 必须在主时间线中;
- DAPO / Dr.GRPO 必须标后续公开研究;
- MLA 实验必须把 RoPE cache 算进去;
@@ -568,3 +568,30 @@ total bytes = per-token-layer · L · T · B · bytes
- tabs 支持键盘方向键;
- toy model、作者报告和公式推导使用不同标签;
- 专属 Chrome 回归并纳入全站回归。
## 8. 第三轮真实权重执行增量
第三轮固定官方 `deepseek-ai/DeepSeek-V2-Lite` revision
`604d5664dddd88a0433dbae533b7fe9472482de0`,在 RTX 5090 上用官方 tokenizer、
模型代码与 BF16 第一分片连续执行 layer 0–6。
已闭合:
- 4 条固定 prompt、90 个有效 token;
- 6 个 MoE 层、每 token top-6,共 3,240 次真实 routed-expert 选择;
- 每层 `[4,27,576]` MLA 压缩投影;
- HF eager 实际 key `[4,16,27,192]`、value `[4,16,27,128]`;
- V2-Lite 逐 token/层 BF16 的 1,152-byte latent 合同与 10,240-byte eager 物化账;
- 两次独立执行在来源、tokenization、hidden hashes、MLA shapes、loads 与全部 routes 上
`31/31 exact`,计时排除。
永久边界:
- 覆盖率不等于均衡,必须同时看 CV、Gini 与 effective experts;
- expert ID 不赋予语义,跨层同号 ID 不是同一参数;
- `88.75%` 是 V2-Lite latent vs HF eager 的 shape 算术,不冒充 V2 报告 `93.3%`;
- layer 7 因跨 shard 停止,不把 7/27 层写成完整模型生成;
- 原始权重不进 Git,工件以 revision、SHA-256、脚本、trace 与复跑比较固定。
完整方法、数值表与复现入口见
`research/DEEPSEEK_V2_LITE_TRACE.md`。