feat: trace DeepSeek V2-Lite real routes
This commit is contained in:
@@ -1,7 +1,7 @@
|
||||
# DeepSeek 技术谱系二轮正式研究账本
|
||||
# DeepSeek 技术谱系正式研究账本(含三轮真实权重执行)
|
||||
|
||||
> 研究截止:2026-07-29
|
||||
> 课程角色:DeepSeek 聚光专题二轮;与 MoE、长上下文、训练系统、数值、推理、Agent、评测专题互相链接,但不替代各专题完整推导。
|
||||
> 课程角色:DeepSeek 聚光专题三轮;与 MoE、长上下文、训练系统、数值、推理、Agent、评测专题互相链接,但不替代各专题完整推导。
|
||||
> 证据规则:正文事实只来自一手论文、作者官方仓库和 Kimi K3 官方报告;Grok 产物仅见 `DEEPSEEK_GROK_LEADS.md`,不承担证据。
|
||||
> 简化规则:所有二维图、成本滑条和训练曲线若非论文复跑,必须标“教学模型”。
|
||||
|
||||
@@ -557,7 +557,7 @@ total bytes = per-token-layer · L · T · B · bytes
|
||||
- 至少 24 张问题账;
|
||||
- 至少 20 个正文目录;
|
||||
- 60 个一手/官方阅读节点;
|
||||
- 四个独立可操作实验;
|
||||
- 八个独立可操作实验:四个公式/教学实验 + 四个真实工件实验;
|
||||
- DeepSeekMath 必须在主时间线中;
|
||||
- DAPO / Dr.GRPO 必须标后续公开研究;
|
||||
- MLA 实验必须把 RoPE cache 算进去;
|
||||
@@ -568,3 +568,30 @@ total bytes = per-token-layer · L · T · B · bytes
|
||||
- tabs 支持键盘方向键;
|
||||
- toy model、作者报告和公式推导使用不同标签;
|
||||
- 专属 Chrome 回归并纳入全站回归。
|
||||
|
||||
## 8. 第三轮真实权重执行增量
|
||||
|
||||
第三轮固定官方 `deepseek-ai/DeepSeek-V2-Lite` revision
|
||||
`604d5664dddd88a0433dbae533b7fe9472482de0`,在 RTX 5090 上用官方 tokenizer、
|
||||
模型代码与 BF16 第一分片连续执行 layer 0–6。
|
||||
|
||||
已闭合:
|
||||
|
||||
- 4 条固定 prompt、90 个有效 token;
|
||||
- 6 个 MoE 层、每 token top-6,共 3,240 次真实 routed-expert 选择;
|
||||
- 每层 `[4,27,576]` MLA 压缩投影;
|
||||
- HF eager 实际 key `[4,16,27,192]`、value `[4,16,27,128]`;
|
||||
- V2-Lite 逐 token/层 BF16 的 1,152-byte latent 合同与 10,240-byte eager 物化账;
|
||||
- 两次独立执行在来源、tokenization、hidden hashes、MLA shapes、loads 与全部 routes 上
|
||||
`31/31 exact`,计时排除。
|
||||
|
||||
永久边界:
|
||||
|
||||
- 覆盖率不等于均衡,必须同时看 CV、Gini 与 effective experts;
|
||||
- expert ID 不赋予语义,跨层同号 ID 不是同一参数;
|
||||
- `88.75%` 是 V2-Lite latent vs HF eager 的 shape 算术,不冒充 V2 报告 `93.3%`;
|
||||
- layer 7 因跨 shard 停止,不把 7/27 层写成完整模型生成;
|
||||
- 原始权重不进 Git,工件以 revision、SHA-256、脚本、trace 与复跑比较固定。
|
||||
|
||||
完整方法、数值表与复现入口见
|
||||
`research/DEEPSEEK_V2_LITE_TRACE.md`。
|
||||
|
||||
Reference in New Issue
Block a user