REAL-WEIGHT LAB / DEEPSEEK-V2-LITE
++ 固定官方 revision、tokenizer、模型代码和 BF16 第一分片;RTX 5090 连续执行 layer 0–6, + 捕获真实 MLA 状态与 3,240 次 routed-expert 选择。所有结论都带证据身份与停止线。 +
+同一个 expert ID 只在当前层内有意义;跨层同号专家是不同参数,图中不会把它们连成“专长轨迹”。
+颜色表示这条 prompt 在当前层的选择次数;空白表示本小样本未触达,不表示专家失效。
+tokens × top-6
至少被选一次
std ÷ mean
exp(route entropy)
这是 4 条固定 prompt、90 个有效 token 的前六个 MoE 层;不能据此命名专家、估计线上总体负载或判断训练均衡。
+覆盖只问是否出现过;CV、Gini 与 effective experts 才描述计数分布。这里同时展示 aggregate 与四条 prompt。
+个专家在本样本为零;总选择数固定为 540。
+只比较“用过哪些 ID”,不比较权重、次数或语义。
+Layer 1 虽触达 63 个专家,CV 仍为 0.925,E8 被选 48 次。
Layer 2 的 64/64、CV 0.549 与 effective 55.08 才构成较完整的描述。
Layer 4 的 E48 只是该层参数索引;不能命名成“代码专家”。
上半区是本次真实 shape;下半区只把相同维度扩展到可调 batch、context、layers 和 dtype。
+512 KV latent + 64 decoupled RoPE key
+官方 eager 路径物化展开后的多头 K/V
+512 latent + 64 RoPE key;需要配套吸收与 attention kernel 才能兑现。
+16 × (192 key + 128 value);按真实 shape 外推,不是服务显存 benchmark。
+相同 B/T/L/dtype 下的元素倍数
相对本次 HF eager 物化口径
这是 V2 报告的另一模型 / 基线 / 配置口径
算法上“可以缓存 576 元素”与本次框架“实际缓存 5,120 元素”同时为真;生产吞吐还需要真实 latent-cache kernel 与 serving runtime。
+第一分片完整包含 layer 0–6;layer 7 跨两个分片。停止线由 checkpoint index 决定,不由页面叙事决定。
+604d5664…2482de0
+ shard 1 · 8.005 GiB · {(shardFraction * 100).toFixed(1)}%
+ torch 2.11.0+cu128
+ 计时不比较:kernel warm-up、频率与系统噪声不属于确定性证据。
+官方 2024 remote code 引用已移除的 is_torch_fx_available。
隔离依赖、本地 package 导入;官方模型源码不打补丁。
+81ff4ab34d20…1f1aef0d7e9f39bde4…1f1e8da7d8e52210952…b45b9c41f3bf64213d…29f669完整 27 层生成、真实 latent-cache kernel、生产服务、训练负载、FP8/pipeline 与 R1-like 训练 trace 仍未覆盖。
+experiments/deepseek/v2_lite_trace.py ·
+ src/data/deepseek-v2-lite-trace.json ·
+ research/DEEPSEEK_V2_LITE_TRACE.md
+ SPOTLIGHT / DEEPSEEK · ROUND 02 ALGORITHM × SYSTEM × EVIDENCE
+SPOTLIGHT / DEEPSEEK · ROUND 03 ALGORITHM × SYSTEM × REAL WEIGHTS
这不是七篇报告的摘要,而是一套可追问、可计算、可反驳的技术谱系: @@ -53,9 +55,9 @@ const toc = [
22 OFFICIAL WEIGHTS / EXECUTED
++ 前面的四联实验负责建立公式与角色合同;下面的四联工件实验固定官方 revision、tokenizer、 + 模型代码和 checkpoint 第一分片,在 RTX 5090 上连续执行 layer 0–6。它把真实观测、shape 推导、 + 实现差距和未覆盖范围放在同一张证据图里。 +
+1 个 dense 层 + 6 个 MoE 层;layer 7 因跨分片停止。
90 个有效 token × 6 层 × top-6 routed experts。
latent 合同与 HF eager 实际展开元素,两张账同时保留。
hidden hashes、MLA shapes、loads 与全部 token routes。
22 THE MAIN LINE IS NOT THE WHOLE TREE
+23 THE MAIN LINE IS NOT THE WHOLE TREE
23 EVIDENCE AUDIT
+24 EVIDENCE AUDIT
NEW / DEEPSEEK ROUND 02 CAPACITY · STATE · SYSTEM · REASONING
+NEW / DEEPSEEK ROUND 03 LINEAGE · REAL WEIGHTS · ROUTES · CACHE
- 用二十四张问题账和十次技术转向,从 DeepSeek LLM、MoE、V2 的 MLA 权重吸收, - 走到 V3 的 FP8 / DualPipe / MTP、R1 与 DAPO / Dr.GRPO 反查、V3.2 Agent 环境和 V4 异构长状态。 + 用二十四张问题账和十次技术转向走完 Dense→V4,再固定官方 V2-Lite 权重执行 7/27 层: + 逐 token 检查 3,240 次专家选择,并把 latent 状态与 HF eager cache 的实现差距摆在同一张账上。
47 页报告目录、151 条参考来源和架构/后训练/系统主线已经提取。
从语言模型基础到评测安全,包含先修依赖和三条贯穿案例。
响应式导航、章节模板、侧栏、进度、论文链和证据提示组件。
K3 三轴图、八联报告实验与四联开放工件实验,以及语言模型前史、Transformer、表示深度、DeepSeek、长上下文、MoE、推理、Agent、多模态、训练系统、推理服务、Scaling、数据工程、数值、Alignment 与评测安全专题。
K3 三轴图、八联报告实验与四联开放工件实验,DeepSeek 四联公式实验与四联真实权重实验,以及语言模型前史、Transformer、表示深度、长上下文、MoE、推理、Agent、多模态、训练系统、推理服务、Scaling、数据工程、数值、Alignment 与评测安全专题。
K3、语言模型前史、Transformer、表示/位置/残差、DeepSeek、Scaling、数据工程、长上下文、MoE、后训练、推理、Agent、原生多模态、训练系统、推理服务、数值优化与评测安全专题。
八张独立问题账、33 个正式节点、20 段长文与概率—向量—记忆—对齐四联实验。
十张独立问题账、40 个正式节点、21 段正文与 QKV—Mask—多头位置—Block 成本四联实验。
二十张问题账、66 个一手节点、DeepSeek/Kimi 双谱系,以及 Token—位置—Norm—Residual/FFN 四联实验。
二十四张问题账、十次技术转向、60 个一手/官方节点,以及稀疏容量—MLA 缓存—V3 协同—RL 偏差四联实验。
在二十四张问题账、十次转向与四联公式实验上,新增 V2-Lite 7/27 层连续 forward、3,240 次真实专家选择、MLA/eager cache 实现账与 31/31 exact 复跑四联实验。
三十二张问题账、Figure 1–16 / Table 1–5 审计、100 节点阅读链,以及 Delta—Decay—AttnRes—LatentMoE—SiTU—QB—MOPD—Cache 八联实验。
固定官方 revisions,审计 96 个 shards、497,220 个 tensor entries 与真实 KDA / MLA / MoE / MoonViT shapes;四联实验分开显示层型、tensor anatomy、参数范围和复现边界。
隔离 CUDA 13.0 / glibc 2.39 编译 sm_120a wheel;6/6 官方参考逐元素相等,并完成 fixed / varlen、三种 state mode 的 1,800 个 CUDA Event samples。
开放权重 traces → FlashKDA / AttnRes / MoE 真实行为 → Figure 1–16 数值重绘与独立复现
运行证据 + 逐图复现真实 expert load / MLA kernel → FP8 / pipeline traces → R1-like RL 小模型复现
运行证据 + 独立复现真实 latent-cache kernel / 更大负载样本 → FP8 / pipeline traces → R1-like RL 小模型复现
运行证据 + 独立复现多头电路逐图 → Pre/Post-LN 真实 traces → Flash/KV 配置与 kernel 对照
逐图笔记 + 实测边界真实 hidden-state / norm traces → 长上下文位置外推 → mHC / AttnRes 深层稳定性消融
可复现实验 + 逐图笔记Kneser–Ney / LSTM / Bahdanau 逐图 → 真实小语料复现 → tokenizer 公平性
可复现实验 + 逐图笔记