REAL-WEIGHT LAB / DEEPSEEK-V2-LITE
固定官方 revision、tokenizer、模型代码和 BF16 第一分片;RTX 5090 连续执行 layer 0–6, 从 3,240 次 token 显微轨迹扩到 11,289,744 次公开语料路由,并让 layer-1 权重继续走入官方吸收式 cache。 所有结论都带证据身份与停止线。
同一个 expert ID 只在当前层内有意义;跨层同号专家是不同参数,图中不会把它们连成“专长轨迹”。
颜色表示这条 prompt 在当前层的选择次数;空白表示本小样本未触达,不表示专家失效。
tokens × top-6
至少被选一次
std ÷ mean
exp(route entropy)
这是 4 条固定 prompt、90 个有效 token 的前六个 MoE 层;不能据此命名专家、估计线上总体负载或判断训练均衡。
覆盖只问是否出现过;CV、Gini 与 effective experts 才描述计数分布。这里同时展示 aggregate 与四条 prompt。
个专家在本样本为零;总选择数固定为 540。
只比较“用过哪些 ID”,不比较权重、次数或语义。
Layer 1 虽触达 63 个专家,CV 仍为 0.925,E8 被选 48 次。
Layer 2 的 64/64、CV 0.549 与 effective 55.08 才构成较完整的描述。
Layer 4 的 E48 只是该层参数索引;不能命名成“代码专家”。
上半区是本次真实 shape;下半区只把相同维度扩展到可调 batch、context、layers 和 dtype。
512 KV latent + 64 decoupled RoPE key
官方 eager 路径物化展开后的多头 K/V
512 latent + 64 RoPE key;需要配套吸收与 attention kernel 才能兑现。
16 × (192 key + 128 value);按真实 shape 外推,不是服务显存 benchmark。
相同 B/T/L/dtype 下的元素倍数
相对本次 HF eager 物化口径
这是 V2 报告的另一模型 / 基线 / 配置口径
算法上“可以缓存 576 元素”与 HF eager“实际缓存 5,120 元素”同时为真;下一页继续执行官方 absorb 参考路径,生产吞吐仍需要受支持的优化 kernel 与 serving runtime。
同一组真实 V2-Lite layer-1 权重、同一条 26-token hidden-state 轨迹: 先用 V3 官方 naive 路径展开 K/V,再用官方 absorb 路径做 25-token prefill + 1-token decode。
qᵀ(Wᴷc) = (Wᴷᵀq)ᵀc
不再为每个历史 token、每个 head 存展开后的 no-RoPE key;query 先变成 512 维,再与 latent c 相乘。
Σ pₜ(Wⱽcₜ) = Wⱽ(Σ pₜcₜ)
先对 512 维 latent 做加权和,再展开成各 head 的 value。含位置的 64 维 RoPE key 不能这样吸收,必须单独缓存。
K [1, 26, 16, 192]
V [1, 26, 16, 128]
26 × 5,120 元素;与 HF eager 是同一种展开状态。
latent [1, 26, 512]
RoPE [1, 26, 64]
26 × 576 元素;两个官方 buffer 的真实 active slice。
展开 K/V ÷ latent + RoPE
官方 V3 naive ↔ absorb decode
同一 BF16 权重转 FP32 做代数审计
完整 JSON SHA-256 6b4c714a…e63d
三组输出均 finite。FP32 不是新的 checkpoint 精度,而是把同一组 BF16 权重提升后, 隔离矩阵乘法顺序造成的舍入误差。
官方支持矩阵与编译目标只覆盖 SM90 / SM100;本机 RTX 5090 是 SM120。
真实权重、真实 latent / RoPE buffers、真实 incremental decode。
host 编译器边界;隔离 CUDA 13 环境缺少 cuda/std/utility。
源码只生成 sm_90a / sm_100f,dense decode 运行时还拒绝非 SM90a。
本实验复现的是“真实权重 + 官方参考实现中的压缩缓存与 decode 等价性”,不是 FlashMLA 性能、 生产 serving 吞吐或 V2 论文完整模型相对 MHA 的 93.3% 缓存降幅。
三个 cohort 都来自 WikiText-2、TNEWS、HumanEval、GSM8K;等长两档使用完全相同的 128 条源 prompt 和嵌套前缀。每个区间都重采样 prompt,不把相关 token 假装成独立样本。
natural ≤96 · matched 16 / 24
每档 4 domains × 32
答案未使用,代码未执行
三档 × 前六个 MoE 层
prompt-level / domain-stratified
自然长度与两个等长 cohort
自然长度 cohort:每条 prompt 先归一再等权;它保留来源长度差异,适合描述实际选中样本。
每一行独立着色;悬停查看 expert ID、份额与 95% 区间。同号 expert 只在当前层内有意义。
0 表示两条分布相同,理论上界 ln(2)≈0.693;这里展示点估计与 prompt bootstrap 区间。
四域 token 总量不同;不能把差异全归因于内容。
short / long 每次 bootstrap 使用同一组 prompt indices;下方 Δ = CV24 − CV16。 负值表示读入后续 8 tokens 后,64-expert 分布更平。
六层中文↔代码 JSD 都下降,24-token 下仍保持非零经验距离。
这是三个固定公开 cohort 上的前六个 MoE 层,不是训练分布或线上流量;matched cohort 只代表各域至少 24 tokens 的子群。 bootstrap 区间描述本探针换 prompt 的稳定性,不是零差异假设检验;没有多重比较校正, 也不能把 E29、E48 等参数索引命名成“中文专家”或“代码专家”。
三种输入使用同一 checkpoint、同一批 128 条 source prompt、同一 padded batch。 既比较真实整段输入,也只比较字符跨度与 token ID 都完全对齐的 2,874 个内容 token。
四域 × 32 · 固定哈希选样
raw · user · generation
三种协议的真实输入总数
三种协议 × 前六个 MoE 层
追加 Assistant: 后 ordered top-6 exact
完整 JSON SHA-256 da1f1033…bc1b9
每条固定 24 input tokens:1 BOS + 23 content。
apply_chat_template 的单轮 user 渲染。
只在末尾追加 suffix;不能反向改变此前 token。
精确对齐内容:三种条件只保留相同相对字符跨度与相同 token ID;wrapper 和边界重切分 token 同时剔除。
同一 batch 内逐 token ordered top-6;未来 suffix 不得改写过去。
CV Δ / TV / JSD;对齐内容不包含新追加的 Assistant:。
整段统计会变化,因为 generation 条件确实加入了新的 suffix token。
每格是一层;绿色表示 USER 更平,红色表示 USER 更集中。切换 scope / aggregation 后重新计算。
RAW→USER 的变化只描述固定 23-content-token 探针中的协议敏感性;不能命名专家, 不能推出完整 27 层或线上对话流量,也没有生成答案。USER→GENERATION 的共享前缀 exact 是 causal-mask 实现负对照,不是“Assistant: 没有作用”——新增 suffix 自己仍有路由。
同一批 128 条目标内容,在官方模板中切换两个固定处理。system 每条恒增 16 tokens, one-shot 每条恒增 17 tokens;四格同 batch,目标内容精确对齐。
与上一模板探针逐项同 cohort
S0F0 · S1F0 · S0F1 · S1F1
四格完整协议输入
四格 × 前六个 MoE 层
相同字符跨度与 token ID
完整 JSON SHA-256 5765fbf8…c1fb
每条约 30 tokens;只含目标单轮。
相对 base 每条固定 +17 tokens。
相对 base 每条固定 +16 tokens。
两种增量严格相加:+16 +17 tokens。
目标内容:四格只保留相同相对字符跨度与相同 token ID;下方 Δ 均为 CV 的 source-paired 2×2 效应。
有 one-shot 时,六层四域的 system-edge TV 全部下降。
system at F0 → system at F1,平均下降约 74%。
绝对 CV system effect 从均值 .068 降至 .016。
不能单独归因给示例语义;距离、EOS、角色与文本共同变化。
每域同时显示目标路由 TV 与逐 token top-6 set exact;左为 F0,右为 F1。
绿色为 CV 下降,红色为 CV 上升;颜色身份只表示方向,不表示能力好坏。
这组 2×2 同时改变固定文本、角色边界、EOS、距离与长度;“24 / 24 TV 下降”是本探针中的 历史缓冲模式,不证明 one-shot 语义本身稳定了路由,更不证明答案质量提升。
system 开 / 关分别搭配无历史、17-token 重复词元 filler 与 17-token 原 one-shot。 filler / demo 的角色、EOS、目标位置与 batch 形状完全相同,只替换历史文本。
四个公开域各 32 条;同一 cohort
system 0/1 × none/filler/demo
六格完整官方模板输入
六格 × 前六个 MoE 层
相同字符跨度与 token ID
完整 JSON SHA-256 423a095d…e648e
目标前没有已完成 turn。
相对 none 固定 +17 tokens。
同样固定 +17 tokens。
system 相对 S0 固定 +16 tokens。
与 S1 demo 的目标位置相同。
只把 filler 文本替换为原示例。
目标内容:六格只保留相同相对字符跨度与相同 token ID;TV 是两条真实 system edge 的分布距离。
none → filler 的 system-edge TV 全部下降,区间也全部低于零。
filler → demo 再次全部下降,区间同样全部低于零。
重复历史复现约一半缓冲;原示例再贡献一个台阶。
`x` 仍是学习过的 token;没有生成答案,也没有测能力。
绿色表示 selected history 让 system-edge TV 下降;每格都来自六格共享 source-bootstrap。
filler 与 demo 在这些协议字段上完全相同,因此可比较固定文本替换。
none → filler 仍同时加入历史与重复 token,不能命名为纯位置因果效应。
跨实验 token IDs 虽 exact,深层 gate hash 可因矩阵形状改变;正式结论只做六格组内比较。
filler 已说明“可读正确示例”不是缓冲出现的必要条件,但 `x` 不是无语义空气; demo 的额外台阶也不能归因给示例正确性。下一步仍需 EOS、角色、多 filler 与行为指标控制。
重复词元历史、角色标记、长度、目标绝对位置与 32-row batch 全部不动; 只把官方 EOS `100001` 分别换成单 token 的 x、句点或换行。
四个公开域各 32 条;同一 cohort
system 0/1 × 四种边界 ID
八格逐组完全同长度
八格 × 前六个 MoE 层
相同字符跨度、位置与 token ID
完整 JSON SHA-256 9bb93834…b9c37
ID 100001
官方 template 自然产生;唯一的合法序列格。
ID 87
普通内容 token;相对官方序列只改一个 ID。
ID 13
普通标点 token;长度与后续位置完全不变。
ID 185
普通换行 token;保留紧随其后的 `User:` 标记。
每个 source 在 S0 / S1 内都通过 4 / 4 同长度、4 / 4 同目标位置;768 / 768 反事实格相对官方 token 序列恰好只改一个 ID。
目标内容:八格只比较完全相同的后续内容 token;正 ΔTV 表示替换 EOS 后 system edge 更大,不表示能力更差。
system-edge TV 全部高于 EOS;23 / 24 配对区间完全高于零。
点估计全部高于 EOS;同样 23 / 24 区间完全高于零。
16 / 24 区间完全高于零;比另两个对照更依赖层与域。
EOS / x / 句点 / 换行;不是准确率或优劣排名。
红色为替换后 system-edge TV 更大,绿色为更小;每格使用八格共享 source-bootstrap。
在固定模型、目标、位置、mask 与 batch 内,EOS→control 的路由差异来自这一个输入干预。
实验没有删除全部回合结构,只识别 EOS token identity;三个反事实也不是合法官方 chat。
不能把较小 TV 命名为“理解回合结束”;仍需 V2-Lite-Chat 与行为生成对照。
EOS 条件下后续目标路由对 system 开关更稳定,但本实验既未生成答案,也未覆盖 Chat 权重; 更小 TV 不等于更正确。下一步要拆 `User:` 角色标记、special-token 家族与行为指标。
官方 EOS、冒号、长度、目标位置、mask 与 32-row batch 全部不动; 目标后的 generation head 另做 causal suffix 负对照。
四个公开域各 32 条;沿用同一 cohort
system 0/1 × 四种词头水平
八格逐组完全同长度
八格 × 前六个 MoE 层
目标 layer×token×system ordered top-6
完整 JSON SHA-256 9dc0e37f…b8caf
5726 / 77398
目标入口与 generation prompt 都保持官方词头。
5726 → 77398
只改目标前词头;冒号与官方 EOS 不动。
5726 → 87
普通内容 token 对照;仍只改一个 ID。
77398 → 5726
发生在目标之后;目标路由必须 causal-exact。
256 / 256 组同长度同目标位置;768 / 768 个反事实相对官方序列恰好一 ID。 三个反事实都不是官方合法 chat。
目标内容:正 ΔTV 表示替换词头后 system edge 更大;direct TV 单独回答“这个 ID 本身改了多少路由”。
S0 / S1 mean target TV;前置词头有直接作用。
S0 / S1;普通 token 对照同样改变后续路由。
目标 ordered top-6 exact;direct TV / JSD 全为零。
U→A / U→x 的 24 格方向混合,均值近零。
每格用八条件共享 source-bootstrap;红色为更大、绿色为更小,跨零不冒充稳定方向。
单个角色词头 ID 足以条件化后续 token 的专家集合。
六层 × 两个 system 水平全部 causal-exact;对齐与 mask 闸门通过。
冒号仍在,且 base ≠ Chat/SFT;没有生成、准确率或安全行为。
当前 official 与上一轮 EOS 条件的 256 / 256 token-ID hashes 相同;下表是跨实验 official target route-hash exact。
前置词头会改变后续路由,但没有统一调制 system;后置负对照严格为零。 special-token family 与完整两-token 角色块已在后续页签闭环;下一步转向 Chat 权重与行为指标。
固定 tokenizer 只有两个 special IDs;本轮完整枚举 EOS/BOS,再放入 `x` 与句点两个普通 单-ID 对照。四个水平同长度、同目标位置、同一个 32-row BF16 batch。
四个公开域各 32 条;同一固定 cohort
system 0/1 × 四个边界 ID
BOS 与 EOS 全枚举;PAD 与 EOS 同 ID
56,784 tokens × 前六个 MoE 层
三类反事实都恰好修改一个 ID
完整 JSON SHA-256 c372c1b0…4af5bf
`all_special_ids = [100000, 100001]`;PAD 复用 EOS `100001`。 所以 BOS/EOS 是完整 special 库,但 `x`/句点只是普通库中的两个选定对照。
100001官方 assistant 历史边界;同时承担 PAD。
100000完整 special inventory 中的另一个独立 ID。
87一个普通内容 token;不是普通词元总体样本。
13一个普通标点 token;不代表全部 delimiter。
目标内容:正 ΔTV 表示替换边界后 system edge 更大;2-vs-2 只描述这四个 ID。
24 个 layer×domain 的目标内容均值。
22↑ / 2↓;19 个 paired CI 全正。
均值 +.016457 / +.017771。
四 ID 描述性汇总;不是总体类别推断。
红色为更大、绿色为更小;每格保留 source-paired 95% bootstrap 区间。
只看编辑位置之后精确对齐的 23 个目标 tokens。
包含被编辑 token 自身,方向可与目标内容不同。
没有生成、正确率、回合理解或安全性指标。
下表合计 EOS / x / 句点三个共享水平,显示跨上一轮实验的 target route-hash exact。
可以说 BOS 不复现 EOS,也可以描述这四个 ID 的 2-vs-2 差异; 不能说普通 token 普遍比 special token 更强,更不能把 route TV 改写成行为质量。
`User:` = `[5726,25]`,`Assistant:` = `[77398,25]`。本轮独立操纵 head 与 delimiter,官方 EOS、目标、长度、位置、mask 和 generation suffix 全部固定。
四域各 32 条;沿用固定 cohort
system × head × delimiter
两个位置都是普通 token,不是专用 role ID
八格 × 六个 MoE 层
零改动 / 单 ID / 双 ID 全 exact
完整 JSON SHA-256 a703dddb…7e82
四个块长度都为 2;`Assistant x` 相对官方 `User:` 恰好改两个 ID。
[5726, 25]官方目标入口。
[77398, 25]只改 head。
[5726, 87]只改 delimiter。
[77398, 87]同时改两个位置。
head main:平均跨过两个 delimiter,User→Assistant 对 system-edge TV 的影响。
User: / Assistant: / User x / Assistant x 均值非常接近。
9↑ / 15↓;CI 3 正 / 3 负 / 18 跨零。
8↑ / 16↓;23 / 24 个 paired CI 跨零。
6↑ / 18↓;局部正负单元同时存在。
S0 / S1 direct target TV。
多数格低于 head@colon。
冒号→x 也会条件化后续路由。
system modulation 仍跨层跨域混合。
每格是带符号 ΔTV;孤立的稳定单元不会被升级成全局结论。
head 与 delimiter 都会条件化后续目标路由。
直接作用不等于统一放大或削弱 system。
`x` 只有一个对照;base ≠ Chat,也没有生成行为。
下表合计两个共享水平;L1 路由全 exact,深层随 companion rows 改变而逐步分化。
可以识别固定 `User/Assistant × :/x` 的路由效应与 interaction; 不能把一个 delimiter control 泛化成标点规律,也不能把 base routing 等同于 Chat 行为。
第一分片完整包含 layer 0–6;layer 7 跨两个分片。停止线由 checkpoint index 决定,不由页面叙事决定。
604d5664…2482de0
shard 1 · 8.005 GiB · {(shardFraction * 100).toFixed(1)}%
torch 2.11.0+cu128
计时不比较:kernel warm-up、频率与系统噪声不属于确定性证据。
官方 2024 remote code 引用已移除的 is_torch_fx_available。
隔离依赖、本地 package 导入;官方模型源码不打补丁。
81ff4ab34d20…1f1aef0d7e9f39bde4…1f1e8da7d8e52210952…b45b9c41f3bf64213d…29f669完整 27 层生成、受支持硬件上的 FlashMLA 优化 kernel、生产服务、训练负载、FP8/pipeline 与 R1-like 训练 trace 仍未覆盖。
experiments/deepseek/v2_lite_trace.py ·
experiments/deepseek/v2_lite_absorb_probe.py ·
experiments/deepseek/v2_lite_routing_corpus.py ·
experiments/deepseek/compare_routing_length_control.py ·
research/DEEPSEEK_ROUTING_LENGTH_CONTROL_AUDIT.md ·
experiments/deepseek/v2_lite_routing_template_probe.py ·
research/DEEPSEEK_ROUTING_TEMPLATE_AUDIT.md ·
experiments/deepseek/v2_lite_routing_history_factorial_probe.py ·
research/DEEPSEEK_ROUTING_HISTORY_FACTORIAL_AUDIT.md ·
experiments/deepseek/v2_lite_routing_history_distance_control.py ·
research/DEEPSEEK_ROUTING_HISTORY_DISTANCE_CONTROL_AUDIT.md ·
experiments/deepseek/v2_lite_routing_history_boundary_token_control.py ·
research/DEEPSEEK_ROUTING_HISTORY_BOUNDARY_TOKEN_AUDIT.md ·
experiments/deepseek/v2_lite_routing_role_marker_head_control.py ·
research/DEEPSEEK_ROUTING_ROLE_MARKER_HEAD_AUDIT.md ·
experiments/deepseek/v2_lite_routing_special_token_family_control.py ·
research/DEEPSEEK_ROUTING_SPECIAL_TOKEN_FAMILY_AUDIT.md ·
experiments/deepseek/v2_lite_routing_role_marker_block_factorial.py ·
research/DEEPSEEK_ROUTING_ROLE_MARKER_BLOCK_AUDIT.md