28 KiB
DeepSeek 技术谱系正式研究账本(含三轮真实权重执行)
研究截止:2026-07-29
课程角色:DeepSeek 聚光专题三轮;与 MoE、长上下文、训练系统、数值、推理、Agent、评测专题互相链接,但不替代各专题完整推导。 证据规则:正文事实只来自一手论文、作者官方仓库和 Kimi K3 官方报告;Grok 产物仅见DEEPSEEK_GROK_LEADS.md,不承担证据。
简化规则:所有二维图、成本滑条和训练曲线若非论文复跑,必须标“教学模型”。
0. 本轮要修复什么
现有 DeepSeek 页面建立了正确的代际骨架,但还不足以让读者回答四类问题:
- 可归因性:一代同时改模型、数据、精度和系统,怎样知道是哪一项在起作用?
- 对象边界:总参数、激活参数、KV 状态、训练显存、墙钟时间和 benchmark 分数不能混算。
- 训练轨迹:R1-Zero 的长度曲线、DAPO 的熵崩、Dr.GRPO 的长度偏差分别说明什么?
- 跨模型对照:V4 与 K3 都支持 1M,并不意味着状态表示、注意力和服务系统相同。
二轮页面应成为“论文主线的总装图”,而不是再写一遍七个专题。
1. 二十四张正式问题账
| 编号 | 对象 | 读者问题 | 正式回答边界 |
|---|---|---|---|
| Q01 | Dense 坐标系 | 为什么 DeepSeek LLM 不是可跳过的序章? | 它固定 tokenizer、数据、架构和 scaling 试验的起点;并不单独证明后续所有设计 |
| Q02 | 参数角色 | 671B / 37B 各表示什么? | total 是装下的容量,activated 是每 Token 经过的专家参数子集;都不等于端到端 FLOPs |
| Q03 | 专家粒度 | 为什么切小专家还要多选? | DeepSeekMoE 把每个专家缩成 1/m,总数和激活数同乘 m,近似保持专家计算 |
| Q04 | Shared expert | 为什么把公共知识单独隔离? | 始终激活的 shared experts 减少 routed experts 重复;仍付激活计算 |
| Q05 | 通信税 | 为什么稀疏 FLOPs 不等于便宜? | 路由会产生 dispatch/combine、跨节点 all-to-all、负载长尾和权重访问 |
| Q06 | 均衡 | aux-loss-free 到底去掉了什么? | V3 的 expert bias 影响选择、不进入最终 gate weight;仍有 sequence-wise auxiliary loss 防极端失衡 |
| Q07 | KV 状态 | 为什么 V2 把服务状态当架构问题? | 权重只装一次,KV 随请求、层、Token 增长,直接限制并发和长上下文 |
| Q08 | Attention 压缩 | MQA/GQA/MLA 的差别是什么? | MQA/GQA 共享 K/V 头;MLA 联合低秩压缩 K/V 内容并在计算中恢复 |
| Q09 | 矩阵吸收 | MLA 为什么不必显式恢复完整 content key/value? | 无位置项时可利用矩阵乘结合律把上投影吸收到 query/output 投影 |
| Q10 | 位置分叉 | 为什么要 decoupled RoPE? | RoPE 位于 key/query 路径中会阻断上述吸收,因此 V2 另设小的 RoPE key/query 分支并缓存 key |
| Q11 | FP8 合同 | “FP8 训练”包含哪些角色? | V3 主要 GEMM 用 FP8,配 tile/block scaling、较高精度累加和高精度敏感算子;不是全路径 FP8 |
| Q12 | Pipeline | DualPipe 隐藏了什么? | 成对前后向 chunk 的计算—通信重叠并从两端注入 micro-batch;减少而非清零 bubble |
| Q13 | MTP | 训练和推理各怎样使用 MTP? | 顺序模块增加未来 Token 监督;推理可丢弃,也可复用于 speculative draft |
| Q14 | GRPO | 去掉 critic 后还剩什么? | policy/reference、同题多 rollout、reward/verifier、clip 和 KL;主要省 value model |
| Q15 | 可验证奖励 | R1-Zero 的奖励能覆盖哪些任务? | 论文使用数学、代码、逻辑等可规则验证域和格式奖励;复杂开放任务仍是公开限制 |
| Q16 | 纯 RL 实验 | R1-Zero 证明了什么? | 强 V3 Base 在无 reasoning SFT 的设置下可被规则奖励继续塑造;不证明无预训练先验 |
| Q17 | R1 pipeline | 正式 R1 为什么不是纯 RL? | cold start → reasoning RL → rejection/SFT mix → general RL,各自修可读性、广度和对齐 |
| Q18 | 蒸馏 | 为什么学生不是“小号 R1-Zero”? | 报告中的 1.5B–70B 学生主要对约 800K 教师样本做 SFT,没有重演同一 RL |
| Q19 | 复现反查 | DAPO/Dr.GRPO 修的是 R1 的什么? | 它们是公开后续研究:分别处理 clip/采样/聚合/截断和长度/难度归一偏差;不是已披露 R1 内部配方 |
| Q20 | DSA | 可学习 indexer 为什么不是固定稀疏? | indexer 对历史内容评分,主 attention 只读 top-k;有 warm-up 和 sparse training,仍可能漏检 |
| Q21 | Agent 数据 | V3.2 怎样把 reasoning 放进环境? | specialist distillation + mixed RL;真实/合成工具环境、任务、解法和 verifier 构成数据闭环 |
| Q22 | V4 Attention | CSA 与 HCA 各压什么? | CSA 先压缩再稀疏 top-k;HCA 用更大压缩率保留所有压缩 entries,不做同类 top-k |
| Q23 | V4 稳定化 | mHC、Muon、QK/RMSNorm、clamp 各管什么? | 分别管残差混合、矩阵更新、attention 尺度和 FFN 极值,不能归成一个“稳定性技巧” |
| Q24 | K3 对照 | 哪些是祖先,哪些不是? | DeepSeekMoE/MLA 有明确结构继承;QB/KDA/AttnRes/SiTU/MOPD 多为同题新解或同期路线 |
2. 十次历史转向:不要画成产品发布日期
W1 / Dense:先制造可比较坐标系
DeepSeek LLM(2401.02954)的历史作用不是“第一代也很强”,而是:
- 在 7B / 67B dense 模型上固定中英数据、BBPE、训练配方;
- 用小模型研究 scaling behavior,再选择大模型超参数;
- 把 dedup/filter/remix 和 91-dump 全局去重写成可检查步骤;
- 给后续 MoE、MLA 和训练系统提供 dense 对照。
证据缓存:research/sources/scaling-laws/2401.02954.txt。
W2 / DeepSeekMoE:容量与激活计算第一次显式分开
DeepSeekMoE(2401.06066)提出:
- Fine-grained expert segmentation:把
N个专家各切成m份,总数mN,激活数由K增至mK,保持专家激活宽度近似不变; - Shared expert isolation:固定激活
K_s个 shared experts,routed 激活数相应减少,使公共变换不必在多个 routed experts 中重复学习。
论文给的是特定规模和 benchmark 下的消融证据,不是所有 MoE/硬件上的普遍优越性。
证据缓存:research/sources/moe/2401.06066.txt:249-330,606-666。
W3 / V2:把推理状态纳入模型结构
标准 MHA 每层每 Token 的缓存元素与 2 n_h d_h 成正比。V2 MLA 的 content 缓存核心变为:
c_t^KV = W_DKV h_t
cache_content = d_c
cache_total = d_c + d_h^R
其中 d_h^R 是 decoupled RoPE key 分支。V2 配置使用:
d_c = 512(论文以4 d_h表达);- decoupled RoPE per-head dim
d_h^R = 64; - 每层每 Token 缓存
d_c + d_h^R个元素,不是只有d_c。
权重吸收为何重要
对 content path:
qᵀ(W_UK c) = (W_UKᵀ q)ᵀc
W_O(W_UV c) = (W_O W_UV)c
因此推理实现可以在投影权重中吸收上投影,而非先物化所有 heads 的完整 K/V。若直接把 RoPE 施加到 content key,上式之间会插入位置相关旋转矩阵,无法做同样的固定权重吸收。V2 因而将 RoPE 分支解耦。
证据缓存:research/sources/long-context/2405.04434.txt:330-419。
V2 的 −42.5% / −93.3% / 5.76× 必须始终写成“报告相对 DeepSeek 67B 的特定设置”,不能成为 MLA 常数。
W4 / V3:算法—数值—系统协同,不是四个孤立卖点
V3(2412.19437)保留 MLA + DeepSeekMoE,并新增四条互锁机制。
2.4.1 Auxiliary-loss-free balance
- 每个 routed expert 有动态 bias
b_i; - bias 参与 top-k 选择;
- 真正乘到专家输出上的 gate value 不包含 bias;
- 过载 expert 的 bias 下调,低载 expert 上调;
- 报告仍保留 sequence-wise auxiliary loss 防止单序列极端失衡。
所以“aux-loss-free”只描述主要全局 balance 策略。
2.4.2 Sequential MTP
V3 的第 k 个 MTP module 接收上一深度 state 与未来 Token embedding,预测额外未来 Token:
L = L_NTP + λ · mean_k(L_MTP^k)
MTP embedding/output head 与主模型共享。报告明确:
- 训练目标主要为 densify signals / pre-plan representations;
- 推理时可以直接丢弃 MTP module;
- 也可以将其改作 speculative decoding。
这与“并行一次输出多 Token”不是同一概念。
2.4.3 FP8 mixed precision
必须用角色合同描述:
| 角色 | V3 报告处理 |
|---|---|
| 高密度 GEMM inputs | 细粒度量化后 FP8 |
| GEMM accumulation | Tensor Core 路径外补 FP32 精确累加策略 |
| master weights / optimizer | 高精度保存与更新 |
| 敏感算子 | BF16/FP32 |
| activation cache | 部分低精度保存 |
| communication | 结合低精度减少带宽 |
“V3 用 FP8”不能压缩成单一 dtype 标签。
2.4.4 DualPipe + DeepEP
DualPipe:
- 从 pipeline 两端注入 micro-batches;
- 在成对前/后向 chunk 中重叠计算与通信;
- 相对经典 schedule 减少 bubble;
- 仍有 divisibility、activation memory 和 stage balance 条件。
DeepEP 官方仓库承载高吞吐/低延迟 expert dispatch/combine kernel;它是系统实现节点,不是 V3 模型算法的新 loss。
证据:
research/sources/moe/2412.19437.txt:437-448,532-602,644-713,772-999https://github.com/deepseek-ai/DualPipehttps://github.com/deepseek-ai/DeepEP
W5 / DeepSeekMath:GRPO 首先是一笔 critic 账
DeepSeekMath(2402.03300)对同一 prompt 采样 G 个输出,以组内 reward 构造 outcome advantage:
A_i = (r_i - mean(r_1…r_G)) / (std(r_1…r_G) + ε)
完整目标仍含:
- importance ratio;
- clipping;
- reference-policy KL;
- 每题多 rollout;
- reward/verifier 执行。
所以 GRPO 去掉 value model,不是去掉 RL 系统。
该论文在特定 7B 数学设置中观察到 Maj@K 改善而 Pass@K 未同样改善,应解释为输出分布重排证据,而非基础覆盖能力的普遍增长。
证据缓存:research/sources/reasoning/2402.03300.txt。
W6 / R1-Zero → R1:先做隔离实验,再做可用模型
R1-Zero
- base:DeepSeek-V3 Base;
- 无 reasoning SFT;
- GRPO;
- accuracy reward + format reward;
- reasoning 域使用规则验证,避免大规模 neural RM reward hacking;
- 训练中报告 AIME accuracy 与平均 response length 轨迹。
这证明在该强 base 和验证域上,RL 能进一步塑造搜索/反思行为;不证明知识与算法从零产生。
正式 R1
V3 Base
→ cold-start reasoning data
→ reasoning-oriented RL
→ rejection sampling + reasoning/general SFT mix
→ general RL with rule + preference/safety rewards
R1-Zero 的可读性和语言混合问题是正式 R1 增加 cold start 与后续阶段的直接理由。
Distillation
六个 1.5B–70B 学生使用约 800K R1 生成/筛选样本进行 SFT。它说明强教师轨迹可迁移,不说明学生内部重演了大规模 RL 探索。
证据缓存:research/sources/reasoning/2501.12948.txt:85-225,324-437,742-844。
W7 / DAPO 与 Dr.GRPO:复现不是尾注,而是算法显微镜
二者都不是 DeepSeek 官方 R1 配方;它们是公开后续研究。
DAPO(2503.14476)
论文公开四项技术:
- Clip-Higher:上下 clip 解耦,提高上界,缓解熵崩;
- Dynamic Sampling:过滤 reward 全同、优势为零的组并补采;
- Token-Level Policy Gradient Loss:跨 batch Token 聚合,改变长短 response 的权重;
- Overlong Reward Shaping:过滤或平滑惩罚被硬截断的长回答,降低 reward noise。
DAPO 报告的 AIME 分数绑定 Qwen2.5-32B Base、数据、系统和协议,不可写成“算法无条件超过 R1”。
证据缓存:research/sources/reasoning/2503.14476.txt:79-91,234-459。
Dr.GRPO(2503.20783)
论文指出两类偏差:
- response-level length bias:response loss 除以自身长度,使每个 Token 的总权重依赖长度;
- question-level difficulty bias:优势除以组内 reward std,使低 std 问题获得更大尺度。
其实现用固定全局最大 Token 数作分母,并移除组 std normalization。论文还观察 DeepSeek-V3 Base 在 RL 前即可生成 “aha/wait” 表达,因此单个措辞不能作为 RL 创造反思的因果证据。
这是一组明确假设和实验,不等于“推翻所有 GRPO”。
证据缓存:research/sources/reasoning/2503.20783.txt:319-343,521-611。
W8 / V3.2:Attention 与 Agent 数据同时转向
DSA
DeepSeek Sparse Attention:
- lightning indexer 对 query–history 计算 index score;
- 选择 top-k KV entries;
- 主 attention 只在选中 entries 上计算;
- 在 MLA 架构下实例化;
- 先 dense warm-up 初始化 indexer,再 sparse continued pre-training 对齐。
主 attention 从 O(L²) 降到 O(Lk);indexer 本身仍扫描历史并有额外成本。top-k 是容量约束,不是 recall 保证。
Specialist distillation + mixed RL
V3.2 将 reasoning、general agent、agentic coding/search 与 human alignment specialists 蒸馏到同一模型,再做 mixed RL。
Agent 数据必须区分:
| 类型 | 环境 | Prompt |
|---|---|---|
| Code agent | 真实 | 抽取 |
| Search agent | 真实 API | 合成 |
| General agent | 合成工具环境 | 合成 |
报告给出 1,827 个 general-agent environments,并通过 <environment, tools, task, verifier> 闭环生成。不能将其简化为“更多工具调用文本”。
证据缓存:research/sources/long-context/2512.02556.txt:122-234,296-371,557-636。
W9 / V4:百万上下文是一组异构状态
V4(2606.19348)不只是把 V3.2 context 拉长。
CSA
- 先按相邻 hidden states 形成压缩 KV entries;
- indexer 在压缩 entries 上做 DSA-style top-k;
- 主 attention 只读选中的压缩 entries;
- 兼有序列压缩与稀疏选择。
HCA
- 使用显著更大的 compression rate;
- 不做与 CSA 相同的 overlapped compression / top-k sparse selection;
- 保留所有更少的压缩 entries;
- 追求更激进的固定状态压缩。
共同细节
- head-wise query 与 compressed KV RMSNorm;
- 最后 64 维 partial RoPE;
- shared-KV MQA;
- grouped output projection;
- 混合层还包含短窗状态,服务端因此维护异构 KV/state cache。
mHC
将 residual mapping B_l 投影到 doubly stochastic matrices 的 Birkhoff polytope:
B_l ≥ 0
rowsum(B_l) = 1
colsum(B_l) = 1
||B_l||₂ ≤ 1
V4 expansion factor 为 4。它改变相邻层 residual streams 的混合,不等于 AttnRes 沿历史层检索。
Muon 与稳定化
- 主要二维矩阵采用 Muon;
- embedding、prediction head、RMSNorm weights 等保留 AdamW;
- attention Q/K 路径做额外 Norm;
- SwiGLU linear branch clamp 到
[-10,10],gate upper cap10; - Muon、mHC、Norm、clamp 解决不同对象。
Reasoning effort
V4 支持多个 effort mode。任何 benchmark 必须带 model variant、effort、context、tool budget 和 harness;“V4 分数”不是单一协议。
证据缓存:research/sources/long-context/2606.19348.txt:318-741,783-853,1203-1312,1369-1488,1587-1742。
W10 / K3:继承图必须允许“没有箭头”
| DeepSeek 节点 | K3 落点 | 关系类型 | 禁止结论 |
|---|---|---|---|
| DeepSeekMoE fine-grained + shared/routed | Stable LatentMoE shared/routed | 明确结构祖先 | 不代表 expert 数和 router 相同 |
| V2 MLA | 周期性 Gated MLA | 明确采用并改造 | K3 不是全 MLA |
| V3 loss-free balance | Quantile Balancing | 同问题新方案 | QB 不是 expert bias 改名 |
| V3 FP8 | MXFP4 weights + MXFP8 activations QAT | 低精度方向延伸 | 精度角色合同不同 |
| GRPO / R1 | multi-domain/multi-effort RL | 共享范式 | K3 未公开等同 R1 的训练轨迹 |
| V3.2/V4 long context | 3 KDA + 1 NoPE Gated MLA | 同目标不同状态 | 不把 DSA/CSA/HCA 套到 KDA |
| V4 mHC | Block Attention Residuals | 同期不同深度拓扑 | mHC 不是 AttnRes |
| V4 Muon | Per-Head Muon | 同优化器族不同参数分组 | 不写相同 optimizer recipe |
| R1 distillation | MOPD | 都有 teacher/student | MOPD student rollout 是 on-policy,不能等同离线 SFT |
K3 直接证据:research/sources/kimi-k3/k3_tech_report.txt。
特别边界:
- K3 主模型的 93 层以 12 层为 AttnRes block,得到 8 个 layer blocks,加 embedding 共 9 个来源;
- K3 报告的推理芯片 nano-model 原型另使用 block size 2;那是芯片概念验证配置,不能回填主模型架构。
3. 四个交互实验合同
Lab 01 / Sparse Capacity Ledger
输入
- architecture:Dense / coarse MoE / DeepSeekMoE / V3;
- experts
E; - routed top-k
k; - shared experts
s; - expert width ratio;
- EP nodes。
输出
- total expert units;
- active expert units;
- theoretical combinations
C(E,k)(只作组合空间,不作能力); - toy compute ratio;
- toy communication pressure;
- shared/routed 角色说明。
强制边界
- 组合数使用对数或科学计数,避免溢出;
- 通信为教学指标,不写 GB/s;
- total params 与 active params 分列。
Lab 02 / MLA Cache Workbench
输入
- layers、context、batch;
- MHA heads、head dim;
- GQA KV groups;
- MLA latent dim、RoPE dim;
- bytes/element。
公式
MHA elements/token/layer = 2 · n_h · d_h
GQA elements/token/layer = 2 · n_kv · d_h
MLA elements/token/layer = d_c + d_h^R
total bytes = per-token-layer · L · T · B · bytes
输出
- 元素、GiB、相对当前 MHA 基线的 reduction;
- 显式显示“作者报告值 ≠ 当前教学配置”;
- weight absorption / RoPE 分叉图。
Lab 03 / V3 Co-design Board
输入
- pipeline stages;
- micro-batches;
- compute/communication ratio;
- schedule:1F1B / dual-ended toy;
- precision contract:BF16 / naive FP8 / mixed FP8;
- MTP:off / train / speculative。
输出
- toy bubble fraction;
- exposed communication;
- activation/master/accumulator dtype 角色;
- NTP/MTP supervision count;
- MTP inference role。
边界
- 不声称复现 DualPipe schedule;
- bubble/communication 是方向模型;
- naive FP8 必须显示风险,不让它看起来更先进。
Lab 04 / GRPO Bias Microscope
输入
- 4–8 条 rollout rewards;
- 每条长度;
- algorithm:GRPO / DAPO-style / Dr.GRPO;
- clip low/high;
- std norm;
- response-level / token-level aggregation;
- overlong threshold。
输出
- normalized advantage;
- 每个 response / token 的 toy gradient weight;
- reward 全同零信号;
- length/difficulty bias 提示;
- DAPO/Dr.GRPO 与 R1 的 provenance 标签。
边界
- 不模拟完整 optimizer 或真实 policy ratio;
- 不把 toy gradient 当训练曲线;
- DAPO/Dr.GRPO 明确标“后续公开研究,不是 R1 已披露配方”。
4. 六十节点正式阅读链
| # | 年份 | 节点 | 一手链接 | 在本页承担的角色 |
|---|---|---|---|---|
| 01 | 1991 | Adaptive Mixtures of Local Experts | https://proceedings.neurips.cc/paper/1991/hash/59b90e1005a220e2ebc542eb9d950b1e-Abstract.html | 专家门控前史 |
| 02 | 2000 | Learning to Reason with Neural Networks / Conditional Computation | https://arxiv.org/abs/cs/0008102 | 条件计算 |
| 03 | 2003 | A Neural Probabilistic Language Model | https://www.jmlr.org/papers/v3/bengio03a.html | Dense LM 坐标 |
| 04 | 2017 | Attention Is All You Need | https://arxiv.org/abs/1706.03762 | Transformer 主干 |
| 05 | 2017 | Outrageously Large Neural Networks | https://arxiv.org/abs/1701.06538 | 稀疏 MoE |
| 06 | 2017 | Proximal Policy Optimization Algorithms | https://arxiv.org/abs/1707.06347 | GRPO 对照 |
| 07 | 2018 | GPipe | https://arxiv.org/abs/1811.06965 | Pipeline 前史 |
| 08 | 2018 | PipeDream | https://arxiv.org/abs/1806.03377 | Pipeline schedule |
| 09 | 2019 | Fast Transformer Decoding / MQA | https://arxiv.org/abs/1911.02150 | KV 共享 |
| 10 | 2019 | Megatron-LM | https://arxiv.org/abs/1909.08053 | 模型并行 |
| 11 | 2019 | ZeRO | https://arxiv.org/abs/1910.02054 | 状态分片 |
| 12 | 2019 | RMSNorm | https://arxiv.org/abs/1910.07467 | 尺度控制 |
| 13 | 2020 | GShard | https://arxiv.org/abs/2006.16668 | 大规模 MoE |
| 14 | 2020 | QK-Normalization | https://arxiv.org/abs/2010.04245 | attention logit 稳定 |
| 15 | 2021 | Switch Transformers | https://arxiv.org/abs/2101.03961 | coarse top-1 MoE |
| 16 | 2021 | RoFormer / RoPE | https://arxiv.org/abs/2104.09864 | MLA 位置分叉 |
| 17 | 2022 | ST-MoE | https://arxiv.org/abs/2202.08906 | MoE 稳定性 |
| 18 | 2022 | DeepNet | https://arxiv.org/abs/2203.00555 | 深层残差 |
| 19 | 2022 | InstructGPT | https://arxiv.org/abs/2203.02155 | SFT/RM/PPO 合同 |
| 20 | 2022 | FlashAttention | https://arxiv.org/abs/2205.14135 | IO-aware exact attention |
| 21 | 2022 | Process and Outcome Feedback | https://arxiv.org/abs/2211.14275 | reasoning reward 前史 |
| 22 | 2022 | Self-Consistency | https://arxiv.org/abs/2203.11171 | 多采样聚合 |
| 23 | 2023 | GQA | https://arxiv.org/abs/2305.13245 | KV 分组 |
| 24 | 2023 | Let's Verify Step by Step | https://arxiv.org/abs/2305.20050 | verifier / PRM |
| 25 | 2023 | Direct Preference Optimization | https://arxiv.org/abs/2305.18290 | RL 外偏好路线 |
| 26 | 2023 | FlashAttention-2 | https://arxiv.org/abs/2307.08691 | attention kernel |
| 27 | 2023 | PagedAttention / vLLM | https://arxiv.org/abs/2309.06180 | KV 服务状态 |
| 28 | 2024 | DeepSeek LLM | https://arxiv.org/abs/2401.02954 | Dense/scaling 基线 |
| 29 | 2024 | DeepSeek-Coder | https://arxiv.org/abs/2401.14196 | 代码数据旁支 |
| 30 | 2024 | DeepSeekMoE | https://arxiv.org/abs/2401.06066 | 细粒度 + shared |
| 31 | 2024 | DeepSeekMath | https://arxiv.org/abs/2402.03300 | 数学数据 + GRPO |
| 32 | 2024 | RLOO | https://arxiv.org/abs/2402.14740 | critic-free 对照 |
| 33 | 2024 | DeepSeek-V2 | https://arxiv.org/abs/2405.04434 | MLA + MoE |
| 34 | 2024 | Better & Faster LLMs via MTP | https://arxiv.org/abs/2404.19737 | MTP 祖先 |
| 35 | 2024 | DeepSeek-Coder-V2 | https://arxiv.org/abs/2406.11931 | V2 continued pretrain 旁支 |
| 36 | 2024 | ESFT | https://arxiv.org/abs/2407.01906 | 专家特化微调 |
| 37 | 2024 | DeepSeek-Prover-V1.5 | https://arxiv.org/abs/2408.08152 | proof feedback RL |
| 38 | 2024 | Hyper-Connections | https://arxiv.org/abs/2409.19606 | mHC 前身 |
| 39 | 2024 | DeepSeek-V3 | https://arxiv.org/abs/2412.19437 | FP8/DualPipe/MTP |
| 40 | 2025 | DeepSeek-R1 | https://arxiv.org/abs/2501.12948 | R1-Zero/R1/蒸馏 |
| 41 | 2025 | Muon is Scalable for LLM Training | https://arxiv.org/abs/2502.16982 | V4 optimizer 前史 |
| 42 | 2025 | DAPO | https://arxiv.org/abs/2503.14476 | GRPO 工程修正 |
| 43 | 2025 | Understanding R1-Zero-Like Training | https://arxiv.org/abs/2503.20783 | Dr.GRPO / 偏差 |
| 44 | 2025 | DeepSeek-Prover-V2 | https://arxiv.org/abs/2504.21801 | subgoal + RL |
| 45 | 2025 | DeepEP | https://github.com/deepseek-ai/DeepEP | Expert Parallel kernel |
| 46 | 2025 | DualPipe | https://github.com/deepseek-ai/DualPipe | V3/R1 pipeline 实现 |
| 47 | 2025 | DeepGEMM | https://github.com/deepseek-ai/DeepGEMM | FP8 GEMM 实现 |
| 48 | 2025 | DeepSeek-VL2 | https://arxiv.org/abs/2412.10302 | 多模态理解旁支 |
| 49 | 2025 | Janus-Pro | https://arxiv.org/abs/2501.17811 | 统一理解/生成旁支 |
| 50 | 2025 | Kimi k1.5 | https://arxiv.org/abs/2501.12599 | 同期 reasoning RL |
| 51 | 2025 | Kimi K2 | https://arxiv.org/abs/2507.20534 | MLA/MoE/Muon 对照 |
| 52 | 2025 | Kimi Linear | https://arxiv.org/abs/2510.26692 | KDA 前身 |
| 53 | 2025 | DeepSeek-V3.2 | https://arxiv.org/abs/2512.02556 | DSA + Agent |
| 54 | 2025 | mHC | https://arxiv.org/abs/2512.24880 | 受约束 residual |
| 55 | 2026 | Engram | https://arxiv.org/abs/2601.07372 | 条件记忆新稀疏轴 |
| 56 | 2026 | LatentMoE | https://arxiv.org/abs/2601.18089 | K3 routed latent 前身 |
| 57 | 2026 | Attention Residuals | https://arxiv.org/abs/2603.15031 | K3 深度路由 |
| 58 | 2026 | DeepSeek-V4 | https://arxiv.org/abs/2606.19348 | CSA/HCA/mHC/Muon |
| 59 | 2026 | Kimi K3 | https://arxiv.org/abs/2607.24653 | 对照锚点 |
| 60 | 2026 | Kimi K3 official code/model repository | https://github.com/MoonshotAI/Kimi-K3 | 开放实现边界 |
5. 允许进入正文的报告数字
所有数字必须带比较对象:
| 数字 | 允许写法 | 禁止写法 |
|---|---|---|
V2 42.5% / 93.3% / 5.76× |
V2 报告相对 DeepSeek 67B 特定设置 | MLA 固有加速 |
V3 671B / 37B |
total / activated params | 等价 37B dense 端到端成本 |
V3 14.8T |
报告预训练 token 总量 | 数据质量证明 |
V3 2.788M H800 hours |
报告完整训练口径;硬件限定 | 跨模型统一成本 |
R1 ~800K |
教师生成/筛选的 distill SFT samples | 小模型自主 RL 数据 |
V3.2 1,827 environments |
general-agent 合成环境数 | 全部 Agent 数据规模 |
V4 1.6T/49B、284B/13B |
Pro/Flash total/active | 两模型性能排序 |
V4 27%/10% 等 |
报告相对 V3.2、1M context 的 FLOPs/KV | 所有服务栈固定比例 |
K3 2.8T/104B |
total/active | 与 V4 单轴优劣 |
6. 事实审计红线
- DAPO 与 Dr.GRPO 不写成 DeepSeek 官方 R1 recipe。
- “aha/wait” 不写成 RL 从零创造推理的因果证据。
- R1 与 R1-Zero 分开。
- Distill students 不写成重跑 RL。
- aux-loss-free 不写成没有任何 auxiliary balance。
- MLA content cache 与 decoupled RoPE cache 都进入公式。
- FP8 用完整角色合同。
- MTP 训练、可丢弃推理与 speculative role 分开。
- DSA indexer 成本与漏检风险保留。
- CSA 与 HCA 分开。
- mHC 与 AttnRes 分开。
- Muon 与 AdamW 参数分组保留。
- V4 与 K3 按状态对象对照,不按 1M 标签归并。
- 主模型 AttnRes block size 12 与 MiniTriton benchmark block size 2 分开。
- 所有 benchmark/成本数字带报告、配置和比较对象。
7. 页面验收合同
- 至少 24 张问题账;
- 至少 20 个正文目录;
- 60 个一手/官方阅读节点;
- 八个独立可操作实验:四个公式/教学实验 + 四个真实工件实验;
- DeepSeekMath 必须在主时间线中;
- DAPO / Dr.GRPO 必须标后续公开研究;
- MLA 实验必须把 RoPE cache 算进去;
- V3 实验必须显示 FP8 角色而不是单一开关;
- R1 pipeline 必须同时可见 Zero 与正式 R1;
- V4/K3 表必须包含“直接祖先 / 同题新解 / 同期不同路线”;
- 桌面与 390px 移动端无文档级横向溢出;
- tabs 支持键盘方向键;
- toy model、作者报告和公式推导使用不同标签;
- 专属 Chrome 回归并纳入全站回归。
8. 第三轮真实权重执行增量
第三轮固定官方 deepseek-ai/DeepSeek-V2-Lite revision
604d5664dddd88a0433dbae533b7fe9472482de0,在 RTX 5090 上用官方 tokenizer、
模型代码与 BF16 第一分片连续执行 layer 0–6。
已闭合:
- 4 条固定 prompt、90 个有效 token;
- 6 个 MoE 层、每 token top-6,共 3,240 次真实 routed-expert 选择;
- 每层
[4,27,576]MLA 压缩投影; - HF eager 实际 key
[4,16,27,192]、value[4,16,27,128]; - V2-Lite 逐 token/层 BF16 的 1,152-byte latent 合同与 10,240-byte eager 物化账;
- 两次独立执行在来源、tokenization、hidden hashes、MLA shapes、loads 与全部 routes 上
31/31 exact,计时排除。
永久边界:
- 覆盖率不等于均衡,必须同时看 CV、Gini 与 effective experts;
- expert ID 不赋予语义,跨层同号 ID 不是同一参数;
88.75%是 V2-Lite latent vs HF eager 的 shape 算术,不冒充 V2 报告93.3%;- layer 7 因跨 shard 停止,不把 7/27 层写成完整模型生成;
- 原始权重不进 Git,工件以 revision、SHA-256、脚本、trace 与复跑比较固定。
完整方法、数值表与复现入口见
research/DEEPSEEK_V2_LITE_TRACE.md。