# DeepSeek 技术谱系二轮正式研究账本 > 研究截止:2026-07-29 > 课程角色:DeepSeek 聚光专题二轮;与 MoE、长上下文、训练系统、数值、推理、Agent、评测专题互相链接,但不替代各专题完整推导。 > 证据规则:正文事实只来自一手论文、作者官方仓库和 Kimi K3 官方报告;Grok 产物仅见 `DEEPSEEK_GROK_LEADS.md`,不承担证据。 > 简化规则:所有二维图、成本滑条和训练曲线若非论文复跑,必须标“教学模型”。 ## 0. 本轮要修复什么 现有 DeepSeek 页面建立了正确的代际骨架,但还不足以让读者回答四类问题: 1. **可归因性**:一代同时改模型、数据、精度和系统,怎样知道是哪一项在起作用? 2. **对象边界**:总参数、激活参数、KV 状态、训练显存、墙钟时间和 benchmark 分数不能混算。 3. **训练轨迹**:R1-Zero 的长度曲线、DAPO 的熵崩、Dr.GRPO 的长度偏差分别说明什么? 4. **跨模型对照**:V4 与 K3 都支持 1M,并不意味着状态表示、注意力和服务系统相同。 二轮页面应成为“论文主线的总装图”,而不是再写一遍七个专题。 ## 1. 二十四张正式问题账 | 编号 | 对象 | 读者问题 | 正式回答边界 | |---|---|---|---| | Q01 | Dense 坐标系 | 为什么 DeepSeek LLM 不是可跳过的序章? | 它固定 tokenizer、数据、架构和 scaling 试验的起点;并不单独证明后续所有设计 | | Q02 | 参数角色 | 671B / 37B 各表示什么? | total 是装下的容量,activated 是每 Token 经过的专家参数子集;都不等于端到端 FLOPs | | Q03 | 专家粒度 | 为什么切小专家还要多选? | DeepSeekMoE 把每个专家缩成 `1/m`,总数和激活数同乘 `m`,近似保持专家计算 | | Q04 | Shared expert | 为什么把公共知识单独隔离? | 始终激活的 shared experts 减少 routed experts 重复;仍付激活计算 | | Q05 | 通信税 | 为什么稀疏 FLOPs 不等于便宜? | 路由会产生 dispatch/combine、跨节点 all-to-all、负载长尾和权重访问 | | Q06 | 均衡 | aux-loss-free 到底去掉了什么? | V3 的 expert bias 影响选择、不进入最终 gate weight;仍有 sequence-wise auxiliary loss 防极端失衡 | | Q07 | KV 状态 | 为什么 V2 把服务状态当架构问题? | 权重只装一次,KV 随请求、层、Token 增长,直接限制并发和长上下文 | | Q08 | Attention 压缩 | MQA/GQA/MLA 的差别是什么? | MQA/GQA 共享 K/V 头;MLA 联合低秩压缩 K/V 内容并在计算中恢复 | | Q09 | 矩阵吸收 | MLA 为什么不必显式恢复完整 content key/value? | 无位置项时可利用矩阵乘结合律把上投影吸收到 query/output 投影 | | Q10 | 位置分叉 | 为什么要 decoupled RoPE? | RoPE 位于 key/query 路径中会阻断上述吸收,因此 V2 另设小的 RoPE key/query 分支并缓存 key | | Q11 | FP8 合同 | “FP8 训练”包含哪些角色? | V3 主要 GEMM 用 FP8,配 tile/block scaling、较高精度累加和高精度敏感算子;不是全路径 FP8 | | Q12 | Pipeline | DualPipe 隐藏了什么? | 成对前后向 chunk 的计算—通信重叠并从两端注入 micro-batch;减少而非清零 bubble | | Q13 | MTP | 训练和推理各怎样使用 MTP? | 顺序模块增加未来 Token 监督;推理可丢弃,也可复用于 speculative draft | | Q14 | GRPO | 去掉 critic 后还剩什么? | policy/reference、同题多 rollout、reward/verifier、clip 和 KL;主要省 value model | | Q15 | 可验证奖励 | R1-Zero 的奖励能覆盖哪些任务? | 论文使用数学、代码、逻辑等可规则验证域和格式奖励;复杂开放任务仍是公开限制 | | Q16 | 纯 RL 实验 | R1-Zero 证明了什么? | 强 V3 Base 在无 reasoning SFT 的设置下可被规则奖励继续塑造;不证明无预训练先验 | | Q17 | R1 pipeline | 正式 R1 为什么不是纯 RL? | cold start → reasoning RL → rejection/SFT mix → general RL,各自修可读性、广度和对齐 | | Q18 | 蒸馏 | 为什么学生不是“小号 R1-Zero”? | 报告中的 1.5B–70B 学生主要对约 800K 教师样本做 SFT,没有重演同一 RL | | Q19 | 复现反查 | DAPO/Dr.GRPO 修的是 R1 的什么? | 它们是公开后续研究:分别处理 clip/采样/聚合/截断和长度/难度归一偏差;不是已披露 R1 内部配方 | | Q20 | DSA | 可学习 indexer 为什么不是固定稀疏? | indexer 对历史内容评分,主 attention 只读 top-k;有 warm-up 和 sparse training,仍可能漏检 | | Q21 | Agent 数据 | V3.2 怎样把 reasoning 放进环境? | specialist distillation + mixed RL;真实/合成工具环境、任务、解法和 verifier 构成数据闭环 | | Q22 | V4 Attention | CSA 与 HCA 各压什么? | CSA 先压缩再稀疏 top-k;HCA 用更大压缩率保留所有压缩 entries,不做同类 top-k | | Q23 | V4 稳定化 | mHC、Muon、QK/RMSNorm、clamp 各管什么? | 分别管残差混合、矩阵更新、attention 尺度和 FFN 极值,不能归成一个“稳定性技巧” | | Q24 | K3 对照 | 哪些是祖先,哪些不是? | DeepSeekMoE/MLA 有明确结构继承;QB/KDA/AttnRes/SiTU/MOPD 多为同题新解或同期路线 | ## 2. 十次历史转向:不要画成产品发布日期 ### W1 / Dense:先制造可比较坐标系 DeepSeek LLM(`2401.02954`)的历史作用不是“第一代也很强”,而是: - 在 7B / 67B dense 模型上固定中英数据、BBPE、训练配方; - 用小模型研究 scaling behavior,再选择大模型超参数; - 把 dedup/filter/remix 和 91-dump 全局去重写成可检查步骤; - 给后续 MoE、MLA 和训练系统提供 dense 对照。 证据缓存:`research/sources/scaling-laws/2401.02954.txt`。 ### W2 / DeepSeekMoE:容量与激活计算第一次显式分开 DeepSeekMoE(`2401.06066`)提出: 1. **Fine-grained expert segmentation**:把 `N` 个专家各切成 `m` 份,总数 `mN`,激活数由 `K` 增至 `mK`,保持专家激活宽度近似不变; 2. **Shared expert isolation**:固定激活 `K_s` 个 shared experts,routed 激活数相应减少,使公共变换不必在多个 routed experts 中重复学习。 论文给的是特定规模和 benchmark 下的消融证据,不是所有 MoE/硬件上的普遍优越性。 证据缓存:`research/sources/moe/2401.06066.txt:249-330,606-666`。 ### W3 / V2:把推理状态纳入模型结构 标准 MHA 每层每 Token 的缓存元素与 `2 n_h d_h` 成正比。V2 MLA 的 content 缓存核心变为: ```text c_t^KV = W_DKV h_t cache_content = d_c cache_total = d_c + d_h^R ``` 其中 `d_h^R` 是 decoupled RoPE key 分支。V2 配置使用: - `d_c = 512`(论文以 `4 d_h` 表达); - decoupled RoPE per-head dim `d_h^R = 64`; - 每层每 Token 缓存 `d_c + d_h^R` 个元素,不是只有 `d_c`。 #### 权重吸收为何重要 对 content path: ```text qᵀ(W_UK c) = (W_UKᵀ q)ᵀc W_O(W_UV c) = (W_O W_UV)c ``` 因此推理实现可以在投影权重中吸收上投影,而非先物化所有 heads 的完整 K/V。若直接把 RoPE 施加到 content key,上式之间会插入位置相关旋转矩阵,无法做同样的固定权重吸收。V2 因而将 RoPE 分支解耦。 证据缓存:`research/sources/long-context/2405.04434.txt:330-419`。 V2 的 `−42.5% / −93.3% / 5.76×` 必须始终写成“报告相对 DeepSeek 67B 的特定设置”,不能成为 MLA 常数。 ### W4 / V3:算法—数值—系统协同,不是四个孤立卖点 V3(`2412.19437`)保留 MLA + DeepSeekMoE,并新增四条互锁机制。 #### 2.4.1 Auxiliary-loss-free balance - 每个 routed expert 有动态 bias `b_i`; - bias 参与 top-k 选择; - 真正乘到专家输出上的 gate value 不包含 bias; - 过载 expert 的 bias 下调,低载 expert 上调; - 报告仍保留 sequence-wise auxiliary loss 防止单序列极端失衡。 所以“aux-loss-free”只描述主要全局 balance 策略。 #### 2.4.2 Sequential MTP V3 的第 `k` 个 MTP module 接收上一深度 state 与未来 Token embedding,预测额外未来 Token: ```text L = L_NTP + λ · mean_k(L_MTP^k) ``` MTP embedding/output head 与主模型共享。报告明确: - 训练目标主要为 densify signals / pre-plan representations; - 推理时可以直接丢弃 MTP module; - 也可以将其改作 speculative decoding。 这与“并行一次输出多 Token”不是同一概念。 #### 2.4.3 FP8 mixed precision 必须用角色合同描述: | 角色 | V3 报告处理 | |---|---| | 高密度 GEMM inputs | 细粒度量化后 FP8 | | GEMM accumulation | Tensor Core 路径外补 FP32 精确累加策略 | | master weights / optimizer | 高精度保存与更新 | | 敏感算子 | BF16/FP32 | | activation cache | 部分低精度保存 | | communication | 结合低精度减少带宽 | “V3 用 FP8”不能压缩成单一 dtype 标签。 #### 2.4.4 DualPipe + DeepEP DualPipe: - 从 pipeline 两端注入 micro-batches; - 在成对前/后向 chunk 中重叠计算与通信; - 相对经典 schedule 减少 bubble; - 仍有 divisibility、activation memory 和 stage balance 条件。 DeepEP 官方仓库承载高吞吐/低延迟 expert dispatch/combine kernel;它是系统实现节点,不是 V3 模型算法的新 loss。 证据: - `research/sources/moe/2412.19437.txt:437-448,532-602,644-713,772-999` - `https://github.com/deepseek-ai/DualPipe` - `https://github.com/deepseek-ai/DeepEP` ### W5 / DeepSeekMath:GRPO 首先是一笔 critic 账 DeepSeekMath(`2402.03300`)对同一 prompt 采样 `G` 个输出,以组内 reward 构造 outcome advantage: ```text A_i = (r_i - mean(r_1…r_G)) / (std(r_1…r_G) + ε) ``` 完整目标仍含: - importance ratio; - clipping; - reference-policy KL; - 每题多 rollout; - reward/verifier 执行。 所以 GRPO 去掉 value model,不是去掉 RL 系统。 该论文在特定 7B 数学设置中观察到 Maj@K 改善而 Pass@K 未同样改善,应解释为输出分布重排证据,而非基础覆盖能力的普遍增长。 证据缓存:`research/sources/reasoning/2402.03300.txt`。 ### W6 / R1-Zero → R1:先做隔离实验,再做可用模型 #### R1-Zero - base:DeepSeek-V3 Base; - 无 reasoning SFT; - GRPO; - accuracy reward + format reward; - reasoning 域使用规则验证,避免大规模 neural RM reward hacking; - 训练中报告 AIME accuracy 与平均 response length 轨迹。 这证明在该强 base 和验证域上,RL 能进一步塑造搜索/反思行为;不证明知识与算法从零产生。 #### 正式 R1 ```text V3 Base → cold-start reasoning data → reasoning-oriented RL → rejection sampling + reasoning/general SFT mix → general RL with rule + preference/safety rewards ``` R1-Zero 的可读性和语言混合问题是正式 R1 增加 cold start 与后续阶段的直接理由。 #### Distillation 六个 1.5B–70B 学生使用约 800K R1 生成/筛选样本进行 SFT。它说明强教师轨迹可迁移,不说明学生内部重演了大规模 RL 探索。 证据缓存:`research/sources/reasoning/2501.12948.txt:85-225,324-437,742-844`。 ### W7 / DAPO 与 Dr.GRPO:复现不是尾注,而是算法显微镜 二者都不是 DeepSeek 官方 R1 配方;它们是公开后续研究。 #### DAPO(`2503.14476`) 论文公开四项技术: 1. **Clip-Higher**:上下 clip 解耦,提高上界,缓解熵崩; 2. **Dynamic Sampling**:过滤 reward 全同、优势为零的组并补采; 3. **Token-Level Policy Gradient Loss**:跨 batch Token 聚合,改变长短 response 的权重; 4. **Overlong Reward Shaping**:过滤或平滑惩罚被硬截断的长回答,降低 reward noise。 DAPO 报告的 AIME 分数绑定 Qwen2.5-32B Base、数据、系统和协议,不可写成“算法无条件超过 R1”。 证据缓存:`research/sources/reasoning/2503.14476.txt:79-91,234-459`。 #### Dr.GRPO(`2503.20783`) 论文指出两类偏差: - response-level length bias:response loss 除以自身长度,使每个 Token 的总权重依赖长度; - question-level difficulty bias:优势除以组内 reward std,使低 std 问题获得更大尺度。 其实现用固定全局最大 Token 数作分母,并移除组 std normalization。论文还观察 DeepSeek-V3 Base 在 RL 前即可生成 “aha/wait” 表达,因此单个措辞不能作为 RL 创造反思的因果证据。 这是一组明确假设和实验,不等于“推翻所有 GRPO”。 证据缓存:`research/sources/reasoning/2503.20783.txt:319-343,521-611`。 ### W8 / V3.2:Attention 与 Agent 数据同时转向 #### DSA DeepSeek Sparse Attention: 1. lightning indexer 对 query–history 计算 index score; 2. 选择 top-k KV entries; 3. 主 attention 只在选中 entries 上计算; 4. 在 MLA 架构下实例化; 5. 先 dense warm-up 初始化 indexer,再 sparse continued pre-training 对齐。 主 attention 从 `O(L²)` 降到 `O(Lk)`;indexer 本身仍扫描历史并有额外成本。top-k 是容量约束,不是 recall 保证。 #### Specialist distillation + mixed RL V3.2 将 reasoning、general agent、agentic coding/search 与 human alignment specialists 蒸馏到同一模型,再做 mixed RL。 Agent 数据必须区分: | 类型 | 环境 | Prompt | |---|---|---| | Code agent | 真实 | 抽取 | | Search agent | 真实 API | 合成 | | General agent | 合成工具环境 | 合成 | 报告给出 1,827 个 general-agent environments,并通过 `` 闭环生成。不能将其简化为“更多工具调用文本”。 证据缓存:`research/sources/long-context/2512.02556.txt:122-234,296-371,557-636`。 ### W9 / V4:百万上下文是一组异构状态 V4(`2606.19348`)不只是把 V3.2 context 拉长。 #### CSA - 先按相邻 hidden states 形成压缩 KV entries; - indexer 在压缩 entries 上做 DSA-style top-k; - 主 attention 只读选中的压缩 entries; - 兼有序列压缩与稀疏选择。 #### HCA - 使用显著更大的 compression rate; - 不做与 CSA 相同的 overlapped compression / top-k sparse selection; - 保留所有更少的压缩 entries; - 追求更激进的固定状态压缩。 #### 共同细节 - head-wise query 与 compressed KV RMSNorm; - 最后 64 维 partial RoPE; - shared-KV MQA; - grouped output projection; - 混合层还包含短窗状态,服务端因此维护异构 KV/state cache。 #### mHC 将 residual mapping `B_l` 投影到 doubly stochastic matrices 的 Birkhoff polytope: ```text B_l ≥ 0 rowsum(B_l) = 1 colsum(B_l) = 1 ||B_l||₂ ≤ 1 ``` V4 expansion factor 为 4。它改变相邻层 residual streams 的混合,不等于 AttnRes 沿历史层检索。 #### Muon 与稳定化 - 主要二维矩阵采用 Muon; - embedding、prediction head、RMSNorm weights 等保留 AdamW; - attention Q/K 路径做额外 Norm; - SwiGLU linear branch clamp 到 `[-10,10]`,gate upper cap `10`; - Muon、mHC、Norm、clamp 解决不同对象。 #### Reasoning effort V4 支持多个 effort mode。任何 benchmark 必须带 model variant、effort、context、tool budget 和 harness;“V4 分数”不是单一协议。 证据缓存:`research/sources/long-context/2606.19348.txt:318-741,783-853,1203-1312,1369-1488,1587-1742`。 ### W10 / K3:继承图必须允许“没有箭头” | DeepSeek 节点 | K3 落点 | 关系类型 | 禁止结论 | |---|---|---|---| | DeepSeekMoE fine-grained + shared/routed | Stable LatentMoE shared/routed | 明确结构祖先 | 不代表 expert 数和 router 相同 | | V2 MLA | 周期性 Gated MLA | 明确采用并改造 | K3 不是全 MLA | | V3 loss-free balance | Quantile Balancing | 同问题新方案 | QB 不是 expert bias 改名 | | V3 FP8 | MXFP4 weights + MXFP8 activations QAT | 低精度方向延伸 | 精度角色合同不同 | | GRPO / R1 | multi-domain/multi-effort RL | 共享范式 | K3 未公开等同 R1 的训练轨迹 | | V3.2/V4 long context | 3 KDA + 1 NoPE Gated MLA | 同目标不同状态 | 不把 DSA/CSA/HCA 套到 KDA | | V4 mHC | Block Attention Residuals | 同期不同深度拓扑 | mHC 不是 AttnRes | | V4 Muon | Per-Head Muon | 同优化器族不同参数分组 | 不写相同 optimizer recipe | | R1 distillation | MOPD | 都有 teacher/student | MOPD student rollout 是 on-policy,不能等同离线 SFT | K3 直接证据:`research/sources/kimi-k3/k3_tech_report.txt`。 特别边界: - K3 主模型的 93 层以 12 层为 AttnRes block,得到 8 个 layer blocks,加 embedding 共 9 个来源; - K3 报告的推理芯片 nano-model 原型另使用 block size 2;那是芯片概念验证配置,不能回填主模型架构。 ## 3. 四个交互实验合同 ### Lab 01 / Sparse Capacity Ledger **输入** - architecture:Dense / coarse MoE / DeepSeekMoE / V3; - experts `E`; - routed top-k `k`; - shared experts `s`; - expert width ratio; - EP nodes。 **输出** - total expert units; - active expert units; - theoretical combinations `C(E,k)`(只作组合空间,不作能力); - toy compute ratio; - toy communication pressure; - shared/routed 角色说明。 **强制边界** - 组合数使用对数或科学计数,避免溢出; - 通信为教学指标,不写 GB/s; - total params 与 active params 分列。 ### Lab 02 / MLA Cache Workbench **输入** - layers、context、batch; - MHA heads、head dim; - GQA KV groups; - MLA latent dim、RoPE dim; - bytes/element。 **公式** ```text MHA elements/token/layer = 2 · n_h · d_h GQA elements/token/layer = 2 · n_kv · d_h MLA elements/token/layer = d_c + d_h^R total bytes = per-token-layer · L · T · B · bytes ``` **输出** - 元素、GiB、相对当前 MHA 基线的 reduction; - 显式显示“作者报告值 ≠ 当前教学配置”; - weight absorption / RoPE 分叉图。 ### Lab 03 / V3 Co-design Board **输入** - pipeline stages; - micro-batches; - compute/communication ratio; - schedule:1F1B / dual-ended toy; - precision contract:BF16 / naive FP8 / mixed FP8; - MTP:off / train / speculative。 **输出** - toy bubble fraction; - exposed communication; - activation/master/accumulator dtype 角色; - NTP/MTP supervision count; - MTP inference role。 **边界** - 不声称复现 DualPipe schedule; - bubble/communication 是方向模型; - naive FP8 必须显示风险,不让它看起来更先进。 ### Lab 04 / GRPO Bias Microscope **输入** - 4–8 条 rollout rewards; - 每条长度; - algorithm:GRPO / DAPO-style / Dr.GRPO; - clip low/high; - std norm; - response-level / token-level aggregation; - overlong threshold。 **输出** - normalized advantage; - 每个 response / token 的 toy gradient weight; - reward 全同零信号; - length/difficulty bias 提示; - DAPO/Dr.GRPO 与 R1 的 provenance 标签。 **边界** - 不模拟完整 optimizer 或真实 policy ratio; - 不把 toy gradient 当训练曲线; - DAPO/Dr.GRPO 明确标“后续公开研究,不是 R1 已披露配方”。 ## 4. 六十节点正式阅读链 | # | 年份 | 节点 | 一手链接 | 在本页承担的角色 | |---:|---:|---|---|---| | 01 | 1991 | Adaptive Mixtures of Local Experts | https://proceedings.neurips.cc/paper/1991/hash/59b90e1005a220e2ebc542eb9d950b1e-Abstract.html | 专家门控前史 | | 02 | 2000 | Learning to Reason with Neural Networks / Conditional Computation | https://arxiv.org/abs/cs/0008102 | 条件计算 | | 03 | 2003 | A Neural Probabilistic Language Model | https://www.jmlr.org/papers/v3/bengio03a.html | Dense LM 坐标 | | 04 | 2017 | Attention Is All You Need | https://arxiv.org/abs/1706.03762 | Transformer 主干 | | 05 | 2017 | Outrageously Large Neural Networks | https://arxiv.org/abs/1701.06538 | 稀疏 MoE | | 06 | 2017 | Proximal Policy Optimization Algorithms | https://arxiv.org/abs/1707.06347 | GRPO 对照 | | 07 | 2018 | GPipe | https://arxiv.org/abs/1811.06965 | Pipeline 前史 | | 08 | 2018 | PipeDream | https://arxiv.org/abs/1806.03377 | Pipeline schedule | | 09 | 2019 | Fast Transformer Decoding / MQA | https://arxiv.org/abs/1911.02150 | KV 共享 | | 10 | 2019 | Megatron-LM | https://arxiv.org/abs/1909.08053 | 模型并行 | | 11 | 2019 | ZeRO | https://arxiv.org/abs/1910.02054 | 状态分片 | | 12 | 2019 | RMSNorm | https://arxiv.org/abs/1910.07467 | 尺度控制 | | 13 | 2020 | GShard | https://arxiv.org/abs/2006.16668 | 大规模 MoE | | 14 | 2020 | QK-Normalization | https://arxiv.org/abs/2010.04245 | attention logit 稳定 | | 15 | 2021 | Switch Transformers | https://arxiv.org/abs/2101.03961 | coarse top-1 MoE | | 16 | 2021 | RoFormer / RoPE | https://arxiv.org/abs/2104.09864 | MLA 位置分叉 | | 17 | 2022 | ST-MoE | https://arxiv.org/abs/2202.08906 | MoE 稳定性 | | 18 | 2022 | DeepNet | https://arxiv.org/abs/2203.00555 | 深层残差 | | 19 | 2022 | InstructGPT | https://arxiv.org/abs/2203.02155 | SFT/RM/PPO 合同 | | 20 | 2022 | FlashAttention | https://arxiv.org/abs/2205.14135 | IO-aware exact attention | | 21 | 2022 | Process and Outcome Feedback | https://arxiv.org/abs/2211.14275 | reasoning reward 前史 | | 22 | 2022 | Self-Consistency | https://arxiv.org/abs/2203.11171 | 多采样聚合 | | 23 | 2023 | GQA | https://arxiv.org/abs/2305.13245 | KV 分组 | | 24 | 2023 | Let's Verify Step by Step | https://arxiv.org/abs/2305.20050 | verifier / PRM | | 25 | 2023 | Direct Preference Optimization | https://arxiv.org/abs/2305.18290 | RL 外偏好路线 | | 26 | 2023 | FlashAttention-2 | https://arxiv.org/abs/2307.08691 | attention kernel | | 27 | 2023 | PagedAttention / vLLM | https://arxiv.org/abs/2309.06180 | KV 服务状态 | | 28 | 2024 | DeepSeek LLM | https://arxiv.org/abs/2401.02954 | Dense/scaling 基线 | | 29 | 2024 | DeepSeek-Coder | https://arxiv.org/abs/2401.14196 | 代码数据旁支 | | 30 | 2024 | DeepSeekMoE | https://arxiv.org/abs/2401.06066 | 细粒度 + shared | | 31 | 2024 | DeepSeekMath | https://arxiv.org/abs/2402.03300 | 数学数据 + GRPO | | 32 | 2024 | RLOO | https://arxiv.org/abs/2402.14740 | critic-free 对照 | | 33 | 2024 | DeepSeek-V2 | https://arxiv.org/abs/2405.04434 | MLA + MoE | | 34 | 2024 | Better & Faster LLMs via MTP | https://arxiv.org/abs/2404.19737 | MTP 祖先 | | 35 | 2024 | DeepSeek-Coder-V2 | https://arxiv.org/abs/2406.11931 | V2 continued pretrain 旁支 | | 36 | 2024 | ESFT | https://arxiv.org/abs/2407.01906 | 专家特化微调 | | 37 | 2024 | DeepSeek-Prover-V1.5 | https://arxiv.org/abs/2408.08152 | proof feedback RL | | 38 | 2024 | Hyper-Connections | https://arxiv.org/abs/2409.19606 | mHC 前身 | | 39 | 2024 | DeepSeek-V3 | https://arxiv.org/abs/2412.19437 | FP8/DualPipe/MTP | | 40 | 2025 | DeepSeek-R1 | https://arxiv.org/abs/2501.12948 | R1-Zero/R1/蒸馏 | | 41 | 2025 | Muon is Scalable for LLM Training | https://arxiv.org/abs/2502.16982 | V4 optimizer 前史 | | 42 | 2025 | DAPO | https://arxiv.org/abs/2503.14476 | GRPO 工程修正 | | 43 | 2025 | Understanding R1-Zero-Like Training | https://arxiv.org/abs/2503.20783 | Dr.GRPO / 偏差 | | 44 | 2025 | DeepSeek-Prover-V2 | https://arxiv.org/abs/2504.21801 | subgoal + RL | | 45 | 2025 | DeepEP | https://github.com/deepseek-ai/DeepEP | Expert Parallel kernel | | 46 | 2025 | DualPipe | https://github.com/deepseek-ai/DualPipe | V3/R1 pipeline 实现 | | 47 | 2025 | DeepGEMM | https://github.com/deepseek-ai/DeepGEMM | FP8 GEMM 实现 | | 48 | 2025 | DeepSeek-VL2 | https://arxiv.org/abs/2412.10302 | 多模态理解旁支 | | 49 | 2025 | Janus-Pro | https://arxiv.org/abs/2501.17811 | 统一理解/生成旁支 | | 50 | 2025 | Kimi k1.5 | https://arxiv.org/abs/2501.12599 | 同期 reasoning RL | | 51 | 2025 | Kimi K2 | https://arxiv.org/abs/2507.20534 | MLA/MoE/Muon 对照 | | 52 | 2025 | Kimi Linear | https://arxiv.org/abs/2510.26692 | KDA 前身 | | 53 | 2025 | DeepSeek-V3.2 | https://arxiv.org/abs/2512.02556 | DSA + Agent | | 54 | 2025 | mHC | https://arxiv.org/abs/2512.24880 | 受约束 residual | | 55 | 2026 | Engram | https://arxiv.org/abs/2601.07372 | 条件记忆新稀疏轴 | | 56 | 2026 | LatentMoE | https://arxiv.org/abs/2601.18089 | K3 routed latent 前身 | | 57 | 2026 | Attention Residuals | https://arxiv.org/abs/2603.15031 | K3 深度路由 | | 58 | 2026 | DeepSeek-V4 | https://arxiv.org/abs/2606.19348 | CSA/HCA/mHC/Muon | | 59 | 2026 | Kimi K3 | https://arxiv.org/abs/2607.24653 | 对照锚点 | | 60 | 2026 | Kimi K3 official code/model repository | https://github.com/MoonshotAI/Kimi-K3 | 开放实现边界 | ## 5. 允许进入正文的报告数字 所有数字必须带比较对象: | 数字 | 允许写法 | 禁止写法 | |---|---|---| | V2 `42.5% / 93.3% / 5.76×` | V2 报告相对 DeepSeek 67B 特定设置 | MLA 固有加速 | | V3 `671B / 37B` | total / activated params | 等价 37B dense 端到端成本 | | V3 `14.8T` | 报告预训练 token 总量 | 数据质量证明 | | V3 `2.788M H800 hours` | 报告完整训练口径;硬件限定 | 跨模型统一成本 | | R1 `~800K` | 教师生成/筛选的 distill SFT samples | 小模型自主 RL 数据 | | V3.2 `1,827 environments` | general-agent 合成环境数 | 全部 Agent 数据规模 | | V4 `1.6T/49B`、`284B/13B` | Pro/Flash total/active | 两模型性能排序 | | V4 `27%/10%` 等 | 报告相对 V3.2、1M context 的 FLOPs/KV | 所有服务栈固定比例 | | K3 `2.8T/104B` | total/active | 与 V4 单轴优劣 | ## 6. 事实审计红线 - [x] DAPO 与 Dr.GRPO 不写成 DeepSeek 官方 R1 recipe。 - [x] “aha/wait” 不写成 RL 从零创造推理的因果证据。 - [x] R1 与 R1-Zero 分开。 - [x] Distill students 不写成重跑 RL。 - [x] aux-loss-free 不写成没有任何 auxiliary balance。 - [x] MLA content cache 与 decoupled RoPE cache 都进入公式。 - [x] FP8 用完整角色合同。 - [x] MTP 训练、可丢弃推理与 speculative role 分开。 - [x] DSA indexer 成本与漏检风险保留。 - [x] CSA 与 HCA 分开。 - [x] mHC 与 AttnRes 分开。 - [x] Muon 与 AdamW 参数分组保留。 - [x] V4 与 K3 按状态对象对照,不按 1M 标签归并。 - [x] 主模型 AttnRes block size 12 与 MiniTriton benchmark block size 2 分开。 - [x] 所有 benchmark/成本数字带报告、配置和比较对象。 ## 7. 页面验收合同 - 至少 24 张问题账; - 至少 20 个正文目录; - 60 个一手/官方阅读节点; - 四个独立可操作实验; - DeepSeekMath 必须在主时间线中; - DAPO / Dr.GRPO 必须标后续公开研究; - MLA 实验必须把 RoPE cache 算进去; - V3 实验必须显示 FP8 角色而不是单一开关; - R1 pipeline 必须同时可见 Zero 与正式 R1; - V4/K3 表必须包含“直接祖先 / 同题新解 / 同期不同路线”; - 桌面与 390px 移动端无文档级横向溢出; - tabs 支持键盘方向键; - toy model、作者报告和公式推导使用不同标签; - 专属 Chrome 回归并纳入全站回归。