Files
llm-atlas/research/DEEPSEEK_RESEARCH.md
T
2026-07-29 11:17:53 +08:00

26 KiB
Raw Blame History

DeepSeek 技术谱系二轮正式研究账本

研究截止:2026-07-29
课程角色:DeepSeek 聚光专题二轮;与 MoE、长上下文、训练系统、数值、推理、Agent、评测专题互相链接,但不替代各专题完整推导。
证据规则:正文事实只来自一手论文、作者官方仓库和 Kimi K3 官方报告;Grok 产物仅见 DEEPSEEK_GROK_LEADS.md,不承担证据。
简化规则:所有二维图、成本滑条和训练曲线若非论文复跑,必须标“教学模型”。

0. 本轮要修复什么

现有 DeepSeek 页面建立了正确的代际骨架,但还不足以让读者回答四类问题:

  1. 可归因性:一代同时改模型、数据、精度和系统,怎样知道是哪一项在起作用?
  2. 对象边界:总参数、激活参数、KV 状态、训练显存、墙钟时间和 benchmark 分数不能混算。
  3. 训练轨迹:R1-Zero 的长度曲线、DAPO 的熵崩、Dr.GRPO 的长度偏差分别说明什么?
  4. 跨模型对照:V4 与 K3 都支持 1M,并不意味着状态表示、注意力和服务系统相同。

二轮页面应成为“论文主线的总装图”,而不是再写一遍七个专题。

1. 二十四张正式问题账

编号 对象 读者问题 正式回答边界
Q01 Dense 坐标系 为什么 DeepSeek LLM 不是可跳过的序章? 它固定 tokenizer、数据、架构和 scaling 试验的起点;并不单独证明后续所有设计
Q02 参数角色 671B / 37B 各表示什么? total 是装下的容量,activated 是每 Token 经过的专家参数子集;都不等于端到端 FLOPs
Q03 专家粒度 为什么切小专家还要多选? DeepSeekMoE 把每个专家缩成 1/m,总数和激活数同乘 m,近似保持专家计算
Q04 Shared expert 为什么把公共知识单独隔离? 始终激活的 shared experts 减少 routed experts 重复;仍付激活计算
Q05 通信税 为什么稀疏 FLOPs 不等于便宜? 路由会产生 dispatch/combine、跨节点 all-to-all、负载长尾和权重访问
Q06 均衡 aux-loss-free 到底去掉了什么? V3 的 expert bias 影响选择、不进入最终 gate weight;仍有 sequence-wise auxiliary loss 防极端失衡
Q07 KV 状态 为什么 V2 把服务状态当架构问题? 权重只装一次,KV 随请求、层、Token 增长,直接限制并发和长上下文
Q08 Attention 压缩 MQA/GQA/MLA 的差别是什么? MQA/GQA 共享 K/V 头;MLA 联合低秩压缩 K/V 内容并在计算中恢复
Q09 矩阵吸收 MLA 为什么不必显式恢复完整 content key/value? 无位置项时可利用矩阵乘结合律把上投影吸收到 query/output 投影
Q10 位置分叉 为什么要 decoupled RoPE? RoPE 位于 key/query 路径中会阻断上述吸收,因此 V2 另设小的 RoPE key/query 分支并缓存 key
Q11 FP8 合同 “FP8 训练”包含哪些角色? V3 主要 GEMM 用 FP8,配 tile/block scaling、较高精度累加和高精度敏感算子;不是全路径 FP8
Q12 Pipeline DualPipe 隐藏了什么? 成对前后向 chunk 的计算—通信重叠并从两端注入 micro-batch;减少而非清零 bubble
Q13 MTP 训练和推理各怎样使用 MTP? 顺序模块增加未来 Token 监督;推理可丢弃,也可复用于 speculative draft
Q14 GRPO 去掉 critic 后还剩什么? policy/reference、同题多 rollout、reward/verifier、clip 和 KL;主要省 value model
Q15 可验证奖励 R1-Zero 的奖励能覆盖哪些任务? 论文使用数学、代码、逻辑等可规则验证域和格式奖励;复杂开放任务仍是公开限制
Q16 纯 RL 实验 R1-Zero 证明了什么? 强 V3 Base 在无 reasoning SFT 的设置下可被规则奖励继续塑造;不证明无预训练先验
Q17 R1 pipeline 正式 R1 为什么不是纯 RL? cold start → reasoning RL → rejection/SFT mix → general RL,各自修可读性、广度和对齐
Q18 蒸馏 为什么学生不是“小号 R1-Zero”? 报告中的 1.5B–70B 学生主要对约 800K 教师样本做 SFT,没有重演同一 RL
Q19 复现反查 DAPO/Dr.GRPO 修的是 R1 的什么? 它们是公开后续研究:分别处理 clip/采样/聚合/截断和长度/难度归一偏差;不是已披露 R1 内部配方
Q20 DSA 可学习 indexer 为什么不是固定稀疏? indexer 对历史内容评分,主 attention 只读 top-k;有 warm-up 和 sparse training,仍可能漏检
Q21 Agent 数据 V3.2 怎样把 reasoning 放进环境? specialist distillation + mixed RL;真实/合成工具环境、任务、解法和 verifier 构成数据闭环
Q22 V4 Attention CSA 与 HCA 各压什么? CSA 先压缩再稀疏 top-k;HCA 用更大压缩率保留所有压缩 entries,不做同类 top-k
Q23 V4 稳定化 mHC、Muon、QK/RMSNorm、clamp 各管什么? 分别管残差混合、矩阵更新、attention 尺度和 FFN 极值,不能归成一个“稳定性技巧”
Q24 K3 对照 哪些是祖先,哪些不是? DeepSeekMoE/MLA 有明确结构继承;QB/KDA/AttnRes/SiTU/MOPD 多为同题新解或同期路线

2. 十次历史转向:不要画成产品发布日期

W1 / Dense:先制造可比较坐标系

DeepSeek LLM(2401.02954)的历史作用不是“第一代也很强”,而是:

  • 在 7B / 67B dense 模型上固定中英数据、BBPE、训练配方;
  • 用小模型研究 scaling behavior,再选择大模型超参数;
  • 把 dedup/filter/remix 和 91-dump 全局去重写成可检查步骤;
  • 给后续 MoE、MLA 和训练系统提供 dense 对照。

证据缓存:research/sources/scaling-laws/2401.02954.txt。

W2 / DeepSeekMoE:容量与激活计算第一次显式分开

DeepSeekMoE(2401.06066)提出:

  1. Fine-grained expert segmentation:把 N 个专家各切成 m 份,总数 mN,激活数由 K 增至 mK,保持专家激活宽度近似不变;
  2. Shared expert isolation:固定激活 K_s 个 shared experts,routed 激活数相应减少,使公共变换不必在多个 routed experts 中重复学习。

论文给的是特定规模和 benchmark 下的消融证据,不是所有 MoE/硬件上的普遍优越性。

证据缓存:research/sources/moe/2401.06066.txt:249-330,606-666。

W3 / V2:把推理状态纳入模型结构

标准 MHA 每层每 Token 的缓存元素与 2 n_h d_h 成正比。V2 MLA 的 content 缓存核心变为:

c_t^KV = W_DKV h_t
cache_content = d_c
cache_total = d_c + d_h^R

其中 d_h^R 是 decoupled RoPE key 分支。V2 配置使用:

  • d_c = 512(论文以 4 d_h 表达);
  • decoupled RoPE per-head dim d_h^R = 64;
  • 每层每 Token 缓存 d_c + d_h^R 个元素,不是只有 d_c。

权重吸收为何重要

对 content path:

qᵀ(W_UK c) = (W_UKᵀ q)ᵀc
W_O(W_UV c) = (W_O W_UV)c

因此推理实现可以在投影权重中吸收上投影,而非先物化所有 heads 的完整 K/V。若直接把 RoPE 施加到 content key,上式之间会插入位置相关旋转矩阵,无法做同样的固定权重吸收。V2 因而将 RoPE 分支解耦。

证据缓存:research/sources/long-context/2405.04434.txt:330-419。

V2 的 −42.5% / −93.3% / 5.76× 必须始终写成“报告相对 DeepSeek 67B 的特定设置”,不能成为 MLA 常数。

W4 / V3:算法—数值—系统协同,不是四个孤立卖点

V3(2412.19437)保留 MLA + DeepSeekMoE,并新增四条互锁机制。

2.4.1 Auxiliary-loss-free balance

  • 每个 routed expert 有动态 bias b_i;
  • bias 参与 top-k 选择;
  • 真正乘到专家输出上的 gate value 不包含 bias;
  • 过载 expert 的 bias 下调,低载 expert 上调;
  • 报告仍保留 sequence-wise auxiliary loss 防止单序列极端失衡。

所以“aux-loss-free”只描述主要全局 balance 策略。

2.4.2 Sequential MTP

V3 的第 k 个 MTP module 接收上一深度 state 与未来 Token embedding,预测额外未来 Token:

L = L_NTP + λ · mean_k(L_MTP^k)

MTP embedding/output head 与主模型共享。报告明确:

  • 训练目标主要为 densify signals / pre-plan representations;
  • 推理时可以直接丢弃 MTP module;
  • 也可以将其改作 speculative decoding。

这与“并行一次输出多 Token”不是同一概念。

2.4.3 FP8 mixed precision

必须用角色合同描述:

角色 V3 报告处理
高密度 GEMM inputs 细粒度量化后 FP8
GEMM accumulation Tensor Core 路径外补 FP32 精确累加策略
master weights / optimizer 高精度保存与更新
敏感算子 BF16/FP32
activation cache 部分低精度保存
communication 结合低精度减少带宽

“V3 用 FP8”不能压缩成单一 dtype 标签。

2.4.4 DualPipe + DeepEP

DualPipe:

  • 从 pipeline 两端注入 micro-batches;
  • 在成对前/后向 chunk 中重叠计算与通信;
  • 相对经典 schedule 减少 bubble;
  • 仍有 divisibility、activation memory 和 stage balance 条件。

DeepEP 官方仓库承载高吞吐/低延迟 expert dispatch/combine kernel;它是系统实现节点,不是 V3 模型算法的新 loss。

证据:

  • research/sources/moe/2412.19437.txt:437-448,532-602,644-713,772-999
  • https://github.com/deepseek-ai/DualPipe
  • https://github.com/deepseek-ai/DeepEP

W5 / DeepSeekMath:GRPO 首先是一笔 critic 账

DeepSeekMath(2402.03300)对同一 prompt 采样 G 个输出,以组内 reward 构造 outcome advantage:

A_i = (r_i - mean(r_1…r_G)) / (std(r_1…r_G) + ε)

完整目标仍含:

  • importance ratio;
  • clipping;
  • reference-policy KL;
  • 每题多 rollout;
  • reward/verifier 执行。

所以 GRPO 去掉 value model,不是去掉 RL 系统。

该论文在特定 7B 数学设置中观察到 Maj@K 改善而 Pass@K 未同样改善,应解释为输出分布重排证据,而非基础覆盖能力的普遍增长。

证据缓存:research/sources/reasoning/2402.03300.txt。

W6 / R1-Zero → R1:先做隔离实验,再做可用模型

R1-Zero

  • base:DeepSeek-V3 Base;
  • 无 reasoning SFT;
  • GRPO;
  • accuracy reward + format reward;
  • reasoning 域使用规则验证,避免大规模 neural RM reward hacking;
  • 训练中报告 AIME accuracy 与平均 response length 轨迹。

这证明在该强 base 和验证域上,RL 能进一步塑造搜索/反思行为;不证明知识与算法从零产生。

正式 R1

V3 Base
→ cold-start reasoning data
→ reasoning-oriented RL
→ rejection sampling + reasoning/general SFT mix
→ general RL with rule + preference/safety rewards

R1-Zero 的可读性和语言混合问题是正式 R1 增加 cold start 与后续阶段的直接理由。

Distillation

六个 1.5B–70B 学生使用约 800K R1 生成/筛选样本进行 SFT。它说明强教师轨迹可迁移,不说明学生内部重演了大规模 RL 探索。

证据缓存:research/sources/reasoning/2501.12948.txt:85-225,324-437,742-844。

W7 / DAPO 与 Dr.GRPO:复现不是尾注,而是算法显微镜

二者都不是 DeepSeek 官方 R1 配方;它们是公开后续研究。

DAPO(2503.14476)

论文公开四项技术:

  1. Clip-Higher:上下 clip 解耦,提高上界,缓解熵崩;
  2. Dynamic Sampling:过滤 reward 全同、优势为零的组并补采;
  3. Token-Level Policy Gradient Loss:跨 batch Token 聚合,改变长短 response 的权重;
  4. Overlong Reward Shaping:过滤或平滑惩罚被硬截断的长回答,降低 reward noise。

DAPO 报告的 AIME 分数绑定 Qwen2.5-32B Base、数据、系统和协议,不可写成“算法无条件超过 R1”。

证据缓存:research/sources/reasoning/2503.14476.txt:79-91,234-459。

Dr.GRPO(2503.20783)

论文指出两类偏差:

  • response-level length bias:response loss 除以自身长度,使每个 Token 的总权重依赖长度;
  • question-level difficulty bias:优势除以组内 reward std,使低 std 问题获得更大尺度。

其实现用固定全局最大 Token 数作分母,并移除组 std normalization。论文还观察 DeepSeek-V3 Base 在 RL 前即可生成 “aha/wait” 表达,因此单个措辞不能作为 RL 创造反思的因果证据。

这是一组明确假设和实验,不等于“推翻所有 GRPO”。

证据缓存:research/sources/reasoning/2503.20783.txt:319-343,521-611。

W8 / V3.2:Attention 与 Agent 数据同时转向

DSA

DeepSeek Sparse Attention:

  1. lightning indexer 对 query–history 计算 index score;
  2. 选择 top-k KV entries;
  3. 主 attention 只在选中 entries 上计算;
  4. 在 MLA 架构下实例化;
  5. 先 dense warm-up 初始化 indexer,再 sparse continued pre-training 对齐。

主 attention 从 O(L²) 降到 O(Lk);indexer 本身仍扫描历史并有额外成本。top-k 是容量约束,不是 recall 保证。

Specialist distillation + mixed RL

V3.2 将 reasoning、general agent、agentic coding/search 与 human alignment specialists 蒸馏到同一模型,再做 mixed RL。

Agent 数据必须区分:

类型 环境 Prompt
Code agent 真实 抽取
Search agent 真实 API 合成
General agent 合成工具环境 合成

报告给出 1,827 个 general-agent environments,并通过 <environment, tools, task, verifier> 闭环生成。不能将其简化为“更多工具调用文本”。

证据缓存:research/sources/long-context/2512.02556.txt:122-234,296-371,557-636。

W9 / V4:百万上下文是一组异构状态

V4(2606.19348)不只是把 V3.2 context 拉长。

CSA

  • 先按相邻 hidden states 形成压缩 KV entries;
  • indexer 在压缩 entries 上做 DSA-style top-k;
  • 主 attention 只读选中的压缩 entries;
  • 兼有序列压缩与稀疏选择。

HCA

  • 使用显著更大的 compression rate;
  • 不做与 CSA 相同的 overlapped compression / top-k sparse selection;
  • 保留所有更少的压缩 entries;
  • 追求更激进的固定状态压缩。

共同细节

  • head-wise query 与 compressed KV RMSNorm;
  • 最后 64 维 partial RoPE;
  • shared-KV MQA;
  • grouped output projection;
  • 混合层还包含短窗状态,服务端因此维护异构 KV/state cache。

mHC

将 residual mapping B_l 投影到 doubly stochastic matrices 的 Birkhoff polytope:

B_l ≥ 0
rowsum(B_l) = 1
colsum(B_l) = 1
||B_l||₂ ≤ 1

V4 expansion factor 为 4。它改变相邻层 residual streams 的混合,不等于 AttnRes 沿历史层检索。

Muon 与稳定化

  • 主要二维矩阵采用 Muon;
  • embedding、prediction head、RMSNorm weights 等保留 AdamW;
  • attention Q/K 路径做额外 Norm;
  • SwiGLU linear branch clamp 到 [-10,10],gate upper cap 10;
  • Muon、mHC、Norm、clamp 解决不同对象。

Reasoning effort

V4 支持多个 effort mode。任何 benchmark 必须带 model variant、effort、context、tool budget 和 harness;“V4 分数”不是单一协议。

证据缓存:research/sources/long-context/2606.19348.txt:318-741,783-853,1203-1312,1369-1488,1587-1742。

W10 / K3:继承图必须允许“没有箭头”

DeepSeek 节点 K3 落点 关系类型 禁止结论
DeepSeekMoE fine-grained + shared/routed Stable LatentMoE shared/routed 明确结构祖先 不代表 expert 数和 router 相同
V2 MLA 周期性 Gated MLA 明确采用并改造 K3 不是全 MLA
V3 loss-free balance Quantile Balancing 同问题新方案 QB 不是 expert bias 改名
V3 FP8 MXFP4 weights + MXFP8 activations QAT 低精度方向延伸 精度角色合同不同
GRPO / R1 multi-domain/multi-effort RL 共享范式 K3 未公开等同 R1 的训练轨迹
V3.2/V4 long context 3 KDA + 1 NoPE Gated MLA 同目标不同状态 不把 DSA/CSA/HCA 套到 KDA
V4 mHC Block Attention Residuals 同期不同深度拓扑 mHC 不是 AttnRes
V4 Muon Per-Head Muon 同优化器族不同参数分组 不写相同 optimizer recipe
R1 distillation MOPD 都有 teacher/student MOPD student rollout 是 on-policy,不能等同离线 SFT

K3 直接证据:research/sources/kimi-k3/k3_tech_report.txt。

特别边界:

  • K3 主模型的 93 层以 12 层为 AttnRes block,得到 8 个 layer blocks,加 embedding 共 9 个来源;
  • K3 报告的推理芯片 nano-model 原型另使用 block size 2;那是芯片概念验证配置,不能回填主模型架构。

3. 四个交互实验合同

Lab 01 / Sparse Capacity Ledger

输入

  • architecture:Dense / coarse MoE / DeepSeekMoE / V3;
  • experts E;
  • routed top-k k;
  • shared experts s;
  • expert width ratio;
  • EP nodes。

输出

  • total expert units;
  • active expert units;
  • theoretical combinations C(E,k)(只作组合空间,不作能力);
  • toy compute ratio;
  • toy communication pressure;
  • shared/routed 角色说明。

强制边界

  • 组合数使用对数或科学计数,避免溢出;
  • 通信为教学指标,不写 GB/s;
  • total params 与 active params 分列。

Lab 02 / MLA Cache Workbench

输入

  • layers、context、batch;
  • MHA heads、head dim;
  • GQA KV groups;
  • MLA latent dim、RoPE dim;
  • bytes/element。

公式

MHA elements/token/layer = 2 · n_h · d_h
GQA elements/token/layer = 2 · n_kv · d_h
MLA elements/token/layer = d_c + d_h^R
total bytes = per-token-layer · L · T · B · bytes

输出

  • 元素、GiB、相对当前 MHA 基线的 reduction;
  • 显式显示“作者报告值 ≠ 当前教学配置”;
  • weight absorption / RoPE 分叉图。

Lab 03 / V3 Co-design Board

输入

  • pipeline stages;
  • micro-batches;
  • compute/communication ratio;
  • schedule:1F1B / dual-ended toy;
  • precision contract:BF16 / naive FP8 / mixed FP8;
  • MTP:off / train / speculative。

输出

  • toy bubble fraction;
  • exposed communication;
  • activation/master/accumulator dtype 角色;
  • NTP/MTP supervision count;
  • MTP inference role。

边界

  • 不声称复现 DualPipe schedule;
  • bubble/communication 是方向模型;
  • naive FP8 必须显示风险,不让它看起来更先进。

Lab 04 / GRPO Bias Microscope

输入

  • 4–8 条 rollout rewards;
  • 每条长度;
  • algorithm:GRPO / DAPO-style / Dr.GRPO;
  • clip low/high;
  • std norm;
  • response-level / token-level aggregation;
  • overlong threshold。

输出

  • normalized advantage;
  • 每个 response / token 的 toy gradient weight;
  • reward 全同零信号;
  • length/difficulty bias 提示;
  • DAPO/Dr.GRPO 与 R1 的 provenance 标签。

边界

  • 不模拟完整 optimizer 或真实 policy ratio;
  • 不把 toy gradient 当训练曲线;
  • DAPO/Dr.GRPO 明确标“后续公开研究,不是 R1 已披露配方”。

4. 六十节点正式阅读链

# 年份 节点 一手链接 在本页承担的角色
01 1991 Adaptive Mixtures of Local Experts https://proceedings.neurips.cc/paper/1991/hash/59b90e1005a220e2ebc542eb9d950b1e-Abstract.html 专家门控前史
02 2000 Learning to Reason with Neural Networks / Conditional Computation https://arxiv.org/abs/cs/0008102 条件计算
03 2003 A Neural Probabilistic Language Model https://www.jmlr.org/papers/v3/bengio03a.html Dense LM 坐标
04 2017 Attention Is All You Need https://arxiv.org/abs/1706.03762 Transformer 主干
05 2017 Outrageously Large Neural Networks https://arxiv.org/abs/1701.06538 稀疏 MoE
06 2017 Proximal Policy Optimization Algorithms https://arxiv.org/abs/1707.06347 GRPO 对照
07 2018 GPipe https://arxiv.org/abs/1811.06965 Pipeline 前史
08 2018 PipeDream https://arxiv.org/abs/1806.03377 Pipeline schedule
09 2019 Fast Transformer Decoding / MQA https://arxiv.org/abs/1911.02150 KV 共享
10 2019 Megatron-LM https://arxiv.org/abs/1909.08053 模型并行
11 2019 ZeRO https://arxiv.org/abs/1910.02054 状态分片
12 2019 RMSNorm https://arxiv.org/abs/1910.07467 尺度控制
13 2020 GShard https://arxiv.org/abs/2006.16668 大规模 MoE
14 2020 QK-Normalization https://arxiv.org/abs/2010.04245 attention logit 稳定
15 2021 Switch Transformers https://arxiv.org/abs/2101.03961 coarse top-1 MoE
16 2021 RoFormer / RoPE https://arxiv.org/abs/2104.09864 MLA 位置分叉
17 2022 ST-MoE https://arxiv.org/abs/2202.08906 MoE 稳定性
18 2022 DeepNet https://arxiv.org/abs/2203.00555 深层残差
19 2022 InstructGPT https://arxiv.org/abs/2203.02155 SFT/RM/PPO 合同
20 2022 FlashAttention https://arxiv.org/abs/2205.14135 IO-aware exact attention
21 2022 Process and Outcome Feedback https://arxiv.org/abs/2211.14275 reasoning reward 前史
22 2022 Self-Consistency https://arxiv.org/abs/2203.11171 多采样聚合
23 2023 GQA https://arxiv.org/abs/2305.13245 KV 分组
24 2023 Let's Verify Step by Step https://arxiv.org/abs/2305.20050 verifier / PRM
25 2023 Direct Preference Optimization https://arxiv.org/abs/2305.18290 RL 外偏好路线
26 2023 FlashAttention-2 https://arxiv.org/abs/2307.08691 attention kernel
27 2023 PagedAttention / vLLM https://arxiv.org/abs/2309.06180 KV 服务状态
28 2024 DeepSeek LLM https://arxiv.org/abs/2401.02954 Dense/scaling 基线
29 2024 DeepSeek-Coder https://arxiv.org/abs/2401.14196 代码数据旁支
30 2024 DeepSeekMoE https://arxiv.org/abs/2401.06066 细粒度 + shared
31 2024 DeepSeekMath https://arxiv.org/abs/2402.03300 数学数据 + GRPO
32 2024 RLOO https://arxiv.org/abs/2402.14740 critic-free 对照
33 2024 DeepSeek-V2 https://arxiv.org/abs/2405.04434 MLA + MoE
34 2024 Better & Faster LLMs via MTP https://arxiv.org/abs/2404.19737 MTP 祖先
35 2024 DeepSeek-Coder-V2 https://arxiv.org/abs/2406.11931 V2 continued pretrain 旁支
36 2024 ESFT https://arxiv.org/abs/2407.01906 专家特化微调
37 2024 DeepSeek-Prover-V1.5 https://arxiv.org/abs/2408.08152 proof feedback RL
38 2024 Hyper-Connections https://arxiv.org/abs/2409.19606 mHC 前身
39 2024 DeepSeek-V3 https://arxiv.org/abs/2412.19437 FP8/DualPipe/MTP
40 2025 DeepSeek-R1 https://arxiv.org/abs/2501.12948 R1-Zero/R1/蒸馏
41 2025 Muon is Scalable for LLM Training https://arxiv.org/abs/2502.16982 V4 optimizer 前史
42 2025 DAPO https://arxiv.org/abs/2503.14476 GRPO 工程修正
43 2025 Understanding R1-Zero-Like Training https://arxiv.org/abs/2503.20783 Dr.GRPO / 偏差
44 2025 DeepSeek-Prover-V2 https://arxiv.org/abs/2504.21801 subgoal + RL
45 2025 DeepEP https://github.com/deepseek-ai/DeepEP Expert Parallel kernel
46 2025 DualPipe https://github.com/deepseek-ai/DualPipe V3/R1 pipeline 实现
47 2025 DeepGEMM https://github.com/deepseek-ai/DeepGEMM FP8 GEMM 实现
48 2025 DeepSeek-VL2 https://arxiv.org/abs/2412.10302 多模态理解旁支
49 2025 Janus-Pro https://arxiv.org/abs/2501.17811 统一理解/生成旁支
50 2025 Kimi k1.5 https://arxiv.org/abs/2501.12599 同期 reasoning RL
51 2025 Kimi K2 https://arxiv.org/abs/2507.20534 MLA/MoE/Muon 对照
52 2025 Kimi Linear https://arxiv.org/abs/2510.26692 KDA 前身
53 2025 DeepSeek-V3.2 https://arxiv.org/abs/2512.02556 DSA + Agent
54 2025 mHC https://arxiv.org/abs/2512.24880 受约束 residual
55 2026 Engram https://arxiv.org/abs/2601.07372 条件记忆新稀疏轴
56 2026 LatentMoE https://arxiv.org/abs/2601.18089 K3 routed latent 前身
57 2026 Attention Residuals https://arxiv.org/abs/2603.15031 K3 深度路由
58 2026 DeepSeek-V4 https://arxiv.org/abs/2606.19348 CSA/HCA/mHC/Muon
59 2026 Kimi K3 https://arxiv.org/abs/2607.24653 对照锚点
60 2026 Kimi K3 official code/model repository https://github.com/MoonshotAI/Kimi-K3 开放实现边界

5. 允许进入正文的报告数字

所有数字必须带比较对象:

数字 允许写法 禁止写法
V2 42.5% / 93.3% / 5.76× V2 报告相对 DeepSeek 67B 特定设置 MLA 固有加速
V3 671B / 37B total / activated params 等价 37B dense 端到端成本
V3 14.8T 报告预训练 token 总量 数据质量证明
V3 2.788M H800 hours 报告完整训练口径;硬件限定 跨模型统一成本
R1 ~800K 教师生成/筛选的 distill SFT samples 小模型自主 RL 数据
V3.2 1,827 environments general-agent 合成环境数 全部 Agent 数据规模
V4 1.6T/49B、284B/13B Pro/Flash total/active 两模型性能排序
V4 27%/10% 等 报告相对 V3.2、1M context 的 FLOPs/KV 所有服务栈固定比例
K3 2.8T/104B total/active 与 V4 单轴优劣

6. 事实审计红线

  • DAPO 与 Dr.GRPO 不写成 DeepSeek 官方 R1 recipe。
  • “aha/wait” 不写成 RL 从零创造推理的因果证据。
  • R1 与 R1-Zero 分开。
  • Distill students 不写成重跑 RL。
  • aux-loss-free 不写成没有任何 auxiliary balance。
  • MLA content cache 与 decoupled RoPE cache 都进入公式。
  • FP8 用完整角色合同。
  • MTP 训练、可丢弃推理与 speculative role 分开。
  • DSA indexer 成本与漏检风险保留。
  • CSA 与 HCA 分开。
  • mHC 与 AttnRes 分开。
  • Muon 与 AdamW 参数分组保留。
  • V4 与 K3 按状态对象对照,不按 1M 标签归并。
  • 主模型 AttnRes block size 12 与 MiniTriton benchmark block size 2 分开。
  • 所有 benchmark/成本数字带报告、配置和比较对象。

7. 页面验收合同

  • 至少 24 张问题账;
  • 至少 20 个正文目录;
  • 60 个一手/官方阅读节点;
  • 四个独立可操作实验;
  • DeepSeekMath 必须在主时间线中;
  • DAPO / Dr.GRPO 必须标后续公开研究;
  • MLA 实验必须把 RoPE cache 算进去;
  • V3 实验必须显示 FP8 角色而不是单一开关;
  • R1 pipeline 必须同时可见 Zero 与正式 R1;
  • V4/K3 表必须包含“直接祖先 / 同题新解 / 同期不同路线”;
  • 桌面与 390px 移动端无文档级横向溢出;
  • tabs 支持键盘方向键;
  • toy model、作者报告和公式推导使用不同标签;
  • 专属 Chrome 回归并纳入全站回归。