571 lines
26 KiB
Markdown
571 lines
26 KiB
Markdown
# DeepSeek 技术谱系二轮正式研究账本
|
||
|
||
> 研究截止:2026-07-29
|
||
> 课程角色:DeepSeek 聚光专题二轮;与 MoE、长上下文、训练系统、数值、推理、Agent、评测专题互相链接,但不替代各专题完整推导。
|
||
> 证据规则:正文事实只来自一手论文、作者官方仓库和 Kimi K3 官方报告;Grok 产物仅见 `DEEPSEEK_GROK_LEADS.md`,不承担证据。
|
||
> 简化规则:所有二维图、成本滑条和训练曲线若非论文复跑,必须标“教学模型”。
|
||
|
||
## 0. 本轮要修复什么
|
||
|
||
现有 DeepSeek 页面建立了正确的代际骨架,但还不足以让读者回答四类问题:
|
||
|
||
1. **可归因性**:一代同时改模型、数据、精度和系统,怎样知道是哪一项在起作用?
|
||
2. **对象边界**:总参数、激活参数、KV 状态、训练显存、墙钟时间和 benchmark 分数不能混算。
|
||
3. **训练轨迹**:R1-Zero 的长度曲线、DAPO 的熵崩、Dr.GRPO 的长度偏差分别说明什么?
|
||
4. **跨模型对照**:V4 与 K3 都支持 1M,并不意味着状态表示、注意力和服务系统相同。
|
||
|
||
二轮页面应成为“论文主线的总装图”,而不是再写一遍七个专题。
|
||
|
||
## 1. 二十四张正式问题账
|
||
|
||
| 编号 | 对象 | 读者问题 | 正式回答边界 |
|
||
|---|---|---|---|
|
||
| Q01 | Dense 坐标系 | 为什么 DeepSeek LLM 不是可跳过的序章? | 它固定 tokenizer、数据、架构和 scaling 试验的起点;并不单独证明后续所有设计 |
|
||
| Q02 | 参数角色 | 671B / 37B 各表示什么? | total 是装下的容量,activated 是每 Token 经过的专家参数子集;都不等于端到端 FLOPs |
|
||
| Q03 | 专家粒度 | 为什么切小专家还要多选? | DeepSeekMoE 把每个专家缩成 `1/m`,总数和激活数同乘 `m`,近似保持专家计算 |
|
||
| Q04 | Shared expert | 为什么把公共知识单独隔离? | 始终激活的 shared experts 减少 routed experts 重复;仍付激活计算 |
|
||
| Q05 | 通信税 | 为什么稀疏 FLOPs 不等于便宜? | 路由会产生 dispatch/combine、跨节点 all-to-all、负载长尾和权重访问 |
|
||
| Q06 | 均衡 | aux-loss-free 到底去掉了什么? | V3 的 expert bias 影响选择、不进入最终 gate weight;仍有 sequence-wise auxiliary loss 防极端失衡 |
|
||
| Q07 | KV 状态 | 为什么 V2 把服务状态当架构问题? | 权重只装一次,KV 随请求、层、Token 增长,直接限制并发和长上下文 |
|
||
| Q08 | Attention 压缩 | MQA/GQA/MLA 的差别是什么? | MQA/GQA 共享 K/V 头;MLA 联合低秩压缩 K/V 内容并在计算中恢复 |
|
||
| Q09 | 矩阵吸收 | MLA 为什么不必显式恢复完整 content key/value? | 无位置项时可利用矩阵乘结合律把上投影吸收到 query/output 投影 |
|
||
| Q10 | 位置分叉 | 为什么要 decoupled RoPE? | RoPE 位于 key/query 路径中会阻断上述吸收,因此 V2 另设小的 RoPE key/query 分支并缓存 key |
|
||
| Q11 | FP8 合同 | “FP8 训练”包含哪些角色? | V3 主要 GEMM 用 FP8,配 tile/block scaling、较高精度累加和高精度敏感算子;不是全路径 FP8 |
|
||
| Q12 | Pipeline | DualPipe 隐藏了什么? | 成对前后向 chunk 的计算—通信重叠并从两端注入 micro-batch;减少而非清零 bubble |
|
||
| Q13 | MTP | 训练和推理各怎样使用 MTP? | 顺序模块增加未来 Token 监督;推理可丢弃,也可复用于 speculative draft |
|
||
| Q14 | GRPO | 去掉 critic 后还剩什么? | policy/reference、同题多 rollout、reward/verifier、clip 和 KL;主要省 value model |
|
||
| Q15 | 可验证奖励 | R1-Zero 的奖励能覆盖哪些任务? | 论文使用数学、代码、逻辑等可规则验证域和格式奖励;复杂开放任务仍是公开限制 |
|
||
| Q16 | 纯 RL 实验 | R1-Zero 证明了什么? | 强 V3 Base 在无 reasoning SFT 的设置下可被规则奖励继续塑造;不证明无预训练先验 |
|
||
| Q17 | R1 pipeline | 正式 R1 为什么不是纯 RL? | cold start → reasoning RL → rejection/SFT mix → general RL,各自修可读性、广度和对齐 |
|
||
| Q18 | 蒸馏 | 为什么学生不是“小号 R1-Zero”? | 报告中的 1.5B–70B 学生主要对约 800K 教师样本做 SFT,没有重演同一 RL |
|
||
| Q19 | 复现反查 | DAPO/Dr.GRPO 修的是 R1 的什么? | 它们是公开后续研究:分别处理 clip/采样/聚合/截断和长度/难度归一偏差;不是已披露 R1 内部配方 |
|
||
| Q20 | DSA | 可学习 indexer 为什么不是固定稀疏? | indexer 对历史内容评分,主 attention 只读 top-k;有 warm-up 和 sparse training,仍可能漏检 |
|
||
| Q21 | Agent 数据 | V3.2 怎样把 reasoning 放进环境? | specialist distillation + mixed RL;真实/合成工具环境、任务、解法和 verifier 构成数据闭环 |
|
||
| Q22 | V4 Attention | CSA 与 HCA 各压什么? | CSA 先压缩再稀疏 top-k;HCA 用更大压缩率保留所有压缩 entries,不做同类 top-k |
|
||
| Q23 | V4 稳定化 | mHC、Muon、QK/RMSNorm、clamp 各管什么? | 分别管残差混合、矩阵更新、attention 尺度和 FFN 极值,不能归成一个“稳定性技巧” |
|
||
| Q24 | K3 对照 | 哪些是祖先,哪些不是? | DeepSeekMoE/MLA 有明确结构继承;QB/KDA/AttnRes/SiTU/MOPD 多为同题新解或同期路线 |
|
||
|
||
## 2. 十次历史转向:不要画成产品发布日期
|
||
|
||
### W1 / Dense:先制造可比较坐标系
|
||
|
||
DeepSeek LLM(`2401.02954`)的历史作用不是“第一代也很强”,而是:
|
||
|
||
- 在 7B / 67B dense 模型上固定中英数据、BBPE、训练配方;
|
||
- 用小模型研究 scaling behavior,再选择大模型超参数;
|
||
- 把 dedup/filter/remix 和 91-dump 全局去重写成可检查步骤;
|
||
- 给后续 MoE、MLA 和训练系统提供 dense 对照。
|
||
|
||
证据缓存:`research/sources/scaling-laws/2401.02954.txt`。
|
||
|
||
### W2 / DeepSeekMoE:容量与激活计算第一次显式分开
|
||
|
||
DeepSeekMoE(`2401.06066`)提出:
|
||
|
||
1. **Fine-grained expert segmentation**:把 `N` 个专家各切成 `m` 份,总数 `mN`,激活数由 `K` 增至 `mK`,保持专家激活宽度近似不变;
|
||
2. **Shared expert isolation**:固定激活 `K_s` 个 shared experts,routed 激活数相应减少,使公共变换不必在多个 routed experts 中重复学习。
|
||
|
||
论文给的是特定规模和 benchmark 下的消融证据,不是所有 MoE/硬件上的普遍优越性。
|
||
|
||
证据缓存:`research/sources/moe/2401.06066.txt:249-330,606-666`。
|
||
|
||
### W3 / V2:把推理状态纳入模型结构
|
||
|
||
标准 MHA 每层每 Token 的缓存元素与 `2 n_h d_h` 成正比。V2 MLA 的 content 缓存核心变为:
|
||
|
||
```text
|
||
c_t^KV = W_DKV h_t
|
||
cache_content = d_c
|
||
cache_total = d_c + d_h^R
|
||
```
|
||
|
||
其中 `d_h^R` 是 decoupled RoPE key 分支。V2 配置使用:
|
||
|
||
- `d_c = 512`(论文以 `4 d_h` 表达);
|
||
- decoupled RoPE per-head dim `d_h^R = 64`;
|
||
- 每层每 Token 缓存 `d_c + d_h^R` 个元素,不是只有 `d_c`。
|
||
|
||
#### 权重吸收为何重要
|
||
|
||
对 content path:
|
||
|
||
```text
|
||
qᵀ(W_UK c) = (W_UKᵀ q)ᵀc
|
||
W_O(W_UV c) = (W_O W_UV)c
|
||
```
|
||
|
||
因此推理实现可以在投影权重中吸收上投影,而非先物化所有 heads 的完整 K/V。若直接把 RoPE 施加到 content key,上式之间会插入位置相关旋转矩阵,无法做同样的固定权重吸收。V2 因而将 RoPE 分支解耦。
|
||
|
||
证据缓存:`research/sources/long-context/2405.04434.txt:330-419`。
|
||
|
||
V2 的 `−42.5% / −93.3% / 5.76×` 必须始终写成“报告相对 DeepSeek 67B 的特定设置”,不能成为 MLA 常数。
|
||
|
||
### W4 / V3:算法—数值—系统协同,不是四个孤立卖点
|
||
|
||
V3(`2412.19437`)保留 MLA + DeepSeekMoE,并新增四条互锁机制。
|
||
|
||
#### 2.4.1 Auxiliary-loss-free balance
|
||
|
||
- 每个 routed expert 有动态 bias `b_i`;
|
||
- bias 参与 top-k 选择;
|
||
- 真正乘到专家输出上的 gate value 不包含 bias;
|
||
- 过载 expert 的 bias 下调,低载 expert 上调;
|
||
- 报告仍保留 sequence-wise auxiliary loss 防止单序列极端失衡。
|
||
|
||
所以“aux-loss-free”只描述主要全局 balance 策略。
|
||
|
||
#### 2.4.2 Sequential MTP
|
||
|
||
V3 的第 `k` 个 MTP module 接收上一深度 state 与未来 Token embedding,预测额外未来 Token:
|
||
|
||
```text
|
||
L = L_NTP + λ · mean_k(L_MTP^k)
|
||
```
|
||
|
||
MTP embedding/output head 与主模型共享。报告明确:
|
||
|
||
- 训练目标主要为 densify signals / pre-plan representations;
|
||
- 推理时可以直接丢弃 MTP module;
|
||
- 也可以将其改作 speculative decoding。
|
||
|
||
这与“并行一次输出多 Token”不是同一概念。
|
||
|
||
#### 2.4.3 FP8 mixed precision
|
||
|
||
必须用角色合同描述:
|
||
|
||
| 角色 | V3 报告处理 |
|
||
|---|---|
|
||
| 高密度 GEMM inputs | 细粒度量化后 FP8 |
|
||
| GEMM accumulation | Tensor Core 路径外补 FP32 精确累加策略 |
|
||
| master weights / optimizer | 高精度保存与更新 |
|
||
| 敏感算子 | BF16/FP32 |
|
||
| activation cache | 部分低精度保存 |
|
||
| communication | 结合低精度减少带宽 |
|
||
|
||
“V3 用 FP8”不能压缩成单一 dtype 标签。
|
||
|
||
#### 2.4.4 DualPipe + DeepEP
|
||
|
||
DualPipe:
|
||
|
||
- 从 pipeline 两端注入 micro-batches;
|
||
- 在成对前/后向 chunk 中重叠计算与通信;
|
||
- 相对经典 schedule 减少 bubble;
|
||
- 仍有 divisibility、activation memory 和 stage balance 条件。
|
||
|
||
DeepEP 官方仓库承载高吞吐/低延迟 expert dispatch/combine kernel;它是系统实现节点,不是 V3 模型算法的新 loss。
|
||
|
||
证据:
|
||
|
||
- `research/sources/moe/2412.19437.txt:437-448,532-602,644-713,772-999`
|
||
- `https://github.com/deepseek-ai/DualPipe`
|
||
- `https://github.com/deepseek-ai/DeepEP`
|
||
|
||
### W5 / DeepSeekMath:GRPO 首先是一笔 critic 账
|
||
|
||
DeepSeekMath(`2402.03300`)对同一 prompt 采样 `G` 个输出,以组内 reward 构造 outcome advantage:
|
||
|
||
```text
|
||
A_i = (r_i - mean(r_1…r_G)) / (std(r_1…r_G) + ε)
|
||
```
|
||
|
||
完整目标仍含:
|
||
|
||
- importance ratio;
|
||
- clipping;
|
||
- reference-policy KL;
|
||
- 每题多 rollout;
|
||
- reward/verifier 执行。
|
||
|
||
所以 GRPO 去掉 value model,不是去掉 RL 系统。
|
||
|
||
该论文在特定 7B 数学设置中观察到 Maj@K 改善而 Pass@K 未同样改善,应解释为输出分布重排证据,而非基础覆盖能力的普遍增长。
|
||
|
||
证据缓存:`research/sources/reasoning/2402.03300.txt`。
|
||
|
||
### W6 / R1-Zero → R1:先做隔离实验,再做可用模型
|
||
|
||
#### R1-Zero
|
||
|
||
- base:DeepSeek-V3 Base;
|
||
- 无 reasoning SFT;
|
||
- GRPO;
|
||
- accuracy reward + format reward;
|
||
- reasoning 域使用规则验证,避免大规模 neural RM reward hacking;
|
||
- 训练中报告 AIME accuracy 与平均 response length 轨迹。
|
||
|
||
这证明在该强 base 和验证域上,RL 能进一步塑造搜索/反思行为;不证明知识与算法从零产生。
|
||
|
||
#### 正式 R1
|
||
|
||
```text
|
||
V3 Base
|
||
→ cold-start reasoning data
|
||
→ reasoning-oriented RL
|
||
→ rejection sampling + reasoning/general SFT mix
|
||
→ general RL with rule + preference/safety rewards
|
||
```
|
||
|
||
R1-Zero 的可读性和语言混合问题是正式 R1 增加 cold start 与后续阶段的直接理由。
|
||
|
||
#### Distillation
|
||
|
||
六个 1.5B–70B 学生使用约 800K R1 生成/筛选样本进行 SFT。它说明强教师轨迹可迁移,不说明学生内部重演了大规模 RL 探索。
|
||
|
||
证据缓存:`research/sources/reasoning/2501.12948.txt:85-225,324-437,742-844`。
|
||
|
||
### W7 / DAPO 与 Dr.GRPO:复现不是尾注,而是算法显微镜
|
||
|
||
二者都不是 DeepSeek 官方 R1 配方;它们是公开后续研究。
|
||
|
||
#### DAPO(`2503.14476`)
|
||
|
||
论文公开四项技术:
|
||
|
||
1. **Clip-Higher**:上下 clip 解耦,提高上界,缓解熵崩;
|
||
2. **Dynamic Sampling**:过滤 reward 全同、优势为零的组并补采;
|
||
3. **Token-Level Policy Gradient Loss**:跨 batch Token 聚合,改变长短 response 的权重;
|
||
4. **Overlong Reward Shaping**:过滤或平滑惩罚被硬截断的长回答,降低 reward noise。
|
||
|
||
DAPO 报告的 AIME 分数绑定 Qwen2.5-32B Base、数据、系统和协议,不可写成“算法无条件超过 R1”。
|
||
|
||
证据缓存:`research/sources/reasoning/2503.14476.txt:79-91,234-459`。
|
||
|
||
#### Dr.GRPO(`2503.20783`)
|
||
|
||
论文指出两类偏差:
|
||
|
||
- response-level length bias:response loss 除以自身长度,使每个 Token 的总权重依赖长度;
|
||
- question-level difficulty bias:优势除以组内 reward std,使低 std 问题获得更大尺度。
|
||
|
||
其实现用固定全局最大 Token 数作分母,并移除组 std normalization。论文还观察 DeepSeek-V3 Base 在 RL 前即可生成 “aha/wait” 表达,因此单个措辞不能作为 RL 创造反思的因果证据。
|
||
|
||
这是一组明确假设和实验,不等于“推翻所有 GRPO”。
|
||
|
||
证据缓存:`research/sources/reasoning/2503.20783.txt:319-343,521-611`。
|
||
|
||
### W8 / V3.2:Attention 与 Agent 数据同时转向
|
||
|
||
#### DSA
|
||
|
||
DeepSeek Sparse Attention:
|
||
|
||
1. lightning indexer 对 query–history 计算 index score;
|
||
2. 选择 top-k KV entries;
|
||
3. 主 attention 只在选中 entries 上计算;
|
||
4. 在 MLA 架构下实例化;
|
||
5. 先 dense warm-up 初始化 indexer,再 sparse continued pre-training 对齐。
|
||
|
||
主 attention 从 `O(L²)` 降到 `O(Lk)`;indexer 本身仍扫描历史并有额外成本。top-k 是容量约束,不是 recall 保证。
|
||
|
||
#### Specialist distillation + mixed RL
|
||
|
||
V3.2 将 reasoning、general agent、agentic coding/search 与 human alignment specialists 蒸馏到同一模型,再做 mixed RL。
|
||
|
||
Agent 数据必须区分:
|
||
|
||
| 类型 | 环境 | Prompt |
|
||
|---|---|---|
|
||
| Code agent | 真实 | 抽取 |
|
||
| Search agent | 真实 API | 合成 |
|
||
| General agent | 合成工具环境 | 合成 |
|
||
|
||
报告给出 1,827 个 general-agent environments,并通过 `<environment, tools, task, verifier>` 闭环生成。不能将其简化为“更多工具调用文本”。
|
||
|
||
证据缓存:`research/sources/long-context/2512.02556.txt:122-234,296-371,557-636`。
|
||
|
||
### W9 / V4:百万上下文是一组异构状态
|
||
|
||
V4(`2606.19348`)不只是把 V3.2 context 拉长。
|
||
|
||
#### CSA
|
||
|
||
- 先按相邻 hidden states 形成压缩 KV entries;
|
||
- indexer 在压缩 entries 上做 DSA-style top-k;
|
||
- 主 attention 只读选中的压缩 entries;
|
||
- 兼有序列压缩与稀疏选择。
|
||
|
||
#### HCA
|
||
|
||
- 使用显著更大的 compression rate;
|
||
- 不做与 CSA 相同的 overlapped compression / top-k sparse selection;
|
||
- 保留所有更少的压缩 entries;
|
||
- 追求更激进的固定状态压缩。
|
||
|
||
#### 共同细节
|
||
|
||
- head-wise query 与 compressed KV RMSNorm;
|
||
- 最后 64 维 partial RoPE;
|
||
- shared-KV MQA;
|
||
- grouped output projection;
|
||
- 混合层还包含短窗状态,服务端因此维护异构 KV/state cache。
|
||
|
||
#### mHC
|
||
|
||
将 residual mapping `B_l` 投影到 doubly stochastic matrices 的 Birkhoff polytope:
|
||
|
||
```text
|
||
B_l ≥ 0
|
||
rowsum(B_l) = 1
|
||
colsum(B_l) = 1
|
||
||B_l||₂ ≤ 1
|
||
```
|
||
|
||
V4 expansion factor 为 4。它改变相邻层 residual streams 的混合,不等于 AttnRes 沿历史层检索。
|
||
|
||
#### Muon 与稳定化
|
||
|
||
- 主要二维矩阵采用 Muon;
|
||
- embedding、prediction head、RMSNorm weights 等保留 AdamW;
|
||
- attention Q/K 路径做额外 Norm;
|
||
- SwiGLU linear branch clamp 到 `[-10,10]`,gate upper cap `10`;
|
||
- Muon、mHC、Norm、clamp 解决不同对象。
|
||
|
||
#### Reasoning effort
|
||
|
||
V4 支持多个 effort mode。任何 benchmark 必须带 model variant、effort、context、tool budget 和 harness;“V4 分数”不是单一协议。
|
||
|
||
证据缓存:`research/sources/long-context/2606.19348.txt:318-741,783-853,1203-1312,1369-1488,1587-1742`。
|
||
|
||
### W10 / K3:继承图必须允许“没有箭头”
|
||
|
||
| DeepSeek 节点 | K3 落点 | 关系类型 | 禁止结论 |
|
||
|---|---|---|---|
|
||
| DeepSeekMoE fine-grained + shared/routed | Stable LatentMoE shared/routed | 明确结构祖先 | 不代表 expert 数和 router 相同 |
|
||
| V2 MLA | 周期性 Gated MLA | 明确采用并改造 | K3 不是全 MLA |
|
||
| V3 loss-free balance | Quantile Balancing | 同问题新方案 | QB 不是 expert bias 改名 |
|
||
| V3 FP8 | MXFP4 weights + MXFP8 activations QAT | 低精度方向延伸 | 精度角色合同不同 |
|
||
| GRPO / R1 | multi-domain/multi-effort RL | 共享范式 | K3 未公开等同 R1 的训练轨迹 |
|
||
| V3.2/V4 long context | 3 KDA + 1 NoPE Gated MLA | 同目标不同状态 | 不把 DSA/CSA/HCA 套到 KDA |
|
||
| V4 mHC | Block Attention Residuals | 同期不同深度拓扑 | mHC 不是 AttnRes |
|
||
| V4 Muon | Per-Head Muon | 同优化器族不同参数分组 | 不写相同 optimizer recipe |
|
||
| R1 distillation | MOPD | 都有 teacher/student | MOPD student rollout 是 on-policy,不能等同离线 SFT |
|
||
|
||
K3 直接证据:`research/sources/kimi-k3/k3_tech_report.txt`。
|
||
|
||
特别边界:
|
||
|
||
- K3 主模型的 93 层以 12 层为 AttnRes block,得到 8 个 layer blocks,加 embedding 共 9 个来源;
|
||
- K3 报告的推理芯片 nano-model 原型另使用 block size 2;那是芯片概念验证配置,不能回填主模型架构。
|
||
|
||
## 3. 四个交互实验合同
|
||
|
||
### Lab 01 / Sparse Capacity Ledger
|
||
|
||
**输入**
|
||
|
||
- architecture:Dense / coarse MoE / DeepSeekMoE / V3;
|
||
- experts `E`;
|
||
- routed top-k `k`;
|
||
- shared experts `s`;
|
||
- expert width ratio;
|
||
- EP nodes。
|
||
|
||
**输出**
|
||
|
||
- total expert units;
|
||
- active expert units;
|
||
- theoretical combinations `C(E,k)`(只作组合空间,不作能力);
|
||
- toy compute ratio;
|
||
- toy communication pressure;
|
||
- shared/routed 角色说明。
|
||
|
||
**强制边界**
|
||
|
||
- 组合数使用对数或科学计数,避免溢出;
|
||
- 通信为教学指标,不写 GB/s;
|
||
- total params 与 active params 分列。
|
||
|
||
### Lab 02 / MLA Cache Workbench
|
||
|
||
**输入**
|
||
|
||
- layers、context、batch;
|
||
- MHA heads、head dim;
|
||
- GQA KV groups;
|
||
- MLA latent dim、RoPE dim;
|
||
- bytes/element。
|
||
|
||
**公式**
|
||
|
||
```text
|
||
MHA elements/token/layer = 2 · n_h · d_h
|
||
GQA elements/token/layer = 2 · n_kv · d_h
|
||
MLA elements/token/layer = d_c + d_h^R
|
||
total bytes = per-token-layer · L · T · B · bytes
|
||
```
|
||
|
||
**输出**
|
||
|
||
- 元素、GiB、相对当前 MHA 基线的 reduction;
|
||
- 显式显示“作者报告值 ≠ 当前教学配置”;
|
||
- weight absorption / RoPE 分叉图。
|
||
|
||
### Lab 03 / V3 Co-design Board
|
||
|
||
**输入**
|
||
|
||
- pipeline stages;
|
||
- micro-batches;
|
||
- compute/communication ratio;
|
||
- schedule:1F1B / dual-ended toy;
|
||
- precision contract:BF16 / naive FP8 / mixed FP8;
|
||
- MTP:off / train / speculative。
|
||
|
||
**输出**
|
||
|
||
- toy bubble fraction;
|
||
- exposed communication;
|
||
- activation/master/accumulator dtype 角色;
|
||
- NTP/MTP supervision count;
|
||
- MTP inference role。
|
||
|
||
**边界**
|
||
|
||
- 不声称复现 DualPipe schedule;
|
||
- bubble/communication 是方向模型;
|
||
- naive FP8 必须显示风险,不让它看起来更先进。
|
||
|
||
### Lab 04 / GRPO Bias Microscope
|
||
|
||
**输入**
|
||
|
||
- 4–8 条 rollout rewards;
|
||
- 每条长度;
|
||
- algorithm:GRPO / DAPO-style / Dr.GRPO;
|
||
- clip low/high;
|
||
- std norm;
|
||
- response-level / token-level aggregation;
|
||
- overlong threshold。
|
||
|
||
**输出**
|
||
|
||
- normalized advantage;
|
||
- 每个 response / token 的 toy gradient weight;
|
||
- reward 全同零信号;
|
||
- length/difficulty bias 提示;
|
||
- DAPO/Dr.GRPO 与 R1 的 provenance 标签。
|
||
|
||
**边界**
|
||
|
||
- 不模拟完整 optimizer 或真实 policy ratio;
|
||
- 不把 toy gradient 当训练曲线;
|
||
- DAPO/Dr.GRPO 明确标“后续公开研究,不是 R1 已披露配方”。
|
||
|
||
## 4. 六十节点正式阅读链
|
||
|
||
| # | 年份 | 节点 | 一手链接 | 在本页承担的角色 |
|
||
|---:|---:|---|---|---|
|
||
| 01 | 1991 | Adaptive Mixtures of Local Experts | https://proceedings.neurips.cc/paper/1991/hash/59b90e1005a220e2ebc542eb9d950b1e-Abstract.html | 专家门控前史 |
|
||
| 02 | 2000 | Learning to Reason with Neural Networks / Conditional Computation | https://arxiv.org/abs/cs/0008102 | 条件计算 |
|
||
| 03 | 2003 | A Neural Probabilistic Language Model | https://www.jmlr.org/papers/v3/bengio03a.html | Dense LM 坐标 |
|
||
| 04 | 2017 | Attention Is All You Need | https://arxiv.org/abs/1706.03762 | Transformer 主干 |
|
||
| 05 | 2017 | Outrageously Large Neural Networks | https://arxiv.org/abs/1701.06538 | 稀疏 MoE |
|
||
| 06 | 2017 | Proximal Policy Optimization Algorithms | https://arxiv.org/abs/1707.06347 | GRPO 对照 |
|
||
| 07 | 2018 | GPipe | https://arxiv.org/abs/1811.06965 | Pipeline 前史 |
|
||
| 08 | 2018 | PipeDream | https://arxiv.org/abs/1806.03377 | Pipeline schedule |
|
||
| 09 | 2019 | Fast Transformer Decoding / MQA | https://arxiv.org/abs/1911.02150 | KV 共享 |
|
||
| 10 | 2019 | Megatron-LM | https://arxiv.org/abs/1909.08053 | 模型并行 |
|
||
| 11 | 2019 | ZeRO | https://arxiv.org/abs/1910.02054 | 状态分片 |
|
||
| 12 | 2019 | RMSNorm | https://arxiv.org/abs/1910.07467 | 尺度控制 |
|
||
| 13 | 2020 | GShard | https://arxiv.org/abs/2006.16668 | 大规模 MoE |
|
||
| 14 | 2020 | QK-Normalization | https://arxiv.org/abs/2010.04245 | attention logit 稳定 |
|
||
| 15 | 2021 | Switch Transformers | https://arxiv.org/abs/2101.03961 | coarse top-1 MoE |
|
||
| 16 | 2021 | RoFormer / RoPE | https://arxiv.org/abs/2104.09864 | MLA 位置分叉 |
|
||
| 17 | 2022 | ST-MoE | https://arxiv.org/abs/2202.08906 | MoE 稳定性 |
|
||
| 18 | 2022 | DeepNet | https://arxiv.org/abs/2203.00555 | 深层残差 |
|
||
| 19 | 2022 | InstructGPT | https://arxiv.org/abs/2203.02155 | SFT/RM/PPO 合同 |
|
||
| 20 | 2022 | FlashAttention | https://arxiv.org/abs/2205.14135 | IO-aware exact attention |
|
||
| 21 | 2022 | Process and Outcome Feedback | https://arxiv.org/abs/2211.14275 | reasoning reward 前史 |
|
||
| 22 | 2022 | Self-Consistency | https://arxiv.org/abs/2203.11171 | 多采样聚合 |
|
||
| 23 | 2023 | GQA | https://arxiv.org/abs/2305.13245 | KV 分组 |
|
||
| 24 | 2023 | Let's Verify Step by Step | https://arxiv.org/abs/2305.20050 | verifier / PRM |
|
||
| 25 | 2023 | Direct Preference Optimization | https://arxiv.org/abs/2305.18290 | RL 外偏好路线 |
|
||
| 26 | 2023 | FlashAttention-2 | https://arxiv.org/abs/2307.08691 | attention kernel |
|
||
| 27 | 2023 | PagedAttention / vLLM | https://arxiv.org/abs/2309.06180 | KV 服务状态 |
|
||
| 28 | 2024 | DeepSeek LLM | https://arxiv.org/abs/2401.02954 | Dense/scaling 基线 |
|
||
| 29 | 2024 | DeepSeek-Coder | https://arxiv.org/abs/2401.14196 | 代码数据旁支 |
|
||
| 30 | 2024 | DeepSeekMoE | https://arxiv.org/abs/2401.06066 | 细粒度 + shared |
|
||
| 31 | 2024 | DeepSeekMath | https://arxiv.org/abs/2402.03300 | 数学数据 + GRPO |
|
||
| 32 | 2024 | RLOO | https://arxiv.org/abs/2402.14740 | critic-free 对照 |
|
||
| 33 | 2024 | DeepSeek-V2 | https://arxiv.org/abs/2405.04434 | MLA + MoE |
|
||
| 34 | 2024 | Better & Faster LLMs via MTP | https://arxiv.org/abs/2404.19737 | MTP 祖先 |
|
||
| 35 | 2024 | DeepSeek-Coder-V2 | https://arxiv.org/abs/2406.11931 | V2 continued pretrain 旁支 |
|
||
| 36 | 2024 | ESFT | https://arxiv.org/abs/2407.01906 | 专家特化微调 |
|
||
| 37 | 2024 | DeepSeek-Prover-V1.5 | https://arxiv.org/abs/2408.08152 | proof feedback RL |
|
||
| 38 | 2024 | Hyper-Connections | https://arxiv.org/abs/2409.19606 | mHC 前身 |
|
||
| 39 | 2024 | DeepSeek-V3 | https://arxiv.org/abs/2412.19437 | FP8/DualPipe/MTP |
|
||
| 40 | 2025 | DeepSeek-R1 | https://arxiv.org/abs/2501.12948 | R1-Zero/R1/蒸馏 |
|
||
| 41 | 2025 | Muon is Scalable for LLM Training | https://arxiv.org/abs/2502.16982 | V4 optimizer 前史 |
|
||
| 42 | 2025 | DAPO | https://arxiv.org/abs/2503.14476 | GRPO 工程修正 |
|
||
| 43 | 2025 | Understanding R1-Zero-Like Training | https://arxiv.org/abs/2503.20783 | Dr.GRPO / 偏差 |
|
||
| 44 | 2025 | DeepSeek-Prover-V2 | https://arxiv.org/abs/2504.21801 | subgoal + RL |
|
||
| 45 | 2025 | DeepEP | https://github.com/deepseek-ai/DeepEP | Expert Parallel kernel |
|
||
| 46 | 2025 | DualPipe | https://github.com/deepseek-ai/DualPipe | V3/R1 pipeline 实现 |
|
||
| 47 | 2025 | DeepGEMM | https://github.com/deepseek-ai/DeepGEMM | FP8 GEMM 实现 |
|
||
| 48 | 2025 | DeepSeek-VL2 | https://arxiv.org/abs/2412.10302 | 多模态理解旁支 |
|
||
| 49 | 2025 | Janus-Pro | https://arxiv.org/abs/2501.17811 | 统一理解/生成旁支 |
|
||
| 50 | 2025 | Kimi k1.5 | https://arxiv.org/abs/2501.12599 | 同期 reasoning RL |
|
||
| 51 | 2025 | Kimi K2 | https://arxiv.org/abs/2507.20534 | MLA/MoE/Muon 对照 |
|
||
| 52 | 2025 | Kimi Linear | https://arxiv.org/abs/2510.26692 | KDA 前身 |
|
||
| 53 | 2025 | DeepSeek-V3.2 | https://arxiv.org/abs/2512.02556 | DSA + Agent |
|
||
| 54 | 2025 | mHC | https://arxiv.org/abs/2512.24880 | 受约束 residual |
|
||
| 55 | 2026 | Engram | https://arxiv.org/abs/2601.07372 | 条件记忆新稀疏轴 |
|
||
| 56 | 2026 | LatentMoE | https://arxiv.org/abs/2601.18089 | K3 routed latent 前身 |
|
||
| 57 | 2026 | Attention Residuals | https://arxiv.org/abs/2603.15031 | K3 深度路由 |
|
||
| 58 | 2026 | DeepSeek-V4 | https://arxiv.org/abs/2606.19348 | CSA/HCA/mHC/Muon |
|
||
| 59 | 2026 | Kimi K3 | https://arxiv.org/abs/2607.24653 | 对照锚点 |
|
||
| 60 | 2026 | Kimi K3 official code/model repository | https://github.com/MoonshotAI/Kimi-K3 | 开放实现边界 |
|
||
|
||
## 5. 允许进入正文的报告数字
|
||
|
||
所有数字必须带比较对象:
|
||
|
||
| 数字 | 允许写法 | 禁止写法 |
|
||
|---|---|---|
|
||
| V2 `42.5% / 93.3% / 5.76×` | V2 报告相对 DeepSeek 67B 特定设置 | MLA 固有加速 |
|
||
| V3 `671B / 37B` | total / activated params | 等价 37B dense 端到端成本 |
|
||
| V3 `14.8T` | 报告预训练 token 总量 | 数据质量证明 |
|
||
| V3 `2.788M H800 hours` | 报告完整训练口径;硬件限定 | 跨模型统一成本 |
|
||
| R1 `~800K` | 教师生成/筛选的 distill SFT samples | 小模型自主 RL 数据 |
|
||
| V3.2 `1,827 environments` | general-agent 合成环境数 | 全部 Agent 数据规模 |
|
||
| V4 `1.6T/49B`、`284B/13B` | Pro/Flash total/active | 两模型性能排序 |
|
||
| V4 `27%/10%` 等 | 报告相对 V3.2、1M context 的 FLOPs/KV | 所有服务栈固定比例 |
|
||
| K3 `2.8T/104B` | total/active | 与 V4 单轴优劣 |
|
||
|
||
## 6. 事实审计红线
|
||
|
||
- [x] DAPO 与 Dr.GRPO 不写成 DeepSeek 官方 R1 recipe。
|
||
- [x] “aha/wait” 不写成 RL 从零创造推理的因果证据。
|
||
- [x] R1 与 R1-Zero 分开。
|
||
- [x] Distill students 不写成重跑 RL。
|
||
- [x] aux-loss-free 不写成没有任何 auxiliary balance。
|
||
- [x] MLA content cache 与 decoupled RoPE cache 都进入公式。
|
||
- [x] FP8 用完整角色合同。
|
||
- [x] MTP 训练、可丢弃推理与 speculative role 分开。
|
||
- [x] DSA indexer 成本与漏检风险保留。
|
||
- [x] CSA 与 HCA 分开。
|
||
- [x] mHC 与 AttnRes 分开。
|
||
- [x] Muon 与 AdamW 参数分组保留。
|
||
- [x] V4 与 K3 按状态对象对照,不按 1M 标签归并。
|
||
- [x] 主模型 AttnRes block size 12 与 MiniTriton benchmark block size 2 分开。
|
||
- [x] 所有 benchmark/成本数字带报告、配置和比较对象。
|
||
|
||
## 7. 页面验收合同
|
||
|
||
- 至少 24 张问题账;
|
||
- 至少 20 个正文目录;
|
||
- 60 个一手/官方阅读节点;
|
||
- 四个独立可操作实验;
|
||
- DeepSeekMath 必须在主时间线中;
|
||
- DAPO / Dr.GRPO 必须标后续公开研究;
|
||
- MLA 实验必须把 RoPE cache 算进去;
|
||
- V3 实验必须显示 FP8 角色而不是单一开关;
|
||
- R1 pipeline 必须同时可见 Zero 与正式 R1;
|
||
- V4/K3 表必须包含“直接祖先 / 同题新解 / 同期不同路线”;
|
||
- 桌面与 390px 移动端无文档级横向溢出;
|
||
- tabs 支持键盘方向键;
|
||
- toy model、作者报告和公式推导使用不同标签;
|
||
- 专属 Chrome 回归并纳入全站回归。
|