190 lines
8.2 KiB
Markdown
190 lines
8.2 KiB
Markdown
# DeepSeek 技术谱系二轮:Grok 候选线索
|
||
|
||
> 状态:**全部未核验**
|
||
> 生成方式:本机 Grok CLI Headless,2026-07-29
|
||
> 用途:查漏、形成问题、发现可能的教学断点。
|
||
> 禁止用途:不得直接承载正文事实、公式、年份、模型数字、benchmark 结论或因果归因。
|
||
|
||
## 1. Grok 对现有页面的审计候选
|
||
|
||
现有 `src/pages/deepseek/index.astro` 已具备从 DeepSeek LLM 到 V4 的静态骨架,但可能存在以下缺口:
|
||
|
||
1. Dense 基线缺少“为什么可归因需要基线”的实验;
|
||
2. DeepSeekMoE 缺少组合空间、激活预算和通信税三本账;
|
||
3. MLA 缺少矩阵吸收、decoupled RoPE 与缓存元素的完整推导;
|
||
4. V3 只概览 FP8、DualPipe、MTP、loss-free balance,没有让读者操作它们;
|
||
5. GRPO 只展示组内归一,缺少 clip、KL、全同奖励零信号和 rollout 成本;
|
||
6. R1 缺少训练轨迹证据边界;
|
||
7. DAPO / Dr.GRPO 只在推理专题出现,DeepSeek 谱系本身断链;
|
||
8. V3.2 缺少 indexer warm-up、稀疏训练和 Agent 数据合成;
|
||
9. V4 的 CSA/HCA、mHC、Muon、混合精度和 effort 只写了摘要;
|
||
10. DeepSeek → K3 映射缺少“直接祖先 / 同题新解 / 同期不同路线”的反例。
|
||
|
||
以上只是候选审计,正式取舍见 `DEEPSEEK_RESEARCH.md`。
|
||
|
||
## 2. 二十四张候选问题账
|
||
|
||
| 编号 | 候选问题 | 禁止偷换 |
|
||
|---|---|---|
|
||
| Q01 | 为什么先建立 dense 坐标系? | 不把后续 MoE 的所有收益归因于稀疏性 |
|
||
| Q02 | 总参数、激活参数、FLOPs 和显存怎样分账? | 不把 active params 等同同规模 dense 成本 |
|
||
| Q03 | 细粒度专家怎样改变组合空间? | 不把组合数直接当能力 |
|
||
| Q04 | shared expert 隔离了什么? | 不写成免费公共知识库 |
|
||
| Q05 | 稀疏计算为什么带来 all-to-all? | 不用理论 FLOPs 代替墙钟 |
|
||
| Q06 | aux loss 与语言建模目标为何可能冲突? | aux-loss-free 不等于无均衡 |
|
||
| Q07 | KV Cache 为什么是服务重复税? | 不把权重显存与 KV 状态混在一起 |
|
||
| Q08 | MHA、GQA、MLA 分别压缩什么? | MLA 不是 MQA 改名 |
|
||
| Q09 | joint latent 保留了什么? | 不声称低秩必然无损 |
|
||
| Q10 | RoPE 为什么妨碍权重吸收? | 不省略位置分支缓存 |
|
||
| Q11 | FP8 是哪些张量的什么角色? | 不写“全模型八位” |
|
||
| Q12 | DualPipe 隐藏哪些气泡? | 不写“消灭所有等待” |
|
||
| Q13 | MTP 的训练与推理角色怎样分开? | 不写“取代自回归” |
|
||
| Q14 | GRPO 去掉 critic 后成本去了哪里? | 不写“几乎零额外成本” |
|
||
| Q15 | 可验证奖励能塑造什么? | 不外推到无法验证的开放任务 |
|
||
| Q16 | R1-Zero 真正隔离了哪个变量? | 不写“无数据从零推理” |
|
||
| Q17 | R1 的四阶段分别修什么? | 不把 R1 写成纯 RL |
|
||
| Q18 | 蒸馏为何不是重演探索? | 不把 SFT 学生称为小型 R1-Zero |
|
||
| Q19 | GRPO 的长度、难度与 clip 偏差是什么? | DAPO / Dr.GRPO 不是官方 R1 配方 |
|
||
| Q20 | DSA indexer 与固定稀疏模式差在哪? | top-k 不保证召回 |
|
||
| Q21 | Agentic task synthesis 怎样形成环境闭环? | 不把静态题提升归因成 Agent 能力 |
|
||
| Q22 | CSA 和 HCA 分别压缩哪本账? | 不把二者合写成一个缩写 |
|
||
| Q23 | mHC 与 Muon 针对的稳定性对象有何不同? | 不写 Muon 替代全部 AdamW |
|
||
| Q24 | DeepSeek 与 K3 如何逐对象对照? | 不按总参数或榜单做单轴排名 |
|
||
|
||
## 3. 候选历史链
|
||
|
||
```text
|
||
Dense / Scaling
|
||
→ 容量随激活计算一起涨
|
||
DeepSeekMoE
|
||
→ 容量与激活计算分开,但通信与路由变贵
|
||
V2 / MLA
|
||
→ 缓存从完整多头 K/V 改为 joint latent,但位置支路与恢复计算仍在
|
||
V3
|
||
→ loss-free balance + MTP + FP8 + DualPipe,把模型与集群一起优化
|
||
DeepSeekMath / GRPO
|
||
→ 用组内相对奖励省掉 critic,但 rollout、奖励和目标偏差仍在
|
||
R1-Zero / R1
|
||
→ 先隔离纯规则奖励实验,再用 cold start、SFT mix 与通用 RL 修复
|
||
DAPO / Dr.GRPO
|
||
→ 从复现断点反查 clip、采样、聚合、截断、长度和难度偏差
|
||
V3.2
|
||
→ DSA 降长上下文主注意力成本;Agent 合成把推理放入环境
|
||
V4
|
||
→ CSA/HCA、mHC、Muon、低精度和异构缓存围绕 1M 联合设计
|
||
K3
|
||
→ MLA/MoE 有明确祖先,其余多为同题新解或同期不同路线
|
||
```
|
||
|
||
## 4. 候选一手节点池
|
||
|
||
### DeepSeek 主线
|
||
|
||
- DeepSeek LLM — `2401.02954`
|
||
- DeepSeek-Coder — `2401.14196`
|
||
- DeepSeekMoE — `2401.06066`
|
||
- DeepSeekMath — `2402.03300`
|
||
- DeepSeek-V2 — `2405.04434`
|
||
- DeepSeek-Coder-V2 — `2406.11931`
|
||
- ESFT — `2407.01906`
|
||
- DeepSeek-Prover-V1.5 — `2408.08152`
|
||
- DeepSeek-V3 — `2412.19437`
|
||
- DeepSeek-R1 — `2501.12948`
|
||
- DAPO — `2503.14476`
|
||
- Understanding R1-Zero-Like Training / Dr.GRPO — `2503.20783`
|
||
- DeepSeek-Prover-V2 — `2504.21801`
|
||
- DeepEP — `github.com/deepseek-ai/DeepEP`
|
||
- DualPipe — `github.com/deepseek-ai/DualPipe`
|
||
- DeepGEMM — `github.com/deepseek-ai/DeepGEMM`
|
||
- DeepSeek-V3.2 — `2512.02556`
|
||
- Engram — `2601.07372`
|
||
- mHC — `2512.24880`
|
||
- DeepSeek-V4 — `2606.19348`
|
||
|
||
### 机制祖先候选
|
||
|
||
- Conditional Computation — `cs/0008102`
|
||
- Sparsely-Gated MoE — `1701.06538`
|
||
- GShard — `2006.16668`
|
||
- Switch Transformer — `2101.03961`
|
||
- ST-MoE — `2202.08906`
|
||
- MQA — `1911.02150`
|
||
- GQA — `2305.13245`
|
||
- RoPE — `2104.09864`
|
||
- FlashAttention — `2205.14135`
|
||
- ZeRO — `1910.02054`
|
||
- GPipe — `1811.06965`
|
||
- PipeDream — `1806.03377`
|
||
- PPO — `1707.06347`
|
||
- InstructGPT — `2203.02155`
|
||
- Multi-Token Prediction — `2404.19737`
|
||
- Muon is Scalable — `2502.16982`
|
||
|
||
### Kimi 对照候选
|
||
|
||
- Kimi k1.5 — `2501.12599`
|
||
- Kimi K2 — `2507.20534`
|
||
- Kimi Linear — `2510.26692`
|
||
- LatentMoE — `2601.18089`
|
||
- Attention Residuals — `2603.15031`
|
||
- Kimi K3 — `2607.24653`
|
||
|
||
候选池并不等于最终阅读链;正式链必须剔除综述、二手页面和无法核验的年份。
|
||
|
||
## 5. 四个候选交互实验
|
||
|
||
### A. Sparse Capacity Ledger
|
||
|
||
- 输入:专家总数、每 Token 激活数、shared 数、专家宽度、EP 节点数;
|
||
- 输出:总/激活参数、组合数、教学通信压力;
|
||
- 误解:总参数等于每 Token 成本、细粒度必然更快、shared 免费。
|
||
|
||
### B. MLA Cache Workbench
|
||
|
||
- 输入:层数、heads、head dim、GQA groups、latent dim、RoPE dim、上下文、精度;
|
||
- 输出:MHA/GQA/MLA 每 Token 元素与总缓存、压缩基线;
|
||
- 误解:V2 的 93.3% 是普适常数、MLA 等于 GQA、RoPE 没有缓存。
|
||
|
||
### C. Algorithm–System Co-design Board
|
||
|
||
- 输入:micro-batches、pipeline stages、通信/计算比、精度角色、MTP 开关;
|
||
- 输出:toy bubble、暴露通信、训练目标密度与角色合同;
|
||
- 误解:DualPipe 清零气泡、FP8 全路径、MTP 默认参与生成。
|
||
|
||
### D. GRPO Bias Microscope
|
||
|
||
- 输入:一组奖励、序列长度、是否 std norm、response/token aggregation、clip 上下界;
|
||
- 输出:优势、轨迹权重、零信号、长度倾向;
|
||
- 误解:去 critic 等于无成本、长 CoT 必然更优、DAPO/Dr.GRPO 是 R1 官方配方。
|
||
|
||
## 6. 二十条候选红线
|
||
|
||
1. 细粒度专家在所有任务、所有硬件上都优于粗粒度专家;
|
||
2. shared expert 是不增加计算的公共知识库;
|
||
3. 激活参数等价于同规模 dense 的完整成本;
|
||
4. MLA 只是 MQA/GQA 换名;
|
||
5. V2 的 KV/吞吐数字是 MLA 通用常数;
|
||
6. decoupled RoPE 分支无需缓存;
|
||
7. aux-loss-free 等于没有负载均衡;
|
||
8. FP8 等于全部张量和累加都使用 FP8;
|
||
9. DualPipe 消灭所有 pipeline bubble;
|
||
10. V3 的 2.788M GPU hours 可直接与不同硬件模型横比;
|
||
11. MTP 在推理时取代 next-token generation;
|
||
12. GRPO 是无偏且严格优于 PPO;
|
||
13. R1-Zero 不依赖预训练知识;
|
||
14. “aha” token 是 RL 创造推理的因果证据;
|
||
15. R1 完整模型没有 SFT;
|
||
16. 蒸馏学生重演了教师的 RL 探索;
|
||
17. DAPO/Dr.GRPO 是 DeepSeek 官方 R1 配方;
|
||
18. DSA top-k 保证不漏关键历史;
|
||
19. V4 与 K3 使用同一种百万上下文状态;
|
||
20. “直接祖先”意味着实现和超参数相同。
|
||
|
||
## 7. 正式核验结果去向
|
||
|
||
- 一手来源结论:`research/DEEPSEEK_RESEARCH.md`
|
||
- 页面实现:`src/pages/deepseek/index.astro`
|
||
- 交互实现:`src/components/DeepSeekLab.astro`
|
||
- 论文索引:`src/data/papers.ts`
|
||
|