8.2 KiB
8.2 KiB
DeepSeek 技术谱系二轮:Grok 候选线索
状态:全部未核验
生成方式:本机 Grok CLI Headless,2026-07-29
用途:查漏、形成问题、发现可能的教学断点。
禁止用途:不得直接承载正文事实、公式、年份、模型数字、benchmark 结论或因果归因。
1. Grok 对现有页面的审计候选
现有 src/pages/deepseek/index.astro 已具备从 DeepSeek LLM 到 V4 的静态骨架,但可能存在以下缺口:
- Dense 基线缺少“为什么可归因需要基线”的实验;
- DeepSeekMoE 缺少组合空间、激活预算和通信税三本账;
- MLA 缺少矩阵吸收、decoupled RoPE 与缓存元素的完整推导;
- V3 只概览 FP8、DualPipe、MTP、loss-free balance,没有让读者操作它们;
- GRPO 只展示组内归一,缺少 clip、KL、全同奖励零信号和 rollout 成本;
- R1 缺少训练轨迹证据边界;
- DAPO / Dr.GRPO 只在推理专题出现,DeepSeek 谱系本身断链;
- V3.2 缺少 indexer warm-up、稀疏训练和 Agent 数据合成;
- V4 的 CSA/HCA、mHC、Muon、混合精度和 effort 只写了摘要;
- DeepSeek → K3 映射缺少“直接祖先 / 同题新解 / 同期不同路线”的反例。
以上只是候选审计,正式取舍见 DEEPSEEK_RESEARCH.md。
2. 二十四张候选问题账
| 编号 | 候选问题 | 禁止偷换 |
|---|---|---|
| Q01 | 为什么先建立 dense 坐标系? | 不把后续 MoE 的所有收益归因于稀疏性 |
| Q02 | 总参数、激活参数、FLOPs 和显存怎样分账? | 不把 active params 等同同规模 dense 成本 |
| Q03 | 细粒度专家怎样改变组合空间? | 不把组合数直接当能力 |
| Q04 | shared expert 隔离了什么? | 不写成免费公共知识库 |
| Q05 | 稀疏计算为什么带来 all-to-all? | 不用理论 FLOPs 代替墙钟 |
| Q06 | aux loss 与语言建模目标为何可能冲突? | aux-loss-free 不等于无均衡 |
| Q07 | KV Cache 为什么是服务重复税? | 不把权重显存与 KV 状态混在一起 |
| Q08 | MHA、GQA、MLA 分别压缩什么? | MLA 不是 MQA 改名 |
| Q09 | joint latent 保留了什么? | 不声称低秩必然无损 |
| Q10 | RoPE 为什么妨碍权重吸收? | 不省略位置分支缓存 |
| Q11 | FP8 是哪些张量的什么角色? | 不写“全模型八位” |
| Q12 | DualPipe 隐藏哪些气泡? | 不写“消灭所有等待” |
| Q13 | MTP 的训练与推理角色怎样分开? | 不写“取代自回归” |
| Q14 | GRPO 去掉 critic 后成本去了哪里? | 不写“几乎零额外成本” |
| Q15 | 可验证奖励能塑造什么? | 不外推到无法验证的开放任务 |
| Q16 | R1-Zero 真正隔离了哪个变量? | 不写“无数据从零推理” |
| Q17 | R1 的四阶段分别修什么? | 不把 R1 写成纯 RL |
| Q18 | 蒸馏为何不是重演探索? | 不把 SFT 学生称为小型 R1-Zero |
| Q19 | GRPO 的长度、难度与 clip 偏差是什么? | DAPO / Dr.GRPO 不是官方 R1 配方 |
| Q20 | DSA indexer 与固定稀疏模式差在哪? | top-k 不保证召回 |
| Q21 | Agentic task synthesis 怎样形成环境闭环? | 不把静态题提升归因成 Agent 能力 |
| Q22 | CSA 和 HCA 分别压缩哪本账? | 不把二者合写成一个缩写 |
| Q23 | mHC 与 Muon 针对的稳定性对象有何不同? | 不写 Muon 替代全部 AdamW |
| Q24 | DeepSeek 与 K3 如何逐对象对照? | 不按总参数或榜单做单轴排名 |
3. 候选历史链
Dense / Scaling
→ 容量随激活计算一起涨
DeepSeekMoE
→ 容量与激活计算分开,但通信与路由变贵
V2 / MLA
→ 缓存从完整多头 K/V 改为 joint latent,但位置支路与恢复计算仍在
V3
→ loss-free balance + MTP + FP8 + DualPipe,把模型与集群一起优化
DeepSeekMath / GRPO
→ 用组内相对奖励省掉 critic,但 rollout、奖励和目标偏差仍在
R1-Zero / R1
→ 先隔离纯规则奖励实验,再用 cold start、SFT mix 与通用 RL 修复
DAPO / Dr.GRPO
→ 从复现断点反查 clip、采样、聚合、截断、长度和难度偏差
V3.2
→ DSA 降长上下文主注意力成本;Agent 合成把推理放入环境
V4
→ CSA/HCA、mHC、Muon、低精度和异构缓存围绕 1M 联合设计
K3
→ MLA/MoE 有明确祖先,其余多为同题新解或同期不同路线
4. 候选一手节点池
DeepSeek 主线
- DeepSeek LLM —
2401.02954 - DeepSeek-Coder —
2401.14196 - DeepSeekMoE —
2401.06066 - DeepSeekMath —
2402.03300 - DeepSeek-V2 —
2405.04434 - DeepSeek-Coder-V2 —
2406.11931 - ESFT —
2407.01906 - DeepSeek-Prover-V1.5 —
2408.08152 - DeepSeek-V3 —
2412.19437 - DeepSeek-R1 —
2501.12948 - DAPO —
2503.14476 - Understanding R1-Zero-Like Training / Dr.GRPO —
2503.20783 - DeepSeek-Prover-V2 —
2504.21801 - DeepEP —
github.com/deepseek-ai/DeepEP - DualPipe —
github.com/deepseek-ai/DualPipe - DeepGEMM —
github.com/deepseek-ai/DeepGEMM - DeepSeek-V3.2 —
2512.02556 - Engram —
2601.07372 - mHC —
2512.24880 - DeepSeek-V4 —
2606.19348
机制祖先候选
- Conditional Computation —
cs/0008102 - Sparsely-Gated MoE —
1701.06538 - GShard —
2006.16668 - Switch Transformer —
2101.03961 - ST-MoE —
2202.08906 - MQA —
1911.02150 - GQA —
2305.13245 - RoPE —
2104.09864 - FlashAttention —
2205.14135 - ZeRO —
1910.02054 - GPipe —
1811.06965 - PipeDream —
1806.03377 - PPO —
1707.06347 - InstructGPT —
2203.02155 - Multi-Token Prediction —
2404.19737 - Muon is Scalable —
2502.16982
Kimi 对照候选
- Kimi k1.5 —
2501.12599 - Kimi K2 —
2507.20534 - Kimi Linear —
2510.26692 - LatentMoE —
2601.18089 - Attention Residuals —
2603.15031 - Kimi K3 —
2607.24653
候选池并不等于最终阅读链;正式链必须剔除综述、二手页面和无法核验的年份。
5. 四个候选交互实验
A. Sparse Capacity Ledger
- 输入:专家总数、每 Token 激活数、shared 数、专家宽度、EP 节点数;
- 输出:总/激活参数、组合数、教学通信压力;
- 误解:总参数等于每 Token 成本、细粒度必然更快、shared 免费。
B. MLA Cache Workbench
- 输入:层数、heads、head dim、GQA groups、latent dim、RoPE dim、上下文、精度;
- 输出:MHA/GQA/MLA 每 Token 元素与总缓存、压缩基线;
- 误解:V2 的 93.3% 是普适常数、MLA 等于 GQA、RoPE 没有缓存。
C. Algorithm–System Co-design Board
- 输入:micro-batches、pipeline stages、通信/计算比、精度角色、MTP 开关;
- 输出:toy bubble、暴露通信、训练目标密度与角色合同;
- 误解:DualPipe 清零气泡、FP8 全路径、MTP 默认参与生成。
D. GRPO Bias Microscope
- 输入:一组奖励、序列长度、是否 std norm、response/token aggregation、clip 上下界;
- 输出:优势、轨迹权重、零信号、长度倾向;
- 误解:去 critic 等于无成本、长 CoT 必然更优、DAPO/Dr.GRPO 是 R1 官方配方。
6. 二十条候选红线
- 细粒度专家在所有任务、所有硬件上都优于粗粒度专家;
- shared expert 是不增加计算的公共知识库;
- 激活参数等价于同规模 dense 的完整成本;
- MLA 只是 MQA/GQA 换名;
- V2 的 KV/吞吐数字是 MLA 通用常数;
- decoupled RoPE 分支无需缓存;
- aux-loss-free 等于没有负载均衡;
- FP8 等于全部张量和累加都使用 FP8;
- DualPipe 消灭所有 pipeline bubble;
- V3 的 2.788M GPU hours 可直接与不同硬件模型横比;
- MTP 在推理时取代 next-token generation;
- GRPO 是无偏且严格优于 PPO;
- R1-Zero 不依赖预训练知识;
- “aha” token 是 RL 创造推理的因果证据;
- R1 完整模型没有 SFT;
- 蒸馏学生重演了教师的 RL 探索;
- DAPO/Dr.GRPO 是 DeepSeek 官方 R1 配方;
- DSA top-k 保证不漏关键历史;
- V4 与 K3 使用同一种百万上下文状态;
- “直接祖先”意味着实现和超参数相同。
7. 正式核验结果去向
- 一手来源结论:
research/DEEPSEEK_RESEARCH.md - 页面实现:
src/pages/deepseek/index.astro - 交互实现:
src/components/DeepSeekLab.astro - 论文索引:
src/data/papers.ts