Files
llm-atlas/research/DEEPSEEK_GROK_LEADS.md
2026-07-29 11:17:53 +08:00

8.2 KiB
Raw Permalink Blame History

DeepSeek 技术谱系二轮:Grok 候选线索

状态:全部未核验
生成方式:本机 Grok CLI Headless,2026-07-29
用途:查漏、形成问题、发现可能的教学断点。
禁止用途:不得直接承载正文事实、公式、年份、模型数字、benchmark 结论或因果归因。

1. Grok 对现有页面的审计候选

现有 src/pages/deepseek/index.astro 已具备从 DeepSeek LLM 到 V4 的静态骨架,但可能存在以下缺口:

  1. Dense 基线缺少“为什么可归因需要基线”的实验;
  2. DeepSeekMoE 缺少组合空间、激活预算和通信税三本账;
  3. MLA 缺少矩阵吸收、decoupled RoPE 与缓存元素的完整推导;
  4. V3 只概览 FP8、DualPipe、MTP、loss-free balance,没有让读者操作它们;
  5. GRPO 只展示组内归一,缺少 clip、KL、全同奖励零信号和 rollout 成本;
  6. R1 缺少训练轨迹证据边界;
  7. DAPO / Dr.GRPO 只在推理专题出现,DeepSeek 谱系本身断链;
  8. V3.2 缺少 indexer warm-up、稀疏训练和 Agent 数据合成;
  9. V4 的 CSA/HCA、mHC、Muon、混合精度和 effort 只写了摘要;
  10. DeepSeek → K3 映射缺少“直接祖先 / 同题新解 / 同期不同路线”的反例。

以上只是候选审计,正式取舍见 DEEPSEEK_RESEARCH.md。

2. 二十四张候选问题账

编号 候选问题 禁止偷换
Q01 为什么先建立 dense 坐标系? 不把后续 MoE 的所有收益归因于稀疏性
Q02 总参数、激活参数、FLOPs 和显存怎样分账? 不把 active params 等同同规模 dense 成本
Q03 细粒度专家怎样改变组合空间? 不把组合数直接当能力
Q04 shared expert 隔离了什么? 不写成免费公共知识库
Q05 稀疏计算为什么带来 all-to-all? 不用理论 FLOPs 代替墙钟
Q06 aux loss 与语言建模目标为何可能冲突? aux-loss-free 不等于无均衡
Q07 KV Cache 为什么是服务重复税? 不把权重显存与 KV 状态混在一起
Q08 MHA、GQA、MLA 分别压缩什么? MLA 不是 MQA 改名
Q09 joint latent 保留了什么? 不声称低秩必然无损
Q10 RoPE 为什么妨碍权重吸收? 不省略位置分支缓存
Q11 FP8 是哪些张量的什么角色? 不写“全模型八位”
Q12 DualPipe 隐藏哪些气泡? 不写“消灭所有等待”
Q13 MTP 的训练与推理角色怎样分开? 不写“取代自回归”
Q14 GRPO 去掉 critic 后成本去了哪里? 不写“几乎零额外成本”
Q15 可验证奖励能塑造什么? 不外推到无法验证的开放任务
Q16 R1-Zero 真正隔离了哪个变量? 不写“无数据从零推理”
Q17 R1 的四阶段分别修什么? 不把 R1 写成纯 RL
Q18 蒸馏为何不是重演探索? 不把 SFT 学生称为小型 R1-Zero
Q19 GRPO 的长度、难度与 clip 偏差是什么? DAPO / Dr.GRPO 不是官方 R1 配方
Q20 DSA indexer 与固定稀疏模式差在哪? top-k 不保证召回
Q21 Agentic task synthesis 怎样形成环境闭环? 不把静态题提升归因成 Agent 能力
Q22 CSA 和 HCA 分别压缩哪本账? 不把二者合写成一个缩写
Q23 mHC 与 Muon 针对的稳定性对象有何不同? 不写 Muon 替代全部 AdamW
Q24 DeepSeek 与 K3 如何逐对象对照? 不按总参数或榜单做单轴排名

3. 候选历史链

Dense / Scaling
  → 容量随激活计算一起涨
DeepSeekMoE
  → 容量与激活计算分开,但通信与路由变贵
V2 / MLA
  → 缓存从完整多头 K/V 改为 joint latent,但位置支路与恢复计算仍在
V3
  → loss-free balance + MTP + FP8 + DualPipe,把模型与集群一起优化
DeepSeekMath / GRPO
  → 用组内相对奖励省掉 critic,但 rollout、奖励和目标偏差仍在
R1-Zero / R1
  → 先隔离纯规则奖励实验,再用 cold start、SFT mix 与通用 RL 修复
DAPO / Dr.GRPO
  → 从复现断点反查 clip、采样、聚合、截断、长度和难度偏差
V3.2
  → DSA 降长上下文主注意力成本;Agent 合成把推理放入环境
V4
  → CSA/HCA、mHC、Muon、低精度和异构缓存围绕 1M 联合设计
K3
  → MLA/MoE 有明确祖先,其余多为同题新解或同期不同路线

4. 候选一手节点池

DeepSeek 主线

  • DeepSeek LLM — 2401.02954
  • DeepSeek-Coder — 2401.14196
  • DeepSeekMoE — 2401.06066
  • DeepSeekMath — 2402.03300
  • DeepSeek-V2 — 2405.04434
  • DeepSeek-Coder-V2 — 2406.11931
  • ESFT — 2407.01906
  • DeepSeek-Prover-V1.5 — 2408.08152
  • DeepSeek-V3 — 2412.19437
  • DeepSeek-R1 — 2501.12948
  • DAPO — 2503.14476
  • Understanding R1-Zero-Like Training / Dr.GRPO — 2503.20783
  • DeepSeek-Prover-V2 — 2504.21801
  • DeepEP — github.com/deepseek-ai/DeepEP
  • DualPipe — github.com/deepseek-ai/DualPipe
  • DeepGEMM — github.com/deepseek-ai/DeepGEMM
  • DeepSeek-V3.2 — 2512.02556
  • Engram — 2601.07372
  • mHC — 2512.24880
  • DeepSeek-V4 — 2606.19348

机制祖先候选

  • Conditional Computation — cs/0008102
  • Sparsely-Gated MoE — 1701.06538
  • GShard — 2006.16668
  • Switch Transformer — 2101.03961
  • ST-MoE — 2202.08906
  • MQA — 1911.02150
  • GQA — 2305.13245
  • RoPE — 2104.09864
  • FlashAttention — 2205.14135
  • ZeRO — 1910.02054
  • GPipe — 1811.06965
  • PipeDream — 1806.03377
  • PPO — 1707.06347
  • InstructGPT — 2203.02155
  • Multi-Token Prediction — 2404.19737
  • Muon is Scalable — 2502.16982

Kimi 对照候选

  • Kimi k1.5 — 2501.12599
  • Kimi K2 — 2507.20534
  • Kimi Linear — 2510.26692
  • LatentMoE — 2601.18089
  • Attention Residuals — 2603.15031
  • Kimi K3 — 2607.24653

候选池并不等于最终阅读链;正式链必须剔除综述、二手页面和无法核验的年份。

5. 四个候选交互实验

A. Sparse Capacity Ledger

  • 输入:专家总数、每 Token 激活数、shared 数、专家宽度、EP 节点数;
  • 输出:总/激活参数、组合数、教学通信压力;
  • 误解:总参数等于每 Token 成本、细粒度必然更快、shared 免费。

B. MLA Cache Workbench

  • 输入:层数、heads、head dim、GQA groups、latent dim、RoPE dim、上下文、精度;
  • 输出:MHA/GQA/MLA 每 Token 元素与总缓存、压缩基线;
  • 误解:V2 的 93.3% 是普适常数、MLA 等于 GQA、RoPE 没有缓存。

C. Algorithm–System Co-design Board

  • 输入:micro-batches、pipeline stages、通信/计算比、精度角色、MTP 开关;
  • 输出:toy bubble、暴露通信、训练目标密度与角色合同;
  • 误解:DualPipe 清零气泡、FP8 全路径、MTP 默认参与生成。

D. GRPO Bias Microscope

  • 输入:一组奖励、序列长度、是否 std norm、response/token aggregation、clip 上下界;
  • 输出:优势、轨迹权重、零信号、长度倾向;
  • 误解:去 critic 等于无成本、长 CoT 必然更优、DAPO/Dr.GRPO 是 R1 官方配方。

6. 二十条候选红线

  1. 细粒度专家在所有任务、所有硬件上都优于粗粒度专家;
  2. shared expert 是不增加计算的公共知识库;
  3. 激活参数等价于同规模 dense 的完整成本;
  4. MLA 只是 MQA/GQA 换名;
  5. V2 的 KV/吞吐数字是 MLA 通用常数;
  6. decoupled RoPE 分支无需缓存;
  7. aux-loss-free 等于没有负载均衡;
  8. FP8 等于全部张量和累加都使用 FP8;
  9. DualPipe 消灭所有 pipeline bubble;
  10. V3 的 2.788M GPU hours 可直接与不同硬件模型横比;
  11. MTP 在推理时取代 next-token generation;
  12. GRPO 是无偏且严格优于 PPO;
  13. R1-Zero 不依赖预训练知识;
  14. “aha” token 是 RL 创造推理的因果证据;
  15. R1 完整模型没有 SFT;
  16. 蒸馏学生重演了教师的 RL 探索;
  17. DAPO/Dr.GRPO 是 DeepSeek 官方 R1 配方;
  18. DSA top-k 保证不漏关键历史;
  19. V4 与 K3 使用同一种百万上下文状态;
  20. “直接祖先”意味着实现和超参数相同。

7. 正式核验结果去向

  • 一手来源结论:research/DEEPSEEK_RESEARCH.md
  • 页面实现:src/pages/deepseek/index.astro
  • 交互实现:src/components/DeepSeekLab.astro
  • 论文索引:src/data/papers.ts