# DeepSeek 技术谱系二轮:Grok 候选线索 > 状态:**全部未核验** > 生成方式:本机 Grok CLI Headless,2026-07-29 > 用途:查漏、形成问题、发现可能的教学断点。 > 禁止用途:不得直接承载正文事实、公式、年份、模型数字、benchmark 结论或因果归因。 ## 1. Grok 对现有页面的审计候选 现有 `src/pages/deepseek/index.astro` 已具备从 DeepSeek LLM 到 V4 的静态骨架,但可能存在以下缺口: 1. Dense 基线缺少“为什么可归因需要基线”的实验; 2. DeepSeekMoE 缺少组合空间、激活预算和通信税三本账; 3. MLA 缺少矩阵吸收、decoupled RoPE 与缓存元素的完整推导; 4. V3 只概览 FP8、DualPipe、MTP、loss-free balance,没有让读者操作它们; 5. GRPO 只展示组内归一,缺少 clip、KL、全同奖励零信号和 rollout 成本; 6. R1 缺少训练轨迹证据边界; 7. DAPO / Dr.GRPO 只在推理专题出现,DeepSeek 谱系本身断链; 8. V3.2 缺少 indexer warm-up、稀疏训练和 Agent 数据合成; 9. V4 的 CSA/HCA、mHC、Muon、混合精度和 effort 只写了摘要; 10. DeepSeek → K3 映射缺少“直接祖先 / 同题新解 / 同期不同路线”的反例。 以上只是候选审计,正式取舍见 `DEEPSEEK_RESEARCH.md`。 ## 2. 二十四张候选问题账 | 编号 | 候选问题 | 禁止偷换 | |---|---|---| | Q01 | 为什么先建立 dense 坐标系? | 不把后续 MoE 的所有收益归因于稀疏性 | | Q02 | 总参数、激活参数、FLOPs 和显存怎样分账? | 不把 active params 等同同规模 dense 成本 | | Q03 | 细粒度专家怎样改变组合空间? | 不把组合数直接当能力 | | Q04 | shared expert 隔离了什么? | 不写成免费公共知识库 | | Q05 | 稀疏计算为什么带来 all-to-all? | 不用理论 FLOPs 代替墙钟 | | Q06 | aux loss 与语言建模目标为何可能冲突? | aux-loss-free 不等于无均衡 | | Q07 | KV Cache 为什么是服务重复税? | 不把权重显存与 KV 状态混在一起 | | Q08 | MHA、GQA、MLA 分别压缩什么? | MLA 不是 MQA 改名 | | Q09 | joint latent 保留了什么? | 不声称低秩必然无损 | | Q10 | RoPE 为什么妨碍权重吸收? | 不省略位置分支缓存 | | Q11 | FP8 是哪些张量的什么角色? | 不写“全模型八位” | | Q12 | DualPipe 隐藏哪些气泡? | 不写“消灭所有等待” | | Q13 | MTP 的训练与推理角色怎样分开? | 不写“取代自回归” | | Q14 | GRPO 去掉 critic 后成本去了哪里? | 不写“几乎零额外成本” | | Q15 | 可验证奖励能塑造什么? | 不外推到无法验证的开放任务 | | Q16 | R1-Zero 真正隔离了哪个变量? | 不写“无数据从零推理” | | Q17 | R1 的四阶段分别修什么? | 不把 R1 写成纯 RL | | Q18 | 蒸馏为何不是重演探索? | 不把 SFT 学生称为小型 R1-Zero | | Q19 | GRPO 的长度、难度与 clip 偏差是什么? | DAPO / Dr.GRPO 不是官方 R1 配方 | | Q20 | DSA indexer 与固定稀疏模式差在哪? | top-k 不保证召回 | | Q21 | Agentic task synthesis 怎样形成环境闭环? | 不把静态题提升归因成 Agent 能力 | | Q22 | CSA 和 HCA 分别压缩哪本账? | 不把二者合写成一个缩写 | | Q23 | mHC 与 Muon 针对的稳定性对象有何不同? | 不写 Muon 替代全部 AdamW | | Q24 | DeepSeek 与 K3 如何逐对象对照? | 不按总参数或榜单做单轴排名 | ## 3. 候选历史链 ```text Dense / Scaling → 容量随激活计算一起涨 DeepSeekMoE → 容量与激活计算分开,但通信与路由变贵 V2 / MLA → 缓存从完整多头 K/V 改为 joint latent,但位置支路与恢复计算仍在 V3 → loss-free balance + MTP + FP8 + DualPipe,把模型与集群一起优化 DeepSeekMath / GRPO → 用组内相对奖励省掉 critic,但 rollout、奖励和目标偏差仍在 R1-Zero / R1 → 先隔离纯规则奖励实验,再用 cold start、SFT mix 与通用 RL 修复 DAPO / Dr.GRPO → 从复现断点反查 clip、采样、聚合、截断、长度和难度偏差 V3.2 → DSA 降长上下文主注意力成本;Agent 合成把推理放入环境 V4 → CSA/HCA、mHC、Muon、低精度和异构缓存围绕 1M 联合设计 K3 → MLA/MoE 有明确祖先,其余多为同题新解或同期不同路线 ``` ## 4. 候选一手节点池 ### DeepSeek 主线 - DeepSeek LLM — `2401.02954` - DeepSeek-Coder — `2401.14196` - DeepSeekMoE — `2401.06066` - DeepSeekMath — `2402.03300` - DeepSeek-V2 — `2405.04434` - DeepSeek-Coder-V2 — `2406.11931` - ESFT — `2407.01906` - DeepSeek-Prover-V1.5 — `2408.08152` - DeepSeek-V3 — `2412.19437` - DeepSeek-R1 — `2501.12948` - DAPO — `2503.14476` - Understanding R1-Zero-Like Training / Dr.GRPO — `2503.20783` - DeepSeek-Prover-V2 — `2504.21801` - DeepEP — `github.com/deepseek-ai/DeepEP` - DualPipe — `github.com/deepseek-ai/DualPipe` - DeepGEMM — `github.com/deepseek-ai/DeepGEMM` - DeepSeek-V3.2 — `2512.02556` - Engram — `2601.07372` - mHC — `2512.24880` - DeepSeek-V4 — `2606.19348` ### 机制祖先候选 - Conditional Computation — `cs/0008102` - Sparsely-Gated MoE — `1701.06538` - GShard — `2006.16668` - Switch Transformer — `2101.03961` - ST-MoE — `2202.08906` - MQA — `1911.02150` - GQA — `2305.13245` - RoPE — `2104.09864` - FlashAttention — `2205.14135` - ZeRO — `1910.02054` - GPipe — `1811.06965` - PipeDream — `1806.03377` - PPO — `1707.06347` - InstructGPT — `2203.02155` - Multi-Token Prediction — `2404.19737` - Muon is Scalable — `2502.16982` ### Kimi 对照候选 - Kimi k1.5 — `2501.12599` - Kimi K2 — `2507.20534` - Kimi Linear — `2510.26692` - LatentMoE — `2601.18089` - Attention Residuals — `2603.15031` - Kimi K3 — `2607.24653` 候选池并不等于最终阅读链;正式链必须剔除综述、二手页面和无法核验的年份。 ## 5. 四个候选交互实验 ### A. Sparse Capacity Ledger - 输入:专家总数、每 Token 激活数、shared 数、专家宽度、EP 节点数; - 输出:总/激活参数、组合数、教学通信压力; - 误解:总参数等于每 Token 成本、细粒度必然更快、shared 免费。 ### B. MLA Cache Workbench - 输入:层数、heads、head dim、GQA groups、latent dim、RoPE dim、上下文、精度; - 输出:MHA/GQA/MLA 每 Token 元素与总缓存、压缩基线; - 误解:V2 的 93.3% 是普适常数、MLA 等于 GQA、RoPE 没有缓存。 ### C. Algorithm–System Co-design Board - 输入:micro-batches、pipeline stages、通信/计算比、精度角色、MTP 开关; - 输出:toy bubble、暴露通信、训练目标密度与角色合同; - 误解:DualPipe 清零气泡、FP8 全路径、MTP 默认参与生成。 ### D. GRPO Bias Microscope - 输入:一组奖励、序列长度、是否 std norm、response/token aggregation、clip 上下界; - 输出:优势、轨迹权重、零信号、长度倾向; - 误解:去 critic 等于无成本、长 CoT 必然更优、DAPO/Dr.GRPO 是 R1 官方配方。 ## 6. 二十条候选红线 1. 细粒度专家在所有任务、所有硬件上都优于粗粒度专家; 2. shared expert 是不增加计算的公共知识库; 3. 激活参数等价于同规模 dense 的完整成本; 4. MLA 只是 MQA/GQA 换名; 5. V2 的 KV/吞吐数字是 MLA 通用常数; 6. decoupled RoPE 分支无需缓存; 7. aux-loss-free 等于没有负载均衡; 8. FP8 等于全部张量和累加都使用 FP8; 9. DualPipe 消灭所有 pipeline bubble; 10. V3 的 2.788M GPU hours 可直接与不同硬件模型横比; 11. MTP 在推理时取代 next-token generation; 12. GRPO 是无偏且严格优于 PPO; 13. R1-Zero 不依赖预训练知识; 14. “aha” token 是 RL 创造推理的因果证据; 15. R1 完整模型没有 SFT; 16. 蒸馏学生重演了教师的 RL 探索; 17. DAPO/Dr.GRPO 是 DeepSeek 官方 R1 配方; 18. DSA top-k 保证不漏关键历史; 19. V4 与 K3 使用同一种百万上下文状态; 20. “直接祖先”意味着实现和超参数相同。 ## 7. 正式核验结果去向 - 一手来源结论:`research/DEEPSEEK_RESEARCH.md` - 页面实现:`src/pages/deepseek/index.astro` - 交互实现:`src/components/DeepSeekLab.astro` - 论文索引:`src/data/papers.ts`