00 THE LINEAGE
+每一代都在偿还上一代最昂贵的账单
++ 把 DeepSeek 看成模型名字序列会很乱;把它看成“容量、缓存、训练、推理、长上下文”五张账单, + 技术演进就清楚了。 +
++ DeepSeek 的强项是把模型结构和硬件约束写在同一张设计图里。MLA 不只是新 attention, + 它直接针对服务时 KV Cache;FP8 不只是少用几个比特,它要求累加精度、缩放和通信共同配合; + GRPO 不只是 PPO 变体,它直接移除同规模 critic 的显存负担。 +
+01 DEEPSEEK LLM
+先用 Dense 模型建立基线:规模、数据和双语能力
++ 2024 年初的 DeepSeek LLM 发布 7B 与 67B dense 模型, + 在约 2T 中英文 Token 上预训练。它的重要性不在今天看来并不夸张的参数量,而在于建立后续研究的可比基线: + tokenizer、数据配方、训练稳定性、中文评测和 scaling behavior 有了统一起点。 +
+为什么先做 Dense 很重要
++ MoE 同时改变总参数、激活参数、路由、通信和数据分配。没有 dense 基线,很难判断收益来自“更多容量” + 还是来自别的训练差异。DeepSeek LLM 还训练小规模模型拟合 scaling laws, + 再用这些规律选择 67B 的超参数;这条“先小规模试验,再外推大模型”的方法后来在 V3/K3 都持续出现。 +
++ DeepSeek LLM 回答的是“如果我们先不引入稀疏专家和低秩缓存,一套扎实的中英 dense Transformer 能到哪里?” + 后面的论文才有明确的对照物。 +
+02 DEEPSEEKMOE
+专家越大不一定越专:把一个大专家拆成许多细粒度专家
++ 传统 MoE 往往把 FFN 分成少数大专家,每个 Token 选 1–2 个。问题是一个大专家仍可能同时处理许多无关知识, + 专家之间也会重复学习公共能力。DeepSeekMoE + 提出两项互补策略。 +
+少数大专家
+每个专家覆盖面广,公共知识在多个专家中重复;可组合的专业分工有限。
+细粒度 routed + shared
+shared expert 吸收公共知识;更多小 routed experts 可以按 Token 组合出细分能力。
+Fine-Grained Expert Segmentation
++ 在保持单 Token 激活计算近似不变时,把专家 FFN 切得更小,同时选择更多个小专家。 + 组合数显著增加:同样的 Token 可以同时调用“代码语法”“Python 库”“矩阵计算”等几个子专长, + 不必把它们硬塞进一个笼统的“代码专家”。 +
+Shared Expert Isolation
++ 某些变换几乎每个 Token 都需要。如果全部交给 routed experts,多个专家会重复学习。 + DeepSeekMoE 把 shared experts 始终激活,承担公共知识;路由专家获得更强动力去形成差异化专长。 + 这套组织直接进入 DeepSeek-V2/V3,也成为 Kimi K3 Stable LatentMoE 的结构祖先。 +
++ Token 必须被发送到拥有对应专家的设备。专家越细、选择越多,all-to-all、负载波动和权重读取越可能成为瓶颈。 + 因此模型侧路由与系统侧 Expert Parallel 从来不能分开看。 +
+03 DEEPSEEK-V2 / MLA
+训练只付一次参数成本,KV Cache 却在每个请求、每个 Token 上重复付费
++ DeepSeek-V2 是整条谱系的关键转折: + 236B 总参数、21B 激活参数、128K 上下文,把 DeepSeekMoE 用于训练经济性, + 再用 Multi-head Latent Attention(MLA)直接攻击推理服务的内存瓶颈。 +
+均为 V2 报告相对 DeepSeek 67B 的特定配置结果,不应外推为任意硬件上的固定倍数。
+标准 MHA 为什么会让 KV Cache 爆长
++ 自回归生成每一步都要查询历史 Token。历史的 K/V 不变,因此缓存起来避免重算。 + 但 MHA 为每层、每个 Token、每个 head 保存 K 和 V;batch、序列和层数一大,缓存会吃掉大量显存, + 直接限制并发和长上下文。 +
+每个 head 各存一份 K/V。
+先存低维 joint latent,计算时再上投影。
+为什么 MLA 比简单 MQA/GQA 更有野心
++ MQA 让所有 Query heads 共用一组 K/V,GQA 让一组 Query heads 共用 K/V,缓存更小但容量可能下降。 + MLA 用低秩 latent 保留可恢复的内容子空间,并把 RoPE 相关部分分离,追求接近 MHA 的表达力与更小缓存。 + 它后来被 Kimi K2/K2.5 采用,并在 K3 中作为周期性全局注意力保留。 +
+04 DEEPSEEK-V3
+V3 的亮点不是一个技巧,而是四层协同
++ DeepSeek-V3 扩到 671B 总参数、37B 激活参数, + 在 14.8T Token 上预训练。报告给出的完整训练用量约 2.788M H800 GPU hours,并称整个训练没有不可恢复的 loss spike 或回滚。 + 这组数字之所以引人注目,是因为它背后同时改动模型、目标、数值和系统。 +
+MLA + DeepSeekMoE
沿用 V2 验证过的低缓存 attention 与细粒度专家。
Aux-loss-free balance
用动态 expert bias 调整负载,减少辅助平衡损失对主目标的干扰。
Multi-Token Prediction
训练时预测多个未来 Token,增加训练信号,并可转化为推测解码草稿能力。
FP8 + DualPipe
低精度训练、计算通信重叠、跨节点专家并行共同压低成本。
无辅助损失负载均衡
++ MoE 必须避免少数专家过载。传统做法加入 load-balancing auxiliary loss, + 但它与语言建模主目标可能冲突:为了均匀而把 Token 送给次优专家。V3 为每个专家维护 bias, + 根据近期负载上调冷门专家、下调热门专家;bias 只影响路由选择,不直接进入最终门控权重, + 从而把“系统要均衡”和“模型要准确”更松地解耦。 +
+ +FP8 训练真正难在哪
++ FP8 动态范围和有效精度有限,不能简单把所有 tensor 强转为 8 位。V3 使用细粒度量化、较高精度累加、 + 在线缩放和特定敏感模块的高精度保留;同时让低精度通信减少跨卡带宽。 + 论文最值得看的不是“首次大规模 FP8”宣传,而是哪些路径降精度、哪些路径绝不降,以及误差怎样被控制。 +
+ +DualPipe:流水线的空泡是一笔真金白银
++ Pipeline Parallel 把层切到不同 stage;朴素调度会让设备在前向/反向依赖之间等待。 + DualPipe 从流水线两端同时喂入 micro-batch,并重叠前向、反向与专家通信,尽量把空泡藏在计算后面。 + 它与 DeepEP 的高吞吐/低延迟 all-to-all 一起,把 MoE 理论稀疏性变成真实集群效率。 +
+05 DEEPSEEKMATH / GRPO
+GRPO:不用再养一个和策略模型同样昂贵的 Critic
++ DeepSeekMath 不只是数学模型论文。 + 它在 7B 模型和 120B 数学相关 Token 上验证数据工程,同时提出 Group Relative Policy Optimization, + 为后来 DeepSeek-V2 对齐和 R1 大规模推理 RL 铺路。 +
+PPO 的显存账单
++ 经典 RLHF/PPO 常同时保留 policy、reference、reward model 和 value/critic model。 + 对大模型而言,critic 往往与 policy 同量级。GRPO 对同一道题采样一组答案, + 用组内奖励的均值和标准差构造相对优势,省去单独 value model。 +
+组相对不是免费午餐
++ 一道题要采样多条答案,rollout 成本仍然很高;奖励若不可验证或存在偏差,组内比较也会放大奖励漏洞。 + 当一组奖励全相同,归一优势几乎不给学习信号。R1 的成功因此同时依赖可验证数学/代码奖励、足够多样的采样和大规模基础设施。 +
+06 DEEPSEEK-R1
+R1-Zero 最重要的实验:先不教推理格式,只给可验证结果奖励
++ DeepSeek-R1 的历史意义, + 是把“推理可以通过大规模 RL 从强 base model 中被激发”做成公开、可研究的系统证据。 +
+R1-Zero 做了什么
++ 从 DeepSeek-V3 Base 出发,不先做推理 SFT,直接以 GRPO 进行大规模 RL。 + 奖励以答案正确性为主,并加入格式奖励。训练中出现更长推理、反思、回溯和自我验证等行为; + 论文把某些突然延长思考的轨迹称为 “aha moment”。 +
+它也明确暴露了纯 RL 的问题
++ R1-Zero 会重复、可读性差、混合语言。奖励只关心最终正确时,模型没有充分动力照顾人类阅读体验。 + 正式 R1 因而先加入少量高质量 cold-start CoT 数据,再做 reasoning-oriented RL; + 随后用 rejection sampling 产生 SFT 数据,混入写作、事实问答等非推理任务,再进行第二阶段 RL 兼顾帮助性与安全。 +
+Distillation 的关键发现
++ 团队用 R1 生成的推理样本微调 Qwen/Llama dense 模型,发布 1.5B–70B 蒸馏版本。 + 这说明小模型不一定要自己承担完整的探索式 RL 成本,可以模仿强 reasoning teacher 的轨迹; + 但蒸馏得到的是 teacher 数据分布上的能力,不等于小模型内部复现了同样的 RL 发现过程。 +
++ 长轨迹可能包含有效搜索,也可能是重复与绕路。R1 证明的是在可验证任务和适当训练下, + 增加推理计算可以转化为能力;不是“输出越长越聪明”。 +
+07 DEEPSEEK-V3.2
+从会推理到会在长上下文里使用工具
++ DeepSeek-V3.2 把三条线合并: + DeepSeek Sparse Attention(DSA)降低长上下文成本,更大规模的 RL 提升 reasoning, + Agentic task synthesis 则把 reasoning 放进工具交互轨迹。 +
+DSA 的两阶段直觉
++ 完整注意力让每个 Query 和全部历史交互。DSA 先用轻量、可学习的 indexer 给历史 Token 评分, + 选出小部分候选,再让主 attention 只在候选上做高容量计算。 + 关键不只是 top-k,而是 indexer 也在训练中学习“什么值得看”;这比固定窗口更能适应内容相关的远距离依赖。 +
++ Agent 方面,V3.2 的任务合成管线系统地产生复杂、交互式工具任务,让思考与 tool use 交织。 + 这与 K3 的 white-box harness、知识图谱任务合成和可验证环境形成同期对照:前沿模型竞争正在从静态题库转向训练环境。 +
+08 DEEPSEEK-V4
+百万上下文从“支持”变成一套专门架构
++ 2026 年的 DeepSeek-V4 preview 包含 + 1.6T-A49B 的 Pro 与 284B-A13B 的 Flash,均支持 1M Token。 + 它使用 Compressed Sparse Attention(CSA)与 Heavily Compressed Attention(HCA)的混合注意力, + Manifold-Constrained Hyper-Connections(mHC)改善深度残差,并采用 Muon 优化器。 +
+V4 官方报告摘要数据;模型是 preview 版本,后续版本需按研究截止日重新核验。
++ 报告称在 1M 上下文下,V4-Pro 的单 Token 推理 FLOPs 是 V3.2 的 27%,KV Cache 是 10%。 + 这说明长上下文竞争已从单一位置外推转向混合注意力、压缩缓存、残差、优化器和后训练的系统协同。 + 它也解释 K3 报告为何把 V4 列为同代开放基础模型对照。 +
++ V4 用 CSA/HCA 混合压缩与稀疏注意力;K3 用 3:1 KDA/Gated MLA 混合线性递归与全局注意力。 + 两者目标相近——降低百万上下文成本并保留能力——但状态表示、检索方式和系统内核不同。 +
+09 INTO KIMI K3
+DeepSeek 的哪些思想直接流入 K3,哪些只是同期呼应
++ 这正是为什么 DeepSeek 值得在 LLM Atlas 中作为贯穿案例:它不是 K3 的“对手名单”之一, + 而是 K3 架构里多条思想的公开祖先与同代参照。读懂 V2 的 MLA 和 DeepSeekMoE, + K3 的一半架构会突然变得熟悉。 +
+↳ READING ORDER
+建议精读顺序:不要直接从 R1 开始
+建立 dense、数据与 scaling 基线;精读架构与 scaling law 部分。
+ DeepSeekMoE精读 fine-grained segmentation、shared expert isolation 与消融。
+ DeepSeek-V2精读 MLA 推导、RoPE 解耦、权重吸收和 KV Cache 对比。
+ DeepSeek-V3分四遍读:架构、FP8、DualPipe/通信、MTP 与后训练。
+ DeepSeekMath先理解 PPO,再推导 GRPO 的组相对优势与 KL 项。
+ DeepSeek-R1对照 R1-Zero 与 R1 pipeline,区分 RL 涌现、冷启动与蒸馏。
+ DeepSeek-V3.2把稀疏 attention 与 agentic task synthesis 放在一起读。
+ DeepSeek-V4从百万上下文成本倒推 CSA/HCA、mHC 与 Muon。
+