Files
llm-atlas/src/data/deepseek.ts
T
2026-07-29 11:17:53 +08:00

111 lines
12 KiB
TypeScript
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
export const deepseekLedgers = [
["Q01", "Dense 坐标系", "为什么 DeepSeek LLM 不是可跳过的序章?", "它固定 tokenizer、数据、架构和 scaling 试验的起点;并不单独证明后续所有设计。"],
["Q02", "参数角色", "671B / 37B 各表示什么?", "total 是装下的容量,activated 是每 Token 经过的专家参数子集;都不等于端到端 FLOPs。"],
["Q03", "专家粒度", "为什么切小专家还要多选?", "DeepSeekMoE 把每个专家缩成 1/m,总数和激活数同乘 m,近似保持专家计算。"],
["Q04", "Shared expert", "为什么把公共知识单独隔离?", "始终激活的 shared experts 减少 routed experts 重复;它们仍然要付激活计算。"],
["Q05", "通信税", "为什么稀疏 FLOPs 不等于便宜?", "路由会产生 dispatch/combine、跨节点 all-to-all、负载长尾和权重访问。"],
["Q06", "均衡", "aux-loss-free 到底去掉了什么?", "V3 的 expert bias 影响选择、不进入最终 gate weight;仍有 sequence-wise auxiliary loss 防极端失衡。"],
["Q07", "KV 状态", "为什么 V2 把服务状态当架构问题?", "权重只装一次,KV 随请求、层、Token 增长,直接限制并发和长上下文。"],
["Q08", "Attention 压缩", "MQA、GQA、MLA 的差别是什么?", "MQA/GQA 共享 K/V 头;MLA 联合低秩压缩 K/V 内容并在计算中恢复。"],
["Q09", "矩阵吸收", "MLA 为什么不必恢复完整 content K/V?", "无位置项时可利用矩阵乘结合律,把 K/V 上投影吸收到 query/output 投影。"],
["Q10", "位置分叉", "为什么要 decoupled RoPE?", "RoPE 会阻断固定权重吸收,所以 V2 另设小 RoPE query/key 分支,并缓存 key。"],
["Q11", "FP8 合同", "“FP8 训练”包含哪些角色?", "主要 GEMM 用 FP8,并配细粒度缩放、较高精度累加和高精度敏感算子;不是全路径 FP8。"],
["Q12", "Pipeline", "DualPipe 隐藏了什么?", "从两端注入 micro-batch,让成对前后向 chunk 与通信重叠;它减少而非清零 bubble。"],
["Q13", "MTP", "训练和推理各怎样使用 MTP?", "顺序模块增加未来 Token 监督;推理可丢弃,也可复用于 speculative draft。"],
["Q14", "GRPO", "去掉 critic 后还剩什么?", "policy/reference、同题多 rollout、reward/verifier、clip 和 KL;主要省掉 value model。"],
["Q15", "可验证奖励", "R1-Zero 的奖励能覆盖哪些任务?", "论文用数学、代码、逻辑等规则可验证域和格式奖励;开放任务仍是限制。"],
["Q16", "纯 RL 实验", "R1-Zero 究竟证明了什么?", "强 V3 Base 在无 reasoning SFT 时可被规则奖励继续塑造;不等于没有预训练先验。"],
["Q17", "R1 pipeline", "正式 R1 为什么不是纯 RL?", "cold start → reasoning RL → rejection/SFT mix → general RL,分别修可读性、广度和对齐。"],
["Q18", "蒸馏", "学生为什么不是“小号 R1-Zero”?", "1.5B–70B 学生主要对约 800K 教师样本做 SFT,没有重演同一 RL 探索。"],
["Q19", "复现反查", "DAPO / Dr.GRPO 修的是哪类问题?", "它们处理 clip、采样、聚合、截断、长度和难度偏差;是后续研究,不是已披露 R1 内部配方。"],
["Q20", "DSA", "可学习 indexer 为什么不是固定稀疏?", "indexer 对历史内容评分,主 attention 只读 top-k;它需要专门训练,也可能漏检。"],
["Q21", "Agent 数据", "V3.2 怎样把 reasoning 放进环境?", "specialist distillation + mixed RL;环境、工具、任务、解法和 verifier 构成数据闭环。"],
["Q22", "V4 Attention", "CSA 与 HCA 各压什么?", "CSA 先压缩再稀疏 top-k;HCA 更强压缩后保留全部 compressed entries。"],
["Q23", "V4 稳定化", "mHC、Muon、QK/RMSNorm、clamp 各管什么?", "它们分别管残差混合、矩阵更新、attention 尺度和 FFN 极值,不能合成一个技巧。"],
["Q24", "K3 对照", "哪些是祖先,哪些只是同题新解?", "DeepSeekMoE/MLA 有明确继承;QB、KDA、AttnRes、SiTU、MOPD 多是新解或同期路线。"],
] as const;
export const deepseekWaves = [
["W1", "2024.01", "Dense 坐标", "先固定数据、tokenizer、训练与 scaling 对照,后面的结构收益才有可比起点。"],
["W2", "2024.01", "稀疏容量", "细粒度 routed experts 加 shared experts,把总容量与单 Token 激活计算第一次清楚分开。"],
["W3", "2024.05", "服务状态", "MLA 不再只优化训练 FLOPs,而是直接改写随请求增长的 KV Cache。"],
["W4", "2024.12", "协同训练", "V3 把路由、FP8、MTP、pipeline 与通信写成同一套训练合同。"],
["W5", "2024.02 → 2025.01", "推理 RL", "DeepSeekMath 先减掉 critic;R1-Zero 再隔离规则奖励,R1 恢复可读性与通用性。"],
["W6", "2025.03", "复现显微镜", "DAPO 与 Dr.GRPO 暴露 clipping、采样、截断、长度归一和题目难度偏差。"],
["W7", "2025.12", "稀疏检索", "V3.2 用学习型 indexer 选历史,再让主 attention 读取 top-k。"],
["W8", "2025.12", "Agent 环境", "推理从静态题目进入含工具、状态转移和 verifier 的交互数据闭环。"],
["W9", "2026.06", "异构长状态", "V4 用 CSA 与 HCA 处理不同时间尺度,并联合 mHC、Muon 和数值约束。"],
["W10", "2026.07", "K3 对照", "继承图必须允许没有箭头:相同的百万上下文目标,可以有完全不同的状态机器。"],
] as const;
export const deepseekBranches = [
["代码与专家", "DeepSeek-Coder → Coder-V2 → ESFT", "代码数据配方、continued pretraining 与只微调相关专家,说明 MoE 的价值不只在通用模型参数量。", "https://arxiv.org/abs/2406.11931"],
["数学与证明", "DeepSeekMath → Prover-V1.5 → Prover-V2", "从数学语料、GRPO 走到 formal proof feedback、subgoal decomposition 与可验证证明搜索。", "https://arxiv.org/abs/2504.21801"],
["视觉与压缩", "DeepSeek-VL/VL2 → Janus → OCR", "理解、生成与光学压缩形成另一条主干;它们不应被挤进纯文本 V2→V4 时间线。", "https://arxiv.org/abs/2412.10302"],
["系统实现", "DeepEP → DualPipe → DeepGEMM / FlashMLA", "论文里的稀疏计算、流水线、FP8 与 MLA 最终必须落到可调用的通信和 kernel 实现。", "https://github.com/deepseek-ai/DeepEP"],
["条件记忆", "Engram", "把可查表的静态模式从动态网络中分离,增加一条不同于 MoE 与 attention 的稀疏轴。", "https://arxiv.org/abs/2601.07372"],
] as const;
export const deepseekPaperChain = [
["01", "1991", "Adaptive Mixtures of Local Experts", "https://proceedings.neurips.cc/paper/1991/hash/59b90e1005a220e2ebc542eb9d950b1e-Abstract.html", "专家门控前史"],
["02", "2000", "Conditional Computation", "https://arxiv.org/abs/cs/0008102", "条件计算"],
["03", "2003", "A Neural Probabilistic Language Model", "https://www.jmlr.org/papers/v3/bengio03a.html", "Dense LM 坐标"],
["04", "2017", "Attention Is All You Need", "https://arxiv.org/abs/1706.03762", "Transformer 主干"],
["05", "2017", "Outrageously Large Neural Networks", "https://arxiv.org/abs/1701.06538", "稀疏 MoE"],
["06", "2017", "Proximal Policy Optimization", "https://arxiv.org/abs/1707.06347", "GRPO 对照"],
["07", "2018", "GPipe", "https://arxiv.org/abs/1811.06965", "Pipeline 前史"],
["08", "2018", "PipeDream", "https://arxiv.org/abs/1806.03377", "Pipeline schedule"],
["09", "2019", "Fast Transformer Decoding / MQA", "https://arxiv.org/abs/1911.02150", "KV 共享"],
["10", "2019", "Megatron-LM", "https://arxiv.org/abs/1909.08053", "模型并行"],
["11", "2019", "ZeRO", "https://arxiv.org/abs/1910.02054", "状态分片"],
["12", "2019", "RMSNorm", "https://arxiv.org/abs/1910.07467", "尺度控制"],
["13", "2020", "GShard", "https://arxiv.org/abs/2006.16668", "大规模 MoE"],
["14", "2020", "QK-Normalization", "https://arxiv.org/abs/2010.04245", "attention logit 稳定"],
["15", "2021", "Switch Transformers", "https://arxiv.org/abs/2101.03961", "coarse top-1 MoE"],
["16", "2021", "RoFormer / RoPE", "https://arxiv.org/abs/2104.09864", "MLA 位置分叉"],
["17", "2022", "ST-MoE", "https://arxiv.org/abs/2202.08906", "MoE 稳定性"],
["18", "2022", "DeepNet", "https://arxiv.org/abs/2203.00555", "深层残差"],
["19", "2022", "InstructGPT", "https://arxiv.org/abs/2203.02155", "SFT/RM/PPO 合同"],
["20", "2022", "FlashAttention", "https://arxiv.org/abs/2205.14135", "IO-aware exact attention"],
["21", "2022", "Process and Outcome Feedback", "https://arxiv.org/abs/2211.14275", "reasoning reward 前史"],
["22", "2022", "Self-Consistency", "https://arxiv.org/abs/2203.11171", "多采样聚合"],
["23", "2023", "GQA", "https://arxiv.org/abs/2305.13245", "KV 分组"],
["24", "2023", "Let's Verify Step by Step", "https://arxiv.org/abs/2305.20050", "verifier / PRM"],
["25", "2023", "Direct Preference Optimization", "https://arxiv.org/abs/2305.18290", "RL 外偏好路线"],
["26", "2023", "FlashAttention-2", "https://arxiv.org/abs/2307.08691", "attention kernel"],
["27", "2023", "PagedAttention / vLLM", "https://arxiv.org/abs/2309.06180", "KV 服务状态"],
["28", "2024", "DeepSeek LLM", "https://arxiv.org/abs/2401.02954", "Dense / scaling 基线"],
["29", "2024", "DeepSeek-Coder", "https://arxiv.org/abs/2401.14196", "代码数据旁支"],
["30", "2024", "DeepSeekMoE", "https://arxiv.org/abs/2401.06066", "细粒度 + shared"],
["31", "2024", "DeepSeekMath", "https://arxiv.org/abs/2402.03300", "数学数据 + GRPO"],
["32", "2024", "RLOO", "https://arxiv.org/abs/2402.14740", "critic-free 对照"],
["33", "2024", "DeepSeek-V2", "https://arxiv.org/abs/2405.04434", "MLA + MoE"],
["34", "2024", "Better & Faster LLMs via MTP", "https://arxiv.org/abs/2404.19737", "MTP 祖先"],
["35", "2024", "DeepSeek-Coder-V2", "https://arxiv.org/abs/2406.11931", "V2 continued pretrain"],
["36", "2024", "ESFT", "https://arxiv.org/abs/2407.01906", "专家特化微调"],
["37", "2024", "DeepSeek-Prover-V1.5", "https://arxiv.org/abs/2408.08152", "proof feedback RL"],
["38", "2024", "Hyper-Connections", "https://arxiv.org/abs/2409.19606", "mHC 前身"],
["39", "2024", "DeepSeek-V3", "https://arxiv.org/abs/2412.19437", "FP8 / DualPipe / MTP"],
["40", "2025", "DeepSeek-R1", "https://arxiv.org/abs/2501.12948", "R1-Zero / R1 / 蒸馏"],
["41", "2025", "Muon is Scalable for LLM Training", "https://arxiv.org/abs/2502.16982", "V4 optimizer 前史"],
["42", "2025", "DAPO", "https://arxiv.org/abs/2503.14476", "GRPO 工程修正"],
["43", "2025", "Understanding R1-Zero-Like Training", "https://arxiv.org/abs/2503.20783", "Dr.GRPO / 偏差"],
["44", "2025", "DeepSeek-Prover-V2", "https://arxiv.org/abs/2504.21801", "subgoal + RL"],
["45", "2025", "DeepEP", "https://github.com/deepseek-ai/DeepEP", "Expert Parallel kernel"],
["46", "2025", "DualPipe", "https://github.com/deepseek-ai/DualPipe", "V3/R1 pipeline 实现"],
["47", "2025", "DeepGEMM", "https://github.com/deepseek-ai/DeepGEMM", "FP8 GEMM 实现"],
["48", "2025", "DeepSeek-VL2", "https://arxiv.org/abs/2412.10302", "多模态理解旁支"],
["49", "2025", "Janus-Pro", "https://arxiv.org/abs/2501.17811", "统一理解/生成旁支"],
["50", "2025", "Kimi k1.5", "https://arxiv.org/abs/2501.12599", "同期 reasoning RL"],
["51", "2025", "Kimi K2", "https://arxiv.org/abs/2507.20534", "MLA / MoE / Muon 对照"],
["52", "2025", "Kimi Linear", "https://arxiv.org/abs/2510.26692", "KDA 前身"],
["53", "2025", "DeepSeek-V3.2", "https://arxiv.org/abs/2512.02556", "DSA + Agent"],
["54", "2025", "mHC", "https://arxiv.org/abs/2512.24880", "受约束 residual"],
["55", "2026", "Engram", "https://arxiv.org/abs/2601.07372", "条件记忆新稀疏轴"],
["56", "2026", "LatentMoE", "https://arxiv.org/abs/2601.18089", "K3 routed latent 前身"],
["57", "2026", "Attention Residuals", "https://arxiv.org/abs/2603.15031", "K3 深度路由"],
["58", "2026", "DeepSeek-V4", "https://arxiv.org/abs/2606.19348", "CSA / HCA / mHC / Muon"],
["59", "2026", "Kimi K3", "https://arxiv.org/abs/2607.24653", "对照锚点"],
["60", "2026", "Kimi K3 official repository", "https://github.com/MoonshotAI/Kimi-K3", "开放实现边界"],
] as const;