# 持续进度 最后更新:2026-07-29 ## 总体状态 | 工作流 | 状态 | 完成度 | 下一检查点 | |---|---:|---:|---| | 研究框架与规范 | 进行中 | 82% | 给推理专题补逐篇图表/实验精读层级 | | 网站设计系统 | 进行中 | 89% | 打印样式与更多通用可视化组件 | | Kimi K3 深读 | 进行中 | 64% | 扩写 scaling / pre-training / infra 逐图笔记 | | Transformer 基础 | 进行中 | 52% | 矩阵形状动画与手算练习 | | DeepSeek 专题 | 进行中 | 71% | 补 R1 / DAPO 的逐图训练轨迹与复现对照 | | 推理与测试时扩展 | 完成首版 | 76% | 真实模型采样曲线、PRM 案例与逐篇图表精读 | | 稀疏计算与 MoE | 完成首版 | 74% | 真实负载 traces 与专家特化案例 | | 长上下文专题 | 完成首版 | 72% | 真实模型配置、内核细节与失败案例 | | 大规模训练系统 | 研究完成首轮 | 38% | 实现内存—并行—流水线—通信四页签实验室 | | 引用与事实检查 | 进行中 | 54% | 自动化外链复查与来源等级扩展 | | 开源仓库 | 已完成首版 | 100% | 持续提交研究与网站迭代 | | k1412 部署 | 已完成首版 | 100% | 每轮发布保留不可变镜像与回滚点 | ## 已完成 - [x] 建立长期任务目标与阶段计划。 - [x] 确认 K3 官方 47 页技术报告与官方模型仓库。 - [x] 提取技术报告目录与 151 条参考来源,建立本地只读研究缓存。 - [x] 从报告反推出 16 个专题与三条贯穿案例。 - [x] 提炼参考网站的编辑设计语言。 - [x] 确认 `git.k1412.top` 为 Gitea/Forgejo 兼容服务且本机 HTTPS 凭据可用于既有仓库。 - [x] 使用 Grok CLI 检索并形成约 95 篇一手论文的补充路线,主代理已回查关键来源。 - [x] 完成 146 篇关键论文索引,覆盖 12 个专题与 Kimi/DeepSeek 聚光主线。 - [x] 完成可检索、可按专题筛选的论文库页面。 - [x] 完成 K3、Transformer 基础、DeepSeek 谱系、长上下文、MoE 与推理六篇首版长文。 - [x] 完成 K3 三轴架构、Self-Attention、DeepSeek 谱系、长上下文、MoE 路由与推理专题三页签等八个原创交互视图。 - [x] 完成长上下文首版:五张成本账、26 篇一手论文、10+ 机制图与 8 策略交互实验室。 - [x] 核验 FlashAttention、DeepSeek-V2/V3.2/V4、Kimi Linear/K3 等六份论文原文,并建立长上下文研究账本。 - [x] 核验 Switch、ST-MoE、DeepSeekMoE、Loss-Free、V3、LatentMoE 与 K3 原文,并建立 MoE 研究账本。 - [x] 完成 MoE 首版:六张账、19 篇一手论文、完整 DeepSeek/K3 主线与路由—容量—通信实验室。 - [x] 为推理专题缓存并核验 23 份一手论文,另复用 K3 原报告,建立 24 份来源的研究账本。 - [x] 明确 CoT / verifier / test-time compute、PPO → GRPO、DeepSeek-R1 与 Kimi k1.5 → K3 四条主线。 - [x] 分清 K3 partial rollout 的 off-policy 稳定化与 MOPD 的 student on-policy 逐 Token 蒸馏。 - [x] 完成推理首版:八张账、30 篇一手论文链、DeepSeek/Kimi 双主线与预算—GRPO—MOPD 三页签实验室。 - [x] 推理首版以提交 `dce94b2`、不可变镜像 `20260728T164043Z-dce94b2` 发布;NAS/VPS/HTTPS/生产 Chrome 全链路通过。 - [x] 训练系统专题完成首轮证据账本:九张资源账、37 个一手节点、DeepSeek-V2/V3/V4 与 Kimi K2/K2.5/K3 系统谱系。 - [x] 缓存并核验 18 篇训练系统核心论文,逐项校正 ZeRO 字节账、pipeline bubble、collective 口径、context parallel 与 MoonEP 上界。 - [x] 将 Grok 产物降级为明确标注的未核验 leads;正式账本只采用回查一手论文后的结论。 - [x] Astro 类型检查、生产构建、10 个内部路由和桌面/移动端视觉检查通过。 - [x] 创建 `wuyang/llm-atlas` 公开仓库,匿名 API 确认 `private: false`。 - [x] 本地生产镜像通过健康检查与全部 9 个页面路由烟雾测试。 - [x] 通过 Unraid Compose Manager、Nginx Proxy Manager 与 HTTPS 发布首版。 ## 正在进行 - [ ] 大规模训练系统:实现四页签实验室与 ZeRO / Megatron → Expert/Context Parallel → DualPipe / MoonEP 长文。 - [ ] 推理专题二轮:真实 pass@k 曲线、PRM 失败案例与逐篇图表精读。 - [ ] 长上下文专题的真实模型配置对比、内核细节与失败案例二轮深化。 - [ ] MoE 专题的真实集群 traces、专家特化案例与二轮外部证据。 ## 研究账本 | 日期 | 决策/发现 | 影响 | |---|---|---| | 2026-07-28 | 网站命名为 **LLM Atlas / 大模型技术全景** | 既能容纳 K3 深读,也能承载完整 LLM 课程 | | 2026-07-28 | K3 作为“汇流点”,不是课程起点 | 初学者可以先学基础,高阶读者可以从 K3 反向跳转 | | 2026-07-28 | 优先重绘论文图并标明“简化/改绘” | 图可缩放、可交互,也减少脱离上下文复制论文图片 | | 2026-07-28 | Grok 只用于线索扩展与交叉检查 | 正文事实必须回到论文、官方仓库或正式文档 | | 2026-07-28 | 首批论文库按问题与专题多标签组织,推理研究后扩充至 146 篇 | 论文库承担发现入口,专题正文承担深度精读与机制复核 | | 2026-07-28 | 源码公开到 `git.k1412.top/wuyang/llm-atlas` | 路线、进度、研究方法和内容变更均可追踪 | | 2026-07-28 | 站点使用不可变镜像与 Compose Manager 部署 | 每次发布保留明确版本、健康检查和回滚点 | | 2026-07-28 | 长上下文按计算、缓存、位置、状态容量、系统五张账单组织 | 避免把 FlashAttention、位置外推和“记住更久”混成同一个问题 | | 2026-07-28 | 交互缓存数字统一标记为教学估算 | 展示增长规律,不冒充任一模型的真实线上显存基准 | | 2026-07-28 | MoE 按六张账组织,路由算法与集群执行分开核算 | 避免用“稀疏所以便宜”跳过容量、负载、通信与权重读取 | | 2026-07-28 | “aux-loss-free”保留论文真实边界 | 区分 selection bias、mixture weight、z-loss 与 V3 的极小 sequence-wise loss | | 2026-07-29 | 推理专题按结果、覆盖、选择、过程、预算、优化、分布、系统八张账组织 | 避免把 pass@1、pass@k、搜索收益、RL 能力增长与系统吞吐混成“会思考” | | 2026-07-29 | K3 partial rollout RL 与 MOPD 在正文中强制并排 | 前者显式容忍跨迭代 stale trajectory,后者由当前 student 采样并接收稠密 teacher signal | | 2026-07-29 | 推理首版用 30 篇一手论文和三页签实验闭环 | 分开演示预算分配、GRPO 聚合偏置和 K3 九教师 MOPD,不合成伪“总分” | | 2026-07-29 | 推理首版发布到既有 `llm-atlas` 生产链路 | Compose Manager、NPM host 31 / cert 41、10 路由与公网交互均复核通过 | | 2026-07-29 | 训练系统按模型状态、激活、计算划分、气泡、collective、EP、CP、数值、可靠性九张账组织 | 任何优化都必须说明节省哪种资源、把成本移到哪里 | | 2026-07-29 | 并行度不再机械写成 `DP×TP×PP×EP×CP` | 先定义 device mesh、group overlap 与作用范围,再核算 world size | | 2026-07-29 | DeepSeek “近零通信”统一解释为特定 overlap 下的 exposed critical-path time | 防止把隐藏通信误写成没有传输字节 | | 2026-07-29 | Grok 训练系统包只保留为 `TRAINING_SYSTEMS_GROK_LEADS.md` | 候选论文、数字和公式不得越过一手证据账本直接进入站点 | ## 未决问题 - K3 报告给出了多项公开组件的整合方式;独立论文与 K3 内部最终实现之间仍需逐项对照。 - 公开技术报告不会披露完整数据配比和训练细节;网站会把“已知”“合理推断”“未知”分开。 - 2026 年模型与榜单变化快,所有动态比较都必须带研究截止日期。