Files
llm-atlas/PROGRESS.md
T
2026-07-29 04:05:52 +08:00

16 KiB
Raw Blame History

持续进度

最后更新:2026-07-29

总体状态

工作流 状态 完成度 下一检查点
研究框架与规范 进行中 83% Scaling Laws 二轮拟合复现与逐图精读
网站设计系统 进行中 89% 打印样式与更多通用可视化组件
Kimi K3 深读 进行中 66% 扩写 pre-training / infra 逐图笔记
Transformer 基础 进行中 52% 矩阵形状动画与手算练习
Scaling Laws 完成首版 74% 真实拟合复现、置信区间与更多模型族对照
数据工程与预训练配方 完成首版 73% FineWeb / DCLM 逐图精读、真实去重误伤与 mixture traces
DeepSeek 专题 进行中 71% 补 R1 / DAPO 的逐图训练轨迹与复现对照
推理与测试时扩展 完成首版 76% 真实模型采样曲线、PRM 案例与逐篇图表精读
稀疏计算与 MoE 完成首版 74% 真实负载 traces 与专家特化案例
长上下文专题 完成首版 72% 真实模型配置、内核细节与失败案例
大规模训练系统 完成首版 71% 真实集群 traces、故障案例与精确 topology 配置
数值精度、优化器与稳定性 完成首版 75% 真实 kernel 吞吐、长程训练 traces 与逐图论文精读
引用与事实检查 进行中 57% 自动化外链复查与来源等级扩展
开源仓库 已完成首版 100% 持续提交研究与网站迭代
k1412 部署 已完成首版 100% 每轮发布保留不可变镜像与回滚点

已完成

  • 建立长期任务目标与阶段计划。
  • 确认 K3 官方 47 页技术报告与官方模型仓库。
  • 提取技术报告目录与 151 条参考来源,建立本地只读研究缓存。
  • 从报告反推出 16 个专题与三条贯穿案例。
  • 提炼参考网站的编辑设计语言。
  • 确认 git.k1412.top 为 Gitea/Forgejo 兼容服务且本机 HTTPS 凭据可用于既有仓库。
  • 使用 Grok CLI 检索并形成约 95 篇一手论文的补充路线,主代理已回查关键来源。
  • 完成 223 篇关键论文索引,覆盖 14 个标签专题与 Kimi/DeepSeek 聚光主线。
  • 完成可检索、可按专题筛选的论文库页面。
  • 完成 K3、Transformer 基础、DeepSeek 谱系、Scaling Laws、数据工程、长上下文、MoE、推理、训练系统与数值优化十篇首版长文。
  • 完成 K3 三轴架构、Self-Attention、DeepSeek 谱系、长上下文、MoE 路由、推理三页签,以及训练系统、Scaling、数据工程与数值专题各四页签等二十四个原创交互视图。
  • 完成长上下文首版:五张成本账、26 篇一手论文、10+ 机制图与 8 策略交互实验室。
  • 核验 FlashAttention、DeepSeek-V2/V3.2/V4、Kimi Linear/K3 等六份论文原文,并建立长上下文研究账本。
  • 核验 Switch、ST-MoE、DeepSeekMoE、Loss-Free、V3、LatentMoE 与 K3 原文,并建立 MoE 研究账本。
  • 完成 MoE 首版:六张账、19 篇一手论文、完整 DeepSeek/K3 主线与路由—容量—通信实验室。
  • 为推理专题缓存并核验 23 份一手论文,另复用 K3 原报告,建立 24 份来源的研究账本。
  • 明确 CoT / verifier / test-time compute、PPO → GRPO、DeepSeek-R1 与 Kimi k1.5 → K3 四条主线。
  • 分清 K3 partial rollout 的 off-policy 稳定化与 MOPD 的 student on-policy 逐 Token 蒸馏。
  • 完成推理首版:八张账、30 篇一手论文链、DeepSeek/Kimi 双主线与预算—GRPO—MOPD 三页签实验室。
  • 推理首版以提交 dce94b2、不可变镜像 20260728T164043Z-dce94b2 发布;NAS/VPS/HTTPS/生产 Chrome 全链路通过。
  • 训练系统专题完成首轮证据账本:九张资源账、37 个一手节点、DeepSeek-V2/V3/V4 与 Kimi K2/K2.5/K3 系统谱系。
  • 缓存并核验 18 篇训练系统核心论文,逐项校正 ZeRO 字节账、pipeline bubble、collective 口径、context parallel 与 MoonEP 上界。
  • 将 Grok 产物降级为明确标注的未核验 leads;正式账本只采用回查一手论文后的结论。
  • 完成训练系统首版:15 节长文、37 个一手节点、12 类机制图与显存—网格—气泡—通信四页签实验室。
  • 训练系统真实 Chrome 断言通过:OOM、无效 mesh、DualPipe 参数副本、overlap 与 MoonEP buffer 均正确响应。
  • Astro 类型检查、生产构建、12 个内部路由、464 个站内引用和桌面/移动端视觉检查通过。
  • 训练系统首版以提交 c6306fe、不可变镜像 20260728T172750Z-c6306fe 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书与生产 Chrome 全链路通过。
  • 创建 wuyang/llm-atlas 公开仓库,匿名 API 确认 private: false
  • 当前生产镜像通过健康检查、14 个页面路由、关键资源与数值四实验生产 Chrome 烟雾测试。
  • 通过 Unraid Compose Manager、Nginx Proxy Manager 与 HTTPS 发布首版。
  • 启动 Scaling Laws 专题:缓存 22 篇新的一手论文,建立九张账、DeepSeek / Kimi 双谱系与四实验首轮证据框架。
  • 使用 Grok Headless 扩展 Scaling 候选路线,并纠正其对 K3 正式报告存在性的错误;线索与正式账本分离。
  • 完成 Scaling Laws 首版:16 节长文、29 个一手节点、九张账与曲面—部署—复用—涌现四联实验。
  • Scaling 真实 Chrome 断言通过:IsoFLOP 谷底、生命周期最优点、重复数据衰减和指标阶跃均正确响应。
  • 对 Scaling、训练系统、推理与 MoE 执行全量浏览器回归;12 项桌面导航、移动菜单和首页新章入口无回归。
  • Scaling 首版以提交 eff0e4c、不可变镜像 20260728T181742Z-eff0e4c 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、12 路由与生产 Chrome 全链路通过。
  • 启动数据工程专题:回查 K3/K2、DeepSeek LLM/Math/V2/V3/V4 数据章节,并将 Grok 线索永久隔离为未核验候选。
  • 建立 1264 行正式研究账本:十二张账、2019→2026 历史主线、DeepSeek/Kimi 双谱系、四实验合同与公开未知项。
  • 完成数据工程首版:18 节长文、31 个一手节点、十余组机制图与流水线—去重—混合—改写四联实验。
  • 论文库新增「数据」标签与 20 个一手节点,从 182 篇扩充至 202 篇。
  • 数据工程真实 Chrome 断言通过:激进过滤、semantic 去重误伤、数学 mixture 和失控合成均正确响应,桌面 / 390px 移动端无溢出。
  • 对 Scaling、训练系统、推理与 MoE 重新执行全量浏览器回归;13 项桌面 / 移动导航和首页数据新章入口无回归。
  • Astro 类型检查、生产构建、13 个页面路由、527 个站内引用和 20 个跨页锚点全部通过。
  • 数据工程首版以源提交 ee0361b、不可变镜像 20260728T190932Z-ee0361b 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、13 路由、门户与生产 Chrome 全链路通过。
  • 启动数值精度、优化器与稳定性专题:回查 K2/K3、DeepSeek-V3/V4 原文,并缓存核验 mixed precision、BF16、FP8、MX、QAT、AdamW、μP、Muon 与稳定性论文。
  • 使用 Grok Headless 扩展 40 个候选节点;将错误年份、不可核实新稿和无一手证据结论保留在独立 leads,不进入正式账本。
  • 建立数值专题正式研究账本:十张数值账、格式/量化/优化器/稳定性主线、DeepSeek/Kimi 双谱系、四实验合同与公开未知项。
  • 完成数值专题首版:19 节长文、36 个一手节点、十余组机制图与格式—状态—更新—失稳四联实验。
  • 论文库新增「优化器」标签与 21 个一手节点,从 202 篇扩充至 223 篇。
  • 数值专题真实 Chrome 断言通过:FP16 subnormal、E4M3 overflow、MX block outlier、状态字节、Full/Per-Head Muon 与四类稳定性防线均正确响应。
  • 对数据工程、Scaling、训练系统、推理与 MoE 重新执行全量浏览器回归;14 项桌面 / 移动导航和首页数值新章入口无回归。
  • Astro 类型检查、生产构建、14 个页面路由、593 个站内引用和 19 个跨页锚点全部通过。
  • 数值专题首版以源提交 c21af18、不可变镜像 20260728T200309Z-c21af18 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、14 路由、门户、公开 Forgejo 与生产 Chrome 全链路通过。

正在进行

  • Scaling Laws 二轮精读:真实拟合复现、逐篇图表、置信区间、外推失败与更多模型族对照。
  • 数据工程二轮:FineWeb / DCLM / Dolma / ROOTS 逐图精读、真实去重误伤、mixture traces 与污染案例。
  • 大规模训练系统二轮:真实集群 traces、故障恢复案例与精确 topology / kernel 配置。
  • 数值与稳定性二轮:真实 kernel 吞吐、长程失稳 traces、optimizer / quantization 逐图复现。
  • 推理专题二轮:真实 pass@k 曲线、PRM 失败案例与逐篇图表精读。
  • 长上下文专题的真实模型配置对比、内核细节与失败案例二轮深化。
  • MoE 专题的真实集群 traces、专家特化案例与二轮外部证据。

研究账本

日期 决策/发现 影响
2026-07-28 网站命名为 LLM Atlas / 大模型技术全景 既能容纳 K3 深读,也能承载完整 LLM 课程
2026-07-28 K3 作为“汇流点”,不是课程起点 初学者可以先学基础,高阶读者可以从 K3 反向跳转
2026-07-28 优先重绘论文图并标明“简化/改绘” 图可缩放、可交互,也减少脱离上下文复制论文图片
2026-07-28 Grok 只用于线索扩展与交叉检查 正文事实必须回到论文、官方仓库或正式文档
2026-07-28 首批论文库按问题与专题多标签组织,推理研究后扩充至 146 篇 论文库承担发现入口,专题正文承担深度精读与机制复核
2026-07-28 源码公开到 git.k1412.top/wuyang/llm-atlas 路线、进度、研究方法和内容变更均可追踪
2026-07-28 站点使用不可变镜像与 Compose Manager 部署 每次发布保留明确版本、健康检查和回滚点
2026-07-28 长上下文按计算、缓存、位置、状态容量、系统五张账单组织 避免把 FlashAttention、位置外推和“记住更久”混成同一个问题
2026-07-28 交互缓存数字统一标记为教学估算 展示增长规律,不冒充任一模型的真实线上显存基准
2026-07-28 MoE 按六张账组织,路由算法与集群执行分开核算 避免用“稀疏所以便宜”跳过容量、负载、通信与权重读取
2026-07-28 “aux-loss-free”保留论文真实边界 区分 selection bias、mixture weight、z-loss 与 V3 的极小 sequence-wise loss
2026-07-29 推理专题按结果、覆盖、选择、过程、预算、优化、分布、系统八张账组织 避免把 pass@1、pass@k、搜索收益、RL 能力增长与系统吞吐混成“会思考”
2026-07-29 K3 partial rollout RL 与 MOPD 在正文中强制并排 前者显式容忍跨迭代 stale trajectory,后者由当前 student 采样并接收稠密 teacher signal
2026-07-29 推理首版用 30 篇一手论文和三页签实验闭环 分开演示预算分配、GRPO 聚合偏置和 K3 九教师 MOPD,不合成伪“总分”
2026-07-29 推理首版发布到既有 llm-atlas 生产链路 Compose Manager、NPM host 31 / cert 41、10 路由与公网交互均复核通过
2026-07-29 训练系统按模型状态、激活、计算划分、气泡、collective、EP、CP、数值、可靠性九张账组织 任何优化都必须说明节省哪种资源、把成本移到哪里
2026-07-29 并行度不再机械写成 DP×TP×PP×EP×CP 先定义 device mesh、group overlap 与作用范围,再核算 world size
2026-07-29 DeepSeek “近零通信”统一解释为特定 overlap 下的 exposed critical-path time 防止把隐藏通信误写成没有传输字节
2026-07-29 Grok 训练系统包只保留为 TRAINING_SYSTEMS_GROK_LEADS.md 候选论文、数字和公式不得越过一手证据账本直接进入站点
2026-07-29 训练系统首版用四个独立实验闭环 显存、device mesh、pipeline 与通信不合成一个伪“系统总分”
2026-07-29 论文库随训练系统一手链扩充到 166 篇 新增 checkpoint、mixed precision、自动并行、FSDP、MoE/CP 与大集群系统节点
2026-07-29 训练系统首版用不可变镜像 20260728T172750Z-c6306fe 发布 保留 12010→8080、NPM host 31 / cert 41 与公开 Forgejo;11 路由、关键资源和四页签生产交互全部复核
2026-07-29 Scaling Laws 拆成观测量、模型、数据、算术、配比、配方、外推、经济目标与能力阶段九张账 防止把 20 TPP6ND、MoE 总参、部署成本和“涌现”混成一条万能曲线
2026-07-29 Grok 对 K3 报告存在性的错误保留在未核验 leads 正式账本回到 arXiv 2607.24653 与本地 47 页报告,展示来源分级为何必要
2026-07-29 Scaling 首版用 29 个一手节点和四个独立实验闭环 IsoFLOP、训练—部署、数据复用与指标涌现分开建模,不合成伪“规模总分”
2026-07-29 论文库随 Scaling 一手链扩充到 182 篇 新增早期跨任务幂律、Gopher、数据受限、过训练、部署经济、复现和 task ladder 节点
2026-07-29 Scaling 首版用不可变镜像 20260728T181742Z-eff0e4c 发布 OCI digest sha256:802e4041…cf83;保留 12010→8080、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo
2026-07-29 数据工程拆成来源、解析、语言、质量、唯一性、污染、混合、变换、Tokenizer、Packing、课程与价值十二张账 防止用一个“高质量 Token”标签掩盖单位、误删、治理与课程
2026-07-29 Grok 数据研究包只保留为 DATA_PRETRAINING_GROK_LEADS.md 模型发现候选不越过一手证据门槛;K3 总训练 Token、工业 mixture 和 source map 保持未知
2026-07-29 K2 改写、K3 2.5×、V3/V4 packing 边界在正文主视区显式限定 不把早期 SimpleQA 对照外推为普遍定律,不把模型族收益归因给单一数据技巧
2026-07-29 数据工程首版用四个独立实验闭环 文档保留、去重误伤、领域 exposure 与改写课程分开建模,不合成伪“数据质量总分”
2026-07-29 论文库新增数据标签并扩充到 202 篇 新增 CCNet、ROOTS、Dedup、DoReMi、DCLM、WRAP、MATES、MM1、Swallow 等 20 个节点
2026-07-29 数据工程首版用不可变镜像 20260728T190932Z-ee0361b 发布 OCI digest sha256:2fe8f3aa…59c8;复用 12010→8080、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo
2026-07-29 数值专题拆成表示、缩放、计算、累加、搬运、更新、参数化、观测、恢复与证据经济十张账 防止把一个 dtype 标签误当成完整训练配方
2026-07-29 Grok 数值研究包只保留为 NUMERICS_GROK_LEADS.md 40 个候选必须回到论文/官方报告核验;错误元数据和不可核实结论不进入正文
2026-07-29 K2/K3 与 DeepSeek-V3/V4 数值谱系显式保留边界 Per-Head Muon 不替代 QK-ClipK3 2.5× 不归因单项技巧;V3 失败实验与高精度保留项不省略
2026-07-29 数值首版用四个独立实验闭环 格式误差、状态字节、矩阵更新与失稳防线分开建模,不合成伪“效率总分”
2026-07-29 论文库新增「优化器」标签并扩充到 223 篇 新增 Shampoo、Adafactor、μP、8-bit optimizer、FP8-LM、FP4 training、稳定性代理等 21 个节点
2026-07-29 数值首版用不可变镜像 20260728T200309Z-c21af18 发布 OCI digest sha256:2155fd7f…c386;复用 12010→8080、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo

未决问题

  • K3 报告给出了多项公开组件的整合方式;独立论文与 K3 内部最终实现之间仍需逐项对照。
  • 公开技术报告不会披露完整数据配比和训练细节;网站会把“已知”“合理推断”“未知”分开。
  • 2026 年模型与榜单变化快,所有动态比较都必须带研究截止日期。