Files
2026-07-29 06:11:34 +08:00

23 KiB
Raw Permalink Blame History

持续进度

最后更新:2026-07-29

总体状态

工作流 状态 完成度 下一检查点
研究框架与规范 进行中 83% Scaling Laws 二轮拟合复现与逐图精读
网站设计系统 进行中 89% 打印样式与更多通用可视化组件
Kimi K3 深读 进行中 66% 扩写 pre-training / infra 逐图笔记
语言模型前史 完成首版 78% KneserNey、LSTM、Bahdanau 逐图精读与真实小语料复现
Transformer 基础 完成首版 79% 多头电路、归一化 traces 与真实 kernel / KV 配置
Scaling Laws 完成首版 74% 真实拟合复现、置信区间与更多模型族对照
数据工程与预训练配方 完成首版 73% FineWeb / DCLM 逐图精读、真实去重误伤与 mixture traces
DeepSeek 专题 进行中 71% 补 R1 / DAPO 的逐图训练轨迹与复现对照
指令微调与人类偏好 完成首版 75% 真实偏好分歧、RM 长度偏置与 PPO/DPO 小模型复现
推理与测试时扩展 完成首版 76% 真实模型采样曲线、PRM 案例与逐篇图表精读
稀疏计算与 MoE 完成首版 74% 真实负载 traces 与专家特化案例
长上下文专题 完成首版 72% 真实模型配置、内核细节与失败案例
大规模训练系统 完成首版 71% 真实集群 traces、故障案例与精确 topology 配置
数值精度、优化器与稳定性 完成首版 75% 真实 kernel 吞吐、长程训练 traces 与逐图论文精读
引用与事实检查 进行中 57% 自动化外链复查与来源等级扩展
开源仓库 已完成首版 100% 持续提交研究与网站迭代
k1412 部署 已完成首版 100% 每轮发布保留不可变镜像与回滚点

已完成

  • 建立长期任务目标与阶段计划。
  • 确认 K3 官方 47 页技术报告与官方模型仓库。
  • 提取技术报告目录与 151 条参考来源,建立本地只读研究缓存。
  • 从报告反推出 16 个专题与三条贯穿案例。
  • 提炼参考网站的编辑设计语言。
  • 确认 git.k1412.top 为 Gitea/Forgejo 兼容服务且本机 HTTPS 凭据可用于既有仓库。
  • 使用 Grok CLI 检索并形成约 95 篇一手论文的补充路线,主代理已回查关键来源。
  • 完成 280 篇关键论文索引,覆盖 14 个标签专题与 Kimi/DeepSeek 聚光主线。
  • 完成可检索、可按专题筛选的论文库页面。
  • 完成 K3、语言模型前史、Transformer 基础、DeepSeek 谱系、Scaling Laws、数据工程、长上下文、MoE、指令微调与人类偏好、推理、训练系统与数值优化十二篇首版长文。
  • 完成 K3 三轴架构、语言模型前史四联实验、Transformer 四联实验、DeepSeek 谱系、长上下文、MoE 路由、推理三页签,以及训练系统、Scaling、数据工程、数值与 Alignment 专题各四页签等三十五个原创交互视图。
  • 完成长上下文首版:五张成本账、26 篇一手论文、10+ 机制图与 8 策略交互实验室。
  • 核验 FlashAttention、DeepSeek-V2/V3.2/V4、Kimi Linear/K3 等六份论文原文,并建立长上下文研究账本。
  • 核验 Switch、ST-MoE、DeepSeekMoE、Loss-Free、V3、LatentMoE 与 K3 原文,并建立 MoE 研究账本。
  • 完成 MoE 首版:六张账、19 篇一手论文、完整 DeepSeek/K3 主线与路由—容量—通信实验室。
  • 为推理专题缓存并核验 23 份一手论文,另复用 K3 原报告,建立 24 份来源的研究账本。
  • 明确 CoT / verifier / test-time compute、PPO → GRPO、DeepSeek-R1 与 Kimi k1.5 → K3 四条主线。
  • 分清 K3 partial rollout 的 off-policy 稳定化与 MOPD 的 student on-policy 逐 Token 蒸馏。
  • 完成推理首版:八张账、30 篇一手论文链、DeepSeek/Kimi 双主线与预算—GRPO—MOPD 三页签实验室。
  • 推理首版以提交 dce94b2、不可变镜像 20260728T164043Z-dce94b2 发布;NAS/VPS/HTTPS/生产 Chrome 全链路通过。
  • 训练系统专题完成首轮证据账本:九张资源账、37 个一手节点、DeepSeek-V2/V3/V4 与 Kimi K2/K2.5/K3 系统谱系。
  • 缓存并核验 18 篇训练系统核心论文,逐项校正 ZeRO 字节账、pipeline bubble、collective 口径、context parallel 与 MoonEP 上界。
  • 将 Grok 产物降级为明确标注的未核验 leads;正式账本只采用回查一手论文后的结论。
  • 完成训练系统首版:15 节长文、37 个一手节点、12 类机制图与显存—网格—气泡—通信四页签实验室。
  • 训练系统真实 Chrome 断言通过:OOM、无效 mesh、DualPipe 参数副本、overlap 与 MoonEP buffer 均正确响应。
  • Astro 类型检查、生产构建、12 个内部路由、464 个站内引用和桌面/移动端视觉检查通过。
  • 训练系统首版以提交 c6306fe、不可变镜像 20260728T172750Z-c6306fe 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书与生产 Chrome 全链路通过。
  • 创建 wuyang/llm-atlas 公开仓库,匿名 API 确认 private: false
  • 当前生产镜像通过健康检查、16 个页面路由、关键资源与九套专题生产 Chrome 回归。
  • 通过 Unraid Compose Manager、Nginx Proxy Manager 与 HTTPS 发布首版。
  • 启动 Scaling Laws 专题:缓存 22 篇新的一手论文,建立九张账、DeepSeek / Kimi 双谱系与四实验首轮证据框架。
  • 使用 Grok Headless 扩展 Scaling 候选路线,并纠正其对 K3 正式报告存在性的错误;线索与正式账本分离。
  • 完成 Scaling Laws 首版:16 节长文、29 个一手节点、九张账与曲面—部署—复用—涌现四联实验。
  • Scaling 真实 Chrome 断言通过:IsoFLOP 谷底、生命周期最优点、重复数据衰减和指标阶跃均正确响应。
  • 对 Scaling、训练系统、推理与 MoE 执行全量浏览器回归;12 项桌面导航、移动菜单和首页新章入口无回归。
  • Scaling 首版以提交 eff0e4c、不可变镜像 20260728T181742Z-eff0e4c 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、12 路由与生产 Chrome 全链路通过。
  • 启动数据工程专题:回查 K3/K2、DeepSeek LLM/Math/V2/V3/V4 数据章节,并将 Grok 线索永久隔离为未核验候选。
  • 建立 1264 行正式研究账本:十二张账、2019→2026 历史主线、DeepSeek/Kimi 双谱系、四实验合同与公开未知项。
  • 完成数据工程首版:18 节长文、31 个一手节点、十余组机制图与流水线—去重—混合—改写四联实验。
  • 论文库新增「数据」标签与 20 个一手节点,从 182 篇扩充至 202 篇。
  • 数据工程真实 Chrome 断言通过:激进过滤、semantic 去重误伤、数学 mixture 和失控合成均正确响应,桌面 / 390px 移动端无溢出。
  • 对 Scaling、训练系统、推理与 MoE 重新执行全量浏览器回归;13 项桌面 / 移动导航和首页数据新章入口无回归。
  • Astro 类型检查、生产构建、13 个页面路由、527 个站内引用和 20 个跨页锚点全部通过。
  • 数据工程首版以源提交 ee0361b、不可变镜像 20260728T190932Z-ee0361b 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、13 路由、门户与生产 Chrome 全链路通过。
  • 启动数值精度、优化器与稳定性专题:回查 K2/K3、DeepSeek-V3/V4 原文,并缓存核验 mixed precision、BF16、FP8、MX、QAT、AdamW、μP、Muon 与稳定性论文。
  • 使用 Grok Headless 扩展 40 个候选节点;将错误年份、不可核实新稿和无一手证据结论保留在独立 leads,不进入正式账本。
  • 建立数值专题正式研究账本:十张数值账、格式/量化/优化器/稳定性主线、DeepSeek/Kimi 双谱系、四实验合同与公开未知项。
  • 完成数值专题首版:19 节长文、36 个一手节点、十余组机制图与格式—状态—更新—失稳四联实验。
  • 论文库新增「优化器」标签与 21 个一手节点,从 202 篇扩充至 223 篇。
  • 数值专题真实 Chrome 断言通过:FP16 subnormal、E4M3 overflow、MX block outlier、状态字节、Full/Per-Head Muon 与四类稳定性防线均正确响应。
  • 对数据工程、Scaling、训练系统、推理与 MoE 重新执行全量浏览器回归;14 项桌面 / 移动导航和首页数值新章入口无回归。
  • Astro 类型检查、生产构建、14 个页面路由、593 个站内引用和 19 个跨页锚点全部通过。
  • 数值专题首版以源提交 c21af18、不可变镜像 20260728T200309Z-c21af18 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、14 路由、门户、公开 Forgejo 与生产 Chrome 全链路通过。
  • 启动语言模型前史专题:以八张独立问题账拆开预测单位、概率信息、上下文、稀疏性、表示、记忆、转导与成本,避免伪单线架构史。
  • 使用 Grok Headless 扩展 45+ 候选一手节点;将错误元数据、过强因果和未核实旧论文永久保留在独立 leads。
  • 建立语言模型前史正式研究账本:33 个正式节点、逐篇旧瓶颈/贡献/遗留问题、四实验合同与 19 组原创重绘清单。
  • 完成语言模型前史首版:20 段长文、Shannon → N-gram → neural LM → RNN/LSTM → Seq2Seq/Attention 完整问题链,以及 DeepSeek/K3 当代回声。
  • 论文库新增 24 个语言模型前史节点,从 223 篇扩充至 247 篇;DeepSeek-V3/V4 与 K3 补充「基础」映射。
  • 语言模型前史真实 Chrome 断言通过:零概率/平滑、one-hot 选择、指数记忆衰减、Attention 对齐、键盘 tabs 与 390px 移动端均正确响应。
  • 语言模型前史首版以源提交 a54152d、不可变镜像 20260728T204916Z-a54152d 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、15 路由、门户、公开 Forgejo 与七套生产 Chrome 回归全链路通过。
  • 启动 Transformer 深度专题:以十张问题账拆开信息路径、匹配几何、可见性、多头、位置、局部计算、深度、架构目标、系统成本与当代映射。
  • 使用 Grok Headless 扩展 50 个候选节点;候选元数据与过强归因永久隔离在 TRANSFORMER_GROK_LEADS.md
  • 建立 Transformer 正式研究账本:40 个节点、DeepSeek V2→V4 与 Kimi Linear→K3 双谱系、四实验合同与解释边界。
  • 完成 Transformer 深度首版:21 段正文与 QKV—Mask—多头位置—Block 成本四联实验。
  • 论文库补齐 Residual/Norm、相对位置、UniLM、多头冗余与解释争论等 11 个节点,从 247 篇扩充至 258 篇。
  • Transformer 深度首版以源提交 252e7d6、不可变镜像 20260728T212813Z-252e7d6 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、15 路由、门户、公开 Forgejo 与八套生产 Chrome 回归全链路通过。
  • 启动 Alignment 专题:按十二张账拆开目标、监督、SFT、偏好、RM、策略更新、直接优化、分布、约束、失效与证据,避免把 SFT / RLHF / DPO 写成彼此替代的三代技术。
  • 缓存并核验 24 份新的一手论文全文,复用 DeepSeek / Kimi / MOPD 报告,建立 44 节点正式论文链;Grok 45 条候选另存为未核验 leads。
  • 完成 Alignment 首版:22 节长文、十二张账、DeepSeek/Kimi 后训练双谱系,以及 SFT—偏好/RM—PPO/DPO—配方比较四联实验。
  • 论文库新增人类偏好学习、HH-RLHF、LIMA、RLAIF、RewardBench、KTO、ORPO、SimPO 等 22 个节点,从 258 篇扩充至 280 篇。
  • Alignment 真实 Chrome 断言通过:response-only / all-token SFT mask、both-bad preference、DPO 陈旧分布、K3 九教师配方、键盘 tabs 与 390px 移动端均正确响应。
  • Astro 类型检查、生产构建、16 个页面、713 个站内引用和 17 个跨页锚点通过;九套专题公网 Chrome 回归无异常。
  • Alignment 首版以源提交 8378e2a、不可变镜像 20260728T220753Z-8378e2a 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户与公开 Forgejo 全链路通过。

正在进行

  • Transformer 二轮:多头电路逐图、Pre/Post-LN 真实 traces、Flash/KV kernel 与模型配置对照。
  • 语言模型前史二轮:KneserNey / LSTM / Bahdanau 逐图精读、真实小语料复现与 tokenizer 公平性案例。
  • Scaling Laws 二轮精读:真实拟合复现、逐篇图表、置信区间、外推失败与更多模型族对照。
  • 数据工程二轮:FineWeb / DCLM / Dolma / ROOTS 逐图精读、真实去重误伤、mixture traces 与污染案例。
  • 大规模训练系统二轮:真实集群 traces、故障恢复案例与精确 topology / kernel 配置。
  • 数值与稳定性二轮:真实 kernel 吞吐、长程失稳 traces、optimizer / quantization 逐图复现。
  • 推理专题二轮:真实 pass@k 曲线、PRM 失败案例与逐篇图表精读。
  • 长上下文专题的真实模型配置对比、内核细节与失败案例二轮深化。
  • MoE 专题的真实集群 traces、专家特化案例与二轮外部证据。

研究账本

日期 决策/发现 影响
2026-07-28 网站命名为 LLM Atlas / 大模型技术全景 既能容纳 K3 深读,也能承载完整 LLM 课程
2026-07-28 K3 作为“汇流点”,不是课程起点 初学者可以先学基础,高阶读者可以从 K3 反向跳转
2026-07-28 优先重绘论文图并标明“简化/改绘” 图可缩放、可交互,也减少脱离上下文复制论文图片
2026-07-28 Grok 只用于线索扩展与交叉检查 正文事实必须回到论文、官方仓库或正式文档
2026-07-28 首批论文库按问题与专题多标签组织,推理研究后扩充至 146 篇 论文库承担发现入口,专题正文承担深度精读与机制复核
2026-07-28 源码公开到 git.k1412.top/wuyang/llm-atlas 路线、进度、研究方法和内容变更均可追踪
2026-07-28 站点使用不可变镜像与 Compose Manager 部署 每次发布保留明确版本、健康检查和回滚点
2026-07-28 长上下文按计算、缓存、位置、状态容量、系统五张账单组织 避免把 FlashAttention、位置外推和“记住更久”混成同一个问题
2026-07-28 交互缓存数字统一标记为教学估算 展示增长规律,不冒充任一模型的真实线上显存基准
2026-07-28 MoE 按六张账组织,路由算法与集群执行分开核算 避免用“稀疏所以便宜”跳过容量、负载、通信与权重读取
2026-07-28 “aux-loss-free”保留论文真实边界 区分 selection bias、mixture weight、z-loss 与 V3 的极小 sequence-wise loss
2026-07-29 推理专题按结果、覆盖、选择、过程、预算、优化、分布、系统八张账组织 避免把 pass@1、pass@k、搜索收益、RL 能力增长与系统吞吐混成“会思考”
2026-07-29 K3 partial rollout RL 与 MOPD 在正文中强制并排 前者显式容忍跨迭代 stale trajectory,后者由当前 student 采样并接收稠密 teacher signal
2026-07-29 推理首版用 30 篇一手论文和三页签实验闭环 分开演示预算分配、GRPO 聚合偏置和 K3 九教师 MOPD,不合成伪“总分”
2026-07-29 推理首版发布到既有 llm-atlas 生产链路 Compose Manager、NPM host 31 / cert 41、10 路由与公网交互均复核通过
2026-07-29 训练系统按模型状态、激活、计算划分、气泡、collective、EP、CP、数值、可靠性九张账组织 任何优化都必须说明节省哪种资源、把成本移到哪里
2026-07-29 并行度不再机械写成 DP×TP×PP×EP×CP 先定义 device mesh、group overlap 与作用范围,再核算 world size
2026-07-29 DeepSeek “近零通信”统一解释为特定 overlap 下的 exposed critical-path time 防止把隐藏通信误写成没有传输字节
2026-07-29 Grok 训练系统包只保留为 TRAINING_SYSTEMS_GROK_LEADS.md 候选论文、数字和公式不得越过一手证据账本直接进入站点
2026-07-29 训练系统首版用四个独立实验闭环 显存、device mesh、pipeline 与通信不合成一个伪“系统总分”
2026-07-29 论文库随训练系统一手链扩充到 166 篇 新增 checkpoint、mixed precision、自动并行、FSDP、MoE/CP 与大集群系统节点
2026-07-29 训练系统首版用不可变镜像 20260728T172750Z-c6306fe 发布 保留 12010→8080、NPM host 31 / cert 41 与公开 Forgejo;11 路由、关键资源和四页签生产交互全部复核
2026-07-29 Scaling Laws 拆成观测量、模型、数据、算术、配比、配方、外推、经济目标与能力阶段九张账 防止把 20 TPP6ND、MoE 总参、部署成本和“涌现”混成一条万能曲线
2026-07-29 Grok 对 K3 报告存在性的错误保留在未核验 leads 正式账本回到 arXiv 2607.24653 与本地 47 页报告,展示来源分级为何必要
2026-07-29 Scaling 首版用 29 个一手节点和四个独立实验闭环 IsoFLOP、训练—部署、数据复用与指标涌现分开建模,不合成伪“规模总分”
2026-07-29 论文库随 Scaling 一手链扩充到 182 篇 新增早期跨任务幂律、Gopher、数据受限、过训练、部署经济、复现和 task ladder 节点
2026-07-29 Scaling 首版用不可变镜像 20260728T181742Z-eff0e4c 发布 OCI digest sha256:802e4041…cf83;保留 12010→8080、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo
2026-07-29 数据工程拆成来源、解析、语言、质量、唯一性、污染、混合、变换、Tokenizer、Packing、课程与价值十二张账 防止用一个“高质量 Token”标签掩盖单位、误删、治理与课程
2026-07-29 Grok 数据研究包只保留为 DATA_PRETRAINING_GROK_LEADS.md 模型发现候选不越过一手证据门槛;K3 总训练 Token、工业 mixture 和 source map 保持未知
2026-07-29 K2 改写、K3 2.5×、V3/V4 packing 边界在正文主视区显式限定 不把早期 SimpleQA 对照外推为普遍定律,不把模型族收益归因给单一数据技巧
2026-07-29 数据工程首版用四个独立实验闭环 文档保留、去重误伤、领域 exposure 与改写课程分开建模,不合成伪“数据质量总分”
2026-07-29 论文库新增数据标签并扩充到 202 篇 新增 CCNet、ROOTS、Dedup、DoReMi、DCLM、WRAP、MATES、MM1、Swallow 等 20 个节点
2026-07-29 数据工程首版用不可变镜像 20260728T190932Z-ee0361b 发布 OCI digest sha256:2fe8f3aa…59c8;复用 12010→8080、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo
2026-07-29 数值专题拆成表示、缩放、计算、累加、搬运、更新、参数化、观测、恢复与证据经济十张账 防止把一个 dtype 标签误当成完整训练配方
2026-07-29 Grok 数值研究包只保留为 NUMERICS_GROK_LEADS.md 40 个候选必须回到论文/官方报告核验;错误元数据和不可核实结论不进入正文
2026-07-29 K2/K3 与 DeepSeek-V3/V4 数值谱系显式保留边界 Per-Head Muon 不替代 QK-ClipK3 2.5× 不归因单项技巧;V3 失败实验与高精度保留项不省略
2026-07-29 数值首版用四个独立实验闭环 格式误差、状态字节、矩阵更新与失稳防线分开建模,不合成伪“效率总分”
2026-07-29 论文库新增「优化器」标签并扩充到 223 篇 新增 Shampoo、Adafactor、μP、8-bit optimizer、FP8-LM、FP4 training、稳定性代理等 21 个节点
2026-07-29 数值首版用不可变镜像 20260728T200309Z-c21af18 发布 OCI digest sha256:2155fd7f…c386;复用 12010→8080、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo
2026-07-29 语言模型前史拆成八张彼此独立的账 不再把 Tokenizer、平滑、Embedding、循环记忆、Seq2Seq 与系统成本压成一条“架构越来越强”的年表
2026-07-29 Grok 语言模型候选与正式证据永久分离 45+ 候选只负责召回;正式 33 节点必须回到 DOI、ACL/PMLR/ISCA、出版社页面或官方技术报告
2026-07-29 K3 / DeepSeek 的 NTP、MTP、多模态与 draft 分角色记账 统一视觉/文本 next-token objective 不排斥 one MTP layerMTP 与 speculative draft 都不写成取消自回归
2026-07-29 论文库扩充到 247 篇 新增 Shannon 1951、Good、Katz、KneserNey、LSTM、RNNLM、Seq2Seq 前夜与输出成本等 24 个一手节点
2026-07-29 语言模型前史首版用不可变镜像 20260728T204916Z-a54152d 发布 OCI digest sha256:fb646aba…fe923;复用 12010→8080、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo
2026-07-29 Transformer 按十张问题账组织 不再把 QKV、Mask、位置、Norm、训练目标、KV Cache、Flash 与当代架构压成一个“Block”
2026-07-29 Attention 权重与因果解释永久分离 热力图只描述中间计算和提出假设;因果结论需要消融、patching 或反事实干预
2026-07-29 论文库扩充到 258 篇 新增 Residual/Norm、relative position、UniLM、多头冗余、解释争论与 NormFormer 等 11 个节点
2026-07-29 Transformer 深度首版用不可变镜像 20260728T212813Z-252e7d6 发布 OCI digest sha256:db003faa…59fa;复用 12010→8080、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo
2026-07-29 Alignment 拆成十二张彼此独立的账 防止把“更会答”“更符合偏好”“更安全”“更可验证”压成同一个 alignment 分数
2026-07-29 Grok Alignment 线索与正式证据永久分离 45 条候选只负责查漏;公式、数字和历史结论必须回到一手 PDF / 会议页面
2026-07-29 DeepSeek 与 Kimi 后训练按阶段合同重建 R1-Zero 不外推为完整 R1K3 partial rollout 与 MOPD 不混写;DPO 不被描述成取消偏好数据
2026-07-29 Alignment 首版用 44 个一手节点与四个独立实验闭环 SFT token mask、RM 偏置、PPO/DPO 更新与模型配方分开演示,不合成伪“对齐总分”
2026-07-29 论文库扩充到 280 篇 新增 22 个 SFT、偏好、RM、RLAIF、直接偏好优化与后训练评测节点
2026-07-29 Alignment 首版用不可变镜像 20260728T220753Z-8378e2a 发布 OCI digest sha256:ef3ad2a8…3048a;复用 12010→8080、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo

未决问题

  • K3 报告给出了多项公开组件的整合方式;独立论文与 K3 内部最终实现之间仍需逐项对照。
  • 公开技术报告不会披露完整数据配比和训练细节;网站会把“已知”“合理推断”“未知”分开。
  • 2026 年模型与榜单变化快,所有动态比较都必须带研究截止日期。