Files
llm-atlas/PROGRESS.md
T
2026-07-29 12:02:04 +08:00

285 lines
41 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 持续进度
最后更新:2026-07-29
## 总体状态
| 工作流 | 状态 | 完成度 | 下一检查点 |
|---|---:|---:|---|
| 研究框架与规范 | 进行中 | 83% | Scaling Laws 二轮拟合复现与逐图精读 |
| 网站设计系统 | 进行中 | 89% | 打印样式与更多通用可视化组件 |
| Kimi K3 深读 | 完成二轮 | 88% | 第三轮加入官方权重 traces、独立复现与逐图数值重绘 |
| 语言模型前史 | 完成首版 | 78% | Kneser–Ney、LSTM、Bahdanau 逐图精读与真实小语料复现 |
| Transformer 基础 | 完成首版 | 79% | 多头电路、归一化 traces 与真实 kernel / KV 配置 |
| 表示、位置与残差高速公路 | 完成首版 | 81% | 真实 hidden-state / norm traces、长上下文位置外推与深层稳定性消融 |
| Scaling Laws | 完成首版 | 74% | 真实拟合复现、置信区间与更多模型族对照 |
| 数据工程与预训练配方 | 完成首版 | 73% | FineWeb / DCLM 逐图精读、真实去重误伤与 mixture traces |
| DeepSeek 专题 | 完成二轮 | 83% | 真实专家负载 / MLA kernel / RL 训练 traces 与独立复现 |
| 指令微调与人类偏好 | 完成首版 | 75% | 真实偏好分歧、RM 长度偏置与 PPO/DPO 小模型复现 |
| 推理与测试时扩展 | 完成首版 | 76% | 真实模型采样曲线、PRM 案例与逐篇图表精读 |
| 工具使用与长程 Agent | 完成首版 | 74% | 真实环境 traces、cross-harness 对照、Agent RL 曲线与安全案例 |
| 原生多模态 | 完成首版 | 76% | 真实视觉 Token traces、跨分辨率消融、OCR 失败案例与视觉 Agent 安全轨迹 |
| 稀疏计算与 MoE | 完成首版 | 74% | 真实负载 traces 与专家特化案例 |
| 长上下文专题 | 完成首版 | 72% | 真实模型配置、内核细节与失败案例 |
| 大规模训练系统 | 完成首版 | 71% | 真实集群 traces、故障案例与精确 topology 配置 |
| 推理服务与低成本部署 | 完成首版 | 78% | 真实 GPU kernel / workload traces、功耗与跨框架复现 |
| 数值精度、优化器与稳定性 | 完成首版 | 75% | 真实 kernel 吞吐、长程训练 traces 与逐图论文精读 |
| 评测、安全与“到底强不强” | 完成首版 | 79% | 真实 cross-harness 复跑、Judge 元评测与动态污染案例 |
| 引用与事实检查 | 进行中 | 57% | 自动化外链复查与来源等级扩展 |
| 开源仓库 | 已完成首版 | 100% | 持续提交研究与网站迭代 |
| k1412 部署 | 已完成首版 | 100% | 每轮发布保留不可变镜像与回滚点 |
## 已完成
- [x] 建立长期任务目标与阶段计划。
- [x] 确认 K3 官方 47 页技术报告与官方模型仓库。
- [x] 提取技术报告目录与 151 条参考来源,建立本地只读研究缓存。
- [x] 从报告反推出 17 个专题与三条贯穿案例。
- [x] 提炼参考网站的编辑设计语言。
- [x] 确认 `git.k1412.top` 为 Gitea/Forgejo 兼容服务且本机 HTTPS 凭据可用于既有仓库。
- [x] 使用 Grok CLI 检索并形成约 95 篇一手论文的补充路线,主代理已回查关键来源。
- [x] 完成 486 篇关键论文索引,覆盖 16 个标签专题与 Kimi/DeepSeek 聚光主线。
- [x] 完成可检索、可按专题筛选的论文库页面。
- [x] 完成 K3、语言模型前史、Transformer 基础、表示/位置/残差、DeepSeek 谱系、Scaling Laws、数据工程、长上下文、MoE、指令微调与人类偏好、推理、Agent、原生多模态、训练系统、推理服务、数值优化与评测安全十七篇首版长文。
- [x] 完成 K3 三轴架构与八联报告实验、语言模型前史四联实验、Transformer 四联实验、表示深度四联实验、DeepSeek 四联实验、长上下文、MoE 路由、推理三页签,以及训练系统、推理服务、Scaling、数据工程、数值、Alignment、Agent、原生多模态与评测安全专题各四页签等六十七个原创交互视图。
- [x] 完成长上下文首版:五张成本账、26 篇一手论文、10+ 机制图与 8 策略交互实验室。
- [x] 核验 FlashAttention、DeepSeek-V2/V3.2/V4、Kimi Linear/K3 等六份论文原文,并建立长上下文研究账本。
- [x] 核验 Switch、ST-MoE、DeepSeekMoE、Loss-Free、V3、LatentMoE 与 K3 原文,并建立 MoE 研究账本。
- [x] 完成 MoE 首版:六张账、19 篇一手论文、完整 DeepSeek/K3 主线与路由—容量—通信实验室。
- [x] 为推理专题缓存并核验 23 份一手论文,另复用 K3 原报告,建立 24 份来源的研究账本。
- [x] 明确 CoT / verifier / test-time compute、PPO → GRPO、DeepSeek-R1 与 Kimi k1.5 → K3 四条主线。
- [x] 分清 K3 partial rollout 的 off-policy 稳定化与 MOPD 的 student on-policy 逐 Token 蒸馏。
- [x] 完成推理首版:八张账、30 篇一手论文链、DeepSeek/Kimi 双主线与预算—GRPO—MOPD 三页签实验室。
- [x] 推理首版以提交 `dce94b2`、不可变镜像 `20260728T164043Z-dce94b2` 发布;NAS/VPS/HTTPS/生产 Chrome 全链路通过。
- [x] 训练系统专题完成首轮证据账本:九张资源账、37 个一手节点、DeepSeek-V2/V3/V4 与 Kimi K2/K2.5/K3 系统谱系。
- [x] 缓存并核验 18 篇训练系统核心论文,逐项校正 ZeRO 字节账、pipeline bubble、collective 口径、context parallel 与 MoonEP 上界。
- [x] 将 Grok 产物降级为明确标注的未核验 leads;正式账本只采用回查一手论文后的结论。
- [x] 完成训练系统首版:15 节长文、37 个一手节点、12 类机制图与显存—网格—气泡—通信四页签实验室。
- [x] 训练系统真实 Chrome 断言通过:OOM、无效 mesh、DualPipe 参数副本、overlap 与 MoonEP buffer 均正确响应。
- [x] Astro 类型检查、生产构建、12 个内部路由、464 个站内引用和桌面/移动端视觉检查通过。
- [x] 训练系统首版以提交 `c6306fe`、不可变镜像 `20260728T172750Z-c6306fe` 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书与生产 Chrome 全链路通过。
- [x] 创建 `wuyang/llm-atlas` 公开仓库,匿名 API 确认 `private: false`。
- [x] 当前生产镜像通过健康检查、16 个页面路由、关键资源与九套专题生产 Chrome 回归。
- [x] 通过 Unraid Compose Manager、Nginx Proxy Manager 与 HTTPS 发布首版。
- [x] 启动 Scaling Laws 专题:缓存 22 篇新的一手论文,建立九张账、DeepSeek / Kimi 双谱系与四实验首轮证据框架。
- [x] 使用 Grok Headless 扩展 Scaling 候选路线,并纠正其对 K3 正式报告存在性的错误;线索与正式账本分离。
- [x] 完成 Scaling Laws 首版:16 节长文、29 个一手节点、九张账与曲面—部署—复用—涌现四联实验。
- [x] Scaling 真实 Chrome 断言通过:IsoFLOP 谷底、生命周期最优点、重复数据衰减和指标阶跃均正确响应。
- [x] 对 Scaling、训练系统、推理与 MoE 执行全量浏览器回归;12 项桌面导航、移动菜单和首页新章入口无回归。
- [x] Scaling 首版以提交 `eff0e4c`、不可变镜像 `20260728T181742Z-eff0e4c` 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、12 路由与生产 Chrome 全链路通过。
- [x] 启动数据工程专题:回查 K3/K2、DeepSeek LLM/Math/V2/V3/V4 数据章节,并将 Grok 线索永久隔离为未核验候选。
- [x] 建立 1264 行正式研究账本:十二张账、2019→2026 历史主线、DeepSeek/Kimi 双谱系、四实验合同与公开未知项。
- [x] 完成数据工程首版:18 节长文、31 个一手节点、十余组机制图与流水线—去重—混合—改写四联实验。
- [x] 论文库新增「数据」标签与 20 个一手节点,从 182 篇扩充至 202 篇。
- [x] 数据工程真实 Chrome 断言通过:激进过滤、semantic 去重误伤、数学 mixture 和失控合成均正确响应,桌面 / 390px 移动端无溢出。
- [x] 对 Scaling、训练系统、推理与 MoE 重新执行全量浏览器回归;13 项桌面 / 移动导航和首页数据新章入口无回归。
- [x] Astro 类型检查、生产构建、13 个页面路由、527 个站内引用和 20 个跨页锚点全部通过。
- [x] 数据工程首版以源提交 `ee0361b`、不可变镜像 `20260728T190932Z-ee0361b` 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、13 路由、门户与生产 Chrome 全链路通过。
- [x] 启动数值精度、优化器与稳定性专题:回查 K2/K3、DeepSeek-V3/V4 原文,并缓存核验 mixed precision、BF16、FP8、MX、QAT、AdamW、μP、Muon 与稳定性论文。
- [x] 使用 Grok Headless 扩展 40 个候选节点;将错误年份、不可核实新稿和无一手证据结论保留在独立 leads,不进入正式账本。
- [x] 建立数值专题正式研究账本:十张数值账、格式/量化/优化器/稳定性主线、DeepSeek/Kimi 双谱系、四实验合同与公开未知项。
- [x] 完成数值专题首版:19 节长文、36 个一手节点、十余组机制图与格式—状态—更新—失稳四联实验。
- [x] 论文库新增「优化器」标签与 21 个一手节点,从 202 篇扩充至 223 篇。
- [x] 数值专题真实 Chrome 断言通过:FP16 subnormal、E4M3 overflow、MX block outlier、状态字节、Full/Per-Head Muon 与四类稳定性防线均正确响应。
- [x] 对数据工程、Scaling、训练系统、推理与 MoE 重新执行全量浏览器回归;14 项桌面 / 移动导航和首页数值新章入口无回归。
- [x] Astro 类型检查、生产构建、14 个页面路由、593 个站内引用和 19 个跨页锚点全部通过。
- [x] 数值专题首版以源提交 `c21af18`、不可变镜像 `20260728T200309Z-c21af18` 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、14 路由、门户、公开 Forgejo 与生产 Chrome 全链路通过。
- [x] 启动语言模型前史专题:以八张独立问题账拆开预测单位、概率信息、上下文、稀疏性、表示、记忆、转导与成本,避免伪单线架构史。
- [x] 使用 Grok Headless 扩展 45+ 候选一手节点;将错误元数据、过强因果和未核实旧论文永久保留在独立 leads。
- [x] 建立语言模型前史正式研究账本:33 个正式节点、逐篇旧瓶颈/贡献/遗留问题、四实验合同与 19 组原创重绘清单。
- [x] 完成语言模型前史首版:20 段长文、Shannon → N-gram → neural LM → RNN/LSTM → Seq2Seq/Attention 完整问题链,以及 DeepSeek/K3 当代回声。
- [x] 论文库新增 24 个语言模型前史节点,从 223 篇扩充至 247 篇;DeepSeek-V3/V4 与 K3 补充「基础」映射。
- [x] 语言模型前史真实 Chrome 断言通过:零概率/平滑、one-hot 选择、指数记忆衰减、Attention 对齐、键盘 tabs 与 390px 移动端均正确响应。
- [x] 语言模型前史首版以源提交 `a54152d`、不可变镜像 `20260728T204916Z-a54152d` 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、15 路由、门户、公开 Forgejo 与七套生产 Chrome 回归全链路通过。
- [x] 启动 Transformer 深度专题:以十张问题账拆开信息路径、匹配几何、可见性、多头、位置、局部计算、深度、架构目标、系统成本与当代映射。
- [x] 使用 Grok Headless 扩展 50 个候选节点;候选元数据与过强归因永久隔离在 `TRANSFORMER_GROK_LEADS.md`。
- [x] 建立 Transformer 正式研究账本:40 个节点、DeepSeek V2→V4 与 Kimi Linear→K3 双谱系、四实验合同与解释边界。
- [x] 完成 Transformer 深度首版:21 段正文与 QKV—Mask—多头位置—Block 成本四联实验。
- [x] 论文库补齐 Residual/Norm、相对位置、UniLM、多头冗余与解释争论等 11 个节点,从 247 篇扩充至 258 篇。
- [x] Transformer 深度首版以源提交 `252e7d6`、不可变镜像 `20260728T212813Z-252e7d6` 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、15 路由、门户、公开 Forgejo 与八套生产 Chrome 回归全链路通过。
- [x] 启动 Alignment 专题:按十二张账拆开目标、监督、SFT、偏好、RM、策略更新、直接优化、分布、约束、失效与证据,避免把 SFT / RLHF / DPO 写成彼此替代的三代技术。
- [x] 缓存并核验 24 份新的一手论文全文,复用 DeepSeek / Kimi / MOPD 报告,建立 44 节点正式论文链;Grok 45 条候选另存为未核验 leads。
- [x] 完成 Alignment 首版:22 节长文、十二张账、DeepSeek/Kimi 后训练双谱系,以及 SFT—偏好/RM—PPO/DPO—配方比较四联实验。
- [x] 论文库新增人类偏好学习、HH-RLHF、LIMA、RLAIF、RewardBench、KTO、ORPO、SimPO 等 22 个节点,从 258 篇扩充至 280 篇。
- [x] Alignment 真实 Chrome 断言通过:response-only / all-token SFT mask、both-bad preference、DPO 陈旧分布、K3 九教师配方、键盘 tabs 与 390px 移动端均正确响应。
- [x] Astro 类型检查、生产构建、16 个页面、713 个站内引用和 17 个跨页锚点通过;九套专题公网 Chrome 回归无异常。
- [x] Alignment 首版以源提交 `8378e2a`、不可变镜像 `20260728T220753Z-8378e2a` 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户与公开 Forgejo 全链路通过。
- [x] 启动 Agent 专题:用十四张问题账拆开环境、工具契约、控制循环、执行、验证、可靠性、安全、credit assignment 与长轨迹系统。
- [x] 使用 Grok Headless 扩展 Agent 候选路线;35 份新增 PDF 与 BFCL 的 ICML/PMLR 正式版本由主代理逐份回查,候选与正式证据永久分离。
- [x] 建立 Agent 正式研究账本:五层系统模型、五波历史主线、DeepSeek/Kimi 双谱系、四条因果链、四实验合同、常见误解与 52 节点阅读链。
- [x] 完成 Agent 首版正文与四联实验:控制循环、工具契约、pass@k / pass^k 可靠性、partial rollout / external KV / AgentENV 长程 RL 分开演示。
- [x] 论文库新增 TextWorld、WebArena、ToolSandbox、AgentDojo、RAGEN、Agent Lightning、AgentENV 等 34 个 Agent 节点,从 280 篇扩充至 314 篇。
- [x] Agent 真实 Chrome 断言通过:Direct/schema 故障传播、final-state verifier、pass@k / pass^k、非幂等副作用、wait-all 长尾、键盘 tabs 与 390px 移动端均正确响应。
- [x] Astro 类型检查、生产构建、17 个页面、792 个站内引用和 18 个跨页锚点通过;Agent 与既有九套专题本地 Chrome 全量回归无异常。
- [x] Agent 首版以源提交 `25982cb`、不可变镜像 `20260728T225618Z-25982cb` 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户、公开 Forgejo 与十套生产 Chrome 回归全链路通过。
- [x] 启动原生多模态专题:用十六张问题账拆开视觉语义空间、connector、Token 预算、OCR、视频、统一理解生成、RL、幻觉、评测、Agent 与系统。
- [x] 使用 Grok Headless 扩展七波、55+ 候选主线;218 行候选账与 1362 行正式一手证据账永久分离。
- [x] 本地完整校验 13 份多模态论文 PDF,并通过官方 arXiv HTML、作者仓库与既有 K2.5/K3 报告核验其余核心节点。
- [x] 完成原生多模态首版:30 个正文目录、DeepSeek-VL/VL2—Janus—OCR 三分支、Kimi 三代 MoonViT 与四联交互实验。
- [x] 论文库新增 ResNet、ALIGN、NaViT、DeepSeek-VL2、Janus、DeepSeek-OCR、Vision-R1 等 41 个节点,从 314 篇扩充至 355 篇。
- [x] 原生多模态真实 Chrome 断言通过:视觉 Token 超预算、K3 五维原生训练、OCR 报告 / 插值 / 证据外边界、vision-in-the-loop、键盘 tabs 与 390px 移动端均正确响应。
- [x] Astro 类型检查、生产构建、18 个页面、875 个站内引用和 17 个跨页锚点通过;多模态页面桌面 / 移动端无文档级横向溢出。
- [x] 原生多模态首版以源提交 `9f56732`、不可变镜像 `20260728T235248Z-9f56732` 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户、公开 Forgejo 与十一套生产 Chrome 回归全链路通过。
- [x] 启动推理服务与低成本部署专题:用十八本账拆开请求形状、SLO、权重、增长状态、内存分配、阶段、缓存、Kernel、推测、并行、网络、路由、故障与经济性。
- [x] 使用 Grok Headless 扩展 70 个候选节点;正式账本回查 26 份完整 PDF/TXT、官方会议页与 DeepSeek/Kimi 报告,候选与证据永久分离。
- [x] 完成推理服务首版:31 个正文目录、62 个一手节点、DeepSeek V2→V4 与 Mooncake→K3 双谱系,以及显存—阶段—推测—集群四联实验。
- [x] 论文库新增「推理服务」标签与 vLLM、SGLang、DistServe、Sarathi、FlashInfer、EAGLE-3、DeepGEMM、FlashMLA 等 45 个节点,从 355 篇扩充至 400 篇。
- [x] 推理服务真实 Chrome 断言通过:MHA OOM、chunked prefill 降低 stall、慢网络反噬 P/D、低验收率负加速、缓存故障重算、平均准入伤害短请求、键盘 tabs 与 390px 移动端均正确响应。
- [x] Astro 类型检查、生产构建、19 个页面、962 个站内引用和 16 个跨页锚点通过;推理服务页面桌面 / 移动端无文档级横向溢出。
- [x] 推理服务首版以源提交 `db2b7d3`、不可变镜像 `20260729T003946Z-db2b7d3` 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户、公开 Forgejo 与十二套生产 Chrome 回归全链路通过。
- [x] 启动评测与安全专题:用二十二张账拆开构念、指标、Prompt、采样、Harness、环境、Judge、污染、动态题、成本、威胁模型与披露。
- [x] 使用 Grok Headless 生成 12 个“协议陷阱”教学问题;全部保留在未核验 leads,正式事实回查一手论文与官方报告。
- [x] 本地缓存并校验 50 份新增 PDF/TXT,建立 1389 行正式研究账本、80 节点阅读链和 DeepSeek/K3 协议谱系。
- [x] 完成评测安全首版:33 个正文目录、二十二张测量账,以及指标校准—Judge 偏差—污染动态题—系统安全边界四联实验。
- [x] 论文库新增 BLEU、GLUE、HumanEval、MT-Bench、LiveBench、HarmBench、InjecAgent、AILuminate 等 50 个节点,从 400 篇扩充至 450 篇。
- [x] Astro 类型检查、生产构建、20 个页面、1053 个站内引用和 15 个跨页锚点通过;十三套专题 Chrome 回归、键盘 tabs 与 390px 移动端无异常。
- [x] 评测安全首版以源提交 `cfd2367`、不可变镜像 `20260729T013530Z-cfd2367` 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户、公开 Forgejo 与十三套生产 Chrome 回归全链路通过。
- [x] 启动表示、位置与残差专题:用二十张账拆开计算单位、接口参数、上下文化、位置对称性、外推、Norm 对象、拓扑、深度路由、激活极值与证据边界。
- [x] 使用 Grok Headless 扩展问题与候选论文;候选只保留在未核验 leads,66 节点正式阅读链全部回到一手论文与 K3/DeepSeek 官方报告。
- [x] 完成表示深度首版:29 个正文目录、二十张问题账,以及 Token/weight tying/context—位置几何—Norm/深度—Residual/FFN 四联实验。
- [x] 论文库新增 output embedding、ELMo、BLT、Fixup、ReZero、Hyper-Connections、mHC、xPos、FIRE、LongRoPE 等 30 个节点,从 450 篇扩充至 480 篇。
- [x] 表示深度真实 Chrome 断言通过:byte/subword、weight tying、RoPE/ALiBi/NoPE、Pre/Post/QK-Norm、mHC/AttnRes、V4 clamp/SiTU、键盘 tabs 与 390px 移动端均正确响应。
- [x] Astro 类型检查、生产构建、21 个页面、1145 个站内引用和 14 个跨页锚点通过;桌面 / 移动端无文档级横向溢出。
- [x] 表示深度与既有十三个专题共十四套本地真实 Chrome 回归全部通过。
- [x] 表示深度首版以源提交 `a2c9298`、不可变镜像 `20260729T023329Z-a2c9298` 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户、公开 Forgejo 与十四套生产 Chrome 回归全链路通过。
- [x] 启动 DeepSeek 二轮深读:Grok Headless 只用于发散候选问题,正式事实逐项回到 DeepSeek 论文、官方代码仓库与 K3 报告。
- [x] 建立 24 张正式问题账、10 次历史转向、4 个实验合同和 60 个一手 / 官方节点;明确 R1-Zero / R1、DAPO / Dr.GRPO、MLA RoPE cache、V3 FP8 角色与 V4/K3 状态边界。
- [x] 完成 DeepSeek 二轮正文:24 个目录、Dense→MoE→MLA→V3→R1→V3.2→V4 因果链、五条旁支、证据审计与稀疏容量—MLA 缓存—V3 协同—RL 偏差四联实验。
- [x] 论文库新增 DeepSeek-Coder/Coder-V2、ESFT、Prover-V1.5/V2 与 Engram 6 个节点,从 480 篇扩充至 486 篇。
- [x] DeepSeek 专属 Chrome 断言通过:24 张账、10 次转向、60 节点、MLA 576 元素、FP8 角色、DualPipe、MTP、GRPO/DAPO/Dr.GRPO、R1 身份、键盘 tabs 与 390px 移动端均正确响应。
- [x] Astro 类型检查、生产构建、21 个页面、1145 个站内引用和 14 个跨页锚点通过;DeepSeek 与既有十四专题共十五套本地真实 Chrome 回归全部通过。
- [x] DeepSeek 二轮以源提交 `cd96dab`、不可变镜像 `20260729T031901Z-cd96dab` 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户、公开 Forgejo 与十五套生产 Chrome 回归全链路通过。
- [x] 启动 K3 二轮深读:Grok Headless 只负责逐节查漏,候选问题、实验和红线保存在 `K3_GROK_LEADS.md`,正式结论逐项回到 47 页官方报告。
- [x] 建立 K3 正式研究账本:32 张问题账、Figure 1–16 / Table 1–5 视觉契约、8 个实验合同、完整数值红线与 100 节点阅读链。
- [x] 纠正 K3 原生多模态训练的旧表述:MoonViT-V2 从头训练,视觉与文本从训练开始在同一个 NTP objective 中联合优化,不采用“冻结语言模型再解冻”的 post-hoc 路线。
- [x] 完成 K3 二轮正文:30 个编号章节逐节覆盖架构、预训练、后训练、环境、系统、评测、案例与 XTML 附录,并与 DeepSeek / 17 个课程专题交叉链接。
- [x] 完成 K3 八联交互实验:Delta Rule、bounded decay、Block AttnRes、LatentMoE payload、SiTU-GLU、Quantile Balancing、MOPD/partial rollout、hybrid prefix cache。
- [x] K3 专属 Chrome 断言通过:32/21/100 内容计数、八个实验计算、键盘 tabs、事实纠错、桌面与 390px 移动端均无异常。
## 正在进行
- [ ] K3 三轮:使用开放权重与官方实现加入 KDA/AttnRes/MoE 真实 traces、FlashKDA kernel 对照、逐图数值重绘与独立复现。
- [ ] DeepSeek 三轮:真实专家负载、MLA kernel、FP8 / pipeline 与 R1-like RL traces,外加独立小模型复现。
- [ ] 表示、位置与残差二轮:真实 hidden-state / norm traces、长上下文位置外推复现与 mHC / AttnRes 深层稳定性消融。
- [ ] 评测安全二轮:真实 cross-harness / pass@k 复跑、Judge 元评测、动态污染与过拒案例。
- [ ] 推理服务二轮:真实 GPU kernel / workload traces、功耗与成本、跨 vLLM / SGLang / TensorRT-LLM 复现。
- [ ] 原生多模态二轮:真实视觉 Token traces、跨分辨率 / connector 消融、OCR 与视觉 Agent 安全失败案例。
- [ ] Agent 二轮:真实环境 traces、cross-harness ablation、Agent RL 训练曲线与提示注入案例。
- [ ] Transformer 二轮:多头电路逐图、Pre/Post-LN 真实 traces、Flash/KV kernel 与模型配置对照。
- [ ] 语言模型前史二轮:Kneser–Ney / LSTM / Bahdanau 逐图精读、真实小语料复现与 tokenizer 公平性案例。
- [ ] Scaling Laws 二轮精读:真实拟合复现、逐篇图表、置信区间、外推失败与更多模型族对照。
- [ ] 数据工程二轮:FineWeb / DCLM / Dolma / ROOTS 逐图精读、真实去重误伤、mixture traces 与污染案例。
- [ ] 大规模训练系统二轮:真实集群 traces、故障恢复案例与精确 topology / kernel 配置。
- [ ] 数值与稳定性二轮:真实 kernel 吞吐、长程失稳 traces、optimizer / quantization 逐图复现。
- [ ] 推理专题二轮:真实 pass@k 曲线、PRM 失败案例与逐篇图表精读。
- [ ] 长上下文专题的真实模型配置对比、内核细节与失败案例二轮深化。
- [ ] MoE 专题的真实集群 traces、专家特化案例与二轮外部证据。
## 研究账本
| 日期 | 决策/发现 | 影响 |
|---|---|---|
| 2026-07-28 | 网站命名为 **LLM Atlas / 大模型技术全景** | 既能容纳 K3 深读,也能承载完整 LLM 课程 |
| 2026-07-28 | K3 作为“汇流点”,不是课程起点 | 初学者可以先学基础,高阶读者可以从 K3 反向跳转 |
| 2026-07-28 | 优先重绘论文图并标明“简化/改绘” | 图可缩放、可交互,也减少脱离上下文复制论文图片 |
| 2026-07-28 | Grok 只用于线索扩展与交叉检查 | 正文事实必须回到论文、官方仓库或正式文档 |
| 2026-07-28 | 首批论文库按问题与专题多标签组织,推理研究后扩充至 146 篇 | 论文库承担发现入口,专题正文承担深度精读与机制复核 |
| 2026-07-28 | 源码公开到 `git.k1412.top/wuyang/llm-atlas` | 路线、进度、研究方法和内容变更均可追踪 |
| 2026-07-28 | 站点使用不可变镜像与 Compose Manager 部署 | 每次发布保留明确版本、健康检查和回滚点 |
| 2026-07-28 | 长上下文按计算、缓存、位置、状态容量、系统五张账单组织 | 避免把 FlashAttention、位置外推和“记住更久”混成同一个问题 |
| 2026-07-28 | 交互缓存数字统一标记为教学估算 | 展示增长规律,不冒充任一模型的真实线上显存基准 |
| 2026-07-28 | MoE 按六张账组织,路由算法与集群执行分开核算 | 避免用“稀疏所以便宜”跳过容量、负载、通信与权重读取 |
| 2026-07-28 | “aux-loss-free”保留论文真实边界 | 区分 selection bias、mixture weight、z-loss 与 V3 的极小 sequence-wise loss |
| 2026-07-29 | 推理专题按结果、覆盖、选择、过程、预算、优化、分布、系统八张账组织 | 避免把 pass@1、pass@k、搜索收益、RL 能力增长与系统吞吐混成“会思考” |
| 2026-07-29 | K3 partial rollout RL 与 MOPD 在正文中强制并排 | 前者显式容忍跨迭代 stale trajectory,后者由当前 student 采样并接收稠密 teacher signal |
| 2026-07-29 | 推理首版用 30 篇一手论文和三页签实验闭环 | 分开演示预算分配、GRPO 聚合偏置和 K3 九教师 MOPD,不合成伪“总分” |
| 2026-07-29 | 推理首版发布到既有 `llm-atlas` 生产链路 | Compose Manager、NPM host 31 / cert 41、10 路由与公网交互均复核通过 |
| 2026-07-29 | 训练系统按模型状态、激活、计算划分、气泡、collective、EP、CP、数值、可靠性九张账组织 | 任何优化都必须说明节省哪种资源、把成本移到哪里 |
| 2026-07-29 | 并行度不再机械写成 `DP×TP×PP×EP×CP` | 先定义 device mesh、group overlap 与作用范围,再核算 world size |
| 2026-07-29 | DeepSeek “近零通信”统一解释为特定 overlap 下的 exposed critical-path time | 防止把隐藏通信误写成没有传输字节 |
| 2026-07-29 | Grok 训练系统包只保留为 `TRAINING_SYSTEMS_GROK_LEADS.md` | 候选论文、数字和公式不得越过一手证据账本直接进入站点 |
| 2026-07-29 | 训练系统首版用四个独立实验闭环 | 显存、device mesh、pipeline 与通信不合成一个伪“系统总分” |
| 2026-07-29 | 论文库随训练系统一手链扩充到 166 篇 | 新增 checkpoint、mixed precision、自动并行、FSDP、MoE/CP 与大集群系统节点 |
| 2026-07-29 | 训练系统首版用不可变镜像 `20260728T172750Z-c6306fe` 发布 | 保留 `12010→8080`、NPM host 31 / cert 41 与公开 Forgejo;11 路由、关键资源和四页签生产交互全部复核 |
| 2026-07-29 | Scaling Laws 拆成观测量、模型、数据、算术、配比、配方、外推、经济目标与能力阶段九张账 | 防止把 `20 TPP`、`6ND`、MoE 总参、部署成本和“涌现”混成一条万能曲线 |
| 2026-07-29 | Grok 对 K3 报告存在性的错误保留在未核验 leads | 正式账本回到 arXiv `2607.24653` 与本地 47 页报告,展示来源分级为何必要 |
| 2026-07-29 | Scaling 首版用 29 个一手节点和四个独立实验闭环 | IsoFLOP、训练—部署、数据复用与指标涌现分开建模,不合成伪“规模总分” |
| 2026-07-29 | 论文库随 Scaling 一手链扩充到 182 篇 | 新增早期跨任务幂律、Gopher、数据受限、过训练、部署经济、复现和 task ladder 节点 |
| 2026-07-29 | Scaling 首版用不可变镜像 `20260728T181742Z-eff0e4c` 发布 | OCI digest `sha256:802e4041…cf83`;保留 `12010→8080`、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo |
| 2026-07-29 | 数据工程拆成来源、解析、语言、质量、唯一性、污染、混合、变换、Tokenizer、Packing、课程与价值十二张账 | 防止用一个“高质量 Token”标签掩盖单位、误删、治理与课程 |
| 2026-07-29 | Grok 数据研究包只保留为 `DATA_PRETRAINING_GROK_LEADS.md` | 模型发现候选不越过一手证据门槛;K3 总训练 Token、工业 mixture 和 source map 保持未知 |
| 2026-07-29 | K2 改写、K3 2.5×、V3/V4 packing 边界在正文主视区显式限定 | 不把早期 SimpleQA 对照外推为普遍定律,不把模型族收益归因给单一数据技巧 |
| 2026-07-29 | 数据工程首版用四个独立实验闭环 | 文档保留、去重误伤、领域 exposure 与改写课程分开建模,不合成伪“数据质量总分” |
| 2026-07-29 | 论文库新增数据标签并扩充到 202 篇 | 新增 CCNet、ROOTS、Dedup、DoReMi、DCLM、WRAP、MATES、MM1、Swallow 等 20 个节点 |
| 2026-07-29 | 数据工程首版用不可变镜像 `20260728T190932Z-ee0361b` 发布 | OCI digest `sha256:2fe8f3aa…59c8`;复用 `12010→8080`、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo |
| 2026-07-29 | 数值专题拆成表示、缩放、计算、累加、搬运、更新、参数化、观测、恢复与证据经济十张账 | 防止把一个 dtype 标签误当成完整训练配方 |
| 2026-07-29 | Grok 数值研究包只保留为 `NUMERICS_GROK_LEADS.md` | 40 个候选必须回到论文/官方报告核验;错误元数据和不可核实结论不进入正文 |
| 2026-07-29 | K2/K3 与 DeepSeek-V3/V4 数值谱系显式保留边界 | Per-Head Muon 不替代 QK-Clip;K3 2.5× 不归因单项技巧;V3 失败实验与高精度保留项不省略 |
| 2026-07-29 | 数值首版用四个独立实验闭环 | 格式误差、状态字节、矩阵更新与失稳防线分开建模,不合成伪“效率总分” |
| 2026-07-29 | 论文库新增「优化器」标签并扩充到 223 篇 | 新增 Shampoo、Adafactor、μP、8-bit optimizer、FP8-LM、FP4 training、稳定性代理等 21 个节点 |
| 2026-07-29 | 数值首版用不可变镜像 `20260728T200309Z-c21af18` 发布 | OCI digest `sha256:2155fd7f…c386`;复用 `12010→8080`、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo |
| 2026-07-29 | 语言模型前史拆成八张彼此独立的账 | 不再把 Tokenizer、平滑、Embedding、循环记忆、Seq2Seq 与系统成本压成一条“架构越来越强”的年表 |
| 2026-07-29 | Grok 语言模型候选与正式证据永久分离 | 45+ 候选只负责召回;正式 33 节点必须回到 DOI、ACL/PMLR/ISCA、出版社页面或官方技术报告 |
| 2026-07-29 | K3 / DeepSeek 的 NTP、MTP、多模态与 draft 分角色记账 | 统一视觉/文本 next-token objective 不排斥 one MTP layer;MTP 与 speculative draft 都不写成取消自回归 |
| 2026-07-29 | 论文库扩充到 247 篇 | 新增 Shannon 1951、Good、Katz、Kneser–Ney、LSTM、RNNLM、Seq2Seq 前夜与输出成本等 24 个一手节点 |
| 2026-07-29 | 语言模型前史首版用不可变镜像 `20260728T204916Z-a54152d` 发布 | OCI digest `sha256:fb646aba…fe923`;复用 `12010→8080`、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo |
| 2026-07-29 | Transformer 按十张问题账组织 | 不再把 QKV、Mask、位置、Norm、训练目标、KV Cache、Flash 与当代架构压成一个“Block” |
| 2026-07-29 | Attention 权重与因果解释永久分离 | 热力图只描述中间计算和提出假设;因果结论需要消融、patching 或反事实干预 |
| 2026-07-29 | 论文库扩充到 258 篇 | 新增 Residual/Norm、relative position、UniLM、多头冗余、解释争论与 NormFormer 等 11 个节点 |
| 2026-07-29 | Transformer 深度首版用不可变镜像 `20260728T212813Z-252e7d6` 发布 | OCI digest `sha256:db003faa…59fa`;复用 `12010→8080`、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo |
| 2026-07-29 | Alignment 拆成十二张彼此独立的账 | 防止把“更会答”“更符合偏好”“更安全”“更可验证”压成同一个 alignment 分数 |
| 2026-07-29 | Grok Alignment 线索与正式证据永久分离 | 45 条候选只负责查漏;公式、数字和历史结论必须回到一手 PDF / 会议页面 |
| 2026-07-29 | DeepSeek 与 Kimi 后训练按阶段合同重建 | R1-Zero 不外推为完整 R1;K3 partial rollout 与 MOPD 不混写;DPO 不被描述成取消偏好数据 |
| 2026-07-29 | Alignment 首版用 44 个一手节点与四个独立实验闭环 | SFT token mask、RM 偏置、PPO/DPO 更新与模型配方分开演示,不合成伪“对齐总分” |
| 2026-07-29 | 论文库扩充到 280 篇 | 新增 22 个 SFT、偏好、RM、RLAIF、直接偏好优化与后训练评测节点 |
| 2026-07-29 | Alignment 首版用不可变镜像 `20260728T220753Z-8378e2a` 发布 | OCI digest `sha256:ef3ad2a8…3048a`;复用 `12010→8080`、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo |
| 2026-07-29 | Agent 按十四张彼此独立的问题账组织 | 模型、harness、工具、环境、验证器、可靠性与安全不再被压成一个 Agent 分数 |
| 2026-07-29 | Agent 完成必须回到 final state | function schema、工具执行、业务状态、策略合规与 pass^k 分层评价;模型自报完成不作为证据 |
| 2026-07-29 | DeepSeek 与 Kimi Agent 谱系显式保留系统边界 | V3.2/V4 的训练环境与 DSec、K3 的 white-box harness/AET/AgentENV 分层说明,不把模型、脚手架和基础设施混写 |
| 2026-07-29 | Grok Agent 线索与正式证据永久分离 | 候选只负责查漏;公式、数字和系统结论必须回到一手论文、正式会议版本或官方报告 |
| 2026-07-29 | 论文库扩充到 314 篇 | 新增 34 个环境、工具、Web/SWE/桌面 Agent、可靠性、安全与 Agent RL 节点 |
| 2026-07-29 | Agent 首版用不可变镜像 `20260728T225618Z-25982cb` 发布 | OCI digest `sha256:a781ad92…ba52`;复用 `12010→8080`、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo |
| 2026-07-29 | 原生多模态按五层管道与十六张账组织 | 像素、视觉塔、压缩 / connector、主干与输出 / 工具闭环分开定位;“原生”再拆成数据、目标、优化、输入输出与 Agent 五维 |
| 2026-07-29 | Grok 多模态召回与正式证据永久分离 | 218 行候选账只做查漏;1362 行正式账本只接受一手论文、官方报告与可计算公式 |
| 2026-07-29 | DeepSeek 多模态永久保留三分支 | VL/VL2 的理解、Janus 的统一生成、OCR 的光学上下文压缩不画成错误单向代际谱系 |
| 2026-07-29 | Kimi 三代 MoonViT 按训练制度重建 | Kimi-VL 的 SigLIP + caption / 对齐,K2.5 的共享图像视频 / zero-vision SFT,K3 的从头共同 NTP 分开说明 |
| 2026-07-29 | 光学压缩实验显式分三级证据 | DeepSeek-OCR 报告锚点、中间教学插值与超过已核范围的“不外推”在交互中使用不同状态 |
| 2026-07-29 | 论文库扩充到 355 篇 | 新增 41 个视觉表示、连接器、分辨率、OCR、视频、统一生成、评测与视觉 RL 节点 |
| 2026-07-29 | 原生多模态首版用不可变镜像 `20260728T235248Z-9f56732` 发布 | OCI digest `sha256:b9c66e4e…07955`;复用 `12010→8080`、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo |
| 2026-07-29 | 推理服务拆成十八本彼此独立的账 | 权重、增长状态、分配、阶段、batch、cache、kernel、推测、量化、网络、路由、故障与经济性不再压成一个 tokens/s |
| 2026-07-29 | Grok 推理服务召回与正式证据永久分离 | 70 个候选节点只负责查漏;26 份完整 PDF/TXT、会议页、官方仓库和模型报告承载正文事实 |
| 2026-07-29 | DeepSeek 与 Kimi 服务谱系按状态对象重建 | MLA→V4 异构状态和 Mooncake→KDA→K3 混合缓存分开讲,精确 KV 公式不套到异构状态上 |
| 2026-07-29 | 论文库扩充到 400 篇 | 新增 45 个内存管理、调度、缓存、P/D 解耦、量化、推测解码、kernel 与真实 workload 节点 |
| 2026-07-29 | 推理服务首版用四个独立实验闭环 | 显存、阶段干扰、推测验收和集群状态分开建模;作者报告、教学估算与 benchmark 永久分级 |
| 2026-07-29 | 推理服务首版用不可变镜像 `20260729T003946Z-db2b7d3` 发布 | OCI digest `sha256:06374603…fe752`;复用 `12010→8080`、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo |
| 2026-07-29 | 评测安全按二十二张测量账组织 | 构念、样本、指标、Prompt、采样、Harness、裁判、污染、成本与威胁模型不再压成一个榜单分 |
| 2026-07-29 | Grok 评测线索与正式证据永久分离 | 12 个协议陷阱只负责教学查漏;50 份新增一手全文与 DeepSeek/K3 官方报告承载正文事实 |
| 2026-07-29 | DeepSeek 与 K3 评测谱系按协议字段重建 | R1 的非零温多采样 pass@1、V4 effort / context / tool budget 与 K3 §6 task-specific harness 分层说明 |
| 2026-07-29 | 论文库扩充到 450 篇 | 新增 50 个指标、套件、动态基准、Judge、代码 Verifier、安全与 Agent 风险节点 |
| 2026-07-29 | 评测安全首版用四个独立实验闭环 | 指标/校准、Judge/Arena、污染/动态题、系统/安全边界分开建模,不合成伪“模型总分” |
| 2026-07-29 | 评测安全首版用不可变镜像 `20260729T013530Z-cfd2367` 发布 | OCI digest `sha256:3c4c34a8…50be6`;复用 `12010→8080`、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo |
| 2026-07-29 | 表示与深度按二十张问题账组织 | 计算单位、接口参数、上下文化、位置、外推、Norm 对象、拓扑、残差路由与非线性极值不再混成一个 hidden-state 名词 |
| 2026-07-29 | Grok 表示候选与正式证据永久分离 | 候选问题和论文只负责查漏;66 节点正式链只接受一手论文与 K3/DeepSeek 官方报告 |
| 2026-07-29 | K3 Block AttnRes 来源数按原报告重算 | 93 层按 12 层形成 8 个 layer blocks(7 个完整块加 1 个尾块),加 embedding 后共 9 个 block-level 来源 |
| 2026-07-29 | DeepSeek 与 Kimi 的位置/深度稳定化分开建模 | V2 decoupled RoPE、V4 partial RoPE/mHC/clamp 与 K3 MLA NoPE、KDA、AttnRes/SiTU 不压成单一代际结论 |
| 2026-07-29 | 论文库扩充到 480 篇 | 新增 30 个表示、位置、归一化、残差拓扑、激活函数与深层稳定性节点 |
| 2026-07-29 | 表示深度首版用四个独立实验闭环 | Token 接口、位置几何、Norm/深度、Residual/FFN 分开操作;报告事实、数学推导与 toy model 永久分级 |
| 2026-07-29 | 表示深度首版用不可变镜像 `20260729T023329Z-a2c9298` 发布 | OCI digest `sha256:93c88bf2…145a23`;复用 `12010→8080`、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo;保留 `20260729T013530Z-cfd2367` 回滚 |
| 2026-07-29 | DeepSeek 二轮按二十四张对象账与十次问题转向重建 | total/active、KV state、通信、数值角色、奖励偏差与长程状态不再压成单一“效率” |
| 2026-07-29 | Grok DeepSeek 候选与正式证据永久分离 | 候选只负责问题召回;60 节点正式链只接受一手论文、DeepSeek 官方仓库和 K3 官方报告 |
| 2026-07-29 | R1-Zero、正式 R1、蒸馏与后续复现分四种身份 | “无 reasoning SFT”不外推为无预训练先验;DAPO / Dr.GRPO 不冒充 DeepSeek 内部 R1 recipe |
| 2026-07-29 | V4 与 K3 按状态机器而非 1M 标签对照 | CSA/HCA、mHC 与 KDA/MLA、AttnRes 分开;主模型 AttnRes 12 层 block 不与芯片 nano-model block size 2 混写 |
| 2026-07-29 | 论文库扩充到 486 篇 | 新增 DeepSeek-Coder/Coder-V2、ESFT、Prover-V1.5/V2 与 Engram 6 个旁支节点 |
| 2026-07-29 | DeepSeek 二轮用四个独立实验闭环 | 稀疏容量、MLA 缓存、V3 协同与 RL 偏差分别操作;精确公式、作者报告和 teaching model 永久分级 |
| 2026-07-29 | DeepSeek 二轮用不可变镜像 `20260729T031901Z-cd96dab` 发布 | OCI digest `sha256:4bfb3faf…fa3968`;复用 `12010→8080`、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo;保留 `20260729T023329Z-a2c9298` 回滚 |
| 2026-07-29 | K3 二轮按 32 张对象账与完整报告顺序重建 | total/active、2.5×、KDA state、深度来源、专家路由、视觉目标、轨迹、缓存与评测协议不再压成一页组件摘要 |
| 2026-07-29 | K3 原生视觉事实回到 §2.4 / §3.3 核验 | 删除“先冻结语言模型再解冻”旧表述;明确 MoonViT-V2 从头训练,视觉/文本从开始共同 NTP |
| 2026-07-29 | K3 Figure 1–16 / Table 1–5 全部建立课程视觉契约 | 每张图同时写支持范围与不可外推项;作者报告、论文、推导与 toy model 使用 R/P/D/T 标签 |
| 2026-07-29 | K3 二轮用八个独立实验闭环 | Delta memory、BF16 decay、AttnRes、LatentMoE、SiTU、QB、MOPD/RL 与 prefix cache 分开操作,不合成伪“架构总分” |
## 未决问题
- K3 报告给出了多项公开组件的整合方式;独立论文与 K3 内部最终实现之间仍需逐项对照。
- 公开技术报告不会披露完整数据配比和训练细节;网站会把“已知”“合理推断”“未知”分开。
- 2026 年模型与榜单变化快,所有动态比较都必须带研究截止日期。