Files
llm-atlas/PROGRESS.md
T

375 lines
62 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 持续进度
最后更新:2026-07-29
## 总体状态
| 工作流 | 状态 | 完成度 | 下一检查点 |
|---|---:|---:|---|
| 研究框架与规范 | 进行中 | 83% | Scaling Laws 二轮拟合复现与逐图精读 |
| 网站设计系统 | 进行中 | 89% | 打印样式与更多通用可视化组件 |
| Kimi K3 深读 | 三轮实证进行中 | 94% | 接入真实 hidden-state / expert-load / cache traces,并重绘报告数值图 |
| 语言模型前史 | 完成首版 | 78% | Kneser–Ney、LSTM、Bahdanau 逐图精读与真实小语料复现 |
| Transformer 基础 | 完成首版 | 79% | 多头电路、归一化 traces 与真实 kernel / KV 配置 |
| 表示、位置与残差高速公路 | 完成首版 | 81% | 真实 hidden-state / norm traces、长上下文位置外推与深层稳定性消融 |
| Scaling Laws | 完成首版 | 74% | 真实拟合复现、置信区间与更多模型族对照 |
| 数据工程与预训练配方 | 完成首版 | 73% | FineWeb / DCLM 逐图精读、真实去重误伤与 mixture traces |
| DeepSeek 专题 | 三轮实证进行中 | 95% | SM90 FlashMLA kernel、完整 27 层、EOS / 角色 / 多 filler / 内容正交控制、FP8/pipeline 与 R1-like RL 复现 |
| 指令微调与人类偏好 | 完成首版 | 75% | 真实偏好分歧、RM 长度偏置与 PPO/DPO 小模型复现 |
| 推理与测试时扩展 | 完成首版 | 76% | 真实模型采样曲线、PRM 案例与逐篇图表精读 |
| 工具使用与长程 Agent | 完成首版 | 74% | 真实环境 traces、cross-harness 对照、Agent RL 曲线与安全案例 |
| 原生多模态 | 完成首版 | 76% | 真实视觉 Token traces、跨分辨率消融、OCR 失败案例与视觉 Agent 安全轨迹 |
| 稀疏计算与 MoE | 完成首版 | 74% | 真实负载 traces 与专家特化案例 |
| 长上下文专题 | 完成首版 | 72% | 真实模型配置、内核细节与失败案例 |
| 大规模训练系统 | 完成首版 | 71% | 真实集群 traces、故障案例与精确 topology 配置 |
| 推理服务与低成本部署 | 完成首版 | 78% | 真实 GPU kernel / workload traces、功耗与跨框架复现 |
| 数值精度、优化器与稳定性 | 完成首版 | 75% | 真实 kernel 吞吐、长程训练 traces 与逐图论文精读 |
| 评测、安全与“到底强不强” | 完成首版 | 79% | 真实 cross-harness 复跑、Judge 元评测与动态污染案例 |
| 引用与事实检查 | 进行中 | 57% | 自动化外链复查与来源等级扩展 |
| 开源仓库 | 已完成首版 | 100% | 持续提交研究与网站迭代 |
| k1412 部署 | 已完成首版 | 100% | 每轮发布保留不可变镜像与回滚点 |
## 已完成
- [x] 建立长期任务目标与阶段计划。
- [x] 确认 K3 官方 47 页技术报告与官方模型仓库。
- [x] 提取技术报告目录与 151 条参考来源,建立本地只读研究缓存。
- [x] 从报告反推出 17 个专题与三条贯穿案例。
- [x] 提炼参考网站的编辑设计语言。
- [x] 确认 `git.k1412.top` 为 Gitea/Forgejo 兼容服务且本机 HTTPS 凭据可用于既有仓库。
- [x] 使用 Grok CLI 检索并形成约 95 篇一手论文的补充路线,主代理已回查关键来源。
- [x] 完成 486 篇关键论文索引,覆盖 16 个标签专题与 Kimi/DeepSeek 聚光主线。
- [x] 完成可检索、可按专题筛选的论文库页面。
- [x] 完成 K3、语言模型前史、Transformer 基础、表示/位置/残差、DeepSeek 谱系、Scaling Laws、数据工程、长上下文、MoE、指令微调与人类偏好、推理、Agent、原生多模态、训练系统、推理服务、数值优化与评测安全十七篇首版长文。
- [x] 完成 K3 三轴架构、八联报告实验与四联开放工件实验、语言模型前史四联实验、Transformer 四联实验、表示深度四联实验、DeepSeek 十三联实验、长上下文、MoE 路由、推理三页签,以及训练系统、推理服务、Scaling、数据工程、数值、Alignment、Agent、原生多模态与评测安全专题各四页签等八十个原创交互视图。
- [x] 完成长上下文首版:五张成本账、26 篇一手论文、10+ 机制图与 8 策略交互实验室。
- [x] 核验 FlashAttention、DeepSeek-V2/V3.2/V4、Kimi Linear/K3 等六份论文原文,并建立长上下文研究账本。
- [x] 核验 Switch、ST-MoE、DeepSeekMoE、Loss-Free、V3、LatentMoE 与 K3 原文,并建立 MoE 研究账本。
- [x] 完成 MoE 首版:六张账、19 篇一手论文、完整 DeepSeek/K3 主线与路由—容量—通信实验室。
- [x] 为推理专题缓存并核验 23 份一手论文,另复用 K3 原报告,建立 24 份来源的研究账本。
- [x] 明确 CoT / verifier / test-time compute、PPO → GRPO、DeepSeek-R1 与 Kimi k1.5 → K3 四条主线。
- [x] 分清 K3 partial rollout 的 off-policy 稳定化与 MOPD 的 student on-policy 逐 Token 蒸馏。
- [x] 完成推理首版:八张账、30 篇一手论文链、DeepSeek/Kimi 双主线与预算—GRPO—MOPD 三页签实验室。
- [x] 推理首版以提交 `dce94b2`、不可变镜像 `20260728T164043Z-dce94b2` 发布;NAS/VPS/HTTPS/生产 Chrome 全链路通过。
- [x] 训练系统专题完成首轮证据账本:九张资源账、37 个一手节点、DeepSeek-V2/V3/V4 与 Kimi K2/K2.5/K3 系统谱系。
- [x] 缓存并核验 18 篇训练系统核心论文,逐项校正 ZeRO 字节账、pipeline bubble、collective 口径、context parallel 与 MoonEP 上界。
- [x] 将 Grok 产物降级为明确标注的未核验 leads;正式账本只采用回查一手论文后的结论。
- [x] 完成训练系统首版:15 节长文、37 个一手节点、12 类机制图与显存—网格—气泡—通信四页签实验室。
- [x] 训练系统真实 Chrome 断言通过:OOM、无效 mesh、DualPipe 参数副本、overlap 与 MoonEP buffer 均正确响应。
- [x] Astro 类型检查、生产构建、12 个内部路由、464 个站内引用和桌面/移动端视觉检查通过。
- [x] 训练系统首版以提交 `c6306fe`、不可变镜像 `20260728T172750Z-c6306fe` 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书与生产 Chrome 全链路通过。
- [x] 创建 `wuyang/llm-atlas` 公开仓库,匿名 API 确认 `private: false`。
- [x] 当前生产镜像通过健康检查、16 个页面路由、关键资源与九套专题生产 Chrome 回归。
- [x] 通过 Unraid Compose Manager、Nginx Proxy Manager 与 HTTPS 发布首版。
- [x] 启动 Scaling Laws 专题:缓存 22 篇新的一手论文,建立九张账、DeepSeek / Kimi 双谱系与四实验首轮证据框架。
- [x] 使用 Grok Headless 扩展 Scaling 候选路线,并纠正其对 K3 正式报告存在性的错误;线索与正式账本分离。
- [x] 完成 Scaling Laws 首版:16 节长文、29 个一手节点、九张账与曲面—部署—复用—涌现四联实验。
- [x] Scaling 真实 Chrome 断言通过:IsoFLOP 谷底、生命周期最优点、重复数据衰减和指标阶跃均正确响应。
- [x] 对 Scaling、训练系统、推理与 MoE 执行全量浏览器回归;12 项桌面导航、移动菜单和首页新章入口无回归。
- [x] Scaling 首版以提交 `eff0e4c`、不可变镜像 `20260728T181742Z-eff0e4c` 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、12 路由与生产 Chrome 全链路通过。
- [x] 启动数据工程专题:回查 K3/K2、DeepSeek LLM/Math/V2/V3/V4 数据章节,并将 Grok 线索永久隔离为未核验候选。
- [x] 建立 1264 行正式研究账本:十二张账、2019→2026 历史主线、DeepSeek/Kimi 双谱系、四实验合同与公开未知项。
- [x] 完成数据工程首版:18 节长文、31 个一手节点、十余组机制图与流水线—去重—混合—改写四联实验。
- [x] 论文库新增「数据」标签与 20 个一手节点,从 182 篇扩充至 202 篇。
- [x] 数据工程真实 Chrome 断言通过:激进过滤、semantic 去重误伤、数学 mixture 和失控合成均正确响应,桌面 / 390px 移动端无溢出。
- [x] 对 Scaling、训练系统、推理与 MoE 重新执行全量浏览器回归;13 项桌面 / 移动导航和首页数据新章入口无回归。
- [x] Astro 类型检查、生产构建、13 个页面路由、527 个站内引用和 20 个跨页锚点全部通过。
- [x] 数据工程首版以源提交 `ee0361b`、不可变镜像 `20260728T190932Z-ee0361b` 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、13 路由、门户与生产 Chrome 全链路通过。
- [x] 启动数值精度、优化器与稳定性专题:回查 K2/K3、DeepSeek-V3/V4 原文,并缓存核验 mixed precision、BF16、FP8、MX、QAT、AdamW、μP、Muon 与稳定性论文。
- [x] 使用 Grok Headless 扩展 40 个候选节点;将错误年份、不可核实新稿和无一手证据结论保留在独立 leads,不进入正式账本。
- [x] 建立数值专题正式研究账本:十张数值账、格式/量化/优化器/稳定性主线、DeepSeek/Kimi 双谱系、四实验合同与公开未知项。
- [x] 完成数值专题首版:19 节长文、36 个一手节点、十余组机制图与格式—状态—更新—失稳四联实验。
- [x] 论文库新增「优化器」标签与 21 个一手节点,从 202 篇扩充至 223 篇。
- [x] 数值专题真实 Chrome 断言通过:FP16 subnormal、E4M3 overflow、MX block outlier、状态字节、Full/Per-Head Muon 与四类稳定性防线均正确响应。
- [x] 对数据工程、Scaling、训练系统、推理与 MoE 重新执行全量浏览器回归;14 项桌面 / 移动导航和首页数值新章入口无回归。
- [x] Astro 类型检查、生产构建、14 个页面路由、593 个站内引用和 19 个跨页锚点全部通过。
- [x] 数值专题首版以源提交 `c21af18`、不可变镜像 `20260728T200309Z-c21af18` 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、14 路由、门户、公开 Forgejo 与生产 Chrome 全链路通过。
- [x] 启动语言模型前史专题:以八张独立问题账拆开预测单位、概率信息、上下文、稀疏性、表示、记忆、转导与成本,避免伪单线架构史。
- [x] 使用 Grok Headless 扩展 45+ 候选一手节点;将错误元数据、过强因果和未核实旧论文永久保留在独立 leads。
- [x] 建立语言模型前史正式研究账本:33 个正式节点、逐篇旧瓶颈/贡献/遗留问题、四实验合同与 19 组原创重绘清单。
- [x] 完成语言模型前史首版:20 段长文、Shannon → N-gram → neural LM → RNN/LSTM → Seq2Seq/Attention 完整问题链,以及 DeepSeek/K3 当代回声。
- [x] 论文库新增 24 个语言模型前史节点,从 223 篇扩充至 247 篇;DeepSeek-V3/V4 与 K3 补充「基础」映射。
- [x] 语言模型前史真实 Chrome 断言通过:零概率/平滑、one-hot 选择、指数记忆衰减、Attention 对齐、键盘 tabs 与 390px 移动端均正确响应。
- [x] 语言模型前史首版以源提交 `a54152d`、不可变镜像 `20260728T204916Z-a54152d` 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、15 路由、门户、公开 Forgejo 与七套生产 Chrome 回归全链路通过。
- [x] 启动 Transformer 深度专题:以十张问题账拆开信息路径、匹配几何、可见性、多头、位置、局部计算、深度、架构目标、系统成本与当代映射。
- [x] 使用 Grok Headless 扩展 50 个候选节点;候选元数据与过强归因永久隔离在 `TRANSFORMER_GROK_LEADS.md`。
- [x] 建立 Transformer 正式研究账本:40 个节点、DeepSeek V2→V4 与 Kimi Linear→K3 双谱系、四实验合同与解释边界。
- [x] 完成 Transformer 深度首版:21 段正文与 QKV—Mask—多头位置—Block 成本四联实验。
- [x] 论文库补齐 Residual/Norm、相对位置、UniLM、多头冗余与解释争论等 11 个节点,从 247 篇扩充至 258 篇。
- [x] Transformer 深度首版以源提交 `252e7d6`、不可变镜像 `20260728T212813Z-252e7d6` 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、15 路由、门户、公开 Forgejo 与八套生产 Chrome 回归全链路通过。
- [x] 启动 Alignment 专题:按十二张账拆开目标、监督、SFT、偏好、RM、策略更新、直接优化、分布、约束、失效与证据,避免把 SFT / RLHF / DPO 写成彼此替代的三代技术。
- [x] 缓存并核验 24 份新的一手论文全文,复用 DeepSeek / Kimi / MOPD 报告,建立 44 节点正式论文链;Grok 45 条候选另存为未核验 leads。
- [x] 完成 Alignment 首版:22 节长文、十二张账、DeepSeek/Kimi 后训练双谱系,以及 SFT—偏好/RM—PPO/DPO—配方比较四联实验。
- [x] 论文库新增人类偏好学习、HH-RLHF、LIMA、RLAIF、RewardBench、KTO、ORPO、SimPO 等 22 个节点,从 258 篇扩充至 280 篇。
- [x] Alignment 真实 Chrome 断言通过:response-only / all-token SFT mask、both-bad preference、DPO 陈旧分布、K3 九教师配方、键盘 tabs 与 390px 移动端均正确响应。
- [x] Astro 类型检查、生产构建、16 个页面、713 个站内引用和 17 个跨页锚点通过;九套专题公网 Chrome 回归无异常。
- [x] Alignment 首版以源提交 `8378e2a`、不可变镜像 `20260728T220753Z-8378e2a` 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户与公开 Forgejo 全链路通过。
- [x] 启动 Agent 专题:用十四张问题账拆开环境、工具契约、控制循环、执行、验证、可靠性、安全、credit assignment 与长轨迹系统。
- [x] 使用 Grok Headless 扩展 Agent 候选路线;35 份新增 PDF 与 BFCL 的 ICML/PMLR 正式版本由主代理逐份回查,候选与正式证据永久分离。
- [x] 建立 Agent 正式研究账本:五层系统模型、五波历史主线、DeepSeek/Kimi 双谱系、四条因果链、四实验合同、常见误解与 52 节点阅读链。
- [x] 完成 Agent 首版正文与四联实验:控制循环、工具契约、pass@k / pass^k 可靠性、partial rollout / external KV / AgentENV 长程 RL 分开演示。
- [x] 论文库新增 TextWorld、WebArena、ToolSandbox、AgentDojo、RAGEN、Agent Lightning、AgentENV 等 34 个 Agent 节点,从 280 篇扩充至 314 篇。
- [x] Agent 真实 Chrome 断言通过:Direct/schema 故障传播、final-state verifier、pass@k / pass^k、非幂等副作用、wait-all 长尾、键盘 tabs 与 390px 移动端均正确响应。
- [x] Astro 类型检查、生产构建、17 个页面、792 个站内引用和 18 个跨页锚点通过;Agent 与既有九套专题本地 Chrome 全量回归无异常。
- [x] Agent 首版以源提交 `25982cb`、不可变镜像 `20260728T225618Z-25982cb` 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户、公开 Forgejo 与十套生产 Chrome 回归全链路通过。
- [x] 启动原生多模态专题:用十六张问题账拆开视觉语义空间、connector、Token 预算、OCR、视频、统一理解生成、RL、幻觉、评测、Agent 与系统。
- [x] 使用 Grok Headless 扩展七波、55+ 候选主线;218 行候选账与 1362 行正式一手证据账永久分离。
- [x] 本地完整校验 13 份多模态论文 PDF,并通过官方 arXiv HTML、作者仓库与既有 K2.5/K3 报告核验其余核心节点。
- [x] 完成原生多模态首版:30 个正文目录、DeepSeek-VL/VL2—Janus—OCR 三分支、Kimi 三代 MoonViT 与四联交互实验。
- [x] 论文库新增 ResNet、ALIGN、NaViT、DeepSeek-VL2、Janus、DeepSeek-OCR、Vision-R1 等 41 个节点,从 314 篇扩充至 355 篇。
- [x] 原生多模态真实 Chrome 断言通过:视觉 Token 超预算、K3 五维原生训练、OCR 报告 / 插值 / 证据外边界、vision-in-the-loop、键盘 tabs 与 390px 移动端均正确响应。
- [x] Astro 类型检查、生产构建、18 个页面、875 个站内引用和 17 个跨页锚点通过;多模态页面桌面 / 移动端无文档级横向溢出。
- [x] 原生多模态首版以源提交 `9f56732`、不可变镜像 `20260728T235248Z-9f56732` 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户、公开 Forgejo 与十一套生产 Chrome 回归全链路通过。
- [x] 启动推理服务与低成本部署专题:用十八本账拆开请求形状、SLO、权重、增长状态、内存分配、阶段、缓存、Kernel、推测、并行、网络、路由、故障与经济性。
- [x] 使用 Grok Headless 扩展 70 个候选节点;正式账本回查 26 份完整 PDF/TXT、官方会议页与 DeepSeek/Kimi 报告,候选与证据永久分离。
- [x] 完成推理服务首版:31 个正文目录、62 个一手节点、DeepSeek V2→V4 与 Mooncake→K3 双谱系,以及显存—阶段—推测—集群四联实验。
- [x] 论文库新增「推理服务」标签与 vLLM、SGLang、DistServe、Sarathi、FlashInfer、EAGLE-3、DeepGEMM、FlashMLA 等 45 个节点,从 355 篇扩充至 400 篇。
- [x] 推理服务真实 Chrome 断言通过:MHA OOM、chunked prefill 降低 stall、慢网络反噬 P/D、低验收率负加速、缓存故障重算、平均准入伤害短请求、键盘 tabs 与 390px 移动端均正确响应。
- [x] Astro 类型检查、生产构建、19 个页面、962 个站内引用和 16 个跨页锚点通过;推理服务页面桌面 / 移动端无文档级横向溢出。
- [x] 推理服务首版以源提交 `db2b7d3`、不可变镜像 `20260729T003946Z-db2b7d3` 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户、公开 Forgejo 与十二套生产 Chrome 回归全链路通过。
- [x] 启动评测与安全专题:用二十二张账拆开构念、指标、Prompt、采样、Harness、环境、Judge、污染、动态题、成本、威胁模型与披露。
- [x] 使用 Grok Headless 生成 12 个“协议陷阱”教学问题;全部保留在未核验 leads,正式事实回查一手论文与官方报告。
- [x] 本地缓存并校验 50 份新增 PDF/TXT,建立 1389 行正式研究账本、80 节点阅读链和 DeepSeek/K3 协议谱系。
- [x] 完成评测安全首版:33 个正文目录、二十二张测量账,以及指标校准—Judge 偏差—污染动态题—系统安全边界四联实验。
- [x] 论文库新增 BLEU、GLUE、HumanEval、MT-Bench、LiveBench、HarmBench、InjecAgent、AILuminate 等 50 个节点,从 400 篇扩充至 450 篇。
- [x] Astro 类型检查、生产构建、20 个页面、1053 个站内引用和 15 个跨页锚点通过;十三套专题 Chrome 回归、键盘 tabs 与 390px 移动端无异常。
- [x] 评测安全首版以源提交 `cfd2367`、不可变镜像 `20260729T013530Z-cfd2367` 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户、公开 Forgejo 与十三套生产 Chrome 回归全链路通过。
- [x] 启动表示、位置与残差专题:用二十张账拆开计算单位、接口参数、上下文化、位置对称性、外推、Norm 对象、拓扑、深度路由、激活极值与证据边界。
- [x] 使用 Grok Headless 扩展问题与候选论文;候选只保留在未核验 leads,66 节点正式阅读链全部回到一手论文与 K3/DeepSeek 官方报告。
- [x] 完成表示深度首版:29 个正文目录、二十张问题账,以及 Token/weight tying/context—位置几何—Norm/深度—Residual/FFN 四联实验。
- [x] 论文库新增 output embedding、ELMo、BLT、Fixup、ReZero、Hyper-Connections、mHC、xPos、FIRE、LongRoPE 等 30 个节点,从 450 篇扩充至 480 篇。
- [x] 表示深度真实 Chrome 断言通过:byte/subword、weight tying、RoPE/ALiBi/NoPE、Pre/Post/QK-Norm、mHC/AttnRes、V4 clamp/SiTU、键盘 tabs 与 390px 移动端均正确响应。
- [x] Astro 类型检查、生产构建、21 个页面、1145 个站内引用和 14 个跨页锚点通过;桌面 / 移动端无文档级横向溢出。
- [x] 表示深度与既有十三个专题共十四套本地真实 Chrome 回归全部通过。
- [x] 表示深度首版以源提交 `a2c9298`、不可变镜像 `20260729T023329Z-a2c9298` 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户、公开 Forgejo 与十四套生产 Chrome 回归全链路通过。
- [x] 启动 DeepSeek 二轮深读:Grok Headless 只用于发散候选问题,正式事实逐项回到 DeepSeek 论文、官方代码仓库与 K3 报告。
- [x] 建立 24 张正式问题账、10 次历史转向、4 个实验合同和 60 个一手 / 官方节点;明确 R1-Zero / R1、DAPO / Dr.GRPO、MLA RoPE cache、V3 FP8 角色与 V4/K3 状态边界。
- [x] 完成 DeepSeek 二轮正文:24 个目录、Dense→MoE→MLA→V3→R1→V3.2→V4 因果链、五条旁支、证据审计与稀疏容量—MLA 缓存—V3 协同—RL 偏差四联实验。
- [x] 论文库新增 DeepSeek-Coder/Coder-V2、ESFT、Prover-V1.5/V2 与 Engram 6 个节点,从 480 篇扩充至 486 篇。
- [x] DeepSeek 专属 Chrome 断言通过:24 张账、10 次转向、60 节点、MLA 576 元素、FP8 角色、DualPipe、MTP、GRPO/DAPO/Dr.GRPO、R1 身份、键盘 tabs 与 390px 移动端均正确响应。
- [x] Astro 类型检查、生产构建、21 个页面、1145 个站内引用和 14 个跨页锚点通过;DeepSeek 与既有十四专题共十五套本地真实 Chrome 回归全部通过。
- [x] DeepSeek 二轮以源提交 `cd96dab`、不可变镜像 `20260729T031901Z-cd96dab` 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户、公开 Forgejo 与十五套生产 Chrome 回归全链路通过。
- [x] 启动 K3 二轮深读:Grok Headless 只负责逐节查漏,候选问题、实验和红线保存在 `K3_GROK_LEADS.md`,正式结论逐项回到 47 页官方报告。
- [x] 建立 K3 正式研究账本:32 张问题账、Figure 1–16 / Table 1–5 视觉契约、8 个实验合同、完整数值红线与 100 节点阅读链。
- [x] 纠正 K3 原生多模态训练的旧表述:MoonViT-V2 从头训练,视觉与文本从训练开始在同一个 NTP objective 中联合优化,不采用“冻结语言模型再解冻”的 post-hoc 路线。
- [x] 完成 K3 二轮正文:30 个编号章节逐节覆盖架构、预训练、后训练、环境、系统、评测、案例与 XTML 附录,并与 DeepSeek / 17 个课程专题交叉链接。
- [x] 完成 K3 八联交互实验:Delta Rule、bounded decay、Block AttnRes、LatentMoE payload、SiTU-GLU、Quantile Balancing、MOPD/partial rollout、hybrid prefix cache。
- [x] K3 专属 Chrome 断言通过:32/21/100 内容计数、八个实验计算、键盘 tabs、事实纠错、桌面与 390px 移动端均无异常。
- [x] K3 二轮以源提交 `b669615`、不可变镜像 `20260729T040336Z-b669615` 发布;OCI digest `sha256:498b7e43…31cdb3c`,NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户、公开 Forgejo 与十六套生产 Chrome 回归全链路通过;保留 `20260729T031901Z-cd96dab` 回滚。
- [x] 启动 K3 三轮开放工件审计:固定 HF revision `9f62e4e9…b3569` 与 FlashKDA revision `1ce47ea3…ffb0b`,通过 config、index、safetensors headers 与 HTTP Range 避免把 1.56 TB 全量下载写成必要前提。
- [x] 闭合 93 层配置与 checkpoint 拓扑:69 KDA / 24 MLA、1 dense / 92 MoE、96 shards、497,220 tensor entries、247,296 expert packed tensors 与同数 scales、187 组 AttnRes projection / norm。
- [x] 完成 K3 四联开放工件实验:93 层真实配置条带、routed expert / MLA / MoonViT tensor anatomy、小参数范围审计,以及 FlashKDA 作者 benchmark / 本机编译 / synthetic router 探针边界。
- [x] 发现并保留官方工件的 `A_log [128]` vs config / remote code / FlashKDA API expected `[96]` 形状不一致;不宣布 checkpoint 损坏,也不把非标准 channel-wise 假设冒充真实 forward。
- [x] FlashKDA 本机编译边界已实测:RTX 5090 架构受支持,但当前 CUDA 12.8 低于官方 12.9+;g++ 13 已推进到 nvcc,随后因 CUDA headers / glibc declarations 冲突停止,kernel 尚未执行。
- [x] 第三轮证据快照、可复现探针脚本与正式审计账本已进入开源树;原始权重字节不提交,真实观测 O、推导 D、执行 X、合成 S 与未决 U 分开标记。
- [x] K3 新四视图本地真实 Chrome 回归通过:93 层条带、tensor group、参数分布、benchmark/router 切换、键盘 tabs、桌面与 390px 移动端均无异常。
- [x] K3 三轮开放工件里程碑以源提交 `be2b291`、不可变镜像 `20260729T044605Z-be2b291` 发布;OCI digest `sha256:99aa953e…d00cdf`,NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户与十六套生产 Chrome 回归全链路通过;保留 `20260729T040336Z-b669615` 回滚。
- [x] FlashKDA 隔离构建闭环:主机 CUDA 13.1 / glibc 2.43 仍在 `rsqrt` declarations 冲突;改用 CUDA 13.0.2 / Ubuntu 24.04 / glibc 2.39 后成功产出 CPython 3.12、`sm_120a` wheel,SHA-256 `14687b6d…2158d`。
- [x] RTX 5090 正确性闸门通过:one chunk、partial tail、multi-chunk、96 heads 与 varlen 共 6 组,FlashKDA output / final state 和官方 `torch_ref.py` 逐元素完全相等,max absolute error 0。
- [x] RTX 5090 K3 形状受控计时完成:fixed / varlen、BF16 / no-state / FP32 state 共 1,800 个 CUDA Event samples;fixed BF16 mean 2.6210 ms、P95 2.6437 ms,varlen BF16 mean 2.3335 ms、P95 2.3574 ms。
- [x] 可复现 Dockerfile、运行脚本与机器可读 JSON 接入开源树;网站第四视图把作者 H20/GB200 表、本机 RTX 5090 值、exact suite、构建链、synthetic router 和 `A_log` 未决冲突分开显示。
- [x] K3 FlashKDA 执行里程碑以源提交 `2ef846f`、不可变镜像 `20260729T053852Z-2ef846f` 发布;OCI digest `sha256:08ad5b55…32e6`,NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户与十六套生产 Chrome 回归全链路通过;保留 `20260729T044605Z-be2b291` 回滚。
- [x] 启动 DeepSeek 三轮真实权重执行:固定官方 V2-Lite revision `604d5664…82de0`,审计 29.261 GiB / 4 shards,并以第一分片的完整层边界执行 layer 0–6。
- [x] RTX 5090 连续 forward 闭环:4 条固定 prompt、90 个有效 token、6 个 MoE 层产生 3,240 次真实 top-6 路由;记录每层 `[4,27,576]` MLA 投影与 HF eager 展开 K/V shapes。
- [x] 独立复跑 31/31 exact:来源、配置、tokenization、逐层 hidden hashes、MLA shapes、aggregate loads 与全部 token routes 完全一致;计时明确不比较。
- [x] DeepSeek 新四视图本地真实 Chrome 回归通过:逐 token 路由、覆盖/均衡分账、latent/HF eager cache 计算、27 层执行断面、键盘 tabs 与 390px 移动端均无异常。
- [x] DeepSeek 三轮首个真实权重执行里程碑以源提交 `e864205`、不可变镜像 `20260729T062034Z-e864205` 发布;OCI digest `sha256:c3c37631…91addc`,NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户与十六套生产 Chrome 回归全链路通过;保留 `20260729T053852Z-2ef846f` 回滚。
- [x] DeepSeek 真实吸收式缓存闭环:同一官方 V2-Lite layer-1 权重与真实 hidden state 依次执行 HF eager、V3 naive 与 V3 absorb;26-token BF16 active cache 从 266,240 B 降至 29,952 B,实际比率 8.8889× / 88.75%。
- [x] 权重吸收正确性闸门通过:HF eager↔V3 naive BF16 max |Δ| 0.0012207,V3 naive↔absorb BF16 max |Δ| 0.00390625;同一 BF16 权重提升到 FP32 后 naive↔absorb max |Δ| 1.19e-7,所有输出 finite。
- [x] 独立吸收实验复跑 byte-exact:两份完整 JSON SHA-256 均为 `6b4c714a…e63d`;实验脚本、机器可读结果与正式研究账本进入开源树。
- [x] FlashMLA 架构边界闭合:固定 revision `15f13e50…a7772c6` 与 CUTLASS submodule;官方矩阵、gencode 与 dense runtime guard 只覆盖 SM90/SM100,本机 SM120 不宣称优化 kernel 已执行;两次隔离构建失败位置如实入账。
- [x] DeepSeek 吸收式缓存里程碑以源提交 `9ba26da`、不可变镜像 `20260729T065822Z-9ba26da` 发布;OCI digest `sha256:0184d7e8…905659`,复用 NAS `12010→8080`、NPM host 31 / cert 41、门户 `LLM ATLAS / projects / 180`,十六套生产 Chrome 回归全通过;保留 `20260729T062034Z-e864205` 回滚。
- [x] DeepSeek 路由探针从 4 条手写 prompt 扩展为 4 个公开域:WikiText-2、TNEWS、HumanEval、GSM8K 各 32 条;固定 revision、原始文件 SHA-256、哈希选样 salt、source ID、tokenizer 与右截断合同。
- [x] RTX 5090 执行 128 条 prompt、8,460 个有效 token;layer 1–6 每层产生 50,760 次真实 top-6 选择,六层共 304,560 次,逐 prompt 的 64 维 integer load 全量保留。
- [x] 统计单位从 token 修正为 prompt:域内有放回重采样 2,000 次,固定 seed `20260729`,同时报告 token-weighted / prompt-balanced 的 CV、Gini、effective experts、top share、64 专家份额与两两 JSD 95% percentile 区间。
- [x] 多域路由正式运行与独立重跑 byte-exact:两份 1.6 MiB JSON SHA-256 均为 `4678a1d1…a09e4`;六联交互实验可切换层与聚合口径,并永久注明不是训练分布、线上流量、专家语义或显著性检验。
- [x] DeepSeek 多域路由版本以源提交 `5bcfd58`、不可变镜像 `20260729T073342Z-5bcfd58` 发布;OCI digest `sha256:dd8bcbce…33abd4`,NAS / VPS / NPM / DNS / TLS / gzip / 门户与十六套生产 Chrome 回归全通过;保留 `20260729T065822Z-9ba26da` 回滚。
- [x] 长度敏感性实验固定同一批 128 条源 prompt:四域均要求至少 24 tokens,再用同一固定 salt 选出 32 条;16-token 输入严格是 24-token 输入前缀,避免换样本后把内容差异误记成长度效应。
- [x] RTX 5090 新增 16 / 24-token 两个等长 cohort:共 5,120 个有效 token、184,320 次真实 top-6 路由;两档独立重跑分别以完整 JSON SHA-256 `f8d437d5…aebd` / `bed54835…436` byte-exact。
- [x] 成对 prompt bootstrap 闭环:2,000 次重采样共用同一组 prompt indices;16→24 tokens 后 24 个 layer×domain 中 22 个 CV 点估计下降、20 个区间完全低于零,最大变化为 Layer 2 Python 代码 `0.969→0.718`、prompt-balanced Δ `-0.251 [-0.283,-0.215]`。
- [x] 中文↔代码 JSD 在六层均下降但没有消失;Layer 2 `0.091→0.065`、Δ `-0.026 [-0.036,-0.018]`。结论限定为固定前缀长度敏感性,不推出因果内容效应、专家语义或训练/线上总体。
- [x] 自然长度与等长 16 / 24 三 cohort 合计 13,580 个有效 token、488,880 次真实路由;机器可读比较结果第二次生成 SHA-256 均为 `00bdc7fe…61a1`,网站加入 cohort、层、聚合口径与 paired delta 联动。
- [x] DeepSeek 长度敏感性版本以源提交 `9ca0850`、不可变镜像 `20260729T081849Z-9ca0850` 发布;OCI digest `sha256:c2146735…3d641`,NAS / VPS / NPM / DNS / TLS / HTTP2 / gzip / 门户与十六套生产 Chrome 回归全通过;保留 `20260729T073342Z-5bcfd58` 回滚。
- [x] 官方 chat-template 扰动固定同一批 128 条 source prompt 与 23 个 canonical content tokens,在同一 padded batch 运行 raw / user / generation 384 个变体;用相对字符跨度与 token ID 的交集精确对齐 2,874 个内容 token。
- [x] RTX 5090 新增 10,612 个输入 token、382,032 次真实 top-6 路由,使公开语料累计达到 870,912 次;完整 JSON 独立复跑 SHA-256 均为 `da1f1033…bc1b9`,byte-exact。
- [x] causal suffix 负对照闭环:USER→GENERATION 的 3,642-token 共享前缀在每层全部 ordered top-6 exact,六层合计 `21,852 / 21,852`;对齐内容的 CV Δ / TV / JSD 全为零,而完整输入因新增 `Assistant:` token 保持非零分布变化。
- [x] RAW→USER 的模板敏感性不写成单向规律:L1 英文/中文与 L2 中文/代码更平,L3 中文、L5 中文/代码与 L6 四域更集中;网站第七个真实工件页签联动 layer、scope、aggregation,并展示 paired 95% 区间与逐 token top-6 稳定性。
- [x] 模板扰动里程碑本地闸门通过:69 个 Astro 文件零诊断、21 个页面、1,151 个站内引用、12 个跨页锚点零失败,十六套真实 Chrome 回归全部通过,桌面与 390px 移动端无文档级横向溢出。
- [x] DeepSeek 官方模板敏感性版本以源提交 `b0acc8b`、不可变镜像 `20260729T092426Z-b0acc8b` 发布;OCI digest `sha256:f1bf2d09…e1463`,NAS / VPS / NPM / DNS / TLS / HTTP2 / gzip / 门户与十六套生产 Chrome 回归全通过;保留 `20260729T081849Z-9ca0850` 回滚。
- [x] 消息历史实验复用上一轮完全相同的 128-source / 23-content-token cohort,把 system 与 one-shot 构成 2×2:system 在两个 one-shot 水平都固定每条 +16 tokens,one-shot 在两个 system 水平都固定每条 +17 tokens,四格同一 padded batch。
- [x] RTX 5090 执行 512 个消息历史变体、24,040 个输入 token,新增 865,440 次真实 top-6 路由,使公开语料累计达到 1,736,352 次;四格各有相同的 2,874 个精确对齐目标 token。
- [x] 2×2 source-paired bootstrap 同报 system main、few-shot main 与 difference-in-differences interaction;CV 区间完全正 / 负 / 跨零分别为 system `8/13/3`、few-shot `7/7/10`、interaction `8/8/8`,不压成单向规律。
- [x] 固定消息中的历史缓冲模式闭环:system-at-F1 相对 system-at-F0 的目标 TV 在 24 / 24 个 layer×domain 全部下降,均值 `.073→.019`;绝对 CV 变化 21 / 24 下降,逐 token top-6 set exact 在六层均明显提高。
- [x] 消息历史正式运行与独立复跑 SHA-256 均为 `5765fbf8…c1fb`,约 28 MiB JSON byte-exact;网站第八个真实工件页签联动 layer、scope、aggregation 与 system/few-shot/interaction depth map。
- [x] 消息历史里程碑本地闸门通过:69 个 Astro 文件零诊断、21 个页面、1,151 个站内引用、12 个跨页锚点零失败,十六套真实 Chrome 回归全部通过,桌面与 390px 移动端无文档级横向溢出。
- [x] DeepSeek 消息历史因子里程碑以源提交 `efe3ffc`、不可变镜像 `20260729T100729Z-efe3ffc` 发布;OCI digest `sha256:e2ea1c35…77e2f`,NAS / VPS / NPM / DNS / TLS / HTTP2 / gzip / 门户与十六套生产 Chrome 回归全通过;保留 `20260729T092426Z-b0acc8b` 回滚。
- [x] 等长历史控制把 system 开/关与 none / repeated-token filler / fixed demo 组成 2×3;filler 与 demo 在两条 system 水平都逐条精确 +17 tokens,并保持相同角色、assistant EOS、目标位置与六格 batch。
- [x] RTX 5090 执行 768 个输入变体、38,236 个输入 token,新增 1,376,496 次真实 top-6 路由,使公开语料累计达到 3,112,848 次;六格各有相同的 2,874 个精确对齐目标 token。
- [x] 目标内容 system-edge TV 呈 none `.0738` → filler `.0378` → demo `.0188` 两级阶梯;none→filler 与 filler→demo 都在 24 / 24 个 layer×domain 下降,且 24 / 24 source-paired 区间完全低于零。
- [x] filler 不冒充“无语义”或纯距离:`x` 是学习过的重复 token;CV edge 方向不统一,完整输入只有 20/24、23/24 点估计下降,主结论严格限定为精确目标内容 route-distribution TV。
- [x] 六格正式运行与独立复跑 SHA-256 均为 `423a095d…e648e`,约 41 MiB JSON byte-exact;网站第九个真实工件页签联动 layer、scope、aggregation 与两个 TV 台阶 depth map。
- [x] 等长历史控制本地闸门通过:69 个 Astro 文件零诊断、21 个页面、1,151 个站内引用、12 个跨页锚点零失败,十六套真实 Chrome 回归全部通过,9 页签桌面端与 390px 移动端均无文档级横向溢出。
- [x] DeepSeek 等长历史控制里程碑以源提交 `8130e37`、不可变镜像 `20260729T110301Z-8130e37` 发布;OCI digest `sha256:e4b79166…5c0846`,NAS / VPS / NPM / DNS / TLS / HTTP2 / gzip / 门户与十六套生产 Chrome 回归全通过;保留 `20260729T100729Z-efe3ffc` 回滚。
## 正在进行
- [ ] K3 三轮下一闸门:获得真实 token hidden states、expert load 与 cache traces,解释或修订 `A_log [128]` 工件冲突,再做 Figure 3/4/5 数值重绘和独立小模型复现。
- [ ] DeepSeek 三轮下一闸门:在官方支持的 SM90 环境执行 FlashMLA 优化 kernel;扩到完整 27 层并继续拆分 EOS、角色、多 filler、示例内容与 batch shape,再推进 FP8 / pipeline traces 与 R1-like RL 小模型复现。
- [ ] 表示、位置与残差二轮:真实 hidden-state / norm traces、长上下文位置外推复现与 mHC / AttnRes 深层稳定性消融。
- [ ] 评测安全二轮:真实 cross-harness / pass@k 复跑、Judge 元评测、动态污染与过拒案例。
- [ ] 推理服务二轮:真实 GPU kernel / workload traces、功耗与成本、跨 vLLM / SGLang / TensorRT-LLM 复现。
- [ ] 原生多模态二轮:真实视觉 Token traces、跨分辨率 / connector 消融、OCR 与视觉 Agent 安全失败案例。
- [ ] Agent 二轮:真实环境 traces、cross-harness ablation、Agent RL 训练曲线与提示注入案例。
- [ ] Transformer 二轮:多头电路逐图、Pre/Post-LN 真实 traces、Flash/KV kernel 与模型配置对照。
- [ ] 语言模型前史二轮:Kneser–Ney / LSTM / Bahdanau 逐图精读、真实小语料复现与 tokenizer 公平性案例。
- [ ] Scaling Laws 二轮精读:真实拟合复现、逐篇图表、置信区间、外推失败与更多模型族对照。
- [ ] 数据工程二轮:FineWeb / DCLM / Dolma / ROOTS 逐图精读、真实去重误伤、mixture traces 与污染案例。
- [ ] 大规模训练系统二轮:真实集群 traces、故障恢复案例与精确 topology / kernel 配置。
- [ ] 数值与稳定性二轮:真实 kernel 吞吐、长程失稳 traces、optimizer / quantization 逐图复现。
- [ ] 推理专题二轮:真实 pass@k 曲线、PRM 失败案例与逐篇图表精读。
- [ ] 长上下文专题的真实模型配置对比、内核细节与失败案例二轮深化。
- [ ] MoE 专题的真实集群 traces、专家特化案例与二轮外部证据。
## 研究账本
| 日期 | 决策/发现 | 影响 |
|---|---|---|
| 2026-07-29 | K3 FlashKDA 在隔离 CUDA 13.0 / glibc 2.39 构建并回到 RTX 5090 执行 | 主机头文件 ABI 问题与 GPU 架构支持分离;wheel checksum、Dockerfile 与执行 JSON 可审计 |
| 2026-07-29 | FlashKDA 本机实测永久与作者 H20 / GB200 表分账 | 6/6 exact 与 1,800 个 latency samples 可称 X;未跑本机 FLA 就不计算本机 speedup |
| 2026-07-29 | K3 FlashKDA 执行里程碑发布到既有 `llm-atlas` 链路 | `2ef846f`、不可变镜像、NAS 12010→8080、NPM 31 / cert 41、门户 order 180 与十六套生产回归闭环 |
| 2026-07-28 | 网站命名为 **LLM Atlas / 大模型技术全景** | 既能容纳 K3 深读,也能承载完整 LLM 课程 |
| 2026-07-28 | K3 作为“汇流点”,不是课程起点 | 初学者可以先学基础,高阶读者可以从 K3 反向跳转 |
| 2026-07-28 | 优先重绘论文图并标明“简化/改绘” | 图可缩放、可交互,也减少脱离上下文复制论文图片 |
| 2026-07-28 | Grok 只用于线索扩展与交叉检查 | 正文事实必须回到论文、官方仓库或正式文档 |
| 2026-07-28 | 首批论文库按问题与专题多标签组织,推理研究后扩充至 146 篇 | 论文库承担发现入口,专题正文承担深度精读与机制复核 |
| 2026-07-28 | 源码公开到 `git.k1412.top/wuyang/llm-atlas` | 路线、进度、研究方法和内容变更均可追踪 |
| 2026-07-28 | 站点使用不可变镜像与 Compose Manager 部署 | 每次发布保留明确版本、健康检查和回滚点 |
| 2026-07-28 | 长上下文按计算、缓存、位置、状态容量、系统五张账单组织 | 避免把 FlashAttention、位置外推和“记住更久”混成同一个问题 |
| 2026-07-28 | 交互缓存数字统一标记为教学估算 | 展示增长规律,不冒充任一模型的真实线上显存基准 |
| 2026-07-28 | MoE 按六张账组织,路由算法与集群执行分开核算 | 避免用“稀疏所以便宜”跳过容量、负载、通信与权重读取 |
| 2026-07-28 | “aux-loss-free”保留论文真实边界 | 区分 selection bias、mixture weight、z-loss 与 V3 的极小 sequence-wise loss |
| 2026-07-29 | 推理专题按结果、覆盖、选择、过程、预算、优化、分布、系统八张账组织 | 避免把 pass@1、pass@k、搜索收益、RL 能力增长与系统吞吐混成“会思考” |
| 2026-07-29 | K3 partial rollout RL 与 MOPD 在正文中强制并排 | 前者显式容忍跨迭代 stale trajectory,后者由当前 student 采样并接收稠密 teacher signal |
| 2026-07-29 | 推理首版用 30 篇一手论文和三页签实验闭环 | 分开演示预算分配、GRPO 聚合偏置和 K3 九教师 MOPD,不合成伪“总分” |
| 2026-07-29 | 推理首版发布到既有 `llm-atlas` 生产链路 | Compose Manager、NPM host 31 / cert 41、10 路由与公网交互均复核通过 |
| 2026-07-29 | 训练系统按模型状态、激活、计算划分、气泡、collective、EP、CP、数值、可靠性九张账组织 | 任何优化都必须说明节省哪种资源、把成本移到哪里 |
| 2026-07-29 | 并行度不再机械写成 `DP×TP×PP×EP×CP` | 先定义 device mesh、group overlap 与作用范围,再核算 world size |
| 2026-07-29 | DeepSeek “近零通信”统一解释为特定 overlap 下的 exposed critical-path time | 防止把隐藏通信误写成没有传输字节 |
| 2026-07-29 | Grok 训练系统包只保留为 `TRAINING_SYSTEMS_GROK_LEADS.md` | 候选论文、数字和公式不得越过一手证据账本直接进入站点 |
| 2026-07-29 | 训练系统首版用四个独立实验闭环 | 显存、device mesh、pipeline 与通信不合成一个伪“系统总分” |
| 2026-07-29 | 论文库随训练系统一手链扩充到 166 篇 | 新增 checkpoint、mixed precision、自动并行、FSDP、MoE/CP 与大集群系统节点 |
| 2026-07-29 | 训练系统首版用不可变镜像 `20260728T172750Z-c6306fe` 发布 | 保留 `12010→8080`、NPM host 31 / cert 41 与公开 Forgejo;11 路由、关键资源和四页签生产交互全部复核 |
| 2026-07-29 | Scaling Laws 拆成观测量、模型、数据、算术、配比、配方、外推、经济目标与能力阶段九张账 | 防止把 `20 TPP`、`6ND`、MoE 总参、部署成本和“涌现”混成一条万能曲线 |
| 2026-07-29 | Grok 对 K3 报告存在性的错误保留在未核验 leads | 正式账本回到 arXiv `2607.24653` 与本地 47 页报告,展示来源分级为何必要 |
| 2026-07-29 | Scaling 首版用 29 个一手节点和四个独立实验闭环 | IsoFLOP、训练—部署、数据复用与指标涌现分开建模,不合成伪“规模总分” |
| 2026-07-29 | 论文库随 Scaling 一手链扩充到 182 篇 | 新增早期跨任务幂律、Gopher、数据受限、过训练、部署经济、复现和 task ladder 节点 |
| 2026-07-29 | Scaling 首版用不可变镜像 `20260728T181742Z-eff0e4c` 发布 | OCI digest `sha256:802e4041…cf83`;保留 `12010→8080`、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo |
| 2026-07-29 | 数据工程拆成来源、解析、语言、质量、唯一性、污染、混合、变换、Tokenizer、Packing、课程与价值十二张账 | 防止用一个“高质量 Token”标签掩盖单位、误删、治理与课程 |
| 2026-07-29 | Grok 数据研究包只保留为 `DATA_PRETRAINING_GROK_LEADS.md` | 模型发现候选不越过一手证据门槛;K3 总训练 Token、工业 mixture 和 source map 保持未知 |
| 2026-07-29 | K2 改写、K3 2.5×、V3/V4 packing 边界在正文主视区显式限定 | 不把早期 SimpleQA 对照外推为普遍定律,不把模型族收益归因给单一数据技巧 |
| 2026-07-29 | 数据工程首版用四个独立实验闭环 | 文档保留、去重误伤、领域 exposure 与改写课程分开建模,不合成伪“数据质量总分” |
| 2026-07-29 | 论文库新增数据标签并扩充到 202 篇 | 新增 CCNet、ROOTS、Dedup、DoReMi、DCLM、WRAP、MATES、MM1、Swallow 等 20 个节点 |
| 2026-07-29 | 数据工程首版用不可变镜像 `20260728T190932Z-ee0361b` 发布 | OCI digest `sha256:2fe8f3aa…59c8`;复用 `12010→8080`、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo |
| 2026-07-29 | 数值专题拆成表示、缩放、计算、累加、搬运、更新、参数化、观测、恢复与证据经济十张账 | 防止把一个 dtype 标签误当成完整训练配方 |
| 2026-07-29 | Grok 数值研究包只保留为 `NUMERICS_GROK_LEADS.md` | 40 个候选必须回到论文/官方报告核验;错误元数据和不可核实结论不进入正文 |
| 2026-07-29 | K2/K3 与 DeepSeek-V3/V4 数值谱系显式保留边界 | Per-Head Muon 不替代 QK-Clip;K3 2.5× 不归因单项技巧;V3 失败实验与高精度保留项不省略 |
| 2026-07-29 | 数值首版用四个独立实验闭环 | 格式误差、状态字节、矩阵更新与失稳防线分开建模,不合成伪“效率总分” |
| 2026-07-29 | 论文库新增「优化器」标签并扩充到 223 篇 | 新增 Shampoo、Adafactor、μP、8-bit optimizer、FP8-LM、FP4 training、稳定性代理等 21 个节点 |
| 2026-07-29 | 数值首版用不可变镜像 `20260728T200309Z-c21af18` 发布 | OCI digest `sha256:2155fd7f…c386`;复用 `12010→8080`、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo |
| 2026-07-29 | 语言模型前史拆成八张彼此独立的账 | 不再把 Tokenizer、平滑、Embedding、循环记忆、Seq2Seq 与系统成本压成一条“架构越来越强”的年表 |
| 2026-07-29 | Grok 语言模型候选与正式证据永久分离 | 45+ 候选只负责召回;正式 33 节点必须回到 DOI、ACL/PMLR/ISCA、出版社页面或官方技术报告 |
| 2026-07-29 | K3 / DeepSeek 的 NTP、MTP、多模态与 draft 分角色记账 | 统一视觉/文本 next-token objective 不排斥 one MTP layer;MTP 与 speculative draft 都不写成取消自回归 |
| 2026-07-29 | 论文库扩充到 247 篇 | 新增 Shannon 1951、Good、Katz、Kneser–Ney、LSTM、RNNLM、Seq2Seq 前夜与输出成本等 24 个一手节点 |
| 2026-07-29 | 语言模型前史首版用不可变镜像 `20260728T204916Z-a54152d` 发布 | OCI digest `sha256:fb646aba…fe923`;复用 `12010→8080`、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo |
| 2026-07-29 | Transformer 按十张问题账组织 | 不再把 QKV、Mask、位置、Norm、训练目标、KV Cache、Flash 与当代架构压成一个“Block” |
| 2026-07-29 | Attention 权重与因果解释永久分离 | 热力图只描述中间计算和提出假设;因果结论需要消融、patching 或反事实干预 |
| 2026-07-29 | 论文库扩充到 258 篇 | 新增 Residual/Norm、relative position、UniLM、多头冗余、解释争论与 NormFormer 等 11 个节点 |
| 2026-07-29 | Transformer 深度首版用不可变镜像 `20260728T212813Z-252e7d6` 发布 | OCI digest `sha256:db003faa…59fa`;复用 `12010→8080`、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo |
| 2026-07-29 | Alignment 拆成十二张彼此独立的账 | 防止把“更会答”“更符合偏好”“更安全”“更可验证”压成同一个 alignment 分数 |
| 2026-07-29 | Grok Alignment 线索与正式证据永久分离 | 45 条候选只负责查漏;公式、数字和历史结论必须回到一手 PDF / 会议页面 |
| 2026-07-29 | DeepSeek 与 Kimi 后训练按阶段合同重建 | R1-Zero 不外推为完整 R1;K3 partial rollout 与 MOPD 不混写;DPO 不被描述成取消偏好数据 |
| 2026-07-29 | Alignment 首版用 44 个一手节点与四个独立实验闭环 | SFT token mask、RM 偏置、PPO/DPO 更新与模型配方分开演示,不合成伪“对齐总分” |
| 2026-07-29 | 论文库扩充到 280 篇 | 新增 22 个 SFT、偏好、RM、RLAIF、直接偏好优化与后训练评测节点 |
| 2026-07-29 | Alignment 首版用不可变镜像 `20260728T220753Z-8378e2a` 发布 | OCI digest `sha256:ef3ad2a8…3048a`;复用 `12010→8080`、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo |
| 2026-07-29 | Agent 按十四张彼此独立的问题账组织 | 模型、harness、工具、环境、验证器、可靠性与安全不再被压成一个 Agent 分数 |
| 2026-07-29 | Agent 完成必须回到 final state | function schema、工具执行、业务状态、策略合规与 pass^k 分层评价;模型自报完成不作为证据 |
| 2026-07-29 | DeepSeek 与 Kimi Agent 谱系显式保留系统边界 | V3.2/V4 的训练环境与 DSec、K3 的 white-box harness/AET/AgentENV 分层说明,不把模型、脚手架和基础设施混写 |
| 2026-07-29 | Grok Agent 线索与正式证据永久分离 | 候选只负责查漏;公式、数字和系统结论必须回到一手论文、正式会议版本或官方报告 |
| 2026-07-29 | 论文库扩充到 314 篇 | 新增 34 个环境、工具、Web/SWE/桌面 Agent、可靠性、安全与 Agent RL 节点 |
| 2026-07-29 | Agent 首版用不可变镜像 `20260728T225618Z-25982cb` 发布 | OCI digest `sha256:a781ad92…ba52`;复用 `12010→8080`、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo |
| 2026-07-29 | 原生多模态按五层管道与十六张账组织 | 像素、视觉塔、压缩 / connector、主干与输出 / 工具闭环分开定位;“原生”再拆成数据、目标、优化、输入输出与 Agent 五维 |
| 2026-07-29 | Grok 多模态召回与正式证据永久分离 | 218 行候选账只做查漏;1362 行正式账本只接受一手论文、官方报告与可计算公式 |
| 2026-07-29 | DeepSeek 多模态永久保留三分支 | VL/VL2 的理解、Janus 的统一生成、OCR 的光学上下文压缩不画成错误单向代际谱系 |
| 2026-07-29 | Kimi 三代 MoonViT 按训练制度重建 | Kimi-VL 的 SigLIP + caption / 对齐,K2.5 的共享图像视频 / zero-vision SFT,K3 的从头共同 NTP 分开说明 |
| 2026-07-29 | 光学压缩实验显式分三级证据 | DeepSeek-OCR 报告锚点、中间教学插值与超过已核范围的“不外推”在交互中使用不同状态 |
| 2026-07-29 | 论文库扩充到 355 篇 | 新增 41 个视觉表示、连接器、分辨率、OCR、视频、统一生成、评测与视觉 RL 节点 |
| 2026-07-29 | 原生多模态首版用不可变镜像 `20260728T235248Z-9f56732` 发布 | OCI digest `sha256:b9c66e4e…07955`;复用 `12010→8080`、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo |
| 2026-07-29 | 推理服务拆成十八本彼此独立的账 | 权重、增长状态、分配、阶段、batch、cache、kernel、推测、量化、网络、路由、故障与经济性不再压成一个 tokens/s |
| 2026-07-29 | Grok 推理服务召回与正式证据永久分离 | 70 个候选节点只负责查漏;26 份完整 PDF/TXT、会议页、官方仓库和模型报告承载正文事实 |
| 2026-07-29 | DeepSeek 与 Kimi 服务谱系按状态对象重建 | MLA→V4 异构状态和 Mooncake→KDA→K3 混合缓存分开讲,精确 KV 公式不套到异构状态上 |
| 2026-07-29 | 论文库扩充到 400 篇 | 新增 45 个内存管理、调度、缓存、P/D 解耦、量化、推测解码、kernel 与真实 workload 节点 |
| 2026-07-29 | 推理服务首版用四个独立实验闭环 | 显存、阶段干扰、推测验收和集群状态分开建模;作者报告、教学估算与 benchmark 永久分级 |
| 2026-07-29 | 推理服务首版用不可变镜像 `20260729T003946Z-db2b7d3` 发布 | OCI digest `sha256:06374603…fe752`;复用 `12010→8080`、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo |
| 2026-07-29 | 评测安全按二十二张测量账组织 | 构念、样本、指标、Prompt、采样、Harness、裁判、污染、成本与威胁模型不再压成一个榜单分 |
| 2026-07-29 | Grok 评测线索与正式证据永久分离 | 12 个协议陷阱只负责教学查漏;50 份新增一手全文与 DeepSeek/K3 官方报告承载正文事实 |
| 2026-07-29 | DeepSeek 与 K3 评测谱系按协议字段重建 | R1 的非零温多采样 pass@1、V4 effort / context / tool budget 与 K3 §6 task-specific harness 分层说明 |
| 2026-07-29 | 论文库扩充到 450 篇 | 新增 50 个指标、套件、动态基准、Judge、代码 Verifier、安全与 Agent 风险节点 |
| 2026-07-29 | 评测安全首版用四个独立实验闭环 | 指标/校准、Judge/Arena、污染/动态题、系统/安全边界分开建模,不合成伪“模型总分” |
| 2026-07-29 | 评测安全首版用不可变镜像 `20260729T013530Z-cfd2367` 发布 | OCI digest `sha256:3c4c34a8…50be6`;复用 `12010→8080`、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo |
| 2026-07-29 | 表示与深度按二十张问题账组织 | 计算单位、接口参数、上下文化、位置、外推、Norm 对象、拓扑、残差路由与非线性极值不再混成一个 hidden-state 名词 |
| 2026-07-29 | Grok 表示候选与正式证据永久分离 | 候选问题和论文只负责查漏;66 节点正式链只接受一手论文与 K3/DeepSeek 官方报告 |
| 2026-07-29 | K3 Block AttnRes 来源数按原报告重算 | 93 层按 12 层形成 8 个 layer blocks(7 个完整块加 1 个尾块),加 embedding 后共 9 个 block-level 来源 |
| 2026-07-29 | DeepSeek 与 Kimi 的位置/深度稳定化分开建模 | V2 decoupled RoPE、V4 partial RoPE/mHC/clamp 与 K3 MLA NoPE、KDA、AttnRes/SiTU 不压成单一代际结论 |
| 2026-07-29 | 论文库扩充到 480 篇 | 新增 30 个表示、位置、归一化、残差拓扑、激活函数与深层稳定性节点 |
| 2026-07-29 | 表示深度首版用四个独立实验闭环 | Token 接口、位置几何、Norm/深度、Residual/FFN 分开操作;报告事实、数学推导与 toy model 永久分级 |
| 2026-07-29 | 表示深度首版用不可变镜像 `20260729T023329Z-a2c9298` 发布 | OCI digest `sha256:93c88bf2…145a23`;复用 `12010→8080`、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo;保留 `20260729T013530Z-cfd2367` 回滚 |
| 2026-07-29 | DeepSeek 二轮按二十四张对象账与十次问题转向重建 | total/active、KV state、通信、数值角色、奖励偏差与长程状态不再压成单一“效率” |
| 2026-07-29 | Grok DeepSeek 候选与正式证据永久分离 | 候选只负责问题召回;60 节点正式链只接受一手论文、DeepSeek 官方仓库和 K3 官方报告 |
| 2026-07-29 | R1-Zero、正式 R1、蒸馏与后续复现分四种身份 | “无 reasoning SFT”不外推为无预训练先验;DAPO / Dr.GRPO 不冒充 DeepSeek 内部 R1 recipe |
| 2026-07-29 | V4 与 K3 按状态机器而非 1M 标签对照 | CSA/HCA、mHC 与 KDA/MLA、AttnRes 分开;主模型 AttnRes 12 层 block 不与芯片 nano-model block size 2 混写 |
| 2026-07-29 | 论文库扩充到 486 篇 | 新增 DeepSeek-Coder/Coder-V2、ESFT、Prover-V1.5/V2 与 Engram 6 个旁支节点 |
| 2026-07-29 | DeepSeek 二轮用四个独立实验闭环 | 稀疏容量、MLA 缓存、V3 协同与 RL 偏差分别操作;精确公式、作者报告和 teaching model 永久分级 |
| 2026-07-29 | DeepSeek 二轮用不可变镜像 `20260729T031901Z-cd96dab` 发布 | OCI digest `sha256:4bfb3faf…fa3968`;复用 `12010→8080`、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo;保留 `20260729T023329Z-a2c9298` 回滚 |
| 2026-07-29 | DeepSeek 三轮以官方 V2-Lite 第一分片建立真实执行证据 | layer 0–6 是完整连续边界;layer 7 跨分片即停止,不把部分下载写成完整生成 |
| 2026-07-29 | MLA 算法状态与框架物化格式分两张账 | V2-Lite latent 576 元素与 HF eager 5,120 元素同时报告;88.75% 不冒充 V2 论文 93.3% |
| 2026-07-29 | 专家覆盖、负载均衡与语义永久分开 | 60–64/64 used 不推出 balanced;CV/Gini/effective 同报;expert ID 不跨层连线或命名 |
| 2026-07-29 | DeepSeek 三轮首个真实权重版本以 `20260729T062034Z-e864205` 发布 | OCI digest `sha256:c3c37631…91addc`;复用 `12010→8080`、NPM 31 / cert 41、门户 order 180;保留 `20260729T053852Z-2ef846f` 回滚 |
| 2026-07-29 | MLA 576 元素缓存从算法合同升级为真实执行 | 官方 V3 naive / absorb 使用同一 V2-Lite 权重与 hidden state;26-token active cache 266,240 B→29,952 B,FP32 代数审计 max \|Δ\| 1.19e-7 |
| 2026-07-29 | reference absorb 与 FlashMLA optimized kernel 永久分身份 | 前者已在 RTX 5090 执行;pinned FlashMLA 只列 SM90/SM100 并只生成 sm_90a/sm_100f,本机 SM120 明确标为未支持/未执行 |
| 2026-07-29 | DeepSeek 吸收式缓存版本以 `20260729T065822Z-9ba26da` 发布 | OCI digest `sha256:0184d7e8…905659`;复用 `12010→8080`、NPM 31 / cert 41、门户 order 180;十六套生产 Chrome 回归通过,保留 `20260729T062034Z-e864205` 回滚 |
| 2026-07-29 | 大样本路由使用四个可重建公开域 | WikiText-2 / TNEWS / HumanEval / GSM8K 各 32 条;只用 text / sentence / prompt / question,答案不输入、代码不执行 |
| 2026-07-29 | 路由区间以 prompt 而非 token 为抽样单位 | 同 prompt token 有共同前缀与主题,不能伪装成独立样本;域内 2,000 次 bootstrap,同时保留 token 加权与 prompt 等权 |
| 2026-07-29 | 路由分布差异与 expert semantics 永久分开 | Layer 4 中文、Layer 5/6 数学的集中度与域间 JSD 只描述 128-prompt 探针;不命名 expert,不冒充训练/线上总体或显著性检验 |
| 2026-07-29 | DeepSeek 多域路由版本以 `20260729T073342Z-5bcfd58` 发布 | OCI digest `sha256:dd8bcbce…33abd4`;复用 `12010→8080`、NPM 31 / cert 41、门户 order 180;HTML gzip 与十六套生产 Chrome 回归通过,保留 `20260729T065822Z-9ba26da` 回滚 |
| 2026-07-29 | 取消 32-token 长度对照,改用同源 prompt 的 16→24-token 成对设计 | TNEWS 仅 105/10,000 样本达到 32 tokens,强行统一 32 会选中约 1% 极端长尾;24-token eligibility 仍有 1,609 条中文候选 |
| 2026-07-29 | 长度效应必须用 paired prompt bootstrap | 16-token 输入是 24-token 输入前缀,2,000 次重采样共用 prompt indices;区间描述固定 cohort 的敏感性,不升级为内容因果或总体显著性 |
| 2026-07-29 | 自然长度、matched-16 与 matched-24 永久分开呈现 | 自然 cohort 回答“本批原始样本如何路由”;matched cohort 回答“同一前缀多看 8 tokens 后如何变化”,不能互相替代 |
| 2026-07-29 | DeepSeek 长度敏感性里程碑以 `20260729T081849Z-9ca0850` 发布 | OCI digest `sha256:c2146735…3d641`;复用 NAS 12010→8080、NPM 31 / cert 41、门户 order 180;十六套生产 Chrome 回归通过,保留上一不可变镜像回滚 |
| 2026-07-29 | 模板扰动只比较同一 canonical content | raw / official user / generation 三条件同 batch;字符跨度与 token ID 同时相同才进入 2,874-token 内容交集,wrapper 与边界重切分 token 不混入内容效应 |
| 2026-07-29 | `Assistant:` 追加条件承担 causal-mask 负对照 | 21,852 个共享前缀 ordered top-6 全部 exact;证明未来 suffix 不改写过去,但不推出 suffix 自身没有路由作用 |
| 2026-07-29 | 模板效应永久分 scope、layer 与 domain 报告 | 对齐内容回答上下文条件化,完整输入回答真实协议流量;RAW→USER 的 CV 方向跨层翻转,不压成“角色模板更均衡/更集中” |
| 2026-07-29 | DeepSeek 官方模板敏感性里程碑以 `20260729T092426Z-b0acc8b` 发布 | OCI digest `sha256:f1bf2d09…e1463`;复用 NAS 12010→8080、NPM 31 / cert 41、门户 order 180;十六套生产 Chrome 回归通过,保留上一不可变镜像回滚 |
| 2026-07-29 | system × one-shot 使用固定 16 / 17-token 正交增量 | 四格同 cohort、同 target、同 batch;主效应与交互共用 source-prompt bootstrap indices,避免把两条独立两组实验误拼成因子结论 |
| 2026-07-29 | one-shot 后的 system-edge TV 下降只命名为历史缓冲模式 | 24 / 24 格下降与逐 token set/Jaccard 同向;示例语义、距离、EOS、角色转换和固定文本尚未拆开,因此不写成 few-shot 因果语义 |
| 2026-07-29 | 因子分布 effect 使用 half-L1 magnitude 而非普通 TV | 主效应和 interaction 是带符号 expert-share 向量;只有四条实际条件边继续使用标准 TV / JSD |
| 2026-07-29 | DeepSeek 消息历史因子里程碑以 `20260729T100729Z-efe3ffc` 发布 | OCI digest `sha256:e2ea1c35…77e2f`;复用 NAS 12010→8080、NPM 31 / cert 41、门户 order 180;十六套生产 Chrome 回归通过,保留上一不可变镜像回滚 |
| 2026-07-29 | repeated-token filler 与 demo 逐条精确等长 | 两者共享 user/assistant 角色、assistant EOS、目标位置与 batch shape;`x` 仍是学习过的 token,因此不命名为无语义或纯距离 |
| 2026-07-29 | 等长历史的两个 TV 台阶分开报告 | none→filler 回答“历史结构是否足以复现缓冲”;filler→demo 回答固定协议字段后的文本替换;两者都不升级为能力或示例正确性 |
| 2026-07-29 | batch contract 是 BF16 路由复现的一部分 | 跨实验 512/512 token-ID 合同 exact,但矩阵形状改变会让深层临界 gate hash 分化;正式结论只使用同一次六格 batch 内对比 |
| 2026-07-29 | DeepSeek 等长历史控制以 `20260729T110301Z-8130e37` 发布 | OCI digest `sha256:e4b79166…5c0846`;复用 NAS 12010→8080、NPM 31 / cert 41、门户 order 180;十六套生产 Chrome 回归通过,保留上一不可变镜像回滚 |
| 2026-07-29 | K3 二轮按 32 张对象账与完整报告顺序重建 | total/active、2.5×、KDA state、深度来源、专家路由、视觉目标、轨迹、缓存与评测协议不再压成一页组件摘要 |
| 2026-07-29 | K3 原生视觉事实回到 §2.4 / §3.3 核验 | 删除“先冻结语言模型再解冻”旧表述;明确 MoonViT-V2 从头训练,视觉/文本从开始共同 NTP |
| 2026-07-29 | K3 Figure 1–16 / Table 1–5 全部建立课程视觉契约 | 每张图同时写支持范围与不可外推项;作者报告、论文、推导与 toy model 使用 R/P/D/T 标签 |
| 2026-07-29 | K3 二轮用八个独立实验闭环 | Delta memory、BF16 decay、AttnRes、LatentMoE、SiTU、QB、MOPD/RL 与 prefix cache 分开操作,不合成伪“架构总分” |
| 2026-07-29 | K3 二轮用不可变镜像 `20260729T040336Z-b669615` 发布 | OCI digest `sha256:498b7e43…31cdb3c`;复用 `12010→8080`、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo;十六套生产 Chrome 回归通过,保留 `20260729T031901Z-cd96dab` 回滚 |
| 2026-07-29 | K3 三轮先审计开放工件,不要求加载 1.56 TB | 固定官方 revisions;用 config、index、96 个 shard headers 与两个小范围权重切片闭合真实 topology、shape 和参数统计 |
| 2026-07-29 | 开放工件证据使用 O / D / X / S / U 五种身份 | 观测、推导、本机执行、合成探针与未决矛盾不互相冒充;FlashKDA 作者 benchmark 不写成本机 benchmark |
| 2026-07-29 | `A_log [128]` 与 expected `[96]` 保持未决 | 并列报告 checkpoint、config、remote code 与 kernel API;等待官方 loader / 修订解释,不擅自 reshape |
| 2026-07-29 | K3 三轮开放工件里程碑用不可变镜像 `20260729T044605Z-be2b291` 发布 | OCI digest `sha256:99aa953e…d00cdf`;复用 `12010→8080`、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo;十六套生产 Chrome 回归通过,保留 `20260729T040336Z-b669615` 回滚 |
## 未决问题
- K3 报告给出了多项公开组件的整合方式;独立论文与 K3 内部最终实现之间仍需逐项对照。
- 公开技术报告不会披露完整数据配比和训练细节;网站会把“已知”“合理推断”“未知”分开。
- 2026 年模型与榜单变化快,所有动态比较都必须带研究截止日期。