Files
llm-atlas/PROGRESS.md
T

62 KiB
Raw Blame History

持续进度

最后更新:2026-07-29

总体状态

工作流 状态 完成度 下一检查点
研究框架与规范 进行中 83% Scaling Laws 二轮拟合复现与逐图精读
网站设计系统 进行中 89% 打印样式与更多通用可视化组件
Kimi K3 深读 三轮实证进行中 94% 接入真实 hidden-state / expert-load / cache traces,并重绘报告数值图
语言模型前史 完成首版 78% Kneser–Ney、LSTM、Bahdanau 逐图精读与真实小语料复现
Transformer 基础 完成首版 79% 多头电路、归一化 traces 与真实 kernel / KV 配置
表示、位置与残差高速公路 完成首版 81% 真实 hidden-state / norm traces、长上下文位置外推与深层稳定性消融
Scaling Laws 完成首版 74% 真实拟合复现、置信区间与更多模型族对照
数据工程与预训练配方 完成首版 73% FineWeb / DCLM 逐图精读、真实去重误伤与 mixture traces
DeepSeek 专题 三轮实证进行中 95% SM90 FlashMLA kernel、完整 27 层、EOS / 角色 / 多 filler / 内容正交控制、FP8/pipeline 与 R1-like RL 复现
指令微调与人类偏好 完成首版 75% 真实偏好分歧、RM 长度偏置与 PPO/DPO 小模型复现
推理与测试时扩展 完成首版 76% 真实模型采样曲线、PRM 案例与逐篇图表精读
工具使用与长程 Agent 完成首版 74% 真实环境 traces、cross-harness 对照、Agent RL 曲线与安全案例
原生多模态 完成首版 76% 真实视觉 Token traces、跨分辨率消融、OCR 失败案例与视觉 Agent 安全轨迹
稀疏计算与 MoE 完成首版 74% 真实负载 traces 与专家特化案例
长上下文专题 完成首版 72% 真实模型配置、内核细节与失败案例
大规模训练系统 完成首版 71% 真实集群 traces、故障案例与精确 topology 配置
推理服务与低成本部署 完成首版 78% 真实 GPU kernel / workload traces、功耗与跨框架复现
数值精度、优化器与稳定性 完成首版 75% 真实 kernel 吞吐、长程训练 traces 与逐图论文精读
评测、安全与“到底强不强” 完成首版 79% 真实 cross-harness 复跑、Judge 元评测与动态污染案例
引用与事实检查 进行中 57% 自动化外链复查与来源等级扩展
开源仓库 已完成首版 100% 持续提交研究与网站迭代
k1412 部署 已完成首版 100% 每轮发布保留不可变镜像与回滚点

已完成

  • 建立长期任务目标与阶段计划。
  • 确认 K3 官方 47 页技术报告与官方模型仓库。
  • 提取技术报告目录与 151 条参考来源,建立本地只读研究缓存。
  • 从报告反推出 17 个专题与三条贯穿案例。
  • 提炼参考网站的编辑设计语言。
  • 确认 git.k1412.top 为 Gitea/Forgejo 兼容服务且本机 HTTPS 凭据可用于既有仓库。
  • 使用 Grok CLI 检索并形成约 95 篇一手论文的补充路线,主代理已回查关键来源。
  • 完成 486 篇关键论文索引,覆盖 16 个标签专题与 Kimi/DeepSeek 聚光主线。
  • 完成可检索、可按专题筛选的论文库页面。
  • 完成 K3、语言模型前史、Transformer 基础、表示/位置/残差、DeepSeek 谱系、Scaling Laws、数据工程、长上下文、MoE、指令微调与人类偏好、推理、Agent、原生多模态、训练系统、推理服务、数值优化与评测安全十七篇首版长文。
  • 完成 K3 三轴架构、八联报告实验与四联开放工件实验、语言模型前史四联实验、Transformer 四联实验、表示深度四联实验、DeepSeek 十三联实验、长上下文、MoE 路由、推理三页签,以及训练系统、推理服务、Scaling、数据工程、数值、Alignment、Agent、原生多模态与评测安全专题各四页签等八十个原创交互视图。
  • 完成长上下文首版:五张成本账、26 篇一手论文、10+ 机制图与 8 策略交互实验室。
  • 核验 FlashAttention、DeepSeek-V2/V3.2/V4、Kimi Linear/K3 等六份论文原文,并建立长上下文研究账本。
  • 核验 Switch、ST-MoE、DeepSeekMoE、Loss-Free、V3、LatentMoE 与 K3 原文,并建立 MoE 研究账本。
  • 完成 MoE 首版:六张账、19 篇一手论文、完整 DeepSeek/K3 主线与路由—容量—通信实验室。
  • 为推理专题缓存并核验 23 份一手论文,另复用 K3 原报告,建立 24 份来源的研究账本。
  • 明确 CoT / verifier / test-time compute、PPO → GRPO、DeepSeek-R1 与 Kimi k1.5 → K3 四条主线。
  • 分清 K3 partial rollout 的 off-policy 稳定化与 MOPD 的 student on-policy 逐 Token 蒸馏。
  • 完成推理首版:八张账、30 篇一手论文链、DeepSeek/Kimi 双主线与预算—GRPO—MOPD 三页签实验室。
  • 推理首版以提交 dce94b2、不可变镜像 20260728T164043Z-dce94b2 发布;NAS/VPS/HTTPS/生产 Chrome 全链路通过。
  • 训练系统专题完成首轮证据账本:九张资源账、37 个一手节点、DeepSeek-V2/V3/V4 与 Kimi K2/K2.5/K3 系统谱系。
  • 缓存并核验 18 篇训练系统核心论文,逐项校正 ZeRO 字节账、pipeline bubble、collective 口径、context parallel 与 MoonEP 上界。
  • 将 Grok 产物降级为明确标注的未核验 leads;正式账本只采用回查一手论文后的结论。
  • 完成训练系统首版:15 节长文、37 个一手节点、12 类机制图与显存—网格—气泡—通信四页签实验室。
  • 训练系统真实 Chrome 断言通过:OOM、无效 mesh、DualPipe 参数副本、overlap 与 MoonEP buffer 均正确响应。
  • Astro 类型检查、生产构建、12 个内部路由、464 个站内引用和桌面/移动端视觉检查通过。
  • 训练系统首版以提交 c6306fe、不可变镜像 20260728T172750Z-c6306fe 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书与生产 Chrome 全链路通过。
  • 创建 wuyang/llm-atlas 公开仓库,匿名 API 确认 private: false。
  • 当前生产镜像通过健康检查、16 个页面路由、关键资源与九套专题生产 Chrome 回归。
  • 通过 Unraid Compose Manager、Nginx Proxy Manager 与 HTTPS 发布首版。
  • 启动 Scaling Laws 专题:缓存 22 篇新的一手论文,建立九张账、DeepSeek / Kimi 双谱系与四实验首轮证据框架。
  • 使用 Grok Headless 扩展 Scaling 候选路线,并纠正其对 K3 正式报告存在性的错误;线索与正式账本分离。
  • 完成 Scaling Laws 首版:16 节长文、29 个一手节点、九张账与曲面—部署—复用—涌现四联实验。
  • Scaling 真实 Chrome 断言通过:IsoFLOP 谷底、生命周期最优点、重复数据衰减和指标阶跃均正确响应。
  • 对 Scaling、训练系统、推理与 MoE 执行全量浏览器回归;12 项桌面导航、移动菜单和首页新章入口无回归。
  • Scaling 首版以提交 eff0e4c、不可变镜像 20260728T181742Z-eff0e4c 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、12 路由与生产 Chrome 全链路通过。
  • 启动数据工程专题:回查 K3/K2、DeepSeek LLM/Math/V2/V3/V4 数据章节,并将 Grok 线索永久隔离为未核验候选。
  • 建立 1264 行正式研究账本:十二张账、2019→2026 历史主线、DeepSeek/Kimi 双谱系、四实验合同与公开未知项。
  • 完成数据工程首版:18 节长文、31 个一手节点、十余组机制图与流水线—去重—混合—改写四联实验。
  • 论文库新增「数据」标签与 20 个一手节点,从 182 篇扩充至 202 篇。
  • 数据工程真实 Chrome 断言通过:激进过滤、semantic 去重误伤、数学 mixture 和失控合成均正确响应,桌面 / 390px 移动端无溢出。
  • 对 Scaling、训练系统、推理与 MoE 重新执行全量浏览器回归;13 项桌面 / 移动导航和首页数据新章入口无回归。
  • Astro 类型检查、生产构建、13 个页面路由、527 个站内引用和 20 个跨页锚点全部通过。
  • 数据工程首版以源提交 ee0361b、不可变镜像 20260728T190932Z-ee0361b 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、13 路由、门户与生产 Chrome 全链路通过。
  • 启动数值精度、优化器与稳定性专题:回查 K2/K3、DeepSeek-V3/V4 原文,并缓存核验 mixed precision、BF16、FP8、MX、QAT、AdamW、μP、Muon 与稳定性论文。
  • 使用 Grok Headless 扩展 40 个候选节点;将错误年份、不可核实新稿和无一手证据结论保留在独立 leads,不进入正式账本。
  • 建立数值专题正式研究账本:十张数值账、格式/量化/优化器/稳定性主线、DeepSeek/Kimi 双谱系、四实验合同与公开未知项。
  • 完成数值专题首版:19 节长文、36 个一手节点、十余组机制图与格式—状态—更新—失稳四联实验。
  • 论文库新增「优化器」标签与 21 个一手节点,从 202 篇扩充至 223 篇。
  • 数值专题真实 Chrome 断言通过:FP16 subnormal、E4M3 overflow、MX block outlier、状态字节、Full/Per-Head Muon 与四类稳定性防线均正确响应。
  • 对数据工程、Scaling、训练系统、推理与 MoE 重新执行全量浏览器回归;14 项桌面 / 移动导航和首页数值新章入口无回归。
  • Astro 类型检查、生产构建、14 个页面路由、593 个站内引用和 19 个跨页锚点全部通过。
  • 数值专题首版以源提交 c21af18、不可变镜像 20260728T200309Z-c21af18 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、14 路由、门户、公开 Forgejo 与生产 Chrome 全链路通过。
  • 启动语言模型前史专题:以八张独立问题账拆开预测单位、概率信息、上下文、稀疏性、表示、记忆、转导与成本,避免伪单线架构史。
  • 使用 Grok Headless 扩展 45+ 候选一手节点;将错误元数据、过强因果和未核实旧论文永久保留在独立 leads。
  • 建立语言模型前史正式研究账本:33 个正式节点、逐篇旧瓶颈/贡献/遗留问题、四实验合同与 19 组原创重绘清单。
  • 完成语言模型前史首版:20 段长文、Shannon → N-gram → neural LM → RNN/LSTM → Seq2Seq/Attention 完整问题链,以及 DeepSeek/K3 当代回声。
  • 论文库新增 24 个语言模型前史节点,从 223 篇扩充至 247 篇;DeepSeek-V3/V4 与 K3 补充「基础」映射。
  • 语言模型前史真实 Chrome 断言通过:零概率/平滑、one-hot 选择、指数记忆衰减、Attention 对齐、键盘 tabs 与 390px 移动端均正确响应。
  • 语言模型前史首版以源提交 a54152d、不可变镜像 20260728T204916Z-a54152d 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、15 路由、门户、公开 Forgejo 与七套生产 Chrome 回归全链路通过。
  • 启动 Transformer 深度专题:以十张问题账拆开信息路径、匹配几何、可见性、多头、位置、局部计算、深度、架构目标、系统成本与当代映射。
  • 使用 Grok Headless 扩展 50 个候选节点;候选元数据与过强归因永久隔离在 TRANSFORMER_GROK_LEADS.md。
  • 建立 Transformer 正式研究账本:40 个节点、DeepSeek V2→V4 与 Kimi Linear→K3 双谱系、四实验合同与解释边界。
  • 完成 Transformer 深度首版:21 段正文与 QKV—Mask—多头位置—Block 成本四联实验。
  • 论文库补齐 Residual/Norm、相对位置、UniLM、多头冗余与解释争论等 11 个节点,从 247 篇扩充至 258 篇。
  • Transformer 深度首版以源提交 252e7d6、不可变镜像 20260728T212813Z-252e7d6 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、15 路由、门户、公开 Forgejo 与八套生产 Chrome 回归全链路通过。
  • 启动 Alignment 专题:按十二张账拆开目标、监督、SFT、偏好、RM、策略更新、直接优化、分布、约束、失效与证据,避免把 SFT / RLHF / DPO 写成彼此替代的三代技术。
  • 缓存并核验 24 份新的一手论文全文,复用 DeepSeek / Kimi / MOPD 报告,建立 44 节点正式论文链;Grok 45 条候选另存为未核验 leads。
  • 完成 Alignment 首版:22 节长文、十二张账、DeepSeek/Kimi 后训练双谱系,以及 SFT—偏好/RM—PPO/DPO—配方比较四联实验。
  • 论文库新增人类偏好学习、HH-RLHF、LIMA、RLAIF、RewardBench、KTO、ORPO、SimPO 等 22 个节点,从 258 篇扩充至 280 篇。
  • Alignment 真实 Chrome 断言通过:response-only / all-token SFT mask、both-bad preference、DPO 陈旧分布、K3 九教师配方、键盘 tabs 与 390px 移动端均正确响应。
  • Astro 类型检查、生产构建、16 个页面、713 个站内引用和 17 个跨页锚点通过;九套专题公网 Chrome 回归无异常。
  • Alignment 首版以源提交 8378e2a、不可变镜像 20260728T220753Z-8378e2a 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户与公开 Forgejo 全链路通过。
  • 启动 Agent 专题:用十四张问题账拆开环境、工具契约、控制循环、执行、验证、可靠性、安全、credit assignment 与长轨迹系统。
  • 使用 Grok Headless 扩展 Agent 候选路线;35 份新增 PDF 与 BFCL 的 ICML/PMLR 正式版本由主代理逐份回查,候选与正式证据永久分离。
  • 建立 Agent 正式研究账本:五层系统模型、五波历史主线、DeepSeek/Kimi 双谱系、四条因果链、四实验合同、常见误解与 52 节点阅读链。
  • 完成 Agent 首版正文与四联实验:控制循环、工具契约、pass@k / pass^k 可靠性、partial rollout / external KV / AgentENV 长程 RL 分开演示。
  • 论文库新增 TextWorld、WebArena、ToolSandbox、AgentDojo、RAGEN、Agent Lightning、AgentENV 等 34 个 Agent 节点,从 280 篇扩充至 314 篇。
  • Agent 真实 Chrome 断言通过:Direct/schema 故障传播、final-state verifier、pass@k / pass^k、非幂等副作用、wait-all 长尾、键盘 tabs 与 390px 移动端均正确响应。
  • Astro 类型检查、生产构建、17 个页面、792 个站内引用和 18 个跨页锚点通过;Agent 与既有九套专题本地 Chrome 全量回归无异常。
  • Agent 首版以源提交 25982cb、不可变镜像 20260728T225618Z-25982cb 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户、公开 Forgejo 与十套生产 Chrome 回归全链路通过。
  • 启动原生多模态专题:用十六张问题账拆开视觉语义空间、connector、Token 预算、OCR、视频、统一理解生成、RL、幻觉、评测、Agent 与系统。
  • 使用 Grok Headless 扩展七波、55+ 候选主线;218 行候选账与 1362 行正式一手证据账永久分离。
  • 本地完整校验 13 份多模态论文 PDF,并通过官方 arXiv HTML、作者仓库与既有 K2.5/K3 报告核验其余核心节点。
  • 完成原生多模态首版:30 个正文目录、DeepSeek-VL/VL2—Janus—OCR 三分支、Kimi 三代 MoonViT 与四联交互实验。
  • 论文库新增 ResNet、ALIGN、NaViT、DeepSeek-VL2、Janus、DeepSeek-OCR、Vision-R1 等 41 个节点,从 314 篇扩充至 355 篇。
  • 原生多模态真实 Chrome 断言通过:视觉 Token 超预算、K3 五维原生训练、OCR 报告 / 插值 / 证据外边界、vision-in-the-loop、键盘 tabs 与 390px 移动端均正确响应。
  • Astro 类型检查、生产构建、18 个页面、875 个站内引用和 17 个跨页锚点通过;多模态页面桌面 / 移动端无文档级横向溢出。
  • 原生多模态首版以源提交 9f56732、不可变镜像 20260728T235248Z-9f56732 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户、公开 Forgejo 与十一套生产 Chrome 回归全链路通过。
  • 启动推理服务与低成本部署专题:用十八本账拆开请求形状、SLO、权重、增长状态、内存分配、阶段、缓存、Kernel、推测、并行、网络、路由、故障与经济性。
  • 使用 Grok Headless 扩展 70 个候选节点;正式账本回查 26 份完整 PDF/TXT、官方会议页与 DeepSeek/Kimi 报告,候选与证据永久分离。
  • 完成推理服务首版:31 个正文目录、62 个一手节点、DeepSeek V2→V4 与 Mooncake→K3 双谱系,以及显存—阶段—推测—集群四联实验。
  • 论文库新增「推理服务」标签与 vLLM、SGLang、DistServe、Sarathi、FlashInfer、EAGLE-3、DeepGEMM、FlashMLA 等 45 个节点,从 355 篇扩充至 400 篇。
  • 推理服务真实 Chrome 断言通过:MHA OOM、chunked prefill 降低 stall、慢网络反噬 P/D、低验收率负加速、缓存故障重算、平均准入伤害短请求、键盘 tabs 与 390px 移动端均正确响应。
  • Astro 类型检查、生产构建、19 个页面、962 个站内引用和 16 个跨页锚点通过;推理服务页面桌面 / 移动端无文档级横向溢出。
  • 推理服务首版以源提交 db2b7d3、不可变镜像 20260729T003946Z-db2b7d3 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户、公开 Forgejo 与十二套生产 Chrome 回归全链路通过。
  • 启动评测与安全专题:用二十二张账拆开构念、指标、Prompt、采样、Harness、环境、Judge、污染、动态题、成本、威胁模型与披露。
  • 使用 Grok Headless 生成 12 个“协议陷阱”教学问题;全部保留在未核验 leads,正式事实回查一手论文与官方报告。
  • 本地缓存并校验 50 份新增 PDF/TXT,建立 1389 行正式研究账本、80 节点阅读链和 DeepSeek/K3 协议谱系。
  • 完成评测安全首版:33 个正文目录、二十二张测量账,以及指标校准—Judge 偏差—污染动态题—系统安全边界四联实验。
  • 论文库新增 BLEU、GLUE、HumanEval、MT-Bench、LiveBench、HarmBench、InjecAgent、AILuminate 等 50 个节点,从 400 篇扩充至 450 篇。
  • Astro 类型检查、生产构建、20 个页面、1053 个站内引用和 15 个跨页锚点通过;十三套专题 Chrome 回归、键盘 tabs 与 390px 移动端无异常。
  • 评测安全首版以源提交 cfd2367、不可变镜像 20260729T013530Z-cfd2367 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户、公开 Forgejo 与十三套生产 Chrome 回归全链路通过。
  • 启动表示、位置与残差专题:用二十张账拆开计算单位、接口参数、上下文化、位置对称性、外推、Norm 对象、拓扑、深度路由、激活极值与证据边界。
  • 使用 Grok Headless 扩展问题与候选论文;候选只保留在未核验 leads,66 节点正式阅读链全部回到一手论文与 K3/DeepSeek 官方报告。
  • 完成表示深度首版:29 个正文目录、二十张问题账,以及 Token/weight tying/context—位置几何—Norm/深度—Residual/FFN 四联实验。
  • 论文库新增 output embedding、ELMo、BLT、Fixup、ReZero、Hyper-Connections、mHC、xPos、FIRE、LongRoPE 等 30 个节点,从 450 篇扩充至 480 篇。
  • 表示深度真实 Chrome 断言通过:byte/subword、weight tying、RoPE/ALiBi/NoPE、Pre/Post/QK-Norm、mHC/AttnRes、V4 clamp/SiTU、键盘 tabs 与 390px 移动端均正确响应。
  • Astro 类型检查、生产构建、21 个页面、1145 个站内引用和 14 个跨页锚点通过;桌面 / 移动端无文档级横向溢出。
  • 表示深度与既有十三个专题共十四套本地真实 Chrome 回归全部通过。
  • 表示深度首版以源提交 a2c9298、不可变镜像 20260729T023329Z-a2c9298 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户、公开 Forgejo 与十四套生产 Chrome 回归全链路通过。
  • 启动 DeepSeek 二轮深读:Grok Headless 只用于发散候选问题,正式事实逐项回到 DeepSeek 论文、官方代码仓库与 K3 报告。
  • 建立 24 张正式问题账、10 次历史转向、4 个实验合同和 60 个一手 / 官方节点;明确 R1-Zero / R1、DAPO / Dr.GRPO、MLA RoPE cache、V3 FP8 角色与 V4/K3 状态边界。
  • 完成 DeepSeek 二轮正文:24 个目录、Dense→MoE→MLA→V3→R1→V3.2→V4 因果链、五条旁支、证据审计与稀疏容量—MLA 缓存—V3 协同—RL 偏差四联实验。
  • 论文库新增 DeepSeek-Coder/Coder-V2、ESFT、Prover-V1.5/V2 与 Engram 6 个节点,从 480 篇扩充至 486 篇。
  • DeepSeek 专属 Chrome 断言通过:24 张账、10 次转向、60 节点、MLA 576 元素、FP8 角色、DualPipe、MTP、GRPO/DAPO/Dr.GRPO、R1 身份、键盘 tabs 与 390px 移动端均正确响应。
  • Astro 类型检查、生产构建、21 个页面、1145 个站内引用和 14 个跨页锚点通过;DeepSeek 与既有十四专题共十五套本地真实 Chrome 回归全部通过。
  • DeepSeek 二轮以源提交 cd96dab、不可变镜像 20260729T031901Z-cd96dab 发布;NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户、公开 Forgejo 与十五套生产 Chrome 回归全链路通过。
  • 启动 K3 二轮深读:Grok Headless 只负责逐节查漏,候选问题、实验和红线保存在 K3_GROK_LEADS.md,正式结论逐项回到 47 页官方报告。
  • 建立 K3 正式研究账本:32 张问题账、Figure 1–16 / Table 1–5 视觉契约、8 个实验合同、完整数值红线与 100 节点阅读链。
  • 纠正 K3 原生多模态训练的旧表述:MoonViT-V2 从头训练,视觉与文本从训练开始在同一个 NTP objective 中联合优化,不采用“冻结语言模型再解冻”的 post-hoc 路线。
  • 完成 K3 二轮正文:30 个编号章节逐节覆盖架构、预训练、后训练、环境、系统、评测、案例与 XTML 附录,并与 DeepSeek / 17 个课程专题交叉链接。
  • 完成 K3 八联交互实验:Delta Rule、bounded decay、Block AttnRes、LatentMoE payload、SiTU-GLU、Quantile Balancing、MOPD/partial rollout、hybrid prefix cache。
  • K3 专属 Chrome 断言通过:32/21/100 内容计数、八个实验计算、键盘 tabs、事实纠错、桌面与 390px 移动端均无异常。
  • K3 二轮以源提交 b669615、不可变镜像 20260729T040336Z-b669615 发布;OCI digest sha256:498b7e43…31cdb3c,NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户、公开 Forgejo 与十六套生产 Chrome 回归全链路通过;保留 20260729T031901Z-cd96dab 回滚。
  • 启动 K3 三轮开放工件审计:固定 HF revision 9f62e4e9…b3569 与 FlashKDA revision 1ce47ea3…ffb0b,通过 config、index、safetensors headers 与 HTTP Range 避免把 1.56 TB 全量下载写成必要前提。
  • 闭合 93 层配置与 checkpoint 拓扑:69 KDA / 24 MLA、1 dense / 92 MoE、96 shards、497,220 tensor entries、247,296 expert packed tensors 与同数 scales、187 组 AttnRes projection / norm。
  • 完成 K3 四联开放工件实验:93 层真实配置条带、routed expert / MLA / MoonViT tensor anatomy、小参数范围审计,以及 FlashKDA 作者 benchmark / 本机编译 / synthetic router 探针边界。
  • 发现并保留官方工件的 A_log [128] vs config / remote code / FlashKDA API expected [96] 形状不一致;不宣布 checkpoint 损坏,也不把非标准 channel-wise 假设冒充真实 forward。
  • FlashKDA 本机编译边界已实测:RTX 5090 架构受支持,但当前 CUDA 12.8 低于官方 12.9+;g++ 13 已推进到 nvcc,随后因 CUDA headers / glibc declarations 冲突停止,kernel 尚未执行。
  • 第三轮证据快照、可复现探针脚本与正式审计账本已进入开源树;原始权重字节不提交,真实观测 O、推导 D、执行 X、合成 S 与未决 U 分开标记。
  • K3 新四视图本地真实 Chrome 回归通过:93 层条带、tensor group、参数分布、benchmark/router 切换、键盘 tabs、桌面与 390px 移动端均无异常。
  • K3 三轮开放工件里程碑以源提交 be2b291、不可变镜像 20260729T044605Z-be2b291 发布;OCI digest sha256:99aa953e…d00cdf,NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户与十六套生产 Chrome 回归全链路通过;保留 20260729T040336Z-b669615 回滚。
  • FlashKDA 隔离构建闭环:主机 CUDA 13.1 / glibc 2.43 仍在 rsqrt declarations 冲突;改用 CUDA 13.0.2 / Ubuntu 24.04 / glibc 2.39 后成功产出 CPython 3.12、sm_120a wheel,SHA-256 14687b6d…2158d。
  • RTX 5090 正确性闸门通过:one chunk、partial tail、multi-chunk、96 heads 与 varlen 共 6 组,FlashKDA output / final state 和官方 torch_ref.py 逐元素完全相等,max absolute error 0。
  • RTX 5090 K3 形状受控计时完成:fixed / varlen、BF16 / no-state / FP32 state 共 1,800 个 CUDA Event samples;fixed BF16 mean 2.6210 ms、P95 2.6437 ms,varlen BF16 mean 2.3335 ms、P95 2.3574 ms。
  • 可复现 Dockerfile、运行脚本与机器可读 JSON 接入开源树;网站第四视图把作者 H20/GB200 表、本机 RTX 5090 值、exact suite、构建链、synthetic router 和 A_log 未决冲突分开显示。
  • K3 FlashKDA 执行里程碑以源提交 2ef846f、不可变镜像 20260729T053852Z-2ef846f 发布;OCI digest sha256:08ad5b55…32e6,NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户与十六套生产 Chrome 回归全链路通过;保留 20260729T044605Z-be2b291 回滚。
  • 启动 DeepSeek 三轮真实权重执行:固定官方 V2-Lite revision 604d5664…82de0,审计 29.261 GiB / 4 shards,并以第一分片的完整层边界执行 layer 0–6。
  • RTX 5090 连续 forward 闭环:4 条固定 prompt、90 个有效 token、6 个 MoE 层产生 3,240 次真实 top-6 路由;记录每层 [4,27,576] MLA 投影与 HF eager 展开 K/V shapes。
  • 独立复跑 31/31 exact:来源、配置、tokenization、逐层 hidden hashes、MLA shapes、aggregate loads 与全部 token routes 完全一致;计时明确不比较。
  • DeepSeek 新四视图本地真实 Chrome 回归通过:逐 token 路由、覆盖/均衡分账、latent/HF eager cache 计算、27 层执行断面、键盘 tabs 与 390px 移动端均无异常。
  • DeepSeek 三轮首个真实权重执行里程碑以源提交 e864205、不可变镜像 20260729T062034Z-e864205 发布;OCI digest sha256:c3c37631…91addc,NAS、VPS/Tailscale、NPM、DNS、HTTPS、证书、门户与十六套生产 Chrome 回归全链路通过;保留 20260729T053852Z-2ef846f 回滚。
  • DeepSeek 真实吸收式缓存闭环:同一官方 V2-Lite layer-1 权重与真实 hidden state 依次执行 HF eager、V3 naive 与 V3 absorb;26-token BF16 active cache 从 266,240 B 降至 29,952 B,实际比率 8.8889× / 88.75%。
  • 权重吸收正确性闸门通过:HF eager↔V3 naive BF16 max |Δ| 0.0012207,V3 naive↔absorb BF16 max |Δ| 0.00390625;同一 BF16 权重提升到 FP32 后 naive↔absorb max |Δ| 1.19e-7,所有输出 finite。
  • 独立吸收实验复跑 byte-exact:两份完整 JSON SHA-256 均为 6b4c714a…e63d;实验脚本、机器可读结果与正式研究账本进入开源树。
  • FlashMLA 架构边界闭合:固定 revision 15f13e50…a7772c6 与 CUTLASS submodule;官方矩阵、gencode 与 dense runtime guard 只覆盖 SM90/SM100,本机 SM120 不宣称优化 kernel 已执行;两次隔离构建失败位置如实入账。
  • DeepSeek 吸收式缓存里程碑以源提交 9ba26da、不可变镜像 20260729T065822Z-9ba26da 发布;OCI digest sha256:0184d7e8…905659,复用 NAS 12010→8080、NPM host 31 / cert 41、门户 LLM ATLAS / projects / 180,十六套生产 Chrome 回归全通过;保留 20260729T062034Z-e864205 回滚。
  • DeepSeek 路由探针从 4 条手写 prompt 扩展为 4 个公开域:WikiText-2、TNEWS、HumanEval、GSM8K 各 32 条;固定 revision、原始文件 SHA-256、哈希选样 salt、source ID、tokenizer 与右截断合同。
  • RTX 5090 执行 128 条 prompt、8,460 个有效 token;layer 1–6 每层产生 50,760 次真实 top-6 选择,六层共 304,560 次,逐 prompt 的 64 维 integer load 全量保留。
  • 统计单位从 token 修正为 prompt:域内有放回重采样 2,000 次,固定 seed 20260729,同时报告 token-weighted / prompt-balanced 的 CV、Gini、effective experts、top share、64 专家份额与两两 JSD 95% percentile 区间。
  • 多域路由正式运行与独立重跑 byte-exact:两份 1.6 MiB JSON SHA-256 均为 4678a1d1…a09e4;六联交互实验可切换层与聚合口径,并永久注明不是训练分布、线上流量、专家语义或显著性检验。
  • DeepSeek 多域路由版本以源提交 5bcfd58、不可变镜像 20260729T073342Z-5bcfd58 发布;OCI digest sha256:dd8bcbce…33abd4,NAS / VPS / NPM / DNS / TLS / gzip / 门户与十六套生产 Chrome 回归全通过;保留 20260729T065822Z-9ba26da 回滚。
  • 长度敏感性实验固定同一批 128 条源 prompt:四域均要求至少 24 tokens,再用同一固定 salt 选出 32 条;16-token 输入严格是 24-token 输入前缀,避免换样本后把内容差异误记成长度效应。
  • RTX 5090 新增 16 / 24-token 两个等长 cohort:共 5,120 个有效 token、184,320 次真实 top-6 路由;两档独立重跑分别以完整 JSON SHA-256 f8d437d5…aebd / bed54835…436 byte-exact。
  • 成对 prompt bootstrap 闭环:2,000 次重采样共用同一组 prompt indices;16→24 tokens 后 24 个 layer×domain 中 22 个 CV 点估计下降、20 个区间完全低于零,最大变化为 Layer 2 Python 代码 0.969→0.718、prompt-balanced Δ -0.251 [-0.283,-0.215]。
  • 中文↔代码 JSD 在六层均下降但没有消失;Layer 2 0.091→0.065、Δ -0.026 [-0.036,-0.018]。结论限定为固定前缀长度敏感性,不推出因果内容效应、专家语义或训练/线上总体。
  • 自然长度与等长 16 / 24 三 cohort 合计 13,580 个有效 token、488,880 次真实路由;机器可读比较结果第二次生成 SHA-256 均为 00bdc7fe…61a1,网站加入 cohort、层、聚合口径与 paired delta 联动。
  • DeepSeek 长度敏感性版本以源提交 9ca0850、不可变镜像 20260729T081849Z-9ca0850 发布;OCI digest sha256:c2146735…3d641,NAS / VPS / NPM / DNS / TLS / HTTP2 / gzip / 门户与十六套生产 Chrome 回归全通过;保留 20260729T073342Z-5bcfd58 回滚。
  • 官方 chat-template 扰动固定同一批 128 条 source prompt 与 23 个 canonical content tokens,在同一 padded batch 运行 raw / user / generation 384 个变体;用相对字符跨度与 token ID 的交集精确对齐 2,874 个内容 token。
  • RTX 5090 新增 10,612 个输入 token、382,032 次真实 top-6 路由,使公开语料累计达到 870,912 次;完整 JSON 独立复跑 SHA-256 均为 da1f1033…bc1b9,byte-exact。
  • causal suffix 负对照闭环:USER→GENERATION 的 3,642-token 共享前缀在每层全部 ordered top-6 exact,六层合计 21,852 / 21,852;对齐内容的 CV Δ / TV / JSD 全为零,而完整输入因新增 Assistant: token 保持非零分布变化。
  • RAW→USER 的模板敏感性不写成单向规律:L1 英文/中文与 L2 中文/代码更平,L3 中文、L5 中文/代码与 L6 四域更集中;网站第七个真实工件页签联动 layer、scope、aggregation,并展示 paired 95% 区间与逐 token top-6 稳定性。
  • 模板扰动里程碑本地闸门通过:69 个 Astro 文件零诊断、21 个页面、1,151 个站内引用、12 个跨页锚点零失败,十六套真实 Chrome 回归全部通过,桌面与 390px 移动端无文档级横向溢出。
  • DeepSeek 官方模板敏感性版本以源提交 b0acc8b、不可变镜像 20260729T092426Z-b0acc8b 发布;OCI digest sha256:f1bf2d09…e1463,NAS / VPS / NPM / DNS / TLS / HTTP2 / gzip / 门户与十六套生产 Chrome 回归全通过;保留 20260729T081849Z-9ca0850 回滚。
  • 消息历史实验复用上一轮完全相同的 128-source / 23-content-token cohort,把 system 与 one-shot 构成 2×2:system 在两个 one-shot 水平都固定每条 +16 tokens,one-shot 在两个 system 水平都固定每条 +17 tokens,四格同一 padded batch。
  • RTX 5090 执行 512 个消息历史变体、24,040 个输入 token,新增 865,440 次真实 top-6 路由,使公开语料累计达到 1,736,352 次;四格各有相同的 2,874 个精确对齐目标 token。
  • 2×2 source-paired bootstrap 同报 system main、few-shot main 与 difference-in-differences interaction;CV 区间完全正 / 负 / 跨零分别为 system 8/13/3、few-shot 7/7/10、interaction 8/8/8,不压成单向规律。
  • 固定消息中的历史缓冲模式闭环:system-at-F1 相对 system-at-F0 的目标 TV 在 24 / 24 个 layer×domain 全部下降,均值 .073→.019;绝对 CV 变化 21 / 24 下降,逐 token top-6 set exact 在六层均明显提高。
  • 消息历史正式运行与独立复跑 SHA-256 均为 5765fbf8…c1fb,约 28 MiB JSON byte-exact;网站第八个真实工件页签联动 layer、scope、aggregation 与 system/few-shot/interaction depth map。
  • 消息历史里程碑本地闸门通过:69 个 Astro 文件零诊断、21 个页面、1,151 个站内引用、12 个跨页锚点零失败,十六套真实 Chrome 回归全部通过,桌面与 390px 移动端无文档级横向溢出。
  • DeepSeek 消息历史因子里程碑以源提交 efe3ffc、不可变镜像 20260729T100729Z-efe3ffc 发布;OCI digest sha256:e2ea1c35…77e2f,NAS / VPS / NPM / DNS / TLS / HTTP2 / gzip / 门户与十六套生产 Chrome 回归全通过;保留 20260729T092426Z-b0acc8b 回滚。
  • 等长历史控制把 system 开/关与 none / repeated-token filler / fixed demo 组成 2×3;filler 与 demo 在两条 system 水平都逐条精确 +17 tokens,并保持相同角色、assistant EOS、目标位置与六格 batch。
  • RTX 5090 执行 768 个输入变体、38,236 个输入 token,新增 1,376,496 次真实 top-6 路由,使公开语料累计达到 3,112,848 次;六格各有相同的 2,874 个精确对齐目标 token。
  • 目标内容 system-edge TV 呈 none .0738 → filler .0378 → demo .0188 两级阶梯;none→filler 与 filler→demo 都在 24 / 24 个 layer×domain 下降,且 24 / 24 source-paired 区间完全低于零。
  • filler 不冒充“无语义”或纯距离:x 是学习过的重复 token;CV edge 方向不统一,完整输入只有 20/24、23/24 点估计下降,主结论严格限定为精确目标内容 route-distribution TV。
  • 六格正式运行与独立复跑 SHA-256 均为 423a095d…e648e,约 41 MiB JSON byte-exact;网站第九个真实工件页签联动 layer、scope、aggregation 与两个 TV 台阶 depth map。
  • 等长历史控制本地闸门通过:69 个 Astro 文件零诊断、21 个页面、1,151 个站内引用、12 个跨页锚点零失败,十六套真实 Chrome 回归全部通过,9 页签桌面端与 390px 移动端均无文档级横向溢出。

正在进行

  • K3 三轮下一闸门:获得真实 token hidden states、expert load 与 cache traces,解释或修订 A_log [128] 工件冲突,再做 Figure 3/4/5 数值重绘和独立小模型复现。
  • DeepSeek 三轮下一闸门:在官方支持的 SM90 环境执行 FlashMLA 优化 kernel;扩到完整 27 层并继续拆分 EOS、角色、多 filler、示例内容与 batch shape,再推进 FP8 / pipeline traces 与 R1-like RL 小模型复现。
  • 表示、位置与残差二轮:真实 hidden-state / norm traces、长上下文位置外推复现与 mHC / AttnRes 深层稳定性消融。
  • 评测安全二轮:真实 cross-harness / pass@k 复跑、Judge 元评测、动态污染与过拒案例。
  • 推理服务二轮:真实 GPU kernel / workload traces、功耗与成本、跨 vLLM / SGLang / TensorRT-LLM 复现。
  • 原生多模态二轮:真实视觉 Token traces、跨分辨率 / connector 消融、OCR 与视觉 Agent 安全失败案例。
  • Agent 二轮:真实环境 traces、cross-harness ablation、Agent RL 训练曲线与提示注入案例。
  • Transformer 二轮:多头电路逐图、Pre/Post-LN 真实 traces、Flash/KV kernel 与模型配置对照。
  • 语言模型前史二轮:Kneser–Ney / LSTM / Bahdanau 逐图精读、真实小语料复现与 tokenizer 公平性案例。
  • Scaling Laws 二轮精读:真实拟合复现、逐篇图表、置信区间、外推失败与更多模型族对照。
  • 数据工程二轮:FineWeb / DCLM / Dolma / ROOTS 逐图精读、真实去重误伤、mixture traces 与污染案例。
  • 大规模训练系统二轮:真实集群 traces、故障恢复案例与精确 topology / kernel 配置。
  • 数值与稳定性二轮:真实 kernel 吞吐、长程失稳 traces、optimizer / quantization 逐图复现。
  • 推理专题二轮:真实 pass@k 曲线、PRM 失败案例与逐篇图表精读。
  • 长上下文专题的真实模型配置对比、内核细节与失败案例二轮深化。
  • MoE 专题的真实集群 traces、专家特化案例与二轮外部证据。

研究账本

日期 决策/发现 影响
2026-07-29 K3 FlashKDA 在隔离 CUDA 13.0 / glibc 2.39 构建并回到 RTX 5090 执行 主机头文件 ABI 问题与 GPU 架构支持分离;wheel checksum、Dockerfile 与执行 JSON 可审计
2026-07-29 FlashKDA 本机实测永久与作者 H20 / GB200 表分账 6/6 exact 与 1,800 个 latency samples 可称 X;未跑本机 FLA 就不计算本机 speedup
2026-07-29 K3 FlashKDA 执行里程碑发布到既有 llm-atlas 链路 2ef846f、不可变镜像、NAS 12010→8080、NPM 31 / cert 41、门户 order 180 与十六套生产回归闭环
2026-07-28 网站命名为 LLM Atlas / 大模型技术全景 既能容纳 K3 深读,也能承载完整 LLM 课程
2026-07-28 K3 作为“汇流点”,不是课程起点 初学者可以先学基础,高阶读者可以从 K3 反向跳转
2026-07-28 优先重绘论文图并标明“简化/改绘” 图可缩放、可交互,也减少脱离上下文复制论文图片
2026-07-28 Grok 只用于线索扩展与交叉检查 正文事实必须回到论文、官方仓库或正式文档
2026-07-28 首批论文库按问题与专题多标签组织,推理研究后扩充至 146 篇 论文库承担发现入口,专题正文承担深度精读与机制复核
2026-07-28 源码公开到 git.k1412.top/wuyang/llm-atlas 路线、进度、研究方法和内容变更均可追踪
2026-07-28 站点使用不可变镜像与 Compose Manager 部署 每次发布保留明确版本、健康检查和回滚点
2026-07-28 长上下文按计算、缓存、位置、状态容量、系统五张账单组织 避免把 FlashAttention、位置外推和“记住更久”混成同一个问题
2026-07-28 交互缓存数字统一标记为教学估算 展示增长规律,不冒充任一模型的真实线上显存基准
2026-07-28 MoE 按六张账组织,路由算法与集群执行分开核算 避免用“稀疏所以便宜”跳过容量、负载、通信与权重读取
2026-07-28 “aux-loss-free”保留论文真实边界 区分 selection bias、mixture weight、z-loss 与 V3 的极小 sequence-wise loss
2026-07-29 推理专题按结果、覆盖、选择、过程、预算、优化、分布、系统八张账组织 避免把 pass@1、pass@k、搜索收益、RL 能力增长与系统吞吐混成“会思考”
2026-07-29 K3 partial rollout RL 与 MOPD 在正文中强制并排 前者显式容忍跨迭代 stale trajectory,后者由当前 student 采样并接收稠密 teacher signal
2026-07-29 推理首版用 30 篇一手论文和三页签实验闭环 分开演示预算分配、GRPO 聚合偏置和 K3 九教师 MOPD,不合成伪“总分”
2026-07-29 推理首版发布到既有 llm-atlas 生产链路 Compose Manager、NPM host 31 / cert 41、10 路由与公网交互均复核通过
2026-07-29 训练系统按模型状态、激活、计算划分、气泡、collective、EP、CP、数值、可靠性九张账组织 任何优化都必须说明节省哪种资源、把成本移到哪里
2026-07-29 并行度不再机械写成 DP×TP×PP×EP×CP 先定义 device mesh、group overlap 与作用范围,再核算 world size
2026-07-29 DeepSeek “近零通信”统一解释为特定 overlap 下的 exposed critical-path time 防止把隐藏通信误写成没有传输字节
2026-07-29 Grok 训练系统包只保留为 TRAINING_SYSTEMS_GROK_LEADS.md 候选论文、数字和公式不得越过一手证据账本直接进入站点
2026-07-29 训练系统首版用四个独立实验闭环 显存、device mesh、pipeline 与通信不合成一个伪“系统总分”
2026-07-29 论文库随训练系统一手链扩充到 166 篇 新增 checkpoint、mixed precision、自动并行、FSDP、MoE/CP 与大集群系统节点
2026-07-29 训练系统首版用不可变镜像 20260728T172750Z-c6306fe 发布 保留 12010→8080、NPM host 31 / cert 41 与公开 Forgejo;11 路由、关键资源和四页签生产交互全部复核
2026-07-29 Scaling Laws 拆成观测量、模型、数据、算术、配比、配方、外推、经济目标与能力阶段九张账 防止把 20 TPP、6ND、MoE 总参、部署成本和“涌现”混成一条万能曲线
2026-07-29 Grok 对 K3 报告存在性的错误保留在未核验 leads 正式账本回到 arXiv 2607.24653 与本地 47 页报告,展示来源分级为何必要
2026-07-29 Scaling 首版用 29 个一手节点和四个独立实验闭环 IsoFLOP、训练—部署、数据复用与指标涌现分开建模,不合成伪“规模总分”
2026-07-29 论文库随 Scaling 一手链扩充到 182 篇 新增早期跨任务幂律、Gopher、数据受限、过训练、部署经济、复现和 task ladder 节点
2026-07-29 Scaling 首版用不可变镜像 20260728T181742Z-eff0e4c 发布 OCI digest sha256:802e4041…cf83;保留 12010→8080、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo
2026-07-29 数据工程拆成来源、解析、语言、质量、唯一性、污染、混合、变换、Tokenizer、Packing、课程与价值十二张账 防止用一个“高质量 Token”标签掩盖单位、误删、治理与课程
2026-07-29 Grok 数据研究包只保留为 DATA_PRETRAINING_GROK_LEADS.md 模型发现候选不越过一手证据门槛;K3 总训练 Token、工业 mixture 和 source map 保持未知
2026-07-29 K2 改写、K3 2.5×、V3/V4 packing 边界在正文主视区显式限定 不把早期 SimpleQA 对照外推为普遍定律,不把模型族收益归因给单一数据技巧
2026-07-29 数据工程首版用四个独立实验闭环 文档保留、去重误伤、领域 exposure 与改写课程分开建模,不合成伪“数据质量总分”
2026-07-29 论文库新增数据标签并扩充到 202 篇 新增 CCNet、ROOTS、Dedup、DoReMi、DCLM、WRAP、MATES、MM1、Swallow 等 20 个节点
2026-07-29 数据工程首版用不可变镜像 20260728T190932Z-ee0361b 发布 OCI digest sha256:2fe8f3aa…59c8;复用 12010→8080、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo
2026-07-29 数值专题拆成表示、缩放、计算、累加、搬运、更新、参数化、观测、恢复与证据经济十张账 防止把一个 dtype 标签误当成完整训练配方
2026-07-29 Grok 数值研究包只保留为 NUMERICS_GROK_LEADS.md 40 个候选必须回到论文/官方报告核验;错误元数据和不可核实结论不进入正文
2026-07-29 K2/K3 与 DeepSeek-V3/V4 数值谱系显式保留边界 Per-Head Muon 不替代 QK-Clip;K3 2.5× 不归因单项技巧;V3 失败实验与高精度保留项不省略
2026-07-29 数值首版用四个独立实验闭环 格式误差、状态字节、矩阵更新与失稳防线分开建模,不合成伪“效率总分”
2026-07-29 论文库新增「优化器」标签并扩充到 223 篇 新增 Shampoo、Adafactor、μP、8-bit optimizer、FP8-LM、FP4 training、稳定性代理等 21 个节点
2026-07-29 数值首版用不可变镜像 20260728T200309Z-c21af18 发布 OCI digest sha256:2155fd7f…c386;复用 12010→8080、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo
2026-07-29 语言模型前史拆成八张彼此独立的账 不再把 Tokenizer、平滑、Embedding、循环记忆、Seq2Seq 与系统成本压成一条“架构越来越强”的年表
2026-07-29 Grok 语言模型候选与正式证据永久分离 45+ 候选只负责召回;正式 33 节点必须回到 DOI、ACL/PMLR/ISCA、出版社页面或官方技术报告
2026-07-29 K3 / DeepSeek 的 NTP、MTP、多模态与 draft 分角色记账 统一视觉/文本 next-token objective 不排斥 one MTP layer;MTP 与 speculative draft 都不写成取消自回归
2026-07-29 论文库扩充到 247 篇 新增 Shannon 1951、Good、Katz、Kneser–Ney、LSTM、RNNLM、Seq2Seq 前夜与输出成本等 24 个一手节点
2026-07-29 语言模型前史首版用不可变镜像 20260728T204916Z-a54152d 发布 OCI digest sha256:fb646aba…fe923;复用 12010→8080、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo
2026-07-29 Transformer 按十张问题账组织 不再把 QKV、Mask、位置、Norm、训练目标、KV Cache、Flash 与当代架构压成一个“Block”
2026-07-29 Attention 权重与因果解释永久分离 热力图只描述中间计算和提出假设;因果结论需要消融、patching 或反事实干预
2026-07-29 论文库扩充到 258 篇 新增 Residual/Norm、relative position、UniLM、多头冗余、解释争论与 NormFormer 等 11 个节点
2026-07-29 Transformer 深度首版用不可变镜像 20260728T212813Z-252e7d6 发布 OCI digest sha256:db003faa…59fa;复用 12010→8080、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo
2026-07-29 Alignment 拆成十二张彼此独立的账 防止把“更会答”“更符合偏好”“更安全”“更可验证”压成同一个 alignment 分数
2026-07-29 Grok Alignment 线索与正式证据永久分离 45 条候选只负责查漏;公式、数字和历史结论必须回到一手 PDF / 会议页面
2026-07-29 DeepSeek 与 Kimi 后训练按阶段合同重建 R1-Zero 不外推为完整 R1;K3 partial rollout 与 MOPD 不混写;DPO 不被描述成取消偏好数据
2026-07-29 Alignment 首版用 44 个一手节点与四个独立实验闭环 SFT token mask、RM 偏置、PPO/DPO 更新与模型配方分开演示,不合成伪“对齐总分”
2026-07-29 论文库扩充到 280 篇 新增 22 个 SFT、偏好、RM、RLAIF、直接偏好优化与后训练评测节点
2026-07-29 Alignment 首版用不可变镜像 20260728T220753Z-8378e2a 发布 OCI digest sha256:ef3ad2a8…3048a;复用 12010→8080、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo
2026-07-29 Agent 按十四张彼此独立的问题账组织 模型、harness、工具、环境、验证器、可靠性与安全不再被压成一个 Agent 分数
2026-07-29 Agent 完成必须回到 final state function schema、工具执行、业务状态、策略合规与 pass^k 分层评价;模型自报完成不作为证据
2026-07-29 DeepSeek 与 Kimi Agent 谱系显式保留系统边界 V3.2/V4 的训练环境与 DSec、K3 的 white-box harness/AET/AgentENV 分层说明,不把模型、脚手架和基础设施混写
2026-07-29 Grok Agent 线索与正式证据永久分离 候选只负责查漏;公式、数字和系统结论必须回到一手论文、正式会议版本或官方报告
2026-07-29 论文库扩充到 314 篇 新增 34 个环境、工具、Web/SWE/桌面 Agent、可靠性、安全与 Agent RL 节点
2026-07-29 Agent 首版用不可变镜像 20260728T225618Z-25982cb 发布 OCI digest sha256:a781ad92…ba52;复用 12010→8080、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo
2026-07-29 原生多模态按五层管道与十六张账组织 像素、视觉塔、压缩 / connector、主干与输出 / 工具闭环分开定位;“原生”再拆成数据、目标、优化、输入输出与 Agent 五维
2026-07-29 Grok 多模态召回与正式证据永久分离 218 行候选账只做查漏;1362 行正式账本只接受一手论文、官方报告与可计算公式
2026-07-29 DeepSeek 多模态永久保留三分支 VL/VL2 的理解、Janus 的统一生成、OCR 的光学上下文压缩不画成错误单向代际谱系
2026-07-29 Kimi 三代 MoonViT 按训练制度重建 Kimi-VL 的 SigLIP + caption / 对齐,K2.5 的共享图像视频 / zero-vision SFT,K3 的从头共同 NTP 分开说明
2026-07-29 光学压缩实验显式分三级证据 DeepSeek-OCR 报告锚点、中间教学插值与超过已核范围的“不外推”在交互中使用不同状态
2026-07-29 论文库扩充到 355 篇 新增 41 个视觉表示、连接器、分辨率、OCR、视频、统一生成、评测与视觉 RL 节点
2026-07-29 原生多模态首版用不可变镜像 20260728T235248Z-9f56732 发布 OCI digest sha256:b9c66e4e…07955;复用 12010→8080、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo
2026-07-29 推理服务拆成十八本彼此独立的账 权重、增长状态、分配、阶段、batch、cache、kernel、推测、量化、网络、路由、故障与经济性不再压成一个 tokens/s
2026-07-29 Grok 推理服务召回与正式证据永久分离 70 个候选节点只负责查漏;26 份完整 PDF/TXT、会议页、官方仓库和模型报告承载正文事实
2026-07-29 DeepSeek 与 Kimi 服务谱系按状态对象重建 MLA→V4 异构状态和 Mooncake→KDA→K3 混合缓存分开讲,精确 KV 公式不套到异构状态上
2026-07-29 论文库扩充到 400 篇 新增 45 个内存管理、调度、缓存、P/D 解耦、量化、推测解码、kernel 与真实 workload 节点
2026-07-29 推理服务首版用四个独立实验闭环 显存、阶段干扰、推测验收和集群状态分开建模;作者报告、教学估算与 benchmark 永久分级
2026-07-29 推理服务首版用不可变镜像 20260729T003946Z-db2b7d3 发布 OCI digest sha256:06374603…fe752;复用 12010→8080、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo
2026-07-29 评测安全按二十二张测量账组织 构念、样本、指标、Prompt、采样、Harness、裁判、污染、成本与威胁模型不再压成一个榜单分
2026-07-29 Grok 评测线索与正式证据永久分离 12 个协议陷阱只负责教学查漏;50 份新增一手全文与 DeepSeek/K3 官方报告承载正文事实
2026-07-29 DeepSeek 与 K3 评测谱系按协议字段重建 R1 的非零温多采样 pass@1、V4 effort / context / tool budget 与 K3 §6 task-specific harness 分层说明
2026-07-29 论文库扩充到 450 篇 新增 50 个指标、套件、动态基准、Judge、代码 Verifier、安全与 Agent 风险节点
2026-07-29 评测安全首版用四个独立实验闭环 指标/校准、Judge/Arena、污染/动态题、系统/安全边界分开建模,不合成伪“模型总分”
2026-07-29 评测安全首版用不可变镜像 20260729T013530Z-cfd2367 发布 OCI digest sha256:3c4c34a8…50be6;复用 12010→8080、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo
2026-07-29 表示与深度按二十张问题账组织 计算单位、接口参数、上下文化、位置、外推、Norm 对象、拓扑、残差路由与非线性极值不再混成一个 hidden-state 名词
2026-07-29 Grok 表示候选与正式证据永久分离 候选问题和论文只负责查漏;66 节点正式链只接受一手论文与 K3/DeepSeek 官方报告
2026-07-29 K3 Block AttnRes 来源数按原报告重算 93 层按 12 层形成 8 个 layer blocks(7 个完整块加 1 个尾块),加 embedding 后共 9 个 block-level 来源
2026-07-29 DeepSeek 与 Kimi 的位置/深度稳定化分开建模 V2 decoupled RoPE、V4 partial RoPE/mHC/clamp 与 K3 MLA NoPE、KDA、AttnRes/SiTU 不压成单一代际结论
2026-07-29 论文库扩充到 480 篇 新增 30 个表示、位置、归一化、残差拓扑、激活函数与深层稳定性节点
2026-07-29 表示深度首版用四个独立实验闭环 Token 接口、位置几何、Norm/深度、Residual/FFN 分开操作;报告事实、数学推导与 toy model 永久分级
2026-07-29 表示深度首版用不可变镜像 20260729T023329Z-a2c9298 发布 OCI digest sha256:93c88bf2…145a23;复用 12010→8080、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo;保留 20260729T013530Z-cfd2367 回滚
2026-07-29 DeepSeek 二轮按二十四张对象账与十次问题转向重建 total/active、KV state、通信、数值角色、奖励偏差与长程状态不再压成单一“效率”
2026-07-29 Grok DeepSeek 候选与正式证据永久分离 候选只负责问题召回;60 节点正式链只接受一手论文、DeepSeek 官方仓库和 K3 官方报告
2026-07-29 R1-Zero、正式 R1、蒸馏与后续复现分四种身份 “无 reasoning SFT”不外推为无预训练先验;DAPO / Dr.GRPO 不冒充 DeepSeek 内部 R1 recipe
2026-07-29 V4 与 K3 按状态机器而非 1M 标签对照 CSA/HCA、mHC 与 KDA/MLA、AttnRes 分开;主模型 AttnRes 12 层 block 不与芯片 nano-model block size 2 混写
2026-07-29 论文库扩充到 486 篇 新增 DeepSeek-Coder/Coder-V2、ESFT、Prover-V1.5/V2 与 Engram 6 个旁支节点
2026-07-29 DeepSeek 二轮用四个独立实验闭环 稀疏容量、MLA 缓存、V3 协同与 RL 偏差分别操作;精确公式、作者报告和 teaching model 永久分级
2026-07-29 DeepSeek 二轮用不可变镜像 20260729T031901Z-cd96dab 发布 OCI digest sha256:4bfb3faf…fa3968;复用 12010→8080、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo;保留 20260729T023329Z-a2c9298 回滚
2026-07-29 DeepSeek 三轮以官方 V2-Lite 第一分片建立真实执行证据 layer 0–6 是完整连续边界;layer 7 跨分片即停止,不把部分下载写成完整生成
2026-07-29 MLA 算法状态与框架物化格式分两张账 V2-Lite latent 576 元素与 HF eager 5,120 元素同时报告;88.75% 不冒充 V2 论文 93.3%
2026-07-29 专家覆盖、负载均衡与语义永久分开 60–64/64 used 不推出 balanced;CV/Gini/effective 同报;expert ID 不跨层连线或命名
2026-07-29 DeepSeek 三轮首个真实权重版本以 20260729T062034Z-e864205 发布 OCI digest sha256:c3c37631…91addc;复用 12010→8080、NPM 31 / cert 41、门户 order 180;保留 20260729T053852Z-2ef846f 回滚
2026-07-29 MLA 576 元素缓存从算法合同升级为真实执行 官方 V3 naive / absorb 使用同一 V2-Lite 权重与 hidden state;26-token active cache 266,240 B→29,952 B,FP32 代数审计 max |Δ| 1.19e-7
2026-07-29 reference absorb 与 FlashMLA optimized kernel 永久分身份 前者已在 RTX 5090 执行;pinned FlashMLA 只列 SM90/SM100 并只生成 sm_90a/sm_100f,本机 SM120 明确标为未支持/未执行
2026-07-29 DeepSeek 吸收式缓存版本以 20260729T065822Z-9ba26da 发布 OCI digest sha256:0184d7e8…905659;复用 12010→8080、NPM 31 / cert 41、门户 order 180;十六套生产 Chrome 回归通过,保留 20260729T062034Z-e864205 回滚
2026-07-29 大样本路由使用四个可重建公开域 WikiText-2 / TNEWS / HumanEval / GSM8K 各 32 条;只用 text / sentence / prompt / question,答案不输入、代码不执行
2026-07-29 路由区间以 prompt 而非 token 为抽样单位 同 prompt token 有共同前缀与主题,不能伪装成独立样本;域内 2,000 次 bootstrap,同时保留 token 加权与 prompt 等权
2026-07-29 路由分布差异与 expert semantics 永久分开 Layer 4 中文、Layer 5/6 数学的集中度与域间 JSD 只描述 128-prompt 探针;不命名 expert,不冒充训练/线上总体或显著性检验
2026-07-29 DeepSeek 多域路由版本以 20260729T073342Z-5bcfd58 发布 OCI digest sha256:dd8bcbce…33abd4;复用 12010→8080、NPM 31 / cert 41、门户 order 180;HTML gzip 与十六套生产 Chrome 回归通过,保留 20260729T065822Z-9ba26da 回滚
2026-07-29 取消 32-token 长度对照,改用同源 prompt 的 16→24-token 成对设计 TNEWS 仅 105/10,000 样本达到 32 tokens,强行统一 32 会选中约 1% 极端长尾;24-token eligibility 仍有 1,609 条中文候选
2026-07-29 长度效应必须用 paired prompt bootstrap 16-token 输入是 24-token 输入前缀,2,000 次重采样共用 prompt indices;区间描述固定 cohort 的敏感性,不升级为内容因果或总体显著性
2026-07-29 自然长度、matched-16 与 matched-24 永久分开呈现 自然 cohort 回答“本批原始样本如何路由”;matched cohort 回答“同一前缀多看 8 tokens 后如何变化”,不能互相替代
2026-07-29 DeepSeek 长度敏感性里程碑以 20260729T081849Z-9ca0850 发布 OCI digest sha256:c2146735…3d641;复用 NAS 12010→8080、NPM 31 / cert 41、门户 order 180;十六套生产 Chrome 回归通过,保留上一不可变镜像回滚
2026-07-29 模板扰动只比较同一 canonical content raw / official user / generation 三条件同 batch;字符跨度与 token ID 同时相同才进入 2,874-token 内容交集,wrapper 与边界重切分 token 不混入内容效应
2026-07-29 Assistant: 追加条件承担 causal-mask 负对照 21,852 个共享前缀 ordered top-6 全部 exact;证明未来 suffix 不改写过去,但不推出 suffix 自身没有路由作用
2026-07-29 模板效应永久分 scope、layer 与 domain 报告 对齐内容回答上下文条件化,完整输入回答真实协议流量;RAW→USER 的 CV 方向跨层翻转,不压成“角色模板更均衡/更集中”
2026-07-29 DeepSeek 官方模板敏感性里程碑以 20260729T092426Z-b0acc8b 发布 OCI digest sha256:f1bf2d09…e1463;复用 NAS 12010→8080、NPM 31 / cert 41、门户 order 180;十六套生产 Chrome 回归通过,保留上一不可变镜像回滚
2026-07-29 system × one-shot 使用固定 16 / 17-token 正交增量 四格同 cohort、同 target、同 batch;主效应与交互共用 source-prompt bootstrap indices,避免把两条独立两组实验误拼成因子结论
2026-07-29 one-shot 后的 system-edge TV 下降只命名为历史缓冲模式 24 / 24 格下降与逐 token set/Jaccard 同向;示例语义、距离、EOS、角色转换和固定文本尚未拆开,因此不写成 few-shot 因果语义
2026-07-29 因子分布 effect 使用 half-L1 magnitude 而非普通 TV 主效应和 interaction 是带符号 expert-share 向量;只有四条实际条件边继续使用标准 TV / JSD
2026-07-29 DeepSeek 消息历史因子里程碑以 20260729T100729Z-efe3ffc 发布 OCI digest sha256:e2ea1c35…77e2f;复用 NAS 12010→8080、NPM 31 / cert 41、门户 order 180;十六套生产 Chrome 回归通过,保留上一不可变镜像回滚
2026-07-29 repeated-token filler 与 demo 逐条精确等长 两者共享 user/assistant 角色、assistant EOS、目标位置与 batch shape;x 仍是学习过的 token,因此不命名为无语义或纯距离
2026-07-29 等长历史的两个 TV 台阶分开报告 none→filler 回答“历史结构是否足以复现缓冲”;filler→demo 回答固定协议字段后的文本替换;两者都不升级为能力或示例正确性
2026-07-29 batch contract 是 BF16 路由复现的一部分 跨实验 512/512 token-ID 合同 exact,但矩阵形状改变会让深层临界 gate hash 分化;正式结论只使用同一次六格 batch 内对比
2026-07-29 K3 二轮按 32 张对象账与完整报告顺序重建 total/active、2.5×、KDA state、深度来源、专家路由、视觉目标、轨迹、缓存与评测协议不再压成一页组件摘要
2026-07-29 K3 原生视觉事实回到 §2.4 / §3.3 核验 删除“先冻结语言模型再解冻”旧表述;明确 MoonViT-V2 从头训练,视觉/文本从开始共同 NTP
2026-07-29 K3 Figure 1–16 / Table 1–5 全部建立课程视觉契约 每张图同时写支持范围与不可外推项;作者报告、论文、推导与 toy model 使用 R/P/D/T 标签
2026-07-29 K3 二轮用八个独立实验闭环 Delta memory、BF16 decay、AttnRes、LatentMoE、SiTU、QB、MOPD/RL 与 prefix cache 分开操作,不合成伪“架构总分”
2026-07-29 K3 二轮用不可变镜像 20260729T040336Z-b669615 发布 OCI digest sha256:498b7e43…31cdb3c;复用 12010→8080、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo;十六套生产 Chrome 回归通过,保留 20260729T031901Z-cd96dab 回滚
2026-07-29 K3 三轮先审计开放工件,不要求加载 1.56 TB 固定官方 revisions;用 config、index、96 个 shard headers 与两个小范围权重切片闭合真实 topology、shape 和参数统计
2026-07-29 开放工件证据使用 O / D / X / S / U 五种身份 观测、推导、本机执行、合成探针与未决矛盾不互相冒充;FlashKDA 作者 benchmark 不写成本机 benchmark
2026-07-29 A_log [128] 与 expected [96] 保持未决 并列报告 checkpoint、config、remote code 与 kernel API;等待官方 loader / 修订解释,不擅自 reshape
2026-07-29 K3 三轮开放工件里程碑用不可变镜像 20260729T044605Z-be2b291 发布 OCI digest sha256:99aa953e…d00cdf;复用 12010→8080、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo;十六套生产 Chrome 回归通过,保留 20260729T040336Z-b669615 回滚

未决问题

  • K3 报告给出了多项公开组件的整合方式;独立论文与 K3 内部最终实现之间仍需逐项对照。
  • 公开技术报告不会披露完整数据配比和训练细节;网站会把“已知”“合理推断”“未知”分开。
  • 2026 年模型与榜单变化快,所有动态比较都必须带研究截止日期。