--- import BaseLayout from "@/layouts/BaseLayout.astro"; import { chapters } from "@/data/chapters"; const average = Math.round(chapters.reduce((sum, chapter) => sum + chapter.progress, 0) / chapters.length); const published = chapters.filter((chapter) => chapter.status === "published").length; const researching = chapters.filter((chapter) => ["researching", "drafting"].includes(chapter.status)).length; const workstreams = [ { label: "研究框架与规范", value: 83, next: "给 Scaling 与推理专题补逐篇图表/实验精读层级" }, { label: "网站设计系统", value: 89, next: "打印样式与更多通用可视化组件" }, { label: "Kimi K3 深读", value: 94, next: "接入真实 hidden-state / expert-load / cache traces,并重绘报告数值图" }, { label: "语言模型前史", value: 78, next: "逐图精读 Kneser–Ney、LSTM 与 Bahdanau,并加入真实小语料复现" }, { label: "Transformer 基础", value: 79, next: "逐图精读多头电路、Pre/Post-LN 与真实 kernel / KV 配置" }, { label: "表示、位置与残差高速公路", value: 81, next: "加入真实 hidden-state / norm traces、长上下文位置外推复现与更多深层稳定性消融" }, { label: "Scaling Laws", value: 74, next: "加入真实拟合复现、置信区间与更多模型族对照" }, { label: "数据工程与预训练配方", value: 73, next: "逐图精读 FineWeb / DCLM,加入真实去重与 mixture traces" }, { label: "DeepSeek 专题", value: 95, next: "SM90 FlashMLA kernel、完整 27 层、EOS / 角色 / 多 filler / 内容与 batch-shape 控制、FP8/pipeline 与 R1-like RL 复现" }, { label: "指令微调与人类偏好", value: 75, next: "加入真实偏好分歧样本、RM 长度偏置与 PPO/DPO 小模型复现" }, { label: "推理与测试时扩展", value: 76, next: "真实模型采样曲线、PRM 案例与逐篇图表精读" }, { label: "工具使用与长程 Agent", value: 74, next: "补真实环境 traces、cross-harness 对照、Agent RL 训练曲线与安全案例" }, { label: "原生多模态", value: 76, next: "补真实视觉 Token traces、跨分辨率消融、OCR 失败案例与视觉 Agent 安全轨迹" }, { label: "稀疏计算与 MoE", value: 74, next: "补充真实集群 traces 与专家特化案例" }, { label: "长上下文专题", value: 72, next: "加入更多论文逐图笔记与真实模型配置对比" }, { label: "大规模训练系统", value: 71, next: "补真实集群 traces、故障案例与精确 topology 配置" }, { label: "推理服务与低成本部署", value: 78, next: "补真实 GPU kernel / workload traces、功耗与跨框架复现" }, { label: "数值精度、优化器与稳定性", value: 75, next: "加入真实 kernel 吞吐、长程训练 traces 与逐图论文精读" }, { label: "评测、安全与“到底强不强”", value: 79, next: "补真实 cross-harness 复跑、Judge 元评测与动态污染案例" }, { label: "引用与事实检查", value: 57, next: "自动化外链复查与来源等级扩展" }, { label: "开源与部署", value: 100, next: "每轮保留不可变镜像、提交与回滚点" }, ]; ---

PUBLIC LEDGER BUILD IN THE OPEN

庞大工作需要一份
公开、可检查的账本

这里不把“正在研究”包装成“已经完成”。每个专题显示成熟度、下一检查点和证据边界; 本地 PROGRESS.md 与网站同步维护。

OVERALL
专题平均 {average}%
READABLE
{published} 个首版可读专题
ACTIVE
{researching} 个研究/写作中
UPDATED
2026-07-29 19:05 CST
MODE
持续迭代,不锁死版本

01 WORKSTREAMS

二十一条工作流同时推进,但不混淆“有页面”和“已核验”

内容首版优先打通全局脉络;随后每轮迭代选择一个专题推进到论文/工程层,并做独立事实复核。

{workstreams.map((stream, index) => (
{String(index + 1).padStart(2, "0")}

{stream.label}

下一检查点:{stream.next}

{stream.value}%
))}

02 COMPLETED THIS ITERATION

当前版本已经落地什么

下列项目都能在仓库或网站中直接检查,不是计划项。

✓

研究目标已持久化

总体路线、完成标准、来源等级与进度账本已写入项目。

✓

K3 报告已结构化拆解

47 页报告目录、151 条参考来源和架构/后训练/系统主线已经提取。

✓

17 专题知识图

从语言模型基础到评测安全,包含先修依赖和三条贯穿案例。

✓

编辑式网站系统

响应式导航、章节模板、侧栏、进度、论文链和证据提示组件。

✓

八十个原创交互视图

K3 三轴图、八联报告实验与四联开放工件实验,DeepSeek 四联公式实验与九联真实权重实验,以及语言模型前史、Transformer、表示深度、长上下文、MoE、推理、Agent、多模态、训练系统、推理服务、Scaling、数据工程、数值、Alignment 与评测安全专题。

✓

十七篇首版长文

K3、语言模型前史、Transformer、表示/位置/残差、DeepSeek、Scaling、数据工程、长上下文、MoE、后训练、推理、Agent、原生多模态、训练系统、推理服务、数值优化与评测安全专题。

✓

语言模型前史深度专题

八张独立问题账、33 个正式节点、20 段长文与概率—向量—记忆—对齐四联实验。

✓

Transformer 深度专题

十张独立问题账、40 个正式节点、21 段正文与 QKV—Mask—多头位置—Block 成本四联实验。

✓

表示、位置与残差高速公路深度专题

二十张问题账、66 个一手节点、DeepSeek/Kimi 双谱系,以及 Token—位置—Norm—Residual/FFN 四联实验。

✓

DeepSeek 三轮真实权重里程碑

在二十四张问题账、十次转向与四联公式实验上,新增 V2-Lite 7/27 层连续 forward、官方 V3 absorb、长度/模板、system × one-shot 与等长 filler 控制;累计 3,112,848 次真实路由,none→filler→demo 的两个 TV 台阶均在 24 / 24 格下降,六份运行结果均 byte-exact 独立复跑。

✓

Kimi K3 技术报告二轮深读

三十二张问题账、Figure 1–16 / Table 1–5 审计、100 节点阅读链,以及 Delta—Decay—AttnRes—LatentMoE—SiTU—QB—MOPD—Cache 八联实验。

✓

Kimi K3 三轮开放工件里程碑

固定官方 revisions,审计 96 个 shards、497,220 个 tensor entries 与真实 KDA / MLA / MoE / MoonViT shapes;四联实验分开显示层型、tensor anatomy、参数范围和复现边界。

✓

FlashKDA RTX 5090 执行闸门

隔离 CUDA 13.0 / glibc 2.39 编译 sm_120a wheel;6/6 官方参考逐元素相等,并完成 fixed / varlen、三种 state mode 的 1,800 个 CUDA Event samples。

✓

Scaling Laws 深度专题

九张账、29 个一手节点、DeepSeek/Kimi 双谱系与曲面—部署—复用—涌现四联实验。

✓

数据工程深度专题

十二张账、31 个一手节点、DeepSeek/Kimi 双谱系与流水线—去重—混合—改写四联实验。

✓

长上下文深度专题

五张成本账、26 篇一手论文、10+ 机制图与 8 策略交互实验室。

✓

MoE 深度专题

六张账、19 篇一手论文、DeepSeek/K3 主线与路由—容量—通信交互实验室。

✓

推理深度专题

八张账、30 篇一手论文链、DeepSeek/Kimi 双主线与三页签互动实验室。

✓

训练系统深度专题

九张账、37 个一手节点、DeepSeek/Kimi 双谱系与显存—网格—气泡—通信实验室。

✓

数值、优化器与稳定性深度专题

十张账、36 个一手节点、K2/K3 与 DeepSeek-V3/V4 双谱系,以及格式—状态—更新—失稳四联实验。

✓

指令微调与人类偏好深度专题

十二张账、44 个一手节点、DeepSeek/Kimi 后训练双谱系,以及 SFT—RM—PPO/DPO—配方四联实验。

✓

工具使用与长程 Agent 深度专题

十四张账、52 个一手节点、DeepSeek/Kimi Agent 双谱系,以及循环—工具契约—可靠性—长程 RL 四联实验。

✓

原生多模态深度专题

十六张账、55 个一手节点、DeepSeek 三分支、Kimi 三代 MoonViT,以及 Token—连接器—光学压缩—视觉闭环四联实验。

✓

推理服务与低成本部署深度专题

十八本账、62 个一手节点、DeepSeek V2→V4 与 Mooncake→K3 双谱系,以及显存—阶段—推测—集群四联实验。

✓

评测、安全与“到底强不强”深度专题

二十二张账、80 个一手节点、DeepSeek/K3 评测协议谱系,以及指标—Judge—污染—系统安全四联实验。

✓

486 篇关键论文索引

新增 DeepSeek-Coder/Coder-V2、ESFT、Prover-V1.5/V2 与 Engram 6 个 DeepSeek 旁支节点。

✓

公开仓库与自托管发布

源码公开到 git.k1412.top,网站由不可变镜像、Compose Manager 与 HTTPS 交付。

03 NEXT QUEUE

下一批按“能闭环的专题”推进

优先级由 K3 依赖度、初学者断点和论文可验证性共同决定。

优先级专题本轮交付完成闸门
P0K3 三轮

开放权重 traces → FlashKDA / AttnRes / MoE 真实行为 → Figure 1–16 数值重绘与独立复现

运行证据 + 逐图复现
P0DeepSeek 三轮

SM90 FlashMLA kernel / 完整 27 层 / EOS、角色、多 filler、示例内容与 batch shape 控制 → FP8 / pipeline traces → R1-like RL 小模型复现

运行证据 + 独立复现
P0Transformer 二轮

多头电路逐图 → Pre/Post-LN 真实 traces → Flash/KV 配置与 kernel 对照

逐图笔记 + 实测边界
P0表示、位置与残差二轮

真实 hidden-state / norm traces → 长上下文位置外推 → mHC / AttnRes 深层稳定性消融

可复现实验 + 逐图笔记
P0语言模型前史二轮

Kneser–Ney / LSTM / Bahdanau 逐图 → 真实小语料复现 → tokenizer 公平性

可复现实验 + 逐图笔记
P0Scaling Laws 二轮

真实拟合复现 → 置信区间 → 更多模型族与下游任务外推

可复现实验 + 逐图笔记
P1数据工程二轮

FineWeb / DCLM 逐图 → 真实去重误伤 → mixture traces 与污染案例

逐图笔记 + 案例库
P1大规模训练系统二轮

真实集群 traces → 故障恢复 → 精确 topology / kernel 配置

案例库 + 实测边界
P1数值与稳定性二轮

真实 kernel 吞吐 → 长程失稳 traces → optimizer / quantization 逐图复现

实测边界 + 逐图笔记
P1长上下文二轮深化

真实模型配置 → 内核细节 → 长上下文评测与失败案例

配置比较器 + 逐图论文笔记
P1MoE 二轮深化

真实负载 traces → 专家特化可解释性 → 共享专家语义

案例库 + 集群证据
P1推理二轮深化

真实 pass@k 曲线 → PRM 失败案例 → 逐篇图表精读

案例库 + 真实 traces
P1Alignment 二轮深化

真实偏好分歧 → RM 长度偏置 → PPO/DPO 小模型复现

数据案例 + 可复现实验
P1Agent 二轮深化

真实环境 traces → cross-harness ablation → Agent RL 曲线与提示注入案例

运行证据 + 安全案例库
P1原生多模态二轮

真实视觉 Token traces → 跨分辨率 / connector 消融 → OCR 与视觉 Agent 安全失败案例

运行证据 + 逐图笔记
P1推理服务二轮

真实 GPU kernel / workload traces → 功耗与成本 → 跨 vLLM / SGLang / TensorRT-LLM 复现

可复现实测 + 成本账
P1评测安全二轮

真实 cross-harness / pass@k 复跑 → Judge 元评测 → 动态污染与过拒案例

可复现实验 + 协议审计

04 QUALITY CONTROL

每条结论怎样进入网站

Grok CLI 用于扩大检索覆盖和找遗漏;任何进入正文的机制、数字与时间仍回到原论文、官方仓库或正式文档。

01 / DISCOVER

发现线索

K3 references、引用网络、Grok/web 检索、作者仓库。

→
02 / VERIFY

打开一手来源

核对标题、版本、公式、表格、实验设置和限制。

→
03 / EXPLAIN

写四层解释

直觉、机制、论文证据、工程代价;简化处显式标注。

→
04 / REVIEW

交叉检查

链接、数字、先修、图文一致性、移动端与可访问性。

05 DECISION LEDGER

重要决策不会只留在对话里

更完整的机器可读进度和研究记录位于开源仓库的 ROADMAP.md、PROGRESS.md 与 research/。

命名为 LLM Atlas

K3 是锚点,范围覆盖完整 LLM 技术史。

按问题链组织

现象 → 旧瓶颈 → 关键论文 → 后继桥梁 → K3/DeepSeek 落点。

优先原创重绘

架构图做成可缩放 SVG/HTML,明确简化与来源。

双重开放许可

代码 MIT,原创文字与图 CC BY-SA 4.0。

自托管交付

源码公开到 git.k1412.top,网站部署到 k1412 私有基础设施。

推理按八张账组织

把答案、覆盖、选择、过程、预算、优化、分布与系统证据分开核算。

训练系统按九张账组织

把模型状态、激活、并行、气泡、通信、专家、上下文、数值与可靠性分开核算。

Scaling Laws 按九张账组织

把观测量、模型、数据、算术、配比、配方、外推、经济目标与能力阶段分开核算。

数据工程按十二张账组织

把来源、解析、语言、质量、唯一性、污染、混合、变换、Tokenizer、Packing、课程与价值分开核算。

Grok 数据线索与正式账本永久分离

1264 行正式研究账本只接受回查一手来源后的结论;203 行 Grok 产物保留为未核验发现队列。

数值专题按十张账组织

把格式、缩放、计算、累加、搬运、更新、参数化、观测、恢复与证据经济分开核算。

低精度结论必须写完整角色合同

对象、格式、scale 粒度、accumulator、输出与硬件不再被压缩成一个 dtype 标签。

语言模型前史按八张账组织

预测单位、概率信息、上下文、稀疏性、分布式表示、循环记忆、序列转导与系统成本不再混成单一架构年表。

NTP、MTP 与多模态永久分角色

K3 的统一视觉/文本 next-token objective、one MTP layer 与 EAGLE-3 draft bridge 分开记账;DeepSeek MTP 也不写成取代自回归。

Transformer 按十张账组织

信息路径、几何、可见性、多头、位置、局部计算、深度、目标、系统成本与当代映射不再混成一个 Block。

Attention 权重与因果解释永久分离

热力图可描述中间权重和提出假设;因果结论必须补消融、patching 或反事实干预。

Agent 按十四张账组织

模型、harness、工具契约、环境、评测器、可靠性与安全不再被压成一个 Agent 分数。

Agent 完成必须回到 final state

function schema、工具执行、业务状态、策略合规与 pass^k 分层评价;模型自报完成不作为证据。

原生多模态按五层管道与十六张账组织

像素、视觉塔、压缩 / connector、主干与输出 / 工具闭环分开定位;“原生”再拆成数据、目标、优化、输入输出与 Agent 五维。

DeepSeek 多模态永久保留三分支

VL/VL2 的理解、Janus 的统一生成、OCR 的光学压缩不画成错误的单向代际谱系。

光学压缩实验分开报告值、教学插值与证据外区域

DeepSeek-OCR 的 <10× / 20× 锚点标成作者报告;中间只做显式教学插值,超过范围不外推。

推理服务按十八本账组织

权重、增长状态、分配、阶段、batch、cache、kernel、推测、网络、路由、故障与经济性不再压成单一 tokens/s。

DeepSeek 与 Kimi 服务谱系按状态对象重建

MLA→V4 异构状态与 Mooncake→KDA→K3 混合缓存分开说明;作者报告、精确公式和教学估算使用不同标签。

表示与深度按二十张账组织

计算单位、词表接口、上下文化、位置、外推、Norm 对象、拓扑、残差路由与非线性极值不再混成一个 hidden-state 名词。

K3 Block AttnRes 来源数按原报告重算

93 层按 12 层形成 8 个 layer blocks(7 个完整块加 1 个尾块);再加 embedding,共 9 个 block-level 来源,废弃早期错误的“2 层一块”读法。

K3 二轮按三十二张账重建

从架构组件摘要升级为覆盖预训练、后训练、环境、系统、评测、案例与附录的完整报告因果链。

K3 原生视觉事实纠错

MoonViT-V2 从头训练;视觉与文本从训练开始在同一个 NTP objective 中联合优化,不再沿用冻结/解冻式 post-hoc 叙述。

K3 图表与实验永久分级

Figure 1–16 / Table 1–5 建立视觉契约;报告事实、原论文、确定性推导与教学模型使用 R/P/D/T 四种身份。

K3 开放工件按五种证据身份审计

真实观测 O、确定性推导 D、本机执行 X、合成探针 S 与未决矛盾 U 分开;作者 benchmark 不冒充本站实测。

A_log 形状冲突保持未决

checkpoint 的 [128] 与 config / remote code / FlashKDA API 期待的 [96] 并列展示;不宣布权重损坏,也不把 channel-wise 假设写成真实 forward。

FlashKDA 编译与执行永久分两道闸门

容器产出 sm_120a wheel 只证明可编译;RTX 5090 的 6/6 official-reference exact suite 通过后,才把证据升级为本机执行 X。

作者表与 RTX 5090 表永久分账

H20 / GB200 保持 O;本站只报告独立环境、协议、300 samples/mode 和延迟分布,未跑本机 FLA 就不写本机 speedup。

32-token 对照改为同源 16→24

TNEWS 只有 105/10,000 条达到 32 tokens,强行统一会落入约 1% 极端长尾;24-token eligibility 仍保留 1,609 条中文候选。

长度敏感性必须成对重采样

16-token 输入严格是 24-token 输入前缀,2,000 次 bootstrap 共用 prompt indices;结果只描述固定 cohort 的长度敏感性。

三类 cohort 永久分身份

自然长度回答本批样本如何路由;matched-16 / 24 回答同一 prompt 多看 8 tokens 后如何变化,不把二者混成内容因果。