未计 scale、元数据与 runtime workspace
+INTERACTIVE / SERVING CONTROL ROOM
++ 每个实验都公开公式、假设与证据边界。它们是可复算的教学模型,不是 GPU + benchmark,也不会把论文中的特定集群结果外推成普遍性能。 +
+先付权重,再付随请求增长的状态;分页只能减少浪费,不能让真实 KV 消失。
+KVBytes = B × T × L × 2 × Hkv × Dh × bytes
+ “2”来自 K 与 V。MLA / KDA 的状态结构不同,必须另立口径,不能只改一个名字。
+未计 scale、元数据与 runtime workspace
+单请求每新增一个位置
+指定上下文长度的增长状态
+权重 + 全部活动请求 KV
+能装下,但还没给 kernel workspace 留余量
+这里只有最后一个 block 的内部浪费;PagedAttention 还会改善非连续分配与共享。
+选 K3 会切换为“增长状态等效估算”,同时保留固定 KDA 状态未公开的边界。
+观察调度策略怎样改变 TTFT、TPOT、吞吐与 goodput;均为相对教学模拟。
+一次处理许多 prompt Token;长输入会推迟第一次输出。
+每步只生成少量 Token,却反复读取权重与历史状态。
+排队 + prefill + 调度
相邻输出 Token 间隔
完成的 output tokens/s
同时满足 TTFT / TPOT SLO
—
最优策略会随工作负载和网络变化,不存在脱离 SLO 的单一冠军。
以静态批为归一化基线,展示方向性取舍。
速度取决于验收率、草稿成本和并行验证成本;“一次猜七步”不是免费得到七个 Token。
+E[tokens] = 1 + a + … + aᵏ
+ 精确采样算法使用目标分布与草稿分布的重叠质量;独立常数 a 只是帮助建立直觉。
+一次 target verification 的期望产出
相对逐 Token target 解码
算过但未被接受的候选
低验收率会把草稿计算变成纯开销
K3 的 KDA rollback 会缓存投影输入并重放已接受状态;这里没有把回滚成本假装成零。
+亲和路由提高复用,却可能制造热点;预算准入保护短请求,却会主动拒绝一部分长请求。
+命中缓存而无需重新计算的 Token
亲和性收益对应的热点代价
admitted / rejected per 100
—
故障时不能把已失效 page 当成命中;需要原子失效后重新 prefill。
这里的命中率、负载和准入曲线是教学模型,不是 K3 线上集群披露值。
NEW / CHAPTER 14 MEMORY · TIME · FLEET
++ 用十八本账从 KV Cache、PagedAttention、连续批处理、chunked prefill、量化和推测解码, + 走到 DeepSeek V2→V4 的异构状态谱系,以及 Mooncake→Kimi K3 的混合缓存、亲和路由与预算准入。 +
+NEW / CHAPTER 13 PIXELS · TOKENS · NATIVE MULTIMODALITY
@@ -545,6 +563,7 @@ const paths = [ transition: transform 180ms ease, border-color 180ms ease; } + .inference-release, .agent-release, .alignment-release, .transformer-release, @@ -558,6 +577,14 @@ const paths = [ min-height: 510px; } + .inference-release { + background: + radial-gradient(circle at 82% 18%, rgba(35, 86, 84, 0.22), transparent 31%), + radial-gradient(circle at 60% 76%, rgba(159, 91, 52, 0.13), transparent 27%), + repeating-linear-gradient(90deg, transparent 0 66px, rgba(35, 86, 84, 0.045) 66px 67px), + var(--paper-raised); + } + .agent-release { background: radial-gradient(circle at 82% 18%, rgba(56, 91, 128, 0.2), transparent 30%), @@ -688,6 +715,7 @@ const paths = [ padding-bottom: 76px; } + .inference-release, .alignment-release, .transformer-release, .foundation-release, diff --git a/src/pages/progress/index.astro b/src/pages/progress/index.astro index 897113e..dd69e16 100644 --- a/src/pages/progress/index.astro +++ b/src/pages/progress/index.astro @@ -22,6 +22,7 @@ const workstreams = [ { label: "稀疏计算与 MoE", value: 74, next: "补充真实集群 traces 与专家特化案例" }, { label: "长上下文专题", value: 72, next: "加入更多论文逐图笔记与真实模型配置对比" }, { label: "大规模训练系统", value: 71, next: "补真实集群 traces、故障案例与精确 topology 配置" }, + { label: "推理服务与低成本部署", value: 78, next: "补真实 GPU kernel / workload traces、功耗与跨框架复现" }, { label: "数值精度、优化器与稳定性", value: 75, next: "加入真实 kernel 吞吐、长程训练 traces 与逐图论文精读" }, { label: "引用与事实检查", value: 57, next: "自动化外链复查与来源等级扩展" }, { label: "开源与部署", value: 100, next: "每轮保留不可变镜像、提交与回滚点" }, @@ -47,7 +48,7 @@ const workstreams = [01 WORKSTREAMS
-
内容首版优先打通全局脉络;随后每轮迭代选择一个专题推进到论文/工程层,并做独立事实复核。
@@ -94,8 +95,8 @@ const workstreams = [
47 页报告目录、151 条参考来源和架构/后训练/系统主线已经提取。 从语言模型基础到评测安全,包含先修依赖和三条贯穿案例。 响应式导航、章节模板、侧栏、进度、论文链和证据提示组件。 K3、语言模型前史、Transformer、DeepSeek、长上下文、MoE、推理、Agent、多模态,以及训练系统、Scaling、数据工程、数值和 Alignment 专题。 K3、语言模型前史、Transformer、DeepSeek、Scaling、数据工程、长上下文、MoE、后训练、推理、Agent、原生多模态、训练系统与数值优化专题。 K3、语言模型前史、Transformer、DeepSeek、长上下文、MoE、推理、Agent、多模态,以及训练系统、推理服务、Scaling、数据工程、数值和 Alignment 专题。 K3、语言模型前史、Transformer、DeepSeek、Scaling、数据工程、长上下文、MoE、后训练、推理、Agent、原生多模态、训练系统、推理服务与数值优化专题。 八张独立问题账、33 个正式节点、20 段长文与概率—向量—记忆—对齐四联实验。 十张独立问题账、40 个正式节点、21 段正文与 QKV—Mask—多头位置—Block 成本四联实验。 九张账、29 个一手节点、DeepSeek/Kimi 双谱系与曲面—部署—复用—涌现四联实验。 十二张账、44 个一手节点、DeepSeek/Kimi 后训练双谱系,以及 SFT—RM—PPO/DPO—配方四联实验。 十四张账、52 个一手节点、DeepSeek/Kimi Agent 双谱系,以及循环—工具契约—可靠性—长程 RL 四联实验。 十六张账、55 个一手节点、DeepSeek 三分支、Kimi 三代 MoonViT,以及 Token—连接器—光学压缩—视觉闭环四联实验。 新增 ResNet、ALIGN、NaViT、DeepSeek-VL2、Janus、DeepSeek-OCR、Vision-R1 等 41 个多模态节点。 十八本账、62 个一手节点、DeepSeek V2→V4 与 Mooncake→K3 双谱系,以及显存—阶段—推测—集群四联实验。 新增 vLLM、SGLang、DistServe、Sarathi、FlashInfer、EAGLE-3、DeepGEMM、FlashMLA 等 45 个推理服务节点。 源码公开到 git.k1412.top,网站由不可变镜像、Compose Manager 与 HTTPS 交付。K3 报告已结构化拆解
16 专题知识图
编辑式网站系统
四十三个原创交互视图
十四篇首版长文
四十七个原创交互视图
十五篇首版长文
语言模型前史深度专题
Transformer 深度专题
Scaling Laws 深度专题
指令微调与人类偏好深度专题
工具使用与长程 Agent 深度专题
原生多模态深度专题
355 篇关键论文索引
推理服务与低成本部署深度专题
400 篇关键论文索引
公开仓库与自托管发布
真实偏好分歧 → RM 长度偏置 → PPO/DPO 小模型复现
数据案例 + 可复现实验真实环境 traces → cross-harness ablation → Agent RL 曲线与提示注入案例
运行证据 + 安全案例库真实视觉 Token traces → 跨分辨率 / connector 消融 → OCR 与视觉 Agent 安全失败案例
运行证据 + 逐图笔记真实 GPU kernel / workload traces → 功耗与成本 → 跨 vLLM / SGLang / TensorRT-LLM 复现
可复现实测 + 成本账像素、视觉塔、压缩 / connector、主干与输出 / 工具闭环分开定位;“原生”再拆成数据、目标、优化、输入输出与 Agent 五维。
VL/VL2 的理解、Janus 的统一生成、OCR 的光学压缩不画成错误的单向代际谱系。
DeepSeek-OCR 的 <10× / 20× 锚点标成作者报告;中间只做显式教学插值,超过范围不外推。
权重、增长状态、分配、阶段、batch、cache、kernel、推测、网络、路由、故障与经济性不再压成单一 tokens/s。
MLA→V4 异构状态与 Mooncake→KDA→K3 混合缓存分开说明;作者报告、精确公式和教学估算使用不同标签。
INFERENCE / 14 MEMORY · TIME · FLEET
++ 从一条请求的权重与 KV 字节账出发,穿过 PagedAttention、连续批处理、 + chunked prefill、P/D 解耦、量化和推测解码;再重点追踪 DeepSeek + 从 MLA 到 V4 异构缓存,以及 Kimi 从 Mooncake 到 K3 混合状态服务的完整谱系。 +
+00 EIGHTEEN LEDGERS
++ 同一个模型可以在离线批处理里吞吐极高,却在聊天服务中首字很慢;可以靠缓存服务 + 400K 代码前缀,也可能因为亲和路由把一台机器压成热点。只有把十八本账分开,系统名才有意义。 +
+ +先理解 KV、MLA、KDA 和上下文状态。
+ PREREQUISITE / 08大规模训练系统并行、通信和 MoE 放置在推理端仍然存在。
+ PREREQUISITE / 09数值精度与稳定性量化节省的是哪类字节,要从数值格式开始。
+{answer}
推理服务是一间状态工厂:prefill 把 prompt 制造成可复用状态,decode 反复读取权重与状态产生下一个 Token,调度器则在 SLO 前提下决定谁先占用哪种资源。
+{note}
01 REQUEST STACK
++ API 网关只负责把请求送进来。真正决定成本的是:怎样排队、是否命中前缀、由谁做 + prefill、状态放在哪里、谁做 decode、每步调用哪些 kernel,以及流式输出能否按时送回。 +
+{body}
{foot}线上延迟
用户满意
有效复用
单位 goodput 最便宜
02 METRICS
+入口排队、cache lookup、prefill、首轮调度与网络返回之和。长 prompt 首先打在这里。
流式输出相邻 Token 的间隔。decode 抖动会让回答“卡顿”。
从请求进入到完整输出结束,受输出长度强烈影响。
系统总产出;若大量请求违约,峰值吞吐依然可能很漂亮。
同时满足 TTFT / TPOT 等约束的完成量,才可用于容量与成本决策。
餐厅一小时做 300 道菜是吞吐;其中 280 道在承诺时间内送到,才是 goodput。为了第 301 道菜让所有桌都迟到,不叫优化。
03 REQUEST CLOCK
+“prefill 算力受限、decode 带宽受限”是常见硬件与 shape 下的工作区间,不是所有模型、batch、长度与 kernel 都成立的物理定律。
04 WEIGHT MEMORY
++ 当模型跨卡时,还要选择复制还是分片。复制提高数据并行容量,却让每个副本承担全部权重; + tensor parallel 分片矩阵,却在层内频繁通信;pipeline parallel 减少单卡权重,却引入阶段气泡和请求微批约束。 +
+05 KV CACHE MATH
+{note}
+ 最常见的错误是只算一个请求,或把模型参数精度当成 KV 精度。W4 不自动等于 KV4; + 量化权重后留下的空间,也可能很快被长上下文和高并发吃完。 +
+06 STATE ARCHITECTURES
+表达直接,增长状态最大;decode 需要读更多历史字节。
状态 ∝ Hq × T以更少 KV heads 换容量与带宽,成为服务友好设计。
状态 ∝ Hkv × T,Hkv ≪ Hq通过低秩压缩与解耦 RoPE,避免保存完整每头 K/V。
仍随 T 增长,但每位置更小线性注意力用门控 Delta Rule 更新有限状态;局部精确回忆仍需混合 MLA。
核心 recurrent state 不随 T 线性增长不能把 MLA 的 latent 或 KDA 的 recurrent matrix 硬塞进标准 Hkv 公式并称为精确值。先确认状态对象,再谈字节。
07 PAGEDATTENTION
+为最大长度预留、不同寿命请求离开后留下洞;连续扩容困难。
逻辑 block 映射到非连续物理 page;前缀可引用共享 page,写入时 copy-on-write。
请求每增长一个 block 才取新 page,不必按最大长度预留。
请求结束可逐 page 回收,避免必须寻找大连续区域。
并行采样和共同前缀可以引用同一物理 page。
+ PagedAttention 解决的是内存管理和共享,不会降低 Transformer 本身的理论 FLOPs; + “近零浪费”也不等于绝对零,最后一个 block 仍有内部碎片,page table 和 kernel 也有开销。 +
+08 PREFILL
+长度、模态与 padding 决定实际输入。
每层同时处理大量位置,通常更容易利用算力。
状态写入 HBM 或缓存层,供 decode 和后续请求读取。
+ 首字延迟不是单纯的 prefill kernel 时间:请求可能在 admission、batch 形成、cache lookup、 + page 分配与队列中停留。长 prompt 若一次占满调度迭代,还会让已经在流式输出的请求停止前进。 +
+09 DECODE
+batch 内请求共同摊一次矩阵权重访问。
attention 访问此前 K/V 或其他 recurrent state。
logits、约束、采样与停止条件。
+ decode 的“算术强度”常较低:每个新位置对应的计算量有限,却需读大量字节。增加 batch + 可以提升权重重用,但 batch 过大又会增加排队、KV 容量和 TPOT。系统优化目标因此是一个带 SLO 的工作点,而非无限扩大 batch。 +
+10 CONTINUOUS BATCHING
+短请求完成后留下空槽,直到最长请求结束。
完成即补新请求,显著提高 slot 利用率;调度开销和公平性仍需管理。
+ continuous batching 不是把所有请求简单堆在一起。一个服务迭代可能包含 decode token、 + 新请求 prefill、被抢占请求恢复和 cache transfer;真正的调度单位越来越接近“token budget + 状态资源”。 +
+11 CHUNKED PREFILL
++ Sarathi-Serve 的核心直觉是把大 prefill 切成 chunk,与 decode 组合成更均匀的迭代。 + chunk 太大仍会 stall,太小则增加调度和 kernel 开销;它改善阶段干扰,不保证所有 workload 都降低 TTFT。 +
+12 KERNELS
+{note}
分别覆盖 MLA attention、低精度 GEMM 与 MoE dispatch/combine。开源 kernel 让“模型架构如何要求系统实现”变得可检查,而不只是论文里的吞吐数字。
13 PREFIX CACHE
+模型 / adapter / tokenizer / 精度 / 内容 hash / 租户。
到底命中多少有效 Token,不是“有相似 prompt”。
page 在哪台 worker、哪层内存,搬运是否比重算便宜。
版本、过期、故障、写入和 copy-on-write 的原子语义。
缓存节省 prefill compute,却消耗容量、索引、网络与路由自由度。SGLang 的 RadixAttention、Prompt Cache、Hydragen、ChunkAttention、Preble 分别从程序结构、共享计算和分布式调度推进这条主线。
+14 PREFILL / DECODE DISAGGREGATION
+长 prompt、宽矩阵、cache creation
持续小步、batch、streaming SLO
+ Splitwise 把 prompt 与 token generation 放到适配的机器;DistServe 以 goodput 与独立扩容为中心; + Mooncake 更进一步把 KVCache 作为存算分离系统的中心。拆分消除资源干扰,却新增 KV transfer、跨池排队和故障协调。 +
+15 QUANTIZATION
+省权重容量和读取;是否加速取决于反量化融合与低精度 GEMM。
离群值、累加精度和校准影响 tensor core 路径。
长上下文直接获益;key/value、近期 / 远期状态可采用不同策略。
量化网络载荷可能省带宽,却增加转换和误差边界。
+ DeepSeek-V3 将 FP8 训练 / 推理和 MLA、MoE 一起设计;K3 从 SFT 进入 MXFP4/MXFP8 QAT, + 并保持非专家模块更高精度。QAT 是让模型适应目标数值路径,不等于所有层都用同一格式。 +
+16 SPECULATIVE DECODING
+小模型、额外 heads、feature predictor、检索或自推测产生候选。
目标模型并行计算候选位置,并按算法逐项验收。
提交被接受前缀,再从目标分布纠正;状态必须可回滚。
+ Vanilla speculative sampling 用独立小模型;Medusa 在主模型上加多步 heads;EAGLE 在 feature + 层预测,EAGLE-2 动态构树,EAGLE-3 融合多层特征。速度取决于验收率、草稿成本、验证 shape 和状态回滚,草稿越长并不总越快。 +
+17 PARALLELISM
+完整副本服务不同请求。扩吞吐自然,但每份权重都占容量。
层内矩阵跨卡,减少单卡权重;每层都有 collective。
不同层跨阶段,降低单卡容量;气泡和逐 Token 流水复杂。
MoE 专家跨设备,激活按路由 all-to-all。
长序列状态或计算跨设备,交换边界与聚合结果。
服务并行还要考虑请求级容错:TP 组中一张卡失败可能使整个 replica 失效;DP 副本则较易摘除。最少 GPU 数、最优 GPU 数和可容错 GPU 数不是同一个答案。
+18 MOE INFERENCE
+全部专家仍需放在 GPU、主存或分层存储中。
Token dispatch / combine 带来 all-to-all 与拓扑敏感性。
输入分布让少数专家拥挤;均值负载掩盖尾部。
单专家 batch 过小,理论低 FLOPs 仍可能 memory-bound。
DeepSeek-V3 的部署报告把 prefill 与 decode 设成完全不同的 EP 规模,并使用冗余专家;DeepEP 则为 dispatch / combine 提供高吞吐与低延迟路径。模型路由和网络拓扑必须共同设计。
+19 SCHEDULING & SLO
++ 平均并发阈值看不见请求长度:1 个 1M 请求和 1 个 1K 请求都被计为“1”。 + token-budget admission 将预期 prefill、KV 和 decode 工作纳入预算;过载时拒绝或延后长任务,可能提高短请求 goodput。 +
+保护短请求、优先付费租户、保证老请求不饿死、为长 Agent 保留配额,都是不同策略;不能只用系统吞吐替用户做决定。
20 FLEET & FAILURE
+减少排队,却可能放弃已有 400K 前缀。
避免 prefill,却可能把热门 repo 挤到单点。
多副本增加成本;不复制则故障时重算和违约。
+ Llumnix 通过请求迁移重平衡实例;Preble 联合考虑前缀复用与负载;Mooncake / MemServe + 把状态放进独立缓存层。真实系统还必须定义 pin、复制中读写、版本升级、原子失效和 secondary re-prefill。 +
+21 DEEPSEEK LINEAGE
+从模型结构上减少每 Token KV 和激活计算。
STATE ARCHITECTURE训练、MoE 路由、专家通信与 P/D 部署一起设计。
FULL STACK长上下文继续压缩 attention 工作,服务与推理训练协同。
LONG CONTEXTCSA / HCA / SWA 把增长状态按功能与介质分层。
STATE HIERARCHY只复制 MLA 或只换 FP8,都不等于复制 DeepSeek 的整体经济性。
22 DEEPSEEK V2 → V3
+把增长缓存从“每个 KV 头的完整向量”压缩成共享 latent,并把 RoPE 部分解耦。
总容量增加而每 Token 只激活部分专家;服务端承担专家放置与通信。
减少权重、激活与通信字节,并以配方和 kernel 守住稳定性。
模型训练中的路由平衡直接影响线上专家热点与硬件利用率。
TP4 · SP / DP8 · EP32 · 32 redundant experts
TP4 · SP / DP80 · EP320;单专家 batch 通常 ≤256,偏 memory-bound
23 DEEPSEEK V3.2 → V4
+只选择与当前 query 相关的一部分历史。
用不同粒度保留全局记忆与可检索摘要。
为局部精确依赖保留有限窗口。
冷状态可下沉,容量变大但访问和失败路径更复杂。
这些是报告内特定配置的估算比例,不是任意工作负载的端到端延迟或成本倍数。磁盘缓存将容量收益换成 IO、预取与尾延迟风险。
+V4 还报告了组件级 FP4 selector:特定选择器实验中 2× 加速、99.7% recall。它描述一个组件,不应写成“V4 整体 2× 且精度 99.7%”。
+24 KIMI LINEAGE
+prefill、decode 与缓存池分离,围绕长上下文复用组织系统。
DISAGGREGATION长工具轨迹与代码前缀让缓存、调度和稳定流式输出更重要。
WORKLOAD以 Gated Delta Rule 形成固定 recurrent state,降低长度增长债。
ARCHITECTUREKDA + Gated MLA、page cache、speculation、affinity 与 admission 联动。
FULL STACK25 MOONCAKE
+生成 KV,并写入分布式缓存。
以带宽、容量和热度管理状态。
读取状态并持续生成。
两者分母和条件不同,不能合并成“Mooncake 普遍 5.25×”。论文的核心贡献是体系结构与调度方法,不是一个脱离 workload 的营销倍数。
+26 K3 HYBRID STATE CACHE
++ KDA 用固定 recurrent state 处理远距离历史,MLA 保留随上下文增长的精确注意力缓存。 + 因为两者生命周期与回滚语义不同,K3 不能只复用传统 KV page manager。 +
+报告示例中的物理管理粒度。
更细粒度索引内容匹配。
内容匹配长度不自动等于有效状态长度。
按 hash block 对齐后可安全复用的示例。
报告还定义并发 pin、copy 与原子 invalidation:复制中不能回收源页,失效后不能继续向路由器宣称命中。这里的难点是分布式状态一致性,不只是 hash 查表。
+27 K3 SPECULATION & ADMISSION
+预训练 MTP 初始化 draft;feature fusion 读取第 1、第 4 和最终 AttnRes,训练时展开 7 步。
LLK = −log Σ min(p, q) 直接鼓励草稿分布与目标分布重叠。
KDA 不为每条草稿复制完整 recurrent state;缓存投影输入,按被接受前缀重放更新。
优先路由到已有状态的实例,同时用 token budget 防止超长任务淹没短请求。
缓存价值来自迭代式 Agent 反复使用巨型 repo 状态;如果路由丢失亲和性,就会为很小增量重复付出巨大 prefill。
K3 的 QAT 从 SFT 阶段进入 MXFP4 / MXFP8,非专家模块保留更高精度。这里再次说明:模型架构、draft、数值路径、cache manager 与 admission policy 是一套系统,而非五个独立“加速插件”。
+28 INTERACTIVE LAB
+四个实验分别管理容量、阶段干扰、串行轮数与集群状态。先使用默认 K3 / 长上下文场景,再故意把每项推到失败区。
+29 AUDIT CHECKLIST
+{question}
保留硬件、模型、工作负载、SLO 和分母,不跨场景外推。
公开脚本、commit、环境与误差,才可作为可比较证据。
公开公式与假设,用于量纲推理,不冒充 benchmark。
↳ PRIMARY-SOURCE CHAIN
+每个链接都指向论文、会议页或官方实现。历史顺序用于建立因果脉络,不代表后出的系统在所有工作负载上都更优。
+{note}