s ← s + βv
+
+ 3.00
+ 每次都继续追加;重复 key 会把同一 value 越写越大。
+INTERACTIVE / EIGHT REPORT WORKBENCHES
++ 数学输出按页面公式实时计算;风险、通信与吞吐标签只是显式 toy model。 + 本实验没有复跑 K3 checkpoint、FlashKDA kernel、MoonEP 集群或线上 cache。 +
+为便于看懂,这里把矩阵 state 压成“当前 key 对应的标量预测”。真实 KDA 是每个 head 的矩阵状态。
+s ← s + βv
+
+ 3.00
+ 每次都继续追加;重复 key 会把同一 value 越写越大。
+s ← s + β(v − s)
+
+ 0.98
+ 只写“目标与旧预测的差”;在这个 toy key 上逐步逼近目标。
+|state − target|
|state − target|
S ∈ Rdₖ×dᵥ,另有 α 与 key geometry
这个实验只解释“纠错写入”直觉,不证明固定状态能无损回忆任意历史。
K3 报告固定 gmin=−5;此时 α>e⁻⁵,16 步累计 log-decay>−80,倒数小于 e⁸⁰。
+αmin = exp(gmin)
tile × gmin
exp(−tile × gmin)
报告默认 −5 × 16 = −80,理论倒数仍低于 BF16 最大有限值。
能落进动态范围不等于精度误差为零;报告的系统收益还来自把 diagonal tile 改成 Tensor Core 稠密矩阵乘。
计数是确定性的;内存只用“每 Token 每 hidden element 的来源份数”表示,不冒充真实运行时 GiB。
+L 层输出 + embedding
ceil(L/S) + embedding
来源份数的确定性比较
12 层/块 · 8 个 layer blocks · 含 embedding 共 9 来源
报告称 Full 的算术因 L<100 尚可,真正代价在存活 activation 和 pipeline 跨 stage 通信。
元素数与字节数按选择精确计算;真实成本还含 router、all-to-all、权重读取、shared experts 与拓扑。
+tokens × k × d × bytes
tokens × k × ℓ × bytes
只比较 routed token elements
K3 expert pool / active routed
公共变换仍要付激活计算
实际系统由 MoonEP 静态 shape、zero-copy communication 与专家执行共同决定。
报告配置 β₁=4、β₂=25,因此标量切片的 |f(x)|≤100。曲线是函数,不是 validation loss。
+σ(x) · x
[xσ(x)] · x
[β₁tanh(x/β₁)σ(x)]·β₂tanh(x/β₂)
β₁ × β₂
真实模型的 Wg x 与 Wu x 并不相同;本图复现报告 Figure 4 的共同标量切片。
固定使用报告 Figure 5 的 m=8、n=4、k=1 规模;score 是本站构造,不是 K3 trace。
+loads = (4, 3, 1, 0)
每个 expert 取目标 q=mk/n=2 对应的分位阈值,再移除公共 offset。
loads = (2, 2, 2, 2)
8 tokens × top-1 / 4 experts
居中后用于 next step
after max − min
通信近似只保证 bin-width 级
bias 只影响 Top-k selection,不进入最终 mixture weight;当前 batch 不能使用由自身算出的新 bias。
三块标量计算互不替代:budget 管过度思考,λ 管 straggler,MOPD reward 管学生当前 prefix。
+12K ≤ 2.0 × 8K:保留任务 reward
64 paused / resume next iteration
clip(log pteacher/pstudent, ±Rmax)
实际系统还有 per-token regularization、domain/effort teacher selection、sandbox state 与 group completion dispatch。
默认复现报告 Figure 12 的 6144-token physical block 与 512-token hash block;checkpoint 周期是教学变量。
+floor(match/hash) × hash
最长同时存在的 state 边界
两类 cache 的共同最长前缀
matched − joint hit
真实系统还需 pin、copy-on-write、跨 KDA group 原子失效、调度 step 可见性和 prefill/decode TP re-layout。
NEW / K3 ROUND 02 REPORT · FORMULA · SYSTEM · EVIDENCE
++ 用三十二张问题账逐节读完 KDA、Gated MLA、AttnRes、Stable LatentMoE、原生视觉、 + 预训练、九专家 MOPD、Agent 环境、FlashKDA / MoonEP、混合 prefix cache、评测与案例边界。 +
+NEW / DEEPSEEK ROUND 02 CAPACITY · STATE · SYSTEM · REASONING
@@ -615,6 +631,7 @@ const paths = [ transition: transform 180ms ease, border-color 180ms ease; } + .k3-release, .deepseek-release, .representation-release, .inference-release, @@ -639,6 +656,14 @@ const paths = [ var(--paper-raised); } + .k3-release { + background: + radial-gradient(circle at 82% 16%, rgba(159, 91, 52, .28), transparent 31%), + radial-gradient(circle at 58% 74%, rgba(76, 118, 112, .22), transparent 30%), + repeating-linear-gradient(135deg, transparent 0 62px, rgba(159, 91, 52, .045) 62px 63px), + var(--paper-raised); + } + .representation-release { background: radial-gradient(circle at 82% 18%, rgba(159, 91, 52, 0.22), transparent 31%), @@ -785,6 +810,7 @@ const paths = [ padding-bottom: 76px; } + .k3-release, .deepseek-release, .representation-release, .inference-release, diff --git a/src/pages/k3/index.astro b/src/pages/k3/index.astro index 6949f00..1b64c6b 100644 --- a/src/pages/k3/index.astro +++ b/src/pages/k3/index.astro @@ -1,45 +1,128 @@ --- import BaseLayout from "@/layouts/BaseLayout.astro"; import ArchitectureExplorer from "@/components/ArchitectureExplorer.astro"; +import K3ReportLab from "@/components/K3ReportLab.astro"; +import { k3FigureAtlas, k3Ledgers, k3PaperChain, k3ReportMap } from "@/data/k3"; const toc = [ - ["00", "orientation", "先建立阅读坐标"], - ["01", "architecture", "一张图看完整架构"], - ["02", "kda", "KDA:线性工作记忆"], - ["03", "mla", "Gated MLA:全局回看"], - ["04", "attnres", "Attention Residuals"], - ["05", "moe", "Stable LatentMoE"], - ["06", "vision", "原生视觉与优化器"], - ["07", "pretrain", "预训练与长上下文"], - ["08", "posttrain", "后训练与推理强度"], - ["09", "agents", "Agentic RL 环境"], - ["10", "infra", "2.8T / 1M 基础设施"], - ["11", "evaluation", "评测与局限"], - ["↳", "sources", "论文链与一手来源"], + ["00", "compass", "三十二张问题账"], + ["01", "report-map", "47 页报告地图"], + ["02", "architecture", "三维信息流"], + ["03", "specs", "K2 → K3 规格"], + ["04", "kda", "KDA 状态与 Delta Rule"], + ["05", "bounded-decay", "Bounded decay"], + ["06", "mla", "Gated MLA 与 NoPE"], + ["07", "attnres", "跨深度 Attention"], + ["08", "latentmoe", "Stable LatentMoE"], + ["09", "stability", "SiTU 与 QB"], + ["10", "vision", "原生视觉"], + ["11", "data", "数据工程"], + ["12", "scaling", "Scaling 与训练配方"], + ["13", "context", "8K → 1M"], + ["14", "sft", "SFT 与 XTML 冷启动"], + ["15", "rl", "九专家与 effort"], + ["16", "mopd", "MOPD 与 partial rollout"], + ["17", "deployment", "QAT 与 draft model"], + ["18", "harness", "White-box harness"], + ["19", "environments", "环境与任务合成"], + ["20", "pretrain-systems", "预训练系统"], + ["21", "moonep", "MoonEP"], + ["22", "rl-systems", "RL 状态与 AgentENV"], + ["23", "cache", "混合 prefix cache"], + ["24", "serving", "Kernel 与 fleet"], + ["25", "evaluation", "评测协议"], + ["26", "cases", "案例边界"], + ["27", "xtml", "XTML 协议"], + ["28", "lab", "八联交互实验"], + ["29", "audit", "21 张图表审计"], + ["↳", "papers", "100 节点阅读链"], ]; + +const specs = [ + ["Transformer layers", "61", "93", "+32"], + ["Total parameters", "1.04T", "2.78T", "容量约 2.67×"], + ["Activated parameters", "32.6B", "104.2B", "路径约 3.20×"], + ["Hidden dimension", "7168", "7168", "主干不变"], + ["Routed latent dimension", "—", "3584", "主干的 0.5×"], + ["MoE expert hidden", "2048", "3072", "专家内部更宽"], + ["Routed experts", "384", "896", "池更大"], + ["Activated routed", "8", "16", "每 Token 多选"], + ["Shared experts", "1", "2", "完整宽度公共路径"], + ["Attention heads", "64", "96", "+32"], + ["Dense layers", "1", "1", "不变"], + ["Vocabulary", "160K", "160K", "不变"], + ["Context", "128K", "1M", "四阶段扩展"], + ["Attention", "61 MLA", "69 KDA + 24 MLA", "3:1 hybrid"], + ["Activation", "SwiGLU", "SiTU-GLU", "有界乘积分支"], + ["MTP layers", "1", "1", "后调为 draft"], + ["Vision encoder", "—", "401M / 27L / p14 / 12H", "从头联合训练"], +]; + +const dataDomains = [ + ["WEB TEXT", "网页正文与长文档", "规则、质量分类、exact/fuzzy dedup;长文档单独清洗与上采样。"], + ["CODE", "代码、仓库与可执行材料", "不仅生成文本,还支撑 kernel、web、软件工程和 programmatic vision。"], + ["MATHEMATICS", "数学推理与重写材料", "K2 参与多风格、多视角 rephrasing,并做 fidelity verification。"], + ["KNOWLEDGE", "知识密集语料", "chunk-wise 自回归改写,尽量在扩展表达的同时保留事实。"], + ["VISION", "caption / OCR / video / visual coding", "图文交错、绝对与归一坐标、SVG/3D/Web/Game/CAD 等程序化视觉。"], +]; + +const environments = [ + ["01", "Verifiable search & professional work", "多步搜索、投行、法律、数据分析与办公交付物;证据和最终产物都能检查。"], + ["02", "Vision reasoning", "在隔离 Python 环境裁剪、放大、计算,再把新图像作为 observation 回到同一轨迹。"], + ["03", "GPU kernel", "先过数值正确性,再比较专家实现和硬件 roofline,同时检测缓存/降精度作弊。"], + ["04", "Long-term assistant", "Gmail、Notion、Slack 等 mock app 跨多日演进,单任务可含数千次工具调用。"], + ["05", "Autonomous Execution", "只给初始状态、目标、约束、工具和 verifier,不给参考轨迹;奖励最终环境状态。"], + ["06", "Web development", "容器内构建网页、游戏、3D 与可视化,由功能、结构/像素和模型检查共同评分。"], +]; + +const stateStack = [ + ["PRETRAIN", "参数 / optimizer / activation / KDA state / vision tokens", "FlashKDA · KCP · MoonEP · pipeline/offload"], + ["AGENTIC RL", "policy / reference / KV / trajectory / sandbox / files", "partial rollout · throttling · AgentENV"], + ["SERVING ENGINE", "KDA recurrent state / MLA KV / prefix hash", "unified page pool · sparse checkpoints · COW"], + ["DEVICE", "projected replay input / AttnRes block / expert weights", "fused KDA · SP · WarpDecode-like kernel"], + ["FLEET", "session affinity / request-class budget", "primary+secondary hash · budget admission"], +]; + +const paperGroups = [ + ["FOUNDATION", "基础"], + ["STATE", "序列状态"], + ["DEPTH", "深度"], + ["MOE", "稀疏宽度"], + ["NUMERICS", "数值"], + ["SCALING", "Scaling"], + ["CONTEXT", "长上下文"], + ["KIMI", "Kimi 谱系"], + ["DEEPSEEK", "DeepSeek 交叉线"], + ["RL", "后训练"], + ["AGENT", "Agent 环境"], + ["DEPLOY", "部署"], + ["SYSTEM", "系统"], + ["EVAL", "评测"], +] as const; ---ANCHOR REPORT / 01 KIMI K3
-ANCHOR REPORT / ROUND 02 KIMI K3 · 47 PAGES
+- 不从 2.8 万亿这个最大数字开始,而从模型同时面对的四个瓶颈开始: - 序列太长、网络太深、容量太大、Agent 轨迹太久。K3 的每个新组件都可以放回这四个问题。 + K3 同时扩展序列、深度、宽度、视觉与 Agent 轨迹。真正值得读的不是 2.8T 这个最大数字, + 而是每种状态为什么出现、放在哪里、怎样被训练,以及作者证据究竟支持到哪一步。
00 READING ORIENTATION
-00 THIRTY-TWO QUESTION LEDGERS
+- K3 报告自己的组织方式非常漂亮:沿序列长度、网络深度和模型宽度扩展信息流。 - 这比“又加了哪些模块”更接近真正的设计逻辑。 + 技术报告最容易制造一种错觉:看完所有术语,却没有建立可追问的对象。 + 下面每张账只回答一个问题,同时写出答案不能被扩张到哪里。
-KDA 负责低成本持续记忆,周期性的 Gated MLA 负责完整全局交互。
-Attention Residuals 让当前层有选择地读取早期层,而不只是接收统一累加结果。
-Stable LatentMoE 建立 896 个路由专家,每个 Token 只激活 16 个。
-{answer}
+- 第四个问题藏在模型外部:这些结构要在真实硬件上完成预训练、百万 Token 强化学习和线上服务。 - 所以报告第 5 章不是附录,而是 K3 设计的一半。没有 FlashKDA、专家并行、外置 KV Cache、 - 可恢复沙箱和集群调度,前面的架构只是一张昂贵的蓝图。 -
-先认状态→找到瓶颈→看机制怎样改写状态→核对系统代价→最后读评测
+01 REPORT MAP
+{question}
- K3 想让信息在“很长的时间、很深的网络、很宽的专家库”里都能流动,同时让整个系统仍然能被训练和部署。 + §2 并不独立于 §5:KDA 的 recurrent state 决定 context parallelism 与 prefix cache; + 极稀疏 LatentMoE 决定 expert communication;长 Agent 轨迹又决定 partial rollout 与可恢复 sandbox。 + 架构、训练、系统是同一条状态链的不同截面。
01 ARCHITECTURE OVERVIEW
-02 THREE-DIMENSIONAL INFORMATION FLOW
+表示模型装下的总容量,不等于每个 Token 都计算全部参数。
单个 Token 前向时实际经过的参数规模,仍然非常大。
其中 1 层 dense;注意力由 69 KDA 与 24 Gated MLA 组成。
主干表示宽度;LatentMoE 内部路由空间压到 3584。
另有 2 个 shared experts,给通用变换保留稳定路径。
约一百万 Token;能放下不等于不需要上下文管理。
MoonViT-V2 把图像和视频编码到共享表示空间。
专家权重 MXFP4、专家激活 MXFP8,非专家模块保留更高精度。
低成本持续状态与周期性全局回看分工,不要求单一 attention 同时擅长所有时间尺度。
当前层不只接收统一 residual sum,而能选择早期 block 的表示。
shared path 保留完整宽度,routed path 压到 latent space 后从 896 个专家选 16 个。
视觉与文本从训练开始共享 backbone 与 NTP objective,使 screenshot 能成为 Agent 轨迹里的连续 observation。
- MoE 的核心正是把参数容量和每 Token 计算拆开。2.8T 描述可用参数总量;104B 才更接近一次前向的激活规模。 - 但 104B 依然远高于许多 dense 模型,所以“稀疏”不等于“能在普通显卡轻松运行”。 + 报告把约 2.5× overall scaling efficiency 归因于 KDA、AttnRes、Stable LatentMoE、 + 训练 recipe 和数据的组合。它不是 KDA 单项消融,也不是线上推理 2.5×。
03 TABLE 1 / EXACT SPECIFICATION
+| FIELD | KIMI K2 | KIMI K3 | HOW TO READ |
|---|---|---|---|
| {field} | {k2} | {k3} | {note} |
+ 2.78T 是总容量,104.2B 是激活路径规模;部署仍需放置大量 expert weights, + 推理仍需 attention、router、shared experts、dispatch/combine 与 kernel。把 active parameters + 直接当成 dense 等价成本,会漏掉系统账。 +
+02 KIMI DELTA ATTENTION
-04 KIMI DELTA ATTENTION
+- 标准注意力会让每个新 Token 和许多旧 Token 直接比较。KDA 改成维护一个固定形状的状态: - 新信息到来时,先有选择地遗忘,再用“纠错式写入”更新这份状态。 + 标准 attention 让新 Query 直接查看许多历史 Key/Value;KDA 将历史压入固定形状矩阵状态 + St∈Rdₖ×dᵥ。状态更便宜,但压缩也意味着它不是无损数据库。
- -- 长度为 n 的序列,如果做完整 self-attention,需要形成近似 n × n 的交互。 - 在一百万 Token 处,哪怕使用 FlashAttention 避免把整张矩阵写回显存,计算量仍按平方增长。 - 线性注意力的基本想法是先把历史压进状态 S,读取时只让 Query 查询状态。 -
- -Sₜ = (I − βₜkₜkₜᵀ) Diag(αₜ) Sₜ₋₁ + βₜkₜvₜᵀ
+ õₜ = Sₜᵀqₜ
+ α∈(0,1)dₖ 逐 key channel 保留旧状态;β∈(0,1) 控制写入;Query 从更新后的 state 读取。
- 如果直接做 S ← S + kvᵀ,同一个 key 反复出现会不断累加,状态容易被重复信息污染。
- Delta Rule 先问“现有状态对这个 key 已经会输出什么”,只写入真实 value 与旧预测之间的差值。
- 它像修改文档:不是每次把整篇内容追加到末尾,而是找到对应位置做差量更新。
-
- K3 报告把整体约 2.5× scaling efficiency 改善归因于 KDA、AttnRes、Stable LatentMoE 与训练/数据配方的组合, - 不能把 2.5× 单独归到 KDA。KDA 的独立机制与消融需要同时阅读 - Kimi Linear 和 K3 §2.1。 -
+Diag(α) 让不同 key channel 有不同记忆时长。
(I−βkkᵀ) 抑制当前 key 在旧 state 中已经对应的内容。
βkvᵀ 把新关联写入;等价直觉是只补预测误差。
Sᵀq 从固定状态返回 value-space 表示,再经 RMSNorm 与 full-rank gate。
+ 纯递归适合 decode,却会让训练沿序列串行。KDA 让 chunk 之间递归传 S, + chunk 内把 inter-chunk 与 causal intra-chunk 两部分改写成矩阵乘。 + 于是训练/prefill 能吃到并行硬件,decode 仍只更新固定 state。 +
+继续读:Kimi Linear 给出 KDA 前身与完整 UT transform;FlashKDA 是官方 kernel 入口。
+ + +05 FIGURE 3 / LOWER-BOUNDED DECAY
++ chunkwise 公式需要用累计 retention Γ 缩放 Key;因为 Γ 是许多 (0,1) 数的乘积,1/Γ 可能爆大。 + Kimi Linear 用负 Softplus,log-decay 下界为 −∞;K3 改成 scaled sigmoid: +
+g = −exp(A) Softplus(z) ∈ (−∞, 0)g = gmin Sigmoid(exp(A)z) ∈ (−5, 0)α = exp(g) ∈ (e⁻⁵, 1)+ BF16 最大有限量级约 3.39×10³⁸,因此报告默认最坏 rescale 仍在动态范围内。 + 这让 diagonal 和 off-diagonal causal tiles 都可使用稠密 Tensor Core 矩阵乘, + 消除显式 position-pair diagonal path。动态范围内不等于无舍入误差,二者要分开。 +
03 GATED MLA
-06 GATED MLA / GLOBAL LOOKBACK
+- 纯递归状态的优势是成本低,弱点是历史被压进固定大小状态后,精确回看某个遥远 Token 会更难。 - K3 没有把完整注意力全部删除,而是采用 3 层 KDA + 1 层 Gated MLA 的混合模式, - 并保证主干最后一层也是 Gated MLA。 + 固定状态擅长持续压缩,弱点是精确回看遥远 Token。K3 因而保留周期性 MLA: + 每个历史 Token 的多头 K/V 先压成 latent ct,服务时缓存 latent,再恢复 attention 所需内容。 + 这条机制来自 DeepSeek‑V2,是 K3 与 DeepSeek 最明确的继承边。
- -- Multi-head Latent Attention 由 DeepSeek-V2 引入。 - 标准多头注意力会为每个历史 Token 缓存多头的 K 和 V;MLA 先把它们压到低维 latent cₜ, - 服务时缓存 cₜ,计算注意力时再通过投影恢复各头所需内容。它保留全局 token-to-token 交互, - 同时显著缩小 KV Cache。 -
- -成本随 decode step 近似固定;历史被压缩,位置与近因通过递归门控保留。
仍做全局 token-to-token 内容交互;缓存比 MHA 小,但不固定。
KDA 负责低成本连续混合,MLA 定期校正和全局检索,最后一层保证全局 attention。
- K3 在全部 MLA 层采用 NoPE:Query 和 Key 不显式加入位置编码。位置与近因信息主要由穿插的 KDA 提供, - MLA 专注于全局内容匹配。这样扩展上下文时,也不必重新调 RoPE base 或应用 YaRN。 - 这是混合架构的一个重要分工:KDA 提供位置敏感的持续混合,MLA 提供不受限的全局内容交互。 + K3 的 MLA Query/Key 不加显式位置编码;穿插的 KDA 提供位置敏感、近因敏感的序列混合。 + MLA 因此专注全局内容匹配,也避免扩展到 1M 时调整 RoPE base 或 YaRN。 + 这是一种跨模块分工,不是证明纯 MLA 可以忽略顺序。
+- K3 还给 MLA 加入与 KDA 对齐的输入相关全秩输出门,并在训练时将 attention output 保持为 FP32, - 以纠正 FlashAttention 中有偏的舍入误差;代价是更大的片上存储,报告为此重新安排了 kernel 中的 tile 缓冲重叠。 + 报告为纠正 FlashAttention 中有偏舍入误差,在训练中保留 FP32 attention output。 + 它会把输出 tile 的片上 footprint 加倍,所以 kernel 改为与 KV staging buffers 重叠, + 腾出更深 KV pipeline 的共享内存。算法精度和 tile 排布在这里直接耦合。
04 ATTENTION RESIDUALS
-07 ATTENTION RESIDUALS
+- Transformer 用注意力解决了 RNN 必须把全部历史压进一个时间状态的问题。 - K3 提问:普通 residual 是否又把所有早期层压进了一个深度状态? + 普通 residual 把所有历史层持续压进一个 hl;这很利于梯度传播,却也让早期表示统一累加。 + AttnRes 把 embedding 与早层输出当成一组 depth sources。
-
- 标准残差不断做 hₗ₊₁ = hₗ + Fₗ(hₗ)。它很利于梯度传播,但越早的特征会在统一累加中混在一起。
- Full AttnRes 为每一层设置可学习 pseudo-query,对 embedding 和所有先前层输出计算权重,再按权重组合。
- 这里的“Query”不是当前 Token 内容,而是“第 l 层通常希望从哪些深度取信息”的可学习参数。
-
αᵢ→ₗ = exp(qₗᵀ RMSNorm(kᵢ)) / Σⱼ exp(qₗᵀ RMSNorm(kⱼ))
+ hₗ = Σᵢ αᵢ→ₗvᵢ
+ qₗ 是 layer-specific learnable pseudo-query,不随当前 Token 内容改变;RMSNorm 防止大幅值来源垄断权重。
+- Full AttnRes 的层数平方计算在不足 100 层时并不离谱,真正麻烦是保留所有层输出带来的内存与流水线跨 stage 通信。 - K3 把层分成 block:block 内先求和,跨 block 才做完整深度注意力。报告称经验上约 8 个 block 可保留大部分收益; - K3 使用 12 层一个 block,加上 embedding 来源,总计形成 9 个深度来源组。 + Full 版的 O(L²d) 算术在 L<100 时尚可,实际压力是所有层输出必须存活,以及 pipeline 跨 stage 通信。 + Block 版在 12 层内部求 partial sum,跨 block 才做完整深度 attention: + K3 有 8 个 layer blocks,加 embedding 共 9 个来源。报告 §7 芯片 nano 模型的 block size=2 + 只是案例配置,不能写回 2.78T 主模型。
-- Kimi Team 已公开 Attention Residuals 独立预印本, - 在 48B-total / 3B-active 模型上用 1.4T Token 做了 scaling 与消融;K3 则证明它能进入 2.8T 系统。 - 但它仍是 2026 年的新方法,第三方复现和跨架构外部有效性需要持续积累。 + Attention Residuals 独立预印本在 + 48B-total / 3B-active、1.4T Token 等设置上做 scaling 与消融;K3 报告证明它进入了更大系统。 + 作为 2026 新方法,跨团队复现仍有限。
05 STABLE LATENTMOE
-08 STABLE LATENTMOE
+- 传统 MoE 让被选中的每个专家都处理完整 d 维 Token。选更多专家时,不只计算变多, - Token 跨设备发送的数据和专家权重读取也随 routing multiplicity 增长。 - LatentMoE 把通用的 full-width 路径留给 shared experts,把 routed experts 放进较窄 latent space: - K3 主干宽度 7168,路由 latent 维度 3584。 + conventional MoE 把完整 d 维 Token 发给每个选中专家;激活专家数变多时, + dispatch payload 与 expert-weight traffic 一起增长。LatentMoE 把公共与专业路径拆开:
- -u = Σᵢ∈Tk(x) pᵢ Eᵢʳᵒᵘᵗᵉᵈ(W↓x)
+ y = Σⱼ₌₁² Eⱼˢʰᵃʳᵉᵈ(x) + W↑ RMSNorm(u)
+ 新增 RMSNorm 位于 routed aggregate 与 up-projection 之间,控制不同专家组合产生的尺度变化。
报告指出极端稀疏度会放大两个失败模式:routed path 连续多次矩阵乘导致内部激活爆炸;近千专家的负载难以靠旧的无辅助损失 bias update 稳定平衡。K3 加入三项修复:
-- 这条技术线与 DeepSeekMoE 紧密相连:shared experts 保存公共知识,细粒度 routed experts 促进专业化。 - K3 再借 LatentMoE 让“选 16 个专家”的通信和权重读取可承受,并为极端稀疏补上稳定性机制。 + routed branch 接近四次连续矩阵乘,2.8T 规模与极端稀疏会放大内部 activation explosion。 + Stable LatentMoE 不是一个技巧,而是三件事的组合:Normalized LatentMoE、SiTU‑GLU、Quantile Balancing。
- 进入 MoE 专题:逐步推导 LatentMoE 与 Quantile Balancing → + 进入 MoE 专题:比较 DeepSeekMoE、LatentMoE、QB 与系统通信 → + + +09 FIGURE 4–5 / ACTIVATION × ROUTING
+[β₁ tanh(Wg x/β₁) ⊙ Sigmoid(Wg x)] ⊙ [β₂ tanh(Wu x/β₂)]
+ 报告用 β₁=4、β₂=25,标量切片满足 |f(x)|≤100;近原点保持近似线性与 SwiGLU 局部形状。
+b̃ⱼ(t+1) ← −quantile₁₋ₖ/ₙ(s:,j − α(t))
+ Top-(k+1) 的最后一项给 token cutoff α;新 bias 下一 step 生效,最终 bias 冻结用于 inference。
++ QB 的 bias 进入 Top-k 选择,但从最终 mixture weight p 中移除,因此调 dispatch 而不直接改 mixture 权重。 + 全局 batch 的数百万 margin 不宜 gather,实际用每 expert histogram:各 rank 只 all-reduce bin counts, + quantile 误差受 bin width 限制。 +
+router score、cutoff、quantile、bias。
static shape、expert execution、zero-copy communication。
按 request class 给资源预算,避免 1M burst 饿死短请求。
06 NATIVE VISION & MUON
-10 NATIVE VISION / FIGURE 6
+先做 post-hoc modality alignment,再逐步解冻。
MoonViT‑V2 从头训练;视觉/文本 Token 交错在同一个 next-token prediction objective。
- 401M 参数 MoonViT-V2 将图片与视频编码成视觉特征,轻量 projector 把它们映射到语言主干的 embedding space。 - “原生”最重要的含义不是“能看图”,而是视觉数据在预训练阶段就进入统一模型;后训练中的 Agent 还能把截图、 - 图表、裁剪/缩放后的新图片当作连续 observation,形成看—行动—再看的闭环。 -
-- 报告描述了渐进式多模态训练:先固定语言模型训练视觉组件,再逐步解冻主干;多模态编码器优化则涉及动态分辨率、 - packing 与避免视觉计算造成流水线 bubble。完整视觉谱系会从 ViT、CLIP、Flamingo、BLIP-2、LLaVA 讲到 Kimi-VL。 + MoonViT‑V2 约 401M、27 层、patch 14、12 heads;使用 RMSNorm,linear/attention projections 无 bias。 + 图像和视频共享参数,以 spatial/temporal factorized attention 处理时空关系, + temporal pooling 压视频长度,2×2 pixel shuffle 减少送入主干的视觉 Token,输入最高 3584×3584。
++ 作者消融中,从头训练的 MoonViT‑V2 比 SigLIP 初始化的 MoonViT‑3D 有更低 gradient norm 与更少 spike, + 并在其视觉评测中匹配 baseline。这是特定大规模联合训练配置的结果,不是“视觉预训练普遍无用”。 +
+11 PRE-TRAINING DATA
+{detail}
- Muon 在矩阵更新上做正交化,目标是比逐元素 Adam 更好地控制隐藏层更新。K3 采用 per-head 分组: - 对 Q/K/V 等多头投影,按 head 分开应用 Muon,而不是把整块矩阵当作一个整体。 - 直觉上,每个 head 是相对独立的子空间,按 head 归一更新可减少大矩阵不同部分相互干扰。 + 团队先用规则、质量分类器和去重筛数据,再用小模型 ablation 调不同 domain sampling。 + Knowledge / Mathematics 使用 K2 生成多风格、多视角改写:长材料采用 chunk-wise 自回归生成, + 最后做 fidelity verification。视觉坐标同时提供绝对值与 [0,1] 归一值, + programmatic data 覆盖 SVG、3D、Webpage、Game、CAD。
- 报告把 Per-Head Muon 放进统一训练配方,但整体 2.5× scaling efficiency 并不是单项优化器消融结论。 - Muon 的通用可扩展性应另外阅读 Muon is Scalable for LLM Training。 -
+ 报告没有公开的,网站不会补写 +完整语料来源、精确域配比、总训练 Token、版权构成与完整过滤阈值均不足以独立复现;参数量不能填补这些空白。
07 PRE-TRAINING
-12 FIGURE 7 / SCALING & RECIPE
+- K3 报告将模型能力的提升明确归因于架构、数据和训练 recipe 的共同作用,但没有公开足以复现的完整语料配比。 - 这需要区分两件事:我们可以准确解释训练阶段和公开机制,却不能根据少量描述虚构完整数据集。 + 团队在小规模模型上共同重调 batch size、learning rate、tokens per parameter 与 model shape, + 并在 held-out OOD data 上比较候选。cosine 与 WSD 各自独立搜索最优超参, + 作者设置中 cosine 最终 loss 更低。约 2.5× 的含义是:相对 K2, + K3 的架构、数据与 recipe 组合在 compute–loss scaling 上更有效。
- -- 团队先在较小规模训练一系列模型,拟合 loss 与参数、数据和计算之间的关系,再用它比较架构候选与估计 2.8T 模型的预算。 - K3 所称约 2.5× overall scaling efficiency,是相对 K2 的经验缩放效率:在相同计算下取得更低 loss,或达到同等 loss 所需计算更少。 - 它不是“推理速度提高 2.5×”,也不是所有下游任务统一提升 2.5×。 + Per-Head Muon + K2 weight clipping;QB 负责 MoE load balance;cosine schedule、1% linear warmup、 + weight decay=0.1。Per-Head 表示 Q/K/V 等多头矩阵按 head 分组应用 Muon, + 不能把整体 scaling 收益单独归到 optimizer。
+ 进入 Scaling 专题:读懂 loss、compute、数据与外推误差 → +13 FOUR-STAGE CONTEXT CURRICULUM
+低成本建立基础能力。
在预训练后段延长。
集中投入昂贵长序列。
适应目标窗口。
- 上下文扩展需要长度 curriculum、长文档数据、并行策略和稳定训练。K3 的 NoPE MLA 避免 RoPE 外推参数; - KDA 的递归/块并行结构降低长序列成本;系统侧再用 KDA Context Parallelism 分摊状态与 chunk。 - 最后还要在 post-training 里真正让模型经历长轨迹,否则“窗口能装下”不等于“模型会有效使用”。 + 自然长文档/视频要做 exact/fuzzy dedup、frame perceptual hashing、heuristic/classifier filtering + 与 structural validation,并因稀缺而上采样。长度本身不训练跨远距离依赖,所以又把多模态文档/子任务 + 置换、拼接,要求答案依赖散落在整段 1M 中的证据。
- 能把一百万 Token 放进输入,像图书馆允许你搬进一百万字;能否跨文档找到证据、维持任务状态并避免遗忘, - 才是在考你是否真的读懂。K3 同时用架构、长程 RL 和上下文管理训练这件事。 + 一百万 Token 像允许把整间资料室搬进考场;能否跨文档找到证据、维持任务状态、在恰当时机压缩, + 才是模型和 harness 是否真正会用它。
08 POST-TRAINING
-14 SFT COLD START
+- K3 的 post-training 覆盖 SFT 与 RL,RL 按三类 domain 与三种 reasoning effort 组织: - general reasoning/knowledge、agentic、coding × low/high/max,形成九个专业策略。 - 然后用 Multi-Teacher On-Policy Distillation(MOPD)把它们整合进统一学生模型。 + K3 扩展前代 Kimi SFT pipeline,由 domain-specialized models 合成长 agent trajectory, + 经多阶段验证与 human-in-the-loop annotation。所有复杂轨迹用 XTML 统一序列化, + 使 reasoning、response、tool call 与动态工具边界保持一致。
+MXFP4 expert weights / MXFP8 expert activations 的 QAT 从 SFT 开始,而不是在全部 RL 完成后临时量化。
+15 FIGURE 8 / NINE RL EXPERTS
+- “更久思考”会提高部分难题表现,也会增加延迟、成本和过度思考。K3 通过预算控制参数训练 max/high/low 专家: - 先在较大预算下追求能力,再逐步退火得到更短策略。不同 domain 的预算调整由人工参与配置, - 因为一道数学题、一次网页研究和一个代码仓库任务的合理轨迹长度并不相同。 + Figure 8 中,随着 RL FLOPs 增长,多个公开/内部评测分数与平均 assistant steps 同时上升。 + 这支持作者在其训练过程里的 scaling 观察,但不能直接推出“任何任务多走几步都会更好”。
- -- 普通蒸馏常让学生模仿教师已经生成的固定答案;学生一旦在真实生成中走到不同前缀,教师数据就失去覆盖。 - On-policy distillation 让学生自己生成当前前缀,再在这个前缀上比较教师和学生对下一个 Token 的概率, - 形成稠密 reward。这样训练分布更贴近学生真正会访问的状态,也能自然结合 partial rollout。 -
- 进入推理专题:并排理解 partial rollout、reasoning effort 与 MOPD → - -- K3 从 SFT 开始对 MoE expert weights 使用 MXFP4 QAT,expert activations 使用 MXFP8; - RL rollout 和训练采用相同量化方案,减少训练—推理失配。预训练中的 MTP 层随后被微调为 EAGLE-3 风格 draft model, - 用低/中/高层 AttnRes 特征预测候选 Token,并直接优化与无损推测采样接受率相关的 LK loss。 -
-09 AGENTIC RL
-- K3 报告最值得细读的部分之一,是它把 Agent 后训练写成环境工程:工具、system prompt、context management、 - skills、memory、subagents 和 harness 都成为可组合变量。训练时动态实例化 Kimi Code、Claude Code、Codex、 - OpenClaw、Hermes 等风格,避免模型过拟合一套固定工具 schema。 -
- -多步检索、投行、数据分析、法律交付物;奖励落在证据和最终成果。
模型在隔离 Python 环境里裁剪、放大、计算并把新图片作为 observation。
先过数值正确性,再比较专家实现与硬件 roofline,并检测缓存/降精度等作弊。
用 Gmail、Notion、Slack 等 mock app 构造跨多日事件;单次可达数千工具调用。
只给初始状态、目标、约束、工具和 verifier,不提供参考轨迹;奖励最终环境状态。
容器内构建网页、游戏、3D、可视化;功能测试、结构/像素相似与模型检查共同评分。
- 长任务最常见的失败之一,是 Agent 输出一段令人信服的总结,却没有真正改变目标状态。 - K3 的 AET 把 reward 绑定到独立 verifier 读取的环境结果;public verifier 提供诊断, - hidden verifier 检查保留场景,并限制提交预算以减少 reward hacking。 -
-if T(y) > τ · b₀(x), override task reward with −1
- 可靠 Agent 的学习单位不是“一条漂亮回答”,而是状态明确、动作可执行、反馈可验证的一整段轨迹。 - Harness 多样化、持久环境和独立 verifier,分别处理接口过拟合、短视行为和自我宣告成功。 - 进入 Agent 专题,完整拆解 white-box harness、AET 与 AgentENV → + b₀(x) 由 cold-start model 估计;general task 主要计 thinking tokens, + agentic task 计 reasoning trace、tool-call arguments 等累计输出。τ 按 domain 由人工指导退火。
10 INFRASTRUCTURE
-16 PARTIAL ROLLOUT × MOPD
+- K3 基础设施可以按三类状态理解:模型状态(参数、优化器)、序列状态(KDA state、KV Cache)、 - 环境状态(代码仓库、应用、microVM)。三类状态的寿命和移动成本完全不同。 + 每轮 N 个 prompts、每题 K 条 completion,保持 N×K 条 active trajectories。 + 当 λN K 条完成就暂停 generation,先进行 policy optimization;未完成轨迹进队列, + 下一轮优先恢复。好处是减少 straggler,代价是同一长轨迹跨多个 iteration, + 数据变 stale/off-policy;报告用 per-token regularization 把更新限制在局部邻域。
- -KDA-aware prefix cache、专用 kernel、cache/budget-aware fleet scheduling,把共享前缀和不同思考预算纳入调度。
partial rollout、外置 KV retention、adaptive throttling 与可恢复 microVM,避免每次更新都丢掉漫长轨迹。
MoonEP 用静态计算形状、平衡专家执行与 zero-copy communication,配合内存优化和多模态 encoder 调度。
针对不同序列 regime 的 fused kernel、KDA Context Parallelism 与状态感知前缀缓存。
rᵈₒₚd(yₜ|e,x,y<t) = clip(sg log[πteacherᵈ,ᵉ(yₜ|x,y<t) / πθ(yₜ|e,x,y<t)], −Rmax, Rmax)
+ domain d 与 effort e 选择对应 teacher;stop-gradient 防 teacher ratio 被学生优化反向改变。
+- MoE 的理论 FLOPs 很漂亮,真实系统却可能被“这个专家突然收到太多 Token”拖垮。 - 跨卡 all-to-all 通信、专家权重读取和不规则 shape 都会制造等待。K3 报告称 MoonEP 追求 perfectly balanced expert execution, - 使用静态计算形状和零拷贝通信把路由后的 Token 送到对应专家。这里的“平衡”是系统执行层结果,不等于路由概率天然均匀; - 它和模型侧 Quantile Balancing 是互补层次。 + 九个 expert models 是训练老师,不是推理时投票。on-policy 的意义是教师覆盖学生真正访问的 prefix, + 避免只模仿固定离线答案;它仍受 teacher 质量、domain mapping 与 compute 约束。
+ 进入推理专题:比较 GRPO、R1、effort control 与蒸馏 → + -17 DEPLOYMENT-AWARE POST-TRAINING
+占大多数参数内存。
rollout 与 training 同方案。
attention、latent projections、shared experts、router。
全 post-training QAT,减少 train–inference mismatch。
- 传统 RL rollout 常在模型更新后重新生成。若一条轨迹已经调用工具几百次、积累几十万 Token, - 重新生成会浪费巨大。K3 将 KV Cache 放到外部、允许 partial rollout 暂停并续接; - 同时把工具环境放进可恢复 microVM,使代码、文件和应用状态与语言上下文一起跨训练 step 存续。 + 预训练 MTP 层结构与 EAGLE‑3 的单 decoder draft 相近,因此冻结 target model, + 只调 draft layer 和 feature-fusion projection。输入融合第 1、第 4、最后 AttnRes blocks 的低/中/高层特征, + 训练展开 7 steps,逼近真实 recurrent drafting。
+Lᴸᴷ = −log Σₓ∈V min(p(x), q(x))
+ p/q 是 target/draft next-token distribution;直接优化无损 speculative sampling 的接受率,而不是只用 KL surrogate。
+18 UNIFIED WHITE-BOX RL ENVIRONMENT
++ 固定 harness 会让模型过拟合 tool schema、system prompt、context management 与 interaction protocol。 + K3 把 harness 表示为配置化模块集合,训练时按 task group 动态组合, + 可实例化 Kimi Code、Claude Code、Codex、OpenClaw、Hermes 等风格或全新组合。 +
+代码/Agent 分数是 model × harness × environment × verifier 的系统结果。模型名不是完整实验条件。
+19 FIGURE 9–10 / TASKS & ENVIRONMENTS
+{detail}
+ AET 只给初始环境、目标、约束、工具和 verifier,不提供 reference trajectory。 + public verifier 给诊断,hidden verifier 检查保留场景,并限制提交预算降低 reward hacking。 + 奖励落在独立读取的环境结果,而不是 Agent 自己说“完成了”。 +
+ 进入 Agent 专题:完整拆解 white-box harness、AET 与 verifier → +20 PRE-TRAINING INFRASTRUCTURE
+{mechanism}
+ bounded decay 让全部 causal tiles 使用 dense Tensor Core path; + KCP 则沿 sequence dimension 分片 1M Token。不同 sequence regime 需要不同 fused kernel, + 算法公式、secondary tile 与设备内存共同决定实现。 +
++ vision encoder 的计算形状和 decoder 不同,会制造 pipeline bubble。 + §5.2 / Figure 11 的重点是重新安排 encoder、pipeline 与 offload,让参数/activation 的放置不把 3T 训练拖成等待链。 + 报告没有公开完整 GPU 数和总训练成本,页面不从示意图反推。 +
+21 MOONEP / EXPERT PARALLEL
++ MoE 的理论 FLOPs 不包含 all-to-all、专家权重读取、padding 与慢 expert 长尾。 + MoonEP 追求 balanced expert execution,以 static computation shape 与 zero-copy communication + 处理 dispatch/combine,并让通信与 shared-expert 等计算重叠。 +
+QB 让 router 负载接近目标;MoonEP 让设备执行可预测;fleet admission 让不同请求类不互相饿死。
+22 LONG-HORIZON RL STATE
++ 重新生成已经调用数百次工具、积累几十万 Token 的轨迹极其浪费。K3 将 KV retention 外置, + partial rollout 可暂停/续接;AgentENV 用 Firecracker microVM 保存代码、文件、应用与系统状态。 +
+报告称等待可占 sandbox 生命周期 98%。
可让 reward judge 检查而不污染原环境。
错误后不必从任务最初重来。
报告最低 checkpoint / resume 133ms / 49ms。
均为 K3 报告的训练/评测基础设施数字,本站未独立复跑。
+23 FIGURE 12 / KDA-AWARE PREFIX CACHE
++ 分开 manager 会重复 allocation、eviction、transfer。K3 把 KDA states 与 MLA KV 放进同字节大小的统一 page pool, + 共享 allocation、reference counting、eviction;KDA 各 head byte stream 连续,跨 prefill/decode 不同 TP + 时在 transfer path re-layout。 +
+Figure 12 示例:请求匹配到 2800,最长 joint hit 在 B=2560;复用五个 MLA hash blocks 与该处 KDA checkpoint。
++ KDA checkpoint 大,只能稀疏保存;若把 hash 也绑到 1024–6144 的物理块,短请求几乎无法命中, + chunked prefill 也要等完整块。K3 允许 512-token hash endpoint 落在粗 physical block 内, + KDA checkpoint 只存可查询 endpoint 的稀疏子集。 +
+24 DEVICE KERNELS × FLEET SCHEDULING
+speculative rejection 后 state 难回滚;重新在片上 replay accepted prefix,再写 verified/bonus states。
+避免每个 TP rank 复制 block representations;inter-block overlap,intra-block merge/RMSNorm fusion。
+latent weight 分片,output all-gather 进 GEMM epilogue;小 batch routed experts 用 token-centric kernel。
+session 绑定 primary/secondary clusters;长请求只消耗自己的 class budget,不饿死短请求。
++ 报告给出 typical coding input:400K prefix、只增加 4K。cache hit 可避免重做整个 prefill; + 而生产请求从 <2K 到 1M,单请求成本跨约三个数量级,按“平均请求”规划会失效。 +
+11 EVALUATION & LIMITS
-- 官方报告的总体表述很克制:K3 在其评测套件中领先被比较的其他开放与部分闭源模型, - 但整体仍落后 Claude Fable 5 与 GPT-5.6 Sol。理解这句话,比挑一个 K3 第一名的榜单更重要。 +
25 FIGURE 1 & 13 / TABLE 2–5
++ 报告结论是:K3 在其套件中领先被比较的其他开放与部分闭源模型, + 但整体仍落后 Claude Fable 5 与 GPT‑5.6 Sol。任何单项第一都不能覆盖这句总体判断。
- -- 例如 BrowseComp 使用 300K Token 触发上下文压缩时 K3 报告 91.2;完整 1M 窗口、不做上下文管理时是 90.4。 - 这反而给出重要工程信号:更大的窗口不自动消灭 context management,适时压缩可能更有效。 -
- +K3 主结果多用 max;比较模型尽量用 max/xhigh。成本与延迟不相等。
代码/Agent 结果携带 Codex、Kimi Code、Claude Code 等脚手架。
HLE、视觉数学等有/无工具必须分列,不可把工具增强写成纯模型能力。
闭源 fallback、拒答或 cyber guard 会改变特定任务结果。
模型、价格和服务行为会变,第三方比较必须附评测日期。
Figure 13 同时画 score 与 token/cost,能力不该脱离预算阅读。
这是报告设置里的工程信号:更大窗口不自动消灭 context management,适时压缩可能更有效。
+- 报告没有给出足以独立复现的完整数据配比、总训练 token 数、全部集群规模与训练成本; - 新架构也缺少广泛第三方复现。网站会持续加入开放权重评测和独立复现,但不会用参数量或单榜第一替代综合判断。 -
+ 局限必须与亮点同页 +报告与外部材料还提示 research reasoning、cyber 等能力边界;新架构缺少广泛第三方复现,完整训练数据、集群与成本未披露。
↳ PRIMARY SOURCES
-本页锚点;架构、预训练、后训练、系统和评测的完整一手报告。
- - - Attention Residuals跨深度选择的独立预印本、Block AttnRes 系统设计与 scaling 消融。
- - - Kimi LinearKDA 的表达能力、chunkwise 算法与 hybrid linear attention 祖先。
- - - DeepSeek-V2MLA 与 DeepSeekMoE 的系统性引入,K3 周期性全局注意力的关键来源。
- - - DeepSeekMoEshared experts 与细粒度专家特化,Stable LatentMoE 的组织祖先。
- - - LatentMoE把 full model width 与 routed expert width 分离,扩张专家数量与激活数。
- - - Kimi k1.5大规模强化学习、长 CoT 与推理时扩展的 Kimi 前代主线。
- - - Kimi K2开放 Agentic Intelligence、MoE 主干和工具使用的直接前代。
- - - Kimi K2.5视觉 Agent、并行 Agent Swarm 与 K3 多模态/Agent 后训练的前代。
- +26 §7 CASE STUDIES
+报告还给出 DSA/KDA reductions 55.1%/73.6%,MLA 超过一半 peak;均为作者个案。
模型构建 tensor library、autograd、compiler 与 distributed;roofline 结果只限报告硬件/任务。
nano model 同型但 AttnRes block size=2;4mm²、100MHz、>8700 tok/s 等不是主模型推理规格。
展示工具、证据、迭代与产物;属于作者选择的 case study,不是平均成功率。
用来研究 trajectory、工具与 verifier 怎样协作;不能用一个成功案例推断所有真实任务的可靠性。
+27 APPENDIX F / XTML
+tool declarations · reasoning effort
think · response · tools
避免破坏已有 KV prefix
会话中可加入 input options
+ XTML 用 `[open]`、`[sep]`、`[close]`、`[end_of_msg]` 标消息边界; + think / response / tools 分 channel;thinking / instruct 由 prefix 选择。 + global options 放历史前,one-shot options 放历史后,是为了既传控制又保留 KV cache。 +
+28 EIGHT INTERACTIVE WORKBENCHES
++ 八张实验台各自声明“精确计算”和“教学模型”的边界。 + 重点不是玩滑条,而是看哪个量发生变化、哪个结论仍然不能推出。 +
+29 FIGURE & TABLE AUDIT
+{contract}
+作者直接陈述或报告数字。
原论文、官方代码或 benchmark。
由公开公式确定性计算。
帮助理解方向,不是实测。
↳ ONE HUNDRED PRIMARY NODES
++ 这 100 个节点经过标题、年份、作用与 URL 核对;优先采用论文原页、官方仓库与 benchmark 官方入口。 + 它们不是“引用越多越好”,而是把 K3 放回 attention、MoE、数值、RL、系统与评测的历史脉络。 +
+ {paperGroups.map(([group, label]) => { + const items = k3PaperChain.filter((paper) => paper[5] === group); + if (!items.length) return null; + return ( +{reason}
+ + ))} +47 页报告目录、151 条参考来源和架构/后训练/系统主线已经提取。
从语言模型基础到评测安全,包含先修依赖和三条贯穿案例。
响应式导航、章节模板、侧栏、进度、论文链和证据提示组件。
K3、语言模型前史、Transformer、表示深度、DeepSeek 四联实验、长上下文、MoE、推理、Agent、多模态,以及训练系统、推理服务、Scaling、数据工程、数值、Alignment 与评测安全专题。
K3 三轴图与八联实验、语言模型前史、Transformer、表示深度、DeepSeek 四联实验、长上下文、MoE、推理、Agent、多模态,以及训练系统、推理服务、Scaling、数据工程、数值、Alignment 与评测安全专题。
K3、语言模型前史、Transformer、表示/位置/残差、DeepSeek、Scaling、数据工程、长上下文、MoE、后训练、推理、Agent、原生多模态、训练系统、推理服务、数值优化与评测安全专题。
八张独立问题账、33 个正式节点、20 段长文与概率—向量—记忆—对齐四联实验。
十张独立问题账、40 个正式节点、21 段正文与 QKV—Mask—多头位置—Block 成本四联实验。
二十张问题账、66 个一手节点、DeepSeek/Kimi 双谱系,以及 Token—位置—Norm—Residual/FFN 四联实验。
二十四张问题账、十次技术转向、60 个一手/官方节点,以及稀疏容量—MLA 缓存—V3 协同—RL 偏差四联实验。
三十二张问题账、Figure 1–16 / Table 1–5 审计、100 节点阅读链,以及 Delta—Decay—AttnRes—LatentMoE—SiTU—QB—MOPD—Cache 八联实验。
九张账、29 个一手节点、DeepSeek/Kimi 双谱系与曲面—部署—复用—涌现四联实验。
十二张账、31 个一手节点、DeepSeek/Kimi 双谱系与流水线—去重—混合—改写四联实验。
五张成本账、26 篇一手论文、10+ 机制图与 8 策略交互实验室。
开放权重 traces → FlashKDA / AttnRes / MoE 真实行为 → Figure 1–16 数值重绘与独立复现
运行证据 + 逐图复现真实 expert load / MLA kernel → FP8 / pipeline traces → R1-like RL 小模型复现
运行证据 + 独立复现多头电路逐图 → Pre/Post-LN 真实 traces → Flash/KV 配置与 kernel 对照
逐图笔记 + 实测边界真实 hidden-state / norm traces → 长上下文位置外推 → mHC / AttnRes 深层稳定性消融
可复现实验 + 逐图笔记MLA→V4 异构状态与 Mooncake→KDA→K3 混合缓存分开说明;作者报告、精确公式和教学估算使用不同标签。
计算单位、词表接口、上下文化、位置、外推、Norm 对象、拓扑、残差路由与非线性极值不再混成一个 hidden-state 名词。
93 层按 12 层形成 8 个 layer blocks(7 个完整块加 1 个尾块);再加 embedding,共 9 个 block-level 来源,废弃早期错误的“2 层一块”读法。
从架构组件摘要升级为覆盖预训练、后训练、环境、系统、评测、案例与附录的完整报告因果链。
MoonViT-V2 从头训练;视觉与文本从训练开始在同一个 NTP objective 中联合优化,不再沿用冻结/解冻式 post-hoc 叙述。
Figure 1–16 / Table 1–5 建立视觉契约;报告事实、原论文、确定性推导与教学模型使用 R/P/D/T 四种身份。
K3 → 07 → 06 → 03 → 11 → 08/14
+K3 架构 → 07/06/03 → 05/04 → 11/12 → 08/14/15