同一句话的教学计算步数
INTERACTIVE / REPRESENTATION WORKBENCH
++ 四台仪器只计算公开公式与明确标注的 toy model。它们帮助建立方向直觉,不是任何真实 tokenizer、 + checkpoint、训练 loss 或梯度的复跑。 +
+切换计算单位、词表和 weight tying,观察参数账;再让同一 token 进入两个上下文,看初始向量如何被改写。
+同一句话的教学计算步数
`V × d`,不含位置和 block
共享时一张表;否则两张
只算 input / output matrix
“行”在河岸语境中被教学变换到“行走/景物”方向;这不是任何真实模型的向量,也不宣称二维投影能容纳全部语义。
+Tokenizer 决定计算单位,embedding 只负责入口查表;真正的上下文化表示来自后续层的序列混合与 FFN。
+移动 Q / K 的位置,比较绝对相加、RoPE 旋转、ALiBi 距离偏置与没有显式项的 NoPE。
+RoPE 让两次绝对旋转在点积中相消,只留下相对位移;这里仅画一个二维频率对。
+`j − i`,方向也属于信息
当前方案写入匹配的量
单个二维内容向量的示意
可计算不等于训练分布熟悉
每个位置有自己的向量;相对规律需由网络再组合。
距离在 Q–K 匹配时才出现,不必污染 Value。
绝对角度进入 Q/K,相对角度留在内积。
不能据此断言 causal / recurrent model 没学顺序。
当前位置仍在训练窗口内;把任一位置移到 64 之外,就进入 toy extrapolation 区。公式仍能算,但相位组合未必训练过。
+同一条 residual branch,Norm 的对象和位置会改变 identity path、累计幅值和 attention logit 饱和。
+xₗ₊₁ = xₗ + F(Norm(xₗ))
+假设分支近似正交的教学估计
捷径上的局部教学系数
一个 logit 高于其余 0 的 toy 分布
位置与对象不能只看名字
(x−μ) / √(σ²+ε)x / √mean(x²)q̂ · k̂ × γNorm(cKV)Pre-LN 保留裸 identity path;toy RMS 用独立分支近似展示固定相加为何可能随深度增长,不能预测真实 checkpoint。
+左侧选择深度路径,右侧选择激活;把 DeepSeek-V4 的 mHC / clamp 与 K3 的 AttnRes / SiTU 放在同一张机制图中。
+hₗ = Σ softmax(qₗᵀ RMSNorm(kᵢ)) · vᵢ
+ K3 把 93 层按 12 层组织为 8 个 layer blocks;加上 embedding,共有 9 个 block-level 来源。
+教学状态数;不是显存字节
固定相加还是按内容选择
4 tanh(g/4) · σ(g) · 25 tanh(u/25)
+ 两条线性支路都用 tanh 平滑压缩;β₁=4、β₂=25 时,逐点绝对值严格小于 100。
+在当前绘图区间采样
函数性质或“无有限上界”
mHC 学习受约束的多流映射;AttnRes 对先前层或 block 表示做内容相关选择。二者改变的是不同拓扑,不能只用“谁更先进”概括。
+CHAPTER 03 REPRESENTATION · POSITION · DEPTH
++ Token 不是词,embedding 不是知识,位置也不是一串神秘正弦。真正的问题是: + 一条离散符号怎样获得上下文、顺序和深度,又怎样在 93 层与乘法门控中不被放大或稀释? +
+模型的 hidden state 同时沿 词表接口、序列位置、网络深度、局部非线性 四个坐标轴被改写;K3 正是把四轴分别重做后再拼成一套系统。
+00 / PROBLEM LEDGERS
++ 这章最危险的读法,是把 Tokenizer、位置编码、Norm、Residual 和激活函数当作五个互不相干的组件。 + 它们其实共同决定一件事:同一条向量在进入模型、匹配上下文、穿过深度、通过非线性时,哪些信息和尺度能被保留。 +
+{question}
{answer} +谁是模型的一步,入口和出口各花多少参数?
位置怎样改变 token-to-token 匹配?
捷径怎样避免阻塞,又怎样避免所有层固定混成一团?
逐位置加工怎样增加容量,又怎样制造极端激活?
01 / REPRESENTATION OBJECTS
+如果不先区分对象,后面所有讨论都会滑坡:把 ID 当语义、把 embedding 当知识、把概率当一个向量固有属性。
+{formula}{note}
t → eₜ = E[t] → hₜ⁰ → hₜ¹ → … → hₜᴸ → zᵥ = Wout[v]ᵀhₜᴸ → softmax(z)
+ 同一个 token ID 的 `E[t]` 固定;真正随上下文变化的是层内状态 `hᶫₜ`。输出概率还依赖整个词表的相对 logits。
+02 / TOKEN AS COMPUTE UNIT
+embedding / output head 参数增大,常见词可用更少步表示。
Attention、状态更新、训练 token budget 与推理步数都增加。
语言、数字、代码、稀有词和拼写鲁棒性会获得不同归纳偏置。
Byte Latent Transformer 不把每个 byte 都交给大 Transformer;它按 next-byte entropy 形成动态 patch,在难预测位置分配更多计算。论文结果属于其 FLOP-controlled scaling 设置,不是“固定 tokenizer 已被淘汰”。
+ 阅读原文 → +03 / INPUT–OUTPUT GEOMETRY
+Press & Wolf 与 Inan et al. 在 2016 年独立把 weight tying 推到语言模型主线:Output Embedding · Tying Word Vectors
+04 / CONTEXTUALIZATION
+“bank” 无论在河岸还是金融句中先取同一行。
type-level邻近词、词形、标点与短程组合开始改变方向。
occurrence-level与语义、指代、预测目标相关的特征继续被重组。
context-conditioned最终 state 与全部输出向量比较,产生下一 token 分布。
decision interface+ 不要把 probe 读成“解剖标签”。 + ELMo、BERT 和后续 probing 工作展示不同层可线性提取不同语言信息;它们没有证明某层只负责一种功能,也没有证明 probe 读出的关联就是模型决策的因果电路。 ++
05 / FFN AS REPRESENTATION
+每个位置按 Q/K 权重汇总其他位置的 Value;它重排和混合序列信息。
+同一组权重逐位置应用,产生非线性特征、门控与大量参数容量。
++ Geva et al. 把 FFN 分析为 key-value memories:第一层方向与输入模式相关,第二层方向诱导输出词表分布; + 低层更多浅层模式,高层更语义化。这个视角说明 FFN 不是“Attention 后的填充”,但也不能把每个 neuron 直接命名成一条稳定事实。 +
+ +06 / EIGHT TURNS
+{note}
07 / PERMUTATION SYMMETRY
+每行用同一 Q/K/V 投影
Attn(X)没有 mask / position输出跟着行顺序
输入行被同一个 P 重排
Attn(PX)= P Attn(X)只跟随排列,不知道语序差异
第 t 位只能读前缀,因此不同位置拥有不同可见集合。NoPE causal decoder 不是完全无序;但 mask 没有显式告诉 Q/K “相距多少”。
+08 / ABSOLUTE POSITION
+原始 Transformer 使用不同频率的 sin/cos,使位置间线性关系可被学习;公式可生成未见绝对位置。
灵活但通常受训练最大索引约束;扩窗需要新增、插值或重训。
09 / RELATIVE POSITION
+{formula}{target}{note}
Shaw et al. 把相对距离表示加入 self-attention;Transformer-XL 为跨段记忆重新设计相对位置;T5 将距离分桶并作为 attention bias。它们都叫“relative”,但写入的张量与参数共享方式不同。
+10 / ROTARY GEOMETRY
+R(mθ) = [ cos mθ −sin mθ
sin mθ cos mθ ]
+ 每两维构成一个复平面。Q 在 m 旋转、K 在 n 旋转;做内积时,公共绝对角度相消,只剩相对位移 `n−m`。
+ 公式可生成任何 m ≠ 模型熟悉任何 m +11 / LENGTH EXTRAPOLATION
+重新设计距离衰减、分辨率或相对函数。
把新位置压回熟悉范围,或按频率非均匀插值。
避免位置参数外推,但仍须证明顺序和长程能力从何而来。
位置公式不替代远距离依赖数据与训练系统。
+ “Context window = 1M”至少有四层含义: + 数学上能接收、系统上能运行、训练中见过、任务上能有效利用。任何一层都不能代替其余三层。 ++
12 / NO POSITION ENCODING
+Q/K 或 embedding 不再加人工位置函数。
每个位置的可见集合不同。
状态更新本身带方向与时间。
语言序列的条件分布并不对称。
+ 2023 的系统研究在一组 decoder-only 推理与数学任务上发现 NoPE 优于若干显式方案,并从表示能力与 SGD 模式分析它; + 这不是所有语言建模、所有架构和所有长度的普遍胜负。K3 更不能只写成“NoPE 模型”:它用 KDA 的 recurrent gating / decay 显式承担位置敏感与 recency-aware 混合。 +
+13 / DEEPSEEK POSITION LINEAGE
+标准 decoder 配方:所有相关 Q/K 维度旋转。
位置与内容共处 headcontent K/V 压入 latent;额外 shared K 与 multi-head Q 专门携带 RoPE。
为矩阵吸收和 KV cache 拆路Q、compressed KV 与 output 的最后 64 维旋转;output 用负位置抵消绝对角。
只给部分通道位置责任14 / NORMALIZATION TARGET
+{action}{purpose}LN(x) = γ ⊙ (x−μ) / √(σ²+ε) + β同时获得平移和缩放不变性;需要均值与方差。
RMS(x) = γ ⊙ x / √(mean(x²)+ε)保留均值方向,只控制 root-mean-square 尺度。
15 / PRE VS POST
+xₗ₊₁ = Norm(xₗ + F(xₗ))
+ 相加后尺度被重置,但 identity path 每层都穿过 Norm;初始化靠近输出处的梯度可能更大。
+xₗ₊₁ = xₗ + F(Norm(xₗ))
+ 裸 identity path 直接跨层,通常更易优化;所有分支固定单位累加,幅值和层贡献稀释成为新问题。
++ Pre-LN “更稳”不等于“全面更优”。 + 初始化梯度、是否需要 warm-up、最终表示变化、深度收益与下游质量是不同指标。NormFormer、DeepNorm、AttnRes 正是沿不同缺口继续修补。 ++
16 / TRAINING DEEP
+{note}
17 / RESIDUAL STREAM
+hL = h0 + f0(Norm(h0)) + f1(Norm(h1)) + … + fL−1(Norm(hL−1))
+
+ 上图是“累计 state 变大时,固定大小单层增量相对占比下降”的概念图,不是实测激活。Kimi AttnRes 报告把这类现象称为 hidden-state growth 与 PreNorm dilution。
+identity shortcut 的原始强项。
Norm、初始化、scale、gate 共同控制。
标准加法没有选择;HC / AttnRes 才重写拓扑。
18 / HYPER-CONNECTIONS
+Xl+1 = BlXl + ClFl(AlXl)
+ 实际 layer 仍只接收 d 维输入;新增的是 residual width 与连接自由度。原论文将目标描述为缓解 gradient vanishing 与 representation collapse 的跷跷板。
+19 / MANIFOLD CONSTRAINT
+报告据此限制 forward / backward 中 residual transformation 的扩张。
doubly stochastic 集合在乘法下封闭,支持深层连续堆叠。
输入和输出映射非负且有界,降低信号抵消风险。
以上是 mHC 论文 与 DeepSeek-V4 报告 的设计和理论主张;本站不把它扩写成任意优化器与任意网络的完备稳定性证明。
+20 / ATTENTION OVER DEPTH
+αᵢ→ₗ = softmax(qₗᵀ RMSNorm(kᵢ))
+ 内容相关、归一化的深度混合
memory O(Ld)depth arithmetic 为 O(L²d);不足百层时算术可接受,训练状态与 PP 通信更难。
memory O(Nd)只保存 block representations,保留大部分选择性并降低跨 stage 状态。
21 / K3 DEPTH MAP
+K3 §2.2 明确写的是 12-layer block size:93 层形成 7 个完整块和 1 个尾块,另计 embedding 后共有 9 个 block-level sources。“block size 2”是早期草案误读,未进入正式页面结论。
+22 / ACTIVATION LINEAGE
+{formula}{structure}{bound}23 / OUTLIER CONTROL
+gate = min(Swish(g), 10)
value = clamp(u, −10, 10)
+ 报告称该配方消除 outliers、帮助稳定且不损性能。这是 V4 训练中的作者经验结论;硬 clamp 在边界外对被截分支给出零梯度。
+4 tanh(g/4) · σ(g)
× 25 tanh(u/25)
+ 两支都用 tanh 平滑压缩;β₁=4、β₂=25,所以逐点 |y|<100。靠近原点一阶近似 SwiGLU,β→∞ 时逐点恢复。
+SiTU 单元输出有界,不等于整个 residual stream、loss 或 gradient 有界;K3 还在 routed expert aggregate 后加入 RMSNorm,并配合路由与系统稳定措施。
+24 / DEEPSEEK FOCUS
+{lesson}
约束流间映射
控制 logits
partial rotation
控制 outliers
25 / KIMI K3 CONVERGENCE
+文本与视觉 token 进入共享 backbone;接口参数和多模态配方共同决定入口。
KDA recurrent decay 提供顺序与近因;MLA NoPE 提供周期性全局内容交互。
93 层压成 8 个 layer blocks + embedding,共 9 个可选深度来源。
routed latent RMSNorm + SiTU-GLU,把稀疏专家路径的尺度和乘法极值一起控制。
报告同时使用长文档 / 视频清洗与合成、渐进扩窗课程和序列维并行。因而“K3 直接外推到 1M”不能被简化成“NoPE 单因收益”。
+26 / INTERACTIVE LAB
+每台仪器都把论文公式和本站 toy assumption 分开标注。先找方向关系,再回到真实报告核对训练与系统边界。
+27 / ARCHITECTURE AUDIT
+{question}
现代 LLM 的架构创新,往往不是发明一个孤立 block,而是重新分配这五种责任,再让算法、低精度、缓存和通信能够承受它。
+PAPER CHAIN / 2003–2026
+页面只写每个节点在本章问题链上的位置;点击进入论文原文或正式页面。具体数字不脱离模型、任务和训练设定外推。
+{note}
+ ↗ + + ))} +NEW / CHAPTER 03 TOKEN · POSITION · DEPTH · FFN
++ 用二十张问题账从 Token、embedding 与上下文化表示,走到 RoPE / NoPE、Pre / Post-LN、 + DeepSeek mHC 与 partial RoPE,以及 Kimi K3 的 9 个 AttnRes 深度来源和有界 SiTU-GLU。 +
+NEW / CHAPTER 15 SCORE · PROTOCOL · THREAT MODEL
@@ -581,6 +599,7 @@ const paths = [ transition: transform 180ms ease, border-color 180ms ease; } + .representation-release, .inference-release, .agent-release, .alignment-release, @@ -595,6 +614,14 @@ const paths = [ min-height: 510px; } + .representation-release { + background: + radial-gradient(circle at 82% 18%, rgba(159, 91, 52, 0.22), transparent 31%), + radial-gradient(circle at 61% 74%, rgba(56, 91, 128, 0.16), transparent 28%), + repeating-linear-gradient(90deg, transparent 0 56px, rgba(159, 91, 52, 0.04) 56px 57px), + var(--paper-raised); + } + .inference-release { background: radial-gradient(circle at 82% 18%, rgba(35, 86, 84, 0.22), transparent 31%), @@ -733,6 +760,7 @@ const paths = [ padding-bottom: 76px; } + .representation-release, .inference-release, .alignment-release, .transformer-release, diff --git a/src/pages/progress/index.astro b/src/pages/progress/index.astro index dcc5d7e..6853d89 100644 --- a/src/pages/progress/index.astro +++ b/src/pages/progress/index.astro @@ -12,6 +12,7 @@ const workstreams = [ { label: "Kimi K3 深读", value: 66, next: "扩写 pre-training / infra 逐图笔记" }, { label: "语言模型前史", value: 78, next: "逐图精读 Kneser–Ney、LSTM 与 Bahdanau,并加入真实小语料复现" }, { label: "Transformer 基础", value: 79, next: "逐图精读多头电路、Pre/Post-LN 与真实 kernel / KV 配置" }, + { label: "表示、位置与残差高速公路", value: 81, next: "加入真实 hidden-state / norm traces、长上下文位置外推复现与更多深层稳定性消融" }, { label: "Scaling Laws", value: 74, next: "加入真实拟合复现、置信区间与更多模型族对照" }, { label: "数据工程与预训练配方", value: 73, next: "逐图精读 FineWeb / DCLM,加入真实去重与 mixture traces" }, { label: "DeepSeek 专题", value: 71, next: "补 R1 / DAPO 的逐图训练轨迹与复现对照" }, @@ -49,7 +50,7 @@ const workstreams = [01 WORKSTREAMS
-
内容首版优先打通全局脉络;随后每轮迭代选择一个专题推进到论文/工程层,并做独立事实复核。
@@ -96,10 +97,11 @@ const workstreams = [
47 页报告目录、151 条参考来源和架构/后训练/系统主线已经提取。 从语言模型基础到评测安全,包含先修依赖和三条贯穿案例。 响应式导航、章节模板、侧栏、进度、论文链和证据提示组件。 K3、语言模型前史、Transformer、DeepSeek、长上下文、MoE、推理、Agent、多模态,以及训练系统、推理服务、Scaling、数据工程、数值、Alignment 与评测安全专题。 K3、语言模型前史、Transformer、DeepSeek、Scaling、数据工程、长上下文、MoE、后训练、推理、Agent、原生多模态、训练系统、推理服务、数值优化与评测安全专题。 K3、语言模型前史、Transformer、表示深度、DeepSeek、长上下文、MoE、推理、Agent、多模态,以及训练系统、推理服务、Scaling、数据工程、数值、Alignment 与评测安全专题。 K3、语言模型前史、Transformer、表示/位置/残差、DeepSeek、Scaling、数据工程、长上下文、MoE、后训练、推理、Agent、原生多模态、训练系统、推理服务、数值优化与评测安全专题。 八张独立问题账、33 个正式节点、20 段长文与概率—向量—记忆—对齐四联实验。 十张独立问题账、40 个正式节点、21 段正文与 QKV—Mask—多头位置—Block 成本四联实验。 二十张问题账、66 个一手节点、DeepSeek/Kimi 双谱系,以及 Token—位置—Norm—Residual/FFN 四联实验。 九张账、29 个一手节点、DeepSeek/Kimi 双谱系与曲面—部署—复用—涌现四联实验。 十二张账、31 个一手节点、DeepSeek/Kimi 双谱系与流水线—去重—混合—改写四联实验。 五张成本账、26 篇一手论文、10+ 机制图与 8 策略交互实验室。 十六张账、55 个一手节点、DeepSeek 三分支、Kimi 三代 MoonViT,以及 Token—连接器—光学压缩—视觉闭环四联实验。 十八本账、62 个一手节点、DeepSeek V2→V4 与 Mooncake→K3 双谱系,以及显存—阶段—推测—集群四联实验。 二十二张账、80 个一手节点、DeepSeek/K3 评测协议谱系,以及指标—Judge—污染—系统安全四联实验。 新增 BLEU、GLUE、HumanEval、MT-Bench、LiveBench、HarmBench、InjecAgent、AILuminate 等 50 个评测安全节点。 新增 output embedding、ELMo、BLT、Fixup、ReZero、Hyper-Connections、mHC、xPos、FIRE、LongRoPE 等 30 个表示与深度节点。 源码公开到 git.k1412.top,网站由不可变镜像、Compose Manager 与 HTTPS 交付。K3 报告已结构化拆解
17 专题知识图
编辑式网站系统
五十一个原创交互视图
十六篇首版长文
五十五个原创交互视图
十七篇首版长文
语言模型前史深度专题
Transformer 深度专题
表示、位置与残差高速公路深度专题
Scaling Laws 深度专题
数据工程深度专题
长上下文深度专题
原生多模态深度专题
推理服务与低成本部署深度专题
评测、安全与“到底强不强”深度专题
450 篇关键论文索引
480 篇关键论文索引
公开仓库与自托管发布
多头电路逐图 → Pre/Post-LN 真实 traces → Flash/KV 配置与 kernel 对照
逐图笔记 + 实测边界真实 hidden-state / norm traces → 长上下文位置外推 → mHC / AttnRes 深层稳定性消融
可复现实验 + 逐图笔记Kneser–Ney / LSTM / Bahdanau 逐图 → 真实小语料复现 → tokenizer 公平性
可复现实验 + 逐图笔记真实拟合复现 → 置信区间 → 更多模型族与下游任务外推
可复现实验 + 逐图笔记FineWeb / DCLM 逐图 → 真实去重误伤 → mixture traces 与污染案例
逐图笔记 + 案例库DeepSeek-OCR 的 <10× / 20× 锚点标成作者报告;中间只做显式教学插值,超过范围不外推。
权重、增长状态、分配、阶段、batch、cache、kernel、推测、网络、路由、故障与经济性不再压成单一 tokens/s。
MLA→V4 异构状态与 Mooncake→KDA→K3 混合缓存分开说明;作者报告、精确公式和教学估算使用不同标签。
计算单位、词表接口、上下文化、位置、外推、Norm 对象、拓扑、残差路由与非线性极值不再混成一个 hidden-state 名词。
93 层按 12 层形成 8 个 layer blocks(7 个完整块加 1 个尾块);再加 embedding,共 9 个 block-level 来源,废弃早期错误的“2 层一块”读法。
{chapter.title}