feat: publish representation and depth chapter

This commit is contained in:
wuyang
2026-07-29 10:32:33 +08:00
parent a9afa12c7c
commit a2c9298d35
28 changed files with 2960 additions and 51 deletions
+391
View File
@@ -0,0 +1,391 @@
# 第 03 章研究账本:表示、位置与残差高速公路
> 核验截止:2026-07-29(Asia/Shanghai)
>
> 证据规则:论文原文、正式会议页、作者/团队官方报告和官方实现进入事实层;本站公式演算、类比和 toy simulator 明标“教学推导”。Grok 只做候选召回,隔离在 `REPRESENTATION_GROK_LEADS.md`。
## 0. 本章不是“RoPE 名词表”
本章回答四个彼此耦合的问题:
1. **表示**:离散 token 怎样变成向量;一个固定向量又怎样变成随上下文、层数不断改写的状态?
2. **位置**:内容匹配本身不含顺序时,绝对位置、相对距离、旋转、偏置和隐式状态分别怎样把顺序送进模型?
3. **深度**:几十到上百层怎样既保留捷径,又避免幅值增长、梯度失衡和表示稀释?
4. **局部非线性**:FFN / GLU 怎样加工每个位置;极端激活为什么会在大规模、低精度和 MoE 中成为系统问题?
与相邻章节的边界:
- 第 01 章负责 NPLM、word2vec 与语言模型前史;本章从“token 已选定”继续追踪表示在模型内部的生命史。
- 第 02 章给出位置、Norm、Residual、FFN 的最小闭环;本章逐公式拆解并扩展到 DeepSeek / K3。
- 第 05 章负责 tokenizer 的数据工程与训练;本章只研究它对表示、参数和计算单位的结构性影响。
- 第 07 章负责长上下文算法与真实成本;本章只研究位置几何和长度外推边界。
- 第 09 章负责优化器、精度和训练失稳;本章聚焦架构内部的幅值与信息路径。
## 1. 二十张正式问题账
| # | 账 | 先问什么 | 最小结论 |
|---:|---|---|---|
| 01 | 单位账 | 字符、字节、子词、token、patch 谁是模型一步? | Tokenizer 先决定序列长度、词表和边界,再由 embedding 查表。 |
| 02 | 参数账 | 词表大一倍只是多一点词吗? | 输入表和输出头常各含 `V×d` 参数;weight tying 会改变这笔账。 |
| 03 | 静态表示账 | 同一个 ID 是否永远同义? | 初始 embedding 固定,但进入网络后的 hidden state 随上下文和层而变。 |
| 04 | 上下文化账 | 多义性在哪里被展开? | 序列混合和逐位置 FFN 反复改写 token state。 |
| 05 | 输出几何账 | 下一个 token 怎样被选出? | hidden state 与输出向量点积生成 logits;向量空间同时是分类接口。 |
| 06 | 对称性账 | 没有位置时 Attention 知道先后吗? | 裸 self-attention 对输入排列等变;causal mask 只提供有向可见性。 |
| 07 | 绝对位置账 | “第 37 位”怎样进入表示? | learned / sinusoidal vector 可与内容相加,但内容与位置从入口就纠缠。 |
| 08 | 相对位置账 | “相距 3”怎样进入匹配? | 相对向量或 bias 直接改变位置对的 attention score / value。 |
| 09 | 旋转账 | RoPE 为什么用二维旋转? | 位置 `m,n` 的 Q/K 点积可写成与 `n−m` 有关的相对旋转。 |
| 10 | 外推账 | 训练窗外为何会坏? | 新距离改变相位、bias 区间和 attention resolution;可计算不等于会利用。 |
| 11 | NoPE 账 | 不显式编码位置是否等于无顺序? | 因果边界、递归衰减和内容统计可隐式编码顺序;机制必须逐模型说明。 |
| 12 | 统计账 | Norm 究竟归一化谁? | LayerNorm 控制单 token 特征的均值/方差,RMSNorm只控制 RMS,QK-Norm控制匹配向量。 |
| 13 | 拓扑账 | Norm 放在分支前还是相加后? | Pre/Post 改变 identity path、初始化梯度和深度动态。 |
| 14 | 幅值账 | Residual 为什么仍会长大? | `x_{l+1}=x_l+f_l` 固定单位累加;分支不为零时尺度通常随深度积累。 |
| 15 | 梯度账 | 有捷径为何仍难训练? | 捷径改善可达性,却不自动平衡各层更新、attention logits 和输出幅值。 |
| 16 | 稀释账 | 早期层为何会“听不见”? | 所有层固定相加会把单层贡献占比压低;Kimi 把它称为 PreNorm dilution。 |
| 17 | 拓宽账 | residual stream 必须只有一条吗? | HC 展开为多条流并学习层间连接;mHC 再约束映射稳定性。 |
| 18 | 选择账 | 深度能否像序列一样 attention? | AttnRes 对先前层/块表示做 softmax 选择,而非全用单位权重。 |
| 19 | FFN 账 | Attention 后为何还要大 MLP? | Attention 搬运跨 token 信息;FFN 在每个位置做共享非线性特征变换,并占大量参数。 |
| 20 | 极值账 | 门控为何也会爆? | SwiGLU 两个乘法因子都可无界;clamp 与 SiTU 用不同方式限制异常值。 |
## 2. 八次历史转向
| 时期 | 被解决的瓶颈 | 转向 | 仍留下什么 |
|---|---|---|---|
| 2003–13 | one-hot 不能共享统计 | 稠密 distributed representation、word2vec | 同一词仍只有一个静态向量 |
| 2015–18 | 稀有词、开放词表与多义性 | BPE / SentencePiece + ELMo / BERT 上下文化 | token 边界仍由固定 tokenizer 先决定 |
| 2015–17 | 深网退化与序列 batch 统计不便 | ResNet + LayerNorm | fixed residual sum 仍会积累尺度 |
| 2018–21 | Attention 缺少顺序 | relative position、Transformer-XL、T5 bias、RoPE、ALiBi | 长度外推不自动成立 |
| 2019–22 | Transformer 堆深不稳 | RMSNorm、Pre-LN、ReZero、Admin、NormFormer、DeepNorm | 稳定和表示质量存在张力 |
| 2021–24 | 训练窗外的位置分布变了 | xPos、NoPE study、PI、YaRN、FIRE、LongRoPE | 位置修补不等于长程检索能力 |
| 2024–26 | 一条 fixed residual stream 成为深度瓶颈 | HC、nGPT、mHC、AttnRes | 更丰富拓扑带来状态/通信/约束成本 |
| 2024–26 | 前沿规模下位置与激活要协同设计 | DeepSeek-V2/V4、Kimi Linear/K3 | 结论必须绑定整个架构与训练配方 |
## 3. 表示:从查表到上下文化状态
### 3.1 五个常被混成“词向量”的对象
给 token ID `t`、词表大小 `V`、hidden width `d`:
1. **ID**:离散整数,本身没有几何。
2. **输入 embedding**:`e_t = E[t]`,`E∈R^{V×d}`;这是进入第 0 层的查表结果。
3. **hidden state**:`h_t^l`;同一个 ID 在不同句子、位置、层中通常不同。
4. **输出向量**:输出矩阵 `W_out∈R^{V×d}` 的一行;`z_v = W_out[v]·h + b_v`。
5. **概率**:`p(v|context)=softmax(z)_v`;概率是整个上下文计算的结果,不是 embedding 自带属性。
Press & Wolf 2016 研究顶层权重矩阵,指出它本身是有效 word embedding,并推荐 input/output weight tying;Inan et al. 2016 从 loss framework 得到相同 tying 方向。共享矩阵减少约 `V×d` 参数,但输入“读向量”与输出“分类”的计算角色仍不同。
来源:[Output Embedding](https://arxiv.org/abs/1608.05859)、[Tying Word Vectors](https://arxiv.org/abs/1611.01462)。
### 3.2 静态向量不是终点
ELMo 把词向量定义为深双向语言模型内部状态的函数,并允许下游任务混合不同层;论文明确以复杂词用法和 polysemy 为动机。BERT 后续把上下文化预训练推到 Transformer encoder。历史转向是:
`token type → 初始向量 → 句内交互 → 每个 occurrence 的状态`
来源:[ELMo](https://arxiv.org/abs/1802.05365)、[BERT](https://arxiv.org/abs/1810.04805)。
### 3.3 Tokenizer 先决定结构成本
- 固定词表方案:embedding / output head 参数随 `V×d` 增长;序列计算随 token 数增长。
- byte-level:去掉固定子词词表依赖,但通常产生更长序列。
- BLT 2024 把 byte 按 next-byte entropy 分成动态 patch,让高复杂度区域获得更多计算;论文报告的是特定 FLOP-controlled scaling study,不能泛化为“byte 模型已全面更优”。
来源:[Byte Latent Transformer](https://arxiv.org/abs/2412.09871)。
### 3.4 FFN 也是表示系统
Geva et al. 把 Transformer FFN 分析为 key-value memories:第一层方向与输入文本模式相关,第二层方向诱导输出词表分布;低层偏浅层模式,高层更语义化。这个分析支持“FFN 不只是扩维再缩维”,但不证明每个 neuron 都是一条独立、稳定、可编辑的事实。
来源:[Transformer Feed-Forward Layers Are Key-Value Memories](https://arxiv.org/abs/2012.14913)。
## 4. 位置:把排列对称打破到什么程度
### 4.1 无位置的 self-attention
若同时对 token 行做同一个排列 `P`,且没有 mask / position:
`Attn(PX)=P Attn(X)`
它会跟着输入一起排列,却无法区分“相同内容的不同顺序”。Causal mask 已经打破完全对称:位置 `t` 只能看到前缀 `≤t`,所以 NoPE decoder 并非完全没有顺序信号。但它没有显式给每对 Q/K 一个距离坐标。
### 4.2 四种主流写法
1. **absolute add**:`x_t=e_t+p_t`;原始 Transformer 的 fixed sinusoid 与 learned variant 属于此类。
2. **relative representation / bias**:score 依赖 `i−j`;Shaw 2018、Transformer-XL、T5 buckets。
3. **RoPE**:`q_m=R_m q, k_n=R_n k`,于是 `q_mᵀk_n=qᵀR_{n−m}k`。
4. **ALiBi**:`score_{ij}=q_iᵀk_j/√d − m_h(i−j)`;不向 embedding 加位置向量。
来源:[Transformer](https://proceedings.neurips.cc/paper/7181-attention-is-all-you-need)、[Relative Position](https://aclanthology.org/N18-2074/)、[Transformer-XL](https://aclanthology.org/P19-1285/)、[T5](https://jmlr.org/papers/v21/20-074.html)、[RoFormer](https://arxiv.org/abs/2104.09864)、[ALiBi](https://arxiv.org/abs/2108.12409)。
### 4.3 RoPE 的最小几何
对一对维度,把位置 `m` 写成旋转角 `mθ`:
`R_m=[cos(mθ),−sin(mθ); sin(mθ),cos(mθ)]`
因为 `R_mᵀR_n=R_{n−m}`,Q/K 点积自然依赖相对位移。不同维度对使用不同频率:高频区分近邻,低频覆盖较长尺度。测试距离越过训练分布时,相位组合、周期和 attention resolution 都可能陌生;“公式可算任意 m”不等于模型学会任意长度。
### 4.4 长度外推的四条路线
- xPos 提出 attention resolution,并通过位置设计与 blockwise causal attention 改善外推。
- Kazemnejad et al. 在特定 decoder-only reasoning / math tasks 比较 APE、T5 RPE、ALiBi、RoPE 与 NoPE,报告 NoPE 最好;它不是所有语言建模场景的总定律。
- Position Interpolation / YaRN 将超长位置映回更熟悉的 RoPE 范围;FIRE 学习相对位置函数并渐进插值。
- LongRoPE 搜索不同维度/位置的非均匀插值,并做渐进扩展和短上下文恢复;其 2,048K 是论文模型与训练设定的结果。
来源:[xPos](https://arxiv.org/abs/2212.10554)、[NoPE study](https://arxiv.org/abs/2305.19466)、[Position Interpolation](https://arxiv.org/abs/2306.15595)、[YaRN](https://arxiv.org/abs/2309.00071)、[FIRE](https://arxiv.org/abs/2310.04418)、[LongRoPE](https://arxiv.org/abs/2402.13753)。
## 5. Norm:不是“把数字变小”
### 5.1 三个归一化对象
对单 token 向量 `x∈R^d`:
- LayerNorm:`(x−μ)/√(σ²+ε) ⊙ γ + β`,控制均值和方差。
- RMSNorm:`x/√(mean(x²)+ε) ⊙ γ`,保留均值方向,只提供 re-scaling invariance。
- QK-Norm:先按 attention head 归一化 Q、K,再用可学习 scale 形成 logits;它处理 softmax saturation,不替代整个 block 的 PreNorm。
来源:[LayerNorm](https://arxiv.org/abs/1607.06450)、[RMSNorm](https://arxiv.org/abs/1910.07467)、[QK-Norm](https://arxiv.org/abs/2010.04245)。
### 5.2 Pre-LN 与 Post-LN 是拓扑
- Post-LN:`x_{l+1}=Norm(x_l+F(x_l))`
- Pre-LN:`x_{l+1}=x_l+F(Norm(x_l))`
Pre-LN 的 identity path 不经过 Norm,通常更易优化;Xiong et al. 用 mean-field 分析初始化梯度和 warm-up。代价是所有分支固定相加可能造成 hidden-state growth 与层贡献稀释。NormFormer 在 Pre-LN block 内增加 attention 后 Norm、head-wise scaling 和 FFN 内 Norm,以改善深浅层梯度尺度。
来源:[Pre-LN analysis](https://arxiv.org/abs/2002.04745)、[Transformers without Tears](https://arxiv.org/abs/1910.05895)、[NormFormer](https://arxiv.org/abs/2110.09456)。
### 5.3 稳定堆深的谱系
- Fixup 通过初始化缩放让 residual net 在无 normalization 下稳定。
- ReZero 为每条 residual 分支乘零初始化标量,初始网络接近 identity;论文应用到 120-layer Transformer。
- Admin 把训练不稳归因于 residual branch 对参数扰动的放大效应,并做适应性初始化。
- DeepNorm 修改 residual scale 并配套初始化,报告训练到 1,000 Transformer layers。
- nGPT 把 embedding、权重和 hidden state 归一化到 hypersphere;论文的 4–20× steps reduction 依赖其任务和长度设置。
来源:[Fixup](https://arxiv.org/abs/1901.09321)、[ReZero](https://arxiv.org/abs/2003.04887)、[Admin](https://arxiv.org/abs/2004.08249)、[DeepNet](https://arxiv.org/abs/2203.00555)、[nGPT](https://arxiv.org/abs/2410.01131)。
## 6. Residual:从固定加法路到可学习深度路由
### 6.1 成就与盲点
ResNet 把目标写成 `H(x)=x+F(x)`,让 identity shortcut 提供直接路径。现代 Pre-LN LLM 进一步保持裸 identity path。然而:
`h_L=h_0+Σ F_l(Norm(h_l))`
所有分支以固定单位系数进入同一个状态。捷径保证“能到”,不保证“每层被同等听见”,也不控制总幅值。
来源:[ResNet](https://openaccess.thecvf.com/content_cvpr_2016/html/He_Deep_Residual_Learning_CVPR_2016_paper.html)。
### 6.2 Hyper-Connections 与 mHC
HC 把 residual stream 从 `R^d` 扩为 `R^{n×d}`:
`X_{l+1}=B_l X_l + C_l F_l(A_l X_l)`
mHC 指出 unconstrained HC 会破坏 residual 的 identity property并导致训练不稳;它把 `B_l` 投影到 doubly stochastic matrices 的 Birkhoff polytope。DeepSeek-V4 报告写明该约束令 `||B_l||₂≤1`、映射 non-expansive,且集合在矩阵乘法下封闭;实现用 Sinkhorn-Knopp 近似投影。这是论文/报告的理论与设计主张,页面不把它写成所有场景的完备稳定性证明。
来源:[Hyper-Connections](https://arxiv.org/abs/2409.19606)、[mHC](https://arxiv.org/abs/2512.24880)、[DeepSeek-V4](https://arxiv.org/abs/2606.19348)。
### 6.3 Attention Residuals
Kimi Team 把“沿序列注意力”移到“沿深度注意力”:
`α_{i→l}=exp(q_lᵀ RMSNorm(k_i)) / Σ_j exp(q_lᵀ RMSNorm(k_j))`
`h_l=Σ_i α_{i→l}v_i`
Block AttnRes 先把层分块,每块内部累加,再只在 block representations 上做 depth attention,把存储/通信从 `O(Ld)` 降到 `O(Nd)`。独立报告使用 48B total / 3B active、1.4T tokens 验证;K3 则把方案放进更大完整系统。
K3 的具体配置:93 backbone layers;按 12 层划成 8 个 layer blocks(7 个完整 12 层 block + 1 个 partial block),embedding 另作一个 source,因此共有 9 个 block-level depth sources。这里纠正早期草案里“block size 2”的误读。
来源:[Attention Residuals](https://arxiv.org/abs/2603.15031)、[Kimi K3](https://arxiv.org/abs/2607.24653),本地证据 `research/sources/kimi-k3/k3_tech_report.txt:373-425`。
## 7. 激活与 FFN:从选择性通过到有界门控
### 7.1 公式谱系
- ReLU:`max(0,x)`。
- GELU:`x Φ(x)`。
- GLU:`(xW+b) ⊙ σ(xV+c)`。
- Swish / SiLU:`x σ(βx)`。
- SwiGLU:`Swish(xW_g) ⊙ (xW_u)`;两个乘法因子都可无界。
来源:[GELU](https://arxiv.org/abs/1606.08415)、[GLU](https://arxiv.org/abs/1612.08083)、[Swish](https://arxiv.org/abs/1710.05941)、[GLU Variants](https://arxiv.org/abs/2002.05202)、[LLaMA](https://arxiv.org/abs/2302.13971)。
### 7.2 DeepSeek-V4:clamp 两条分支
V4 报告称训练中把 SwiGLU linear component clamp 到 `[-10,10]`,gate component 只把上界 cap 为 `10`,并报告消除 outliers、帮助稳定且未损害性能。它是作者在 V4 设置中的经验报告,不是一般数学保证。
本地证据:`research/sources/long-context/2606.19348.txt:1483-1493`。
### 7.3 K3:SiTU-GLU 的平滑上界
K3 Stable LatentMoE 在 routed experts 聚合后、up projection 前加入 RMSNorm,并定义:
`SiTU-GLU(x)=β₁ tanh(W_gx/β₁) ⊙ Sigmoid(W_gx) ⊙ β₂ tanh(W_ux/β₂)`
报告使用 `β₁=4, β₂=25`,所以输出逐点绝对值严格小于 `β₁β₂=100`。在原点附近一阶近似 SwiGLU,`β→∞` 时逐点恢复;相较 hard clamp,tanh cap 在饱和区仍有非零但很小的梯度。函数上界不等于整个网络 activation / loss 有界。
本地证据:`research/sources/kimi-k3/k3_tech_report.txt:458-505,2700-2815`。
## 8. DeepSeek 重点谱系
### 8.1 DeepSeek LLM / V3:现代基线配方
- DeepSeek LLM 使用 Pre-Norm RMSNorm、SwiGLU 和 RoPE。
- V3 在 compressed latent vectors 后加入额外 RMSNorm;不能把 latent Norm 与 block PreNorm 混成一个位置。
来源:[DeepSeek LLM](https://arxiv.org/abs/2401.02954)、[DeepSeek-V3](https://arxiv.org/abs/2412.19437)。
### 8.2 DeepSeek-V2:把内容与位置拆开缓存
MLA 想把 content K/V 压入 latent 并把 up-projection 吸收到 query 侧;若把 RoPE 直接夹在 key up-projection 中,位置相关旋转阻止矩阵吸收。V2 因而增加独立 multi-head RoPE query 和 shared RoPE key,再与 content Q/K 拼接。它是 **decoupled RoPE**,不是 NoPE。
本地证据:`research/sources/long-context/2405.04434.txt:350-395`。
### 8.3 DeepSeek-V4:四件事一起看
1. mHC 把 residual width 扩为 4,并约束 depth mixing。
2. CSA / HCA 的 query head 与 compressed KV entry 分别做额外 RMSNorm。
3. Q、KV 和 core attention output 的最后 64 维使用 partial RoPE;output 再用负位置旋转恢复相对位置含义。
4. SwiGLU 两条分支使用非对称 clamp。
本地证据:`research/sources/long-context/2606.19348.txt:355-432,715-747,1483-1493`。
## 9. Kimi K3 逐节复原
### 9.1 NoPE 不是删除顺序
- K3 以 3 个 KDA + 1 个 Gated MLA 的比例构成 hybrid backbone。
- 所有 MLA layers 不给 Q/K 施加显式 position encoding。
- KDA 的 channel-wise recurrent gate / decay 提供 position-sensitive、recency-aware sequence mixing。
- 报告因此不需要在扩窗时修改 RoPE base 或 YaRN 参数。
报告称模型能直接外推到 1M,但同一 §3.4 还明确使用 long-context cleaning/synthesis、8K→64K→256K→1M 的渐进课程和序列并行。不得写成“NoPE 单独造出 1M”。
本地证据:`research/sources/kimi-k3/k3_tech_report.txt:352-370,780-811`。
### 9.2 Block AttnRes 是深度轴的选择器
- `RMSNorm(k)` 防止大幅值层仅凭尺度支配 softmax。
- Full 形式 arithmetic `O(L²d)` 在不足百层仍可接受,真正问题是保存所有层输出的 `O(Ld)` memory / pipeline communication。
- K3 的 Block 形式把 93 层按 12 层划块,降低到 `O(Nd)`。
### 9.3 Stable LatentMoE 是表示幅值控制
- routed experts 先在 latent space 聚合,再上投影回 full width;
- 额外 RMSNorm 控制 routed latent variation;
- SiTU-GLU 给乘法门控输出明确的 smooth bound;
- 两项与 MoE 路由、通信优化一起构成 Stable LatentMoE,不能只摘一个公式解释整套训练收益。
## 10. 四联交互实验合同
### Lab A / Token 与表示
输入:文本预设、token unit(word/subword/byte)、`V`、`d`、weight tying、上下文开关。
输出:toy token sequence、tokens/characters、embedding/head 参数、同一 token 的 base/context states。明标不是任何真实 tokenizer / checkpoint。
### Lab B / 位置几何
输入:scheme(absolute/RoPE/ALiBi/NoPE)、位置 `i,j`、训练长度、RoPE base / ALiBi slope。
输出:relative distance、2D Q/K 旋转图、dot similarity、train-window / extrapolation 状态。NoPE 只表示“没有显式项”。
### Lab C / Norm 与深度
输入:topology(Post-LN/Pre-LN/RMS-Pre/QK+RMS)、depth、branch scale、attention logit scale。
输出:toy residual magnitude、identity gradient path、softmax peak / saturation。曲线不是训练预测器。
### Lab D / Residual 与 FFN
输入:residual route(plain/HC/mHC/AttnRes)、depth source scores、activation(GELU/SwiGLU/V4 clamp/SiTU)、input range。
输出:depth weights/path、memory-state count、activation response、最大绝对输出与理论上界;K3 preset 用 `β₁=4,β₂=25`。
共同验收:四 tabs / panels 一一对应,ARIA 与左右方向键可用;1440px / 390px 无横向溢出;控件变化更新数值与解释;公式事实、作者报告、本站推导不可混用。
## 11. 正式论文链(66 个教学节点)
| # | 年 | 节点 | 主账 | 一句话位置 |
|---:|---:|---|---|---|
| 01 | 2003 | Neural Probabilistic LM | 表示 | 离散词变成共同学习的连续向量。 |
| 02 | 2013 | word2vec | 表示 | 高效学习静态分布式表示。 |
| 03 | 2015 | BatchNorm | Norm | 跨 batch 统计的归一化前史。 |
| 04 | 2015 | ResNet | 深度 | identity shortcut 让残差学习成为主干。 |
| 05 | 2015 | BPE for NMT | Token | 以子词处理开放词表与稀有词。 |
| 06 | 2016 | LayerNorm | Norm | 单样本内按特征归一化。 |
| 07 | 2016 | Output Embedding | 表示 | 输出 classifier 也是 embedding,可与输入表共享。 |
| 08 | 2016 | Tying Word Vectors | 表示 | 从 loss framework 推导 weight tying。 |
| 09 | 2016 | GELU | FFN | 平滑、输入相关的激活。 |
| 10 | 2016 | GLU | FFN | 内容分支乘 sigmoid gate。 |
| 11 | 2017 | Transformer | 位置/深度 | sinusoid + Post-LN residual 的原始组合。 |
| 12 | 2017 | Swish | FFN | `x·sigmoid(βx)` 的平滑非单调激活。 |
| 13 | 2018 | SentencePiece | Token | 从原始句子训练语言无关子词模型。 |
| 14 | 2018 | ELMo | 上下文化 | occurrence 表示来自深双向 LM 内部状态。 |
| 15 | 2018 | Relative Position | 位置 | 相对距离进入 self-attention。 |
| 16 | 2018 | BERT | 上下文化 | 深双向 Transformer 表示成为迁移接口。 |
| 17 | 2019 | Transformer-XL | 位置 | segment recurrence 与相对位置。 |
| 18 | 2019 | Fixup | 深度 | 用初始化而非 Norm 控制 residual 更新。 |
| 19 | 2019 | RMSNorm | Norm | 去 re-centering,只按 RMS 缩放。 |
| 20 | 2019 | T5 | 位置 | bucketed relative position bias。 |
| 21 | 2019 | ScaleNorm / FixNorm | Norm | 以固定范数和单一 scale 简化归一化。 |
| 22 | 2020 | Pre-LN analysis | 拓扑 | Norm 位置改变初始化梯度与 warm-up。 |
| 23 | 2020 | GLU Variants | FFN | GEGLU / SwiGLU 进入 Transformer FFN。 |
| 24 | 2020 | ReZero | 深度 | 零初始化 residual gate,从 identity 开始。 |
| 25 | 2020 | Admin | 深度 | 控制 residual 对参数扰动的放大。 |
| 26 | 2020 | QK-Norm | Norm | 限制 Q/K 匹配尺度和 softmax 饱和。 |
| 27 | 2020 | FFN as Memories | 表示 | FFN 方向关联输入模式与词表。 |
| 28 | 2021 | RoPE | 位置 | 绝对旋转形成相对点积。 |
| 29 | 2021 | ALiBi | 位置 | attention logit 加距离惩罚。 |
| 30 | 2021 | NormFormer | Norm | 在 Pre-LN 内补充归一化和平衡梯度。 |
| 31 | 2021 | Primer | FFN | squared ReLU 与 depthwise QKV conv。 |
| 32 | 2021 | ByT5 | Token | token-free byte-to-byte 预训练。 |
| 33 | 2021 | CANINE | Token | 无显式 tokenizer 的字符级 encoder。 |
| 34 | 2021 | Charformer | Token | 学习软子词块。 |
| 35 | 2022 | DeepNet | 深度 | DeepNorm 与初始化堆至 1,000 层。 |
| 36 | 2022 | xPos | 位置 | attention resolution 与长度外推。 |
| 37 | 2023 | LLaMA | 现代配方 | RMSNorm + SwiGLU + RoPE。 |
| 38 | 2023 | NoPE length study | 位置 | 在特定推理任务比较五类位置方案。 |
| 39 | 2023 | Position Interpolation | 位置 | 把新位置压回训练过的范围。 |
| 40 | 2023 | YaRN | 位置 | 频率分区、温度与高效扩窗。 |
| 41 | 2023 | FIRE | 位置 | 可学习相对位置函数与渐进插值。 |
| 42 | 2024 | LongRoPE | 位置 | 搜索非均匀插值并渐进扩展。 |
| 43 | 2024 | DeepSeek LLM | DeepSeek | Pre-Norm RMSNorm、SwiGLU、RoPE。 |
| 44 | 2024 | DeepSeek-V2 | DeepSeek | MLA 用 decoupled RoPE。 |
| 45 | 2024 | DeepSeek-V3 | DeepSeek | latent Norm 与现代 MoE 配方。 |
| 46 | 2024 | Hyper-Connections | 深度 | 扩宽 residual stream、学习层间映射。 |
| 47 | 2024 | nGPT | Norm/表示 | 表示与权重在 hypersphere 上学习。 |
| 48 | 2024 | Byte Latent Transformer | Token | 以 entropy 动态组成 byte patches。 |
| 49 | 2025 | Kimi Linear | Kimi | KDA 隐式位置 + MLA NoPE。 |
| 50 | 2025 | DeepSeek-V3.2 | DeepSeek | 稀疏注意力继续协同位置路径。 |
| 51 | 2025 | mHC | DeepSeek | 用流形约束 HC 稳定性。 |
| 52 | 2026 | Attention Residuals | Kimi | 在深度维选择先前层/块。 |
| 53 | 2026 | DeepSeek-V4 | DeepSeek | mHC + partial RoPE + Q/KV Norm + clamp。 |
| 54 | 2026 | Kimi K3 | Kimi | NoPE hybrid + Block AttnRes + SiTU-GLU。 |
| 55 | 2018 | GPT-1 | 上下文化 | causal decoder 状态成为迁移表示。 |
| 56 | 2019 | BERT pipeline analysis | 表示 | 不同层呈现不同语言信息探针。 |
| 57 | 2019 | Contextual Representations | 表示 | 线性 probe 做分层语言知识分析。 |
| 58 | 2020 | DeBERTa | 位置 | 内容与位置向量解耦进 attention。 |
| 59 | 2022 | PaLM | FFN | 大规模 decoder 采用 SwiGLU。 |
| 60 | 2022 | OPT | 深度 | Pre-LN decoder 的公开复现坐标。 |
| 61 | 2023 | LLaMA 2 | 现代配方 | 延续 RoPE/RMSNorm/SwiGLU。 |
| 62 | 2023 | OLMo studies | 稳定 | QK-Norm 等规模稳定性证据。 |
| 63 | 2024 | Gemma 2 | Norm | pre/post Norm 与 logit soft-cap。 |
| 64 | 2024 | Massive Activations | 极值 | LLM 隐状态异常大激活的系统观察。 |
| 65 | 2025 | Kimi K2 | Kimi | MLA、RMSNorm 与 MuonClip 的前代。 |
| 66 | 2026 | Stable LatentMoE | Kimi | K3 把 Norm 和有界 GLU 放入专家路径。 |
## 12. 写作与证据禁区
1. 不把 toy simulator 曲线写成真实模型的 loss / gradient 预测。
2. 不把 probing 可读模式写成因果、唯一、稳定的 neuron 功能。
3. 不把“理论上可表示位置”写成“SGD 一定学到位置”。
4. 不把短→长 perplexity 外推等同于 1M retrieval 或 Agent 长轨迹。
5. 不把 RMSNorm、QK-Norm、latent Norm 视为同一插槽。
6. 不把 mHC 和 AttnRes 排成单一优劣榜。
7. 不把 V4 clamping 的经验结论写成一般定理。
8. 不把 SiTU 的函数上界直接等同于整个网络 activation / loss 有界。
9. 不把 K3 的 1M 上下文单因归给 NoPE。
10. DeepSeek/Kimi 的效率、质量和稳定性数字全部保留作者自报、模型、训练与基线边界。