Files
llm-atlas/research/REPRESENTATION_RESEARCH.md

392 lines
26 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 第 03 章研究账本:表示、位置与残差高速公路
> 核验截止:2026-07-29(Asia/Shanghai)
>
> 证据规则:论文原文、正式会议页、作者/团队官方报告和官方实现进入事实层;本站公式演算、类比和 toy simulator 明标“教学推导”。Grok 只做候选召回,隔离在 `REPRESENTATION_GROK_LEADS.md`。
## 0. 本章不是“RoPE 名词表”
本章回答四个彼此耦合的问题:
1. **表示**:离散 token 怎样变成向量;一个固定向量又怎样变成随上下文、层数不断改写的状态?
2. **位置**:内容匹配本身不含顺序时,绝对位置、相对距离、旋转、偏置和隐式状态分别怎样把顺序送进模型?
3. **深度**:几十到上百层怎样既保留捷径,又避免幅值增长、梯度失衡和表示稀释?
4. **局部非线性**:FFN / GLU 怎样加工每个位置;极端激活为什么会在大规模、低精度和 MoE 中成为系统问题?
与相邻章节的边界:
- 第 01 章负责 NPLM、word2vec 与语言模型前史;本章从“token 已选定”继续追踪表示在模型内部的生命史。
- 第 02 章给出位置、Norm、Residual、FFN 的最小闭环;本章逐公式拆解并扩展到 DeepSeek / K3。
- 第 05 章负责 tokenizer 的数据工程与训练;本章只研究它对表示、参数和计算单位的结构性影响。
- 第 07 章负责长上下文算法与真实成本;本章只研究位置几何和长度外推边界。
- 第 09 章负责优化器、精度和训练失稳;本章聚焦架构内部的幅值与信息路径。
## 1. 二十张正式问题账
| # | 账 | 先问什么 | 最小结论 |
|---:|---|---|---|
| 01 | 单位账 | 字符、字节、子词、token、patch 谁是模型一步? | Tokenizer 先决定序列长度、词表和边界,再由 embedding 查表。 |
| 02 | 参数账 | 词表大一倍只是多一点词吗? | 输入表和输出头常各含 `V×d` 参数;weight tying 会改变这笔账。 |
| 03 | 静态表示账 | 同一个 ID 是否永远同义? | 初始 embedding 固定,但进入网络后的 hidden state 随上下文和层而变。 |
| 04 | 上下文化账 | 多义性在哪里被展开? | 序列混合和逐位置 FFN 反复改写 token state。 |
| 05 | 输出几何账 | 下一个 token 怎样被选出? | hidden state 与输出向量点积生成 logits;向量空间同时是分类接口。 |
| 06 | 对称性账 | 没有位置时 Attention 知道先后吗? | 裸 self-attention 对输入排列等变;causal mask 只提供有向可见性。 |
| 07 | 绝对位置账 | “第 37 位”怎样进入表示? | learned / sinusoidal vector 可与内容相加,但内容与位置从入口就纠缠。 |
| 08 | 相对位置账 | “相距 3”怎样进入匹配? | 相对向量或 bias 直接改变位置对的 attention score / value。 |
| 09 | 旋转账 | RoPE 为什么用二维旋转? | 位置 `m,n` 的 Q/K 点积可写成与 `n−m` 有关的相对旋转。 |
| 10 | 外推账 | 训练窗外为何会坏? | 新距离改变相位、bias 区间和 attention resolution;可计算不等于会利用。 |
| 11 | NoPE 账 | 不显式编码位置是否等于无顺序? | 因果边界、递归衰减和内容统计可隐式编码顺序;机制必须逐模型说明。 |
| 12 | 统计账 | Norm 究竟归一化谁? | LayerNorm 控制单 token 特征的均值/方差,RMSNorm只控制 RMS,QK-Norm控制匹配向量。 |
| 13 | 拓扑账 | Norm 放在分支前还是相加后? | Pre/Post 改变 identity path、初始化梯度和深度动态。 |
| 14 | 幅值账 | Residual 为什么仍会长大? | `x_{l+1}=x_l+f_l` 固定单位累加;分支不为零时尺度通常随深度积累。 |
| 15 | 梯度账 | 有捷径为何仍难训练? | 捷径改善可达性,却不自动平衡各层更新、attention logits 和输出幅值。 |
| 16 | 稀释账 | 早期层为何会“听不见”? | 所有层固定相加会把单层贡献占比压低;Kimi 把它称为 PreNorm dilution。 |
| 17 | 拓宽账 | residual stream 必须只有一条吗? | HC 展开为多条流并学习层间连接;mHC 再约束映射稳定性。 |
| 18 | 选择账 | 深度能否像序列一样 attention? | AttnRes 对先前层/块表示做 softmax 选择,而非全用单位权重。 |
| 19 | FFN 账 | Attention 后为何还要大 MLP? | Attention 搬运跨 token 信息;FFN 在每个位置做共享非线性特征变换,并占大量参数。 |
| 20 | 极值账 | 门控为何也会爆? | SwiGLU 两个乘法因子都可无界;clamp 与 SiTU 用不同方式限制异常值。 |
## 2. 八次历史转向
| 时期 | 被解决的瓶颈 | 转向 | 仍留下什么 |
|---|---|---|---|
| 2003–13 | one-hot 不能共享统计 | 稠密 distributed representation、word2vec | 同一词仍只有一个静态向量 |
| 2015–18 | 稀有词、开放词表与多义性 | BPE / SentencePiece + ELMo / BERT 上下文化 | token 边界仍由固定 tokenizer 先决定 |
| 2015–17 | 深网退化与序列 batch 统计不便 | ResNet + LayerNorm | fixed residual sum 仍会积累尺度 |
| 2018–21 | Attention 缺少顺序 | relative position、Transformer-XL、T5 bias、RoPE、ALiBi | 长度外推不自动成立 |
| 2019–22 | Transformer 堆深不稳 | RMSNorm、Pre-LN、ReZero、Admin、NormFormer、DeepNorm | 稳定和表示质量存在张力 |
| 2021–24 | 训练窗外的位置分布变了 | xPos、NoPE study、PI、YaRN、FIRE、LongRoPE | 位置修补不等于长程检索能力 |
| 2024–26 | 一条 fixed residual stream 成为深度瓶颈 | HC、nGPT、mHC、AttnRes | 更丰富拓扑带来状态/通信/约束成本 |
| 2024–26 | 前沿规模下位置与激活要协同设计 | DeepSeek-V2/V4、Kimi Linear/K3 | 结论必须绑定整个架构与训练配方 |
## 3. 表示:从查表到上下文化状态
### 3.1 五个常被混成“词向量”的对象
给 token ID `t`、词表大小 `V`、hidden width `d`:
1. **ID**:离散整数,本身没有几何。
2. **输入 embedding**:`e_t = E[t]`,`E∈R^{V×d}`;这是进入第 0 层的查表结果。
3. **hidden state**:`h_t^l`;同一个 ID 在不同句子、位置、层中通常不同。
4. **输出向量**:输出矩阵 `W_out∈R^{V×d}` 的一行;`z_v = W_out[v]·h + b_v`。
5. **概率**:`p(v|context)=softmax(z)_v`;概率是整个上下文计算的结果,不是 embedding 自带属性。
Press & Wolf 2016 研究顶层权重矩阵,指出它本身是有效 word embedding,并推荐 input/output weight tying;Inan et al. 2016 从 loss framework 得到相同 tying 方向。共享矩阵减少约 `V×d` 参数,但输入“读向量”与输出“分类”的计算角色仍不同。
来源:[Output Embedding](https://arxiv.org/abs/1608.05859)、[Tying Word Vectors](https://arxiv.org/abs/1611.01462)。
### 3.2 静态向量不是终点
ELMo 把词向量定义为深双向语言模型内部状态的函数,并允许下游任务混合不同层;论文明确以复杂词用法和 polysemy 为动机。BERT 后续把上下文化预训练推到 Transformer encoder。历史转向是:
`token type → 初始向量 → 句内交互 → 每个 occurrence 的状态`
来源:[ELMo](https://arxiv.org/abs/1802.05365)、[BERT](https://arxiv.org/abs/1810.04805)。
### 3.3 Tokenizer 先决定结构成本
- 固定词表方案:embedding / output head 参数随 `V×d` 增长;序列计算随 token 数增长。
- byte-level:去掉固定子词词表依赖,但通常产生更长序列。
- BLT 2024 把 byte 按 next-byte entropy 分成动态 patch,让高复杂度区域获得更多计算;论文报告的是特定 FLOP-controlled scaling study,不能泛化为“byte 模型已全面更优”。
来源:[Byte Latent Transformer](https://arxiv.org/abs/2412.09871)。
### 3.4 FFN 也是表示系统
Geva et al. 把 Transformer FFN 分析为 key-value memories:第一层方向与输入文本模式相关,第二层方向诱导输出词表分布;低层偏浅层模式,高层更语义化。这个分析支持“FFN 不只是扩维再缩维”,但不证明每个 neuron 都是一条独立、稳定、可编辑的事实。
来源:[Transformer Feed-Forward Layers Are Key-Value Memories](https://arxiv.org/abs/2012.14913)。
## 4. 位置:把排列对称打破到什么程度
### 4.1 无位置的 self-attention
若同时对 token 行做同一个排列 `P`,且没有 mask / position:
`Attn(PX)=P Attn(X)`
它会跟着输入一起排列,却无法区分“相同内容的不同顺序”。Causal mask 已经打破完全对称:位置 `t` 只能看到前缀 `≤t`,所以 NoPE decoder 并非完全没有顺序信号。但它没有显式给每对 Q/K 一个距离坐标。
### 4.2 四种主流写法
1. **absolute add**:`x_t=e_t+p_t`;原始 Transformer 的 fixed sinusoid 与 learned variant 属于此类。
2. **relative representation / bias**:score 依赖 `i−j`;Shaw 2018、Transformer-XL、T5 buckets。
3. **RoPE**:`q_m=R_m q, k_n=R_n k`,于是 `q_mᵀk_n=qᵀR_{n−m}k`。
4. **ALiBi**:`score_{ij}=q_iᵀk_j/√d − m_h(i−j)`;不向 embedding 加位置向量。
来源:[Transformer](https://proceedings.neurips.cc/paper/7181-attention-is-all-you-need)、[Relative Position](https://aclanthology.org/N18-2074/)、[Transformer-XL](https://aclanthology.org/P19-1285/)、[T5](https://jmlr.org/papers/v21/20-074.html)、[RoFormer](https://arxiv.org/abs/2104.09864)、[ALiBi](https://arxiv.org/abs/2108.12409)。
### 4.3 RoPE 的最小几何
对一对维度,把位置 `m` 写成旋转角 `mθ`:
`R_m=[cos(mθ),−sin(mθ); sin(mθ),cos(mθ)]`
因为 `R_mᵀR_n=R_{n−m}`,Q/K 点积自然依赖相对位移。不同维度对使用不同频率:高频区分近邻,低频覆盖较长尺度。测试距离越过训练分布时,相位组合、周期和 attention resolution 都可能陌生;“公式可算任意 m”不等于模型学会任意长度。
### 4.4 长度外推的四条路线
- xPos 提出 attention resolution,并通过位置设计与 blockwise causal attention 改善外推。
- Kazemnejad et al. 在特定 decoder-only reasoning / math tasks 比较 APE、T5 RPE、ALiBi、RoPE 与 NoPE,报告 NoPE 最好;它不是所有语言建模场景的总定律。
- Position Interpolation / YaRN 将超长位置映回更熟悉的 RoPE 范围;FIRE 学习相对位置函数并渐进插值。
- LongRoPE 搜索不同维度/位置的非均匀插值,并做渐进扩展和短上下文恢复;其 2,048K 是论文模型与训练设定的结果。
来源:[xPos](https://arxiv.org/abs/2212.10554)、[NoPE study](https://arxiv.org/abs/2305.19466)、[Position Interpolation](https://arxiv.org/abs/2306.15595)、[YaRN](https://arxiv.org/abs/2309.00071)、[FIRE](https://arxiv.org/abs/2310.04418)、[LongRoPE](https://arxiv.org/abs/2402.13753)。
## 5. Norm:不是“把数字变小”
### 5.1 三个归一化对象
对单 token 向量 `x∈R^d`:
- LayerNorm:`(x−μ)/√(σ²+ε) ⊙ γ + β`,控制均值和方差。
- RMSNorm:`x/√(mean(x²)+ε) ⊙ γ`,保留均值方向,只提供 re-scaling invariance。
- QK-Norm:先按 attention head 归一化 Q、K,再用可学习 scale 形成 logits;它处理 softmax saturation,不替代整个 block 的 PreNorm。
来源:[LayerNorm](https://arxiv.org/abs/1607.06450)、[RMSNorm](https://arxiv.org/abs/1910.07467)、[QK-Norm](https://arxiv.org/abs/2010.04245)。
### 5.2 Pre-LN 与 Post-LN 是拓扑
- Post-LN:`x_{l+1}=Norm(x_l+F(x_l))`
- Pre-LN:`x_{l+1}=x_l+F(Norm(x_l))`
Pre-LN 的 identity path 不经过 Norm,通常更易优化;Xiong et al. 用 mean-field 分析初始化梯度和 warm-up。代价是所有分支固定相加可能造成 hidden-state growth 与层贡献稀释。NormFormer 在 Pre-LN block 内增加 attention 后 Norm、head-wise scaling 和 FFN 内 Norm,以改善深浅层梯度尺度。
来源:[Pre-LN analysis](https://arxiv.org/abs/2002.04745)、[Transformers without Tears](https://arxiv.org/abs/1910.05895)、[NormFormer](https://arxiv.org/abs/2110.09456)。
### 5.3 稳定堆深的谱系
- Fixup 通过初始化缩放让 residual net 在无 normalization 下稳定。
- ReZero 为每条 residual 分支乘零初始化标量,初始网络接近 identity;论文应用到 120-layer Transformer。
- Admin 把训练不稳归因于 residual branch 对参数扰动的放大效应,并做适应性初始化。
- DeepNorm 修改 residual scale 并配套初始化,报告训练到 1,000 Transformer layers。
- nGPT 把 embedding、权重和 hidden state 归一化到 hypersphere;论文的 4–20× steps reduction 依赖其任务和长度设置。
来源:[Fixup](https://arxiv.org/abs/1901.09321)、[ReZero](https://arxiv.org/abs/2003.04887)、[Admin](https://arxiv.org/abs/2004.08249)、[DeepNet](https://arxiv.org/abs/2203.00555)、[nGPT](https://arxiv.org/abs/2410.01131)。
## 6. Residual:从固定加法路到可学习深度路由
### 6.1 成就与盲点
ResNet 把目标写成 `H(x)=x+F(x)`,让 identity shortcut 提供直接路径。现代 Pre-LN LLM 进一步保持裸 identity path。然而:
`h_L=h_0+Σ F_l(Norm(h_l))`
所有分支以固定单位系数进入同一个状态。捷径保证“能到”,不保证“每层被同等听见”,也不控制总幅值。
来源:[ResNet](https://openaccess.thecvf.com/content_cvpr_2016/html/He_Deep_Residual_Learning_CVPR_2016_paper.html)。
### 6.2 Hyper-Connections 与 mHC
HC 把 residual stream 从 `R^d` 扩为 `R^{n×d}`:
`X_{l+1}=B_l X_l + C_l F_l(A_l X_l)`
mHC 指出 unconstrained HC 会破坏 residual 的 identity property并导致训练不稳;它把 `B_l` 投影到 doubly stochastic matrices 的 Birkhoff polytope。DeepSeek-V4 报告写明该约束令 `||B_l||₂≤1`、映射 non-expansive,且集合在矩阵乘法下封闭;实现用 Sinkhorn-Knopp 近似投影。这是论文/报告的理论与设计主张,页面不把它写成所有场景的完备稳定性证明。
来源:[Hyper-Connections](https://arxiv.org/abs/2409.19606)、[mHC](https://arxiv.org/abs/2512.24880)、[DeepSeek-V4](https://arxiv.org/abs/2606.19348)。
### 6.3 Attention Residuals
Kimi Team 把“沿序列注意力”移到“沿深度注意力”:
`α_{i→l}=exp(q_lᵀ RMSNorm(k_i)) / Σ_j exp(q_lᵀ RMSNorm(k_j))`
`h_l=Σ_i α_{i→l}v_i`
Block AttnRes 先把层分块,每块内部累加,再只在 block representations 上做 depth attention,把存储/通信从 `O(Ld)` 降到 `O(Nd)`。独立报告使用 48B total / 3B active、1.4T tokens 验证;K3 则把方案放进更大完整系统。
K3 的具体配置:93 backbone layers;按 12 层划成 8 个 layer blocks(7 个完整 12 层 block + 1 个 partial block),embedding 另作一个 source,因此共有 9 个 block-level depth sources。这里纠正早期草案里“block size 2”的误读。
来源:[Attention Residuals](https://arxiv.org/abs/2603.15031)、[Kimi K3](https://arxiv.org/abs/2607.24653),本地证据 `research/sources/kimi-k3/k3_tech_report.txt:373-425`。
## 7. 激活与 FFN:从选择性通过到有界门控
### 7.1 公式谱系
- ReLU:`max(0,x)`。
- GELU:`x Φ(x)`。
- GLU:`(xW+b) ⊙ σ(xV+c)`。
- Swish / SiLU:`x σ(βx)`。
- SwiGLU:`Swish(xW_g) ⊙ (xW_u)`;两个乘法因子都可无界。
来源:[GELU](https://arxiv.org/abs/1606.08415)、[GLU](https://arxiv.org/abs/1612.08083)、[Swish](https://arxiv.org/abs/1710.05941)、[GLU Variants](https://arxiv.org/abs/2002.05202)、[LLaMA](https://arxiv.org/abs/2302.13971)。
### 7.2 DeepSeek-V4:clamp 两条分支
V4 报告称训练中把 SwiGLU linear component clamp 到 `[-10,10]`,gate component 只把上界 cap 为 `10`,并报告消除 outliers、帮助稳定且未损害性能。它是作者在 V4 设置中的经验报告,不是一般数学保证。
本地证据:`research/sources/long-context/2606.19348.txt:1483-1493`。
### 7.3 K3:SiTU-GLU 的平滑上界
K3 Stable LatentMoE 在 routed experts 聚合后、up projection 前加入 RMSNorm,并定义:
`SiTU-GLU(x)=β₁ tanh(W_gx/β₁) ⊙ Sigmoid(W_gx) ⊙ β₂ tanh(W_ux/β₂)`
报告使用 `β₁=4, β₂=25`,所以输出逐点绝对值严格小于 `β₁β₂=100`。在原点附近一阶近似 SwiGLU,`β→∞` 时逐点恢复;相较 hard clamp,tanh cap 在饱和区仍有非零但很小的梯度。函数上界不等于整个网络 activation / loss 有界。
本地证据:`research/sources/kimi-k3/k3_tech_report.txt:458-505,2700-2815`。
## 8. DeepSeek 重点谱系
### 8.1 DeepSeek LLM / V3:现代基线配方
- DeepSeek LLM 使用 Pre-Norm RMSNorm、SwiGLU 和 RoPE。
- V3 在 compressed latent vectors 后加入额外 RMSNorm;不能把 latent Norm 与 block PreNorm 混成一个位置。
来源:[DeepSeek LLM](https://arxiv.org/abs/2401.02954)、[DeepSeek-V3](https://arxiv.org/abs/2412.19437)。
### 8.2 DeepSeek-V2:把内容与位置拆开缓存
MLA 想把 content K/V 压入 latent 并把 up-projection 吸收到 query 侧;若把 RoPE 直接夹在 key up-projection 中,位置相关旋转阻止矩阵吸收。V2 因而增加独立 multi-head RoPE query 和 shared RoPE key,再与 content Q/K 拼接。它是 **decoupled RoPE**,不是 NoPE。
本地证据:`research/sources/long-context/2405.04434.txt:350-395`。
### 8.3 DeepSeek-V4:四件事一起看
1. mHC 把 residual width 扩为 4,并约束 depth mixing。
2. CSA / HCA 的 query head 与 compressed KV entry 分别做额外 RMSNorm。
3. Q、KV 和 core attention output 的最后 64 维使用 partial RoPE;output 再用负位置旋转恢复相对位置含义。
4. SwiGLU 两条分支使用非对称 clamp。
本地证据:`research/sources/long-context/2606.19348.txt:355-432,715-747,1483-1493`。
## 9. Kimi K3 逐节复原
### 9.1 NoPE 不是删除顺序
- K3 以 3 个 KDA + 1 个 Gated MLA 的比例构成 hybrid backbone。
- 所有 MLA layers 不给 Q/K 施加显式 position encoding。
- KDA 的 channel-wise recurrent gate / decay 提供 position-sensitive、recency-aware sequence mixing。
- 报告因此不需要在扩窗时修改 RoPE base 或 YaRN 参数。
报告称模型能直接外推到 1M,但同一 §3.4 还明确使用 long-context cleaning/synthesis、8K→64K→256K→1M 的渐进课程和序列并行。不得写成“NoPE 单独造出 1M”。
本地证据:`research/sources/kimi-k3/k3_tech_report.txt:352-370,780-811`。
### 9.2 Block AttnRes 是深度轴的选择器
- `RMSNorm(k)` 防止大幅值层仅凭尺度支配 softmax。
- Full 形式 arithmetic `O(L²d)` 在不足百层仍可接受,真正问题是保存所有层输出的 `O(Ld)` memory / pipeline communication。
- K3 的 Block 形式把 93 层按 12 层划块,降低到 `O(Nd)`。
### 9.3 Stable LatentMoE 是表示幅值控制
- routed experts 先在 latent space 聚合,再上投影回 full width;
- 额外 RMSNorm 控制 routed latent variation;
- SiTU-GLU 给乘法门控输出明确的 smooth bound;
- 两项与 MoE 路由、通信优化一起构成 Stable LatentMoE,不能只摘一个公式解释整套训练收益。
## 10. 四联交互实验合同
### Lab A / Token 与表示
输入:文本预设、token unit(word/subword/byte)、`V`、`d`、weight tying、上下文开关。
输出:toy token sequence、tokens/characters、embedding/head 参数、同一 token 的 base/context states。明标不是任何真实 tokenizer / checkpoint。
### Lab B / 位置几何
输入:scheme(absolute/RoPE/ALiBi/NoPE)、位置 `i,j`、训练长度、RoPE base / ALiBi slope。
输出:relative distance、2D Q/K 旋转图、dot similarity、train-window / extrapolation 状态。NoPE 只表示“没有显式项”。
### Lab C / Norm 与深度
输入:topology(Post-LN/Pre-LN/RMS-Pre/QK+RMS)、depth、branch scale、attention logit scale。
输出:toy residual magnitude、identity gradient path、softmax peak / saturation。曲线不是训练预测器。
### Lab D / Residual 与 FFN
输入:residual route(plain/HC/mHC/AttnRes)、depth source scores、activation(GELU/SwiGLU/V4 clamp/SiTU)、input range。
输出:depth weights/path、memory-state count、activation response、最大绝对输出与理论上界;K3 preset 用 `β₁=4,β₂=25`。
共同验收:四 tabs / panels 一一对应,ARIA 与左右方向键可用;1440px / 390px 无横向溢出;控件变化更新数值与解释;公式事实、作者报告、本站推导不可混用。
## 11. 正式论文链(66 个教学节点)
| # | 年 | 节点 | 主账 | 一句话位置 |
|---:|---:|---|---|---|
| 01 | 2003 | Neural Probabilistic LM | 表示 | 离散词变成共同学习的连续向量。 |
| 02 | 2013 | word2vec | 表示 | 高效学习静态分布式表示。 |
| 03 | 2015 | BatchNorm | Norm | 跨 batch 统计的归一化前史。 |
| 04 | 2015 | ResNet | 深度 | identity shortcut 让残差学习成为主干。 |
| 05 | 2015 | BPE for NMT | Token | 以子词处理开放词表与稀有词。 |
| 06 | 2016 | LayerNorm | Norm | 单样本内按特征归一化。 |
| 07 | 2016 | Output Embedding | 表示 | 输出 classifier 也是 embedding,可与输入表共享。 |
| 08 | 2016 | Tying Word Vectors | 表示 | 从 loss framework 推导 weight tying。 |
| 09 | 2016 | GELU | FFN | 平滑、输入相关的激活。 |
| 10 | 2016 | GLU | FFN | 内容分支乘 sigmoid gate。 |
| 11 | 2017 | Transformer | 位置/深度 | sinusoid + Post-LN residual 的原始组合。 |
| 12 | 2017 | Swish | FFN | `x·sigmoid(βx)` 的平滑非单调激活。 |
| 13 | 2018 | SentencePiece | Token | 从原始句子训练语言无关子词模型。 |
| 14 | 2018 | ELMo | 上下文化 | occurrence 表示来自深双向 LM 内部状态。 |
| 15 | 2018 | Relative Position | 位置 | 相对距离进入 self-attention。 |
| 16 | 2018 | BERT | 上下文化 | 深双向 Transformer 表示成为迁移接口。 |
| 17 | 2019 | Transformer-XL | 位置 | segment recurrence 与相对位置。 |
| 18 | 2019 | Fixup | 深度 | 用初始化而非 Norm 控制 residual 更新。 |
| 19 | 2019 | RMSNorm | Norm | 去 re-centering,只按 RMS 缩放。 |
| 20 | 2019 | T5 | 位置 | bucketed relative position bias。 |
| 21 | 2019 | ScaleNorm / FixNorm | Norm | 以固定范数和单一 scale 简化归一化。 |
| 22 | 2020 | Pre-LN analysis | 拓扑 | Norm 位置改变初始化梯度与 warm-up。 |
| 23 | 2020 | GLU Variants | FFN | GEGLU / SwiGLU 进入 Transformer FFN。 |
| 24 | 2020 | ReZero | 深度 | 零初始化 residual gate,从 identity 开始。 |
| 25 | 2020 | Admin | 深度 | 控制 residual 对参数扰动的放大。 |
| 26 | 2020 | QK-Norm | Norm | 限制 Q/K 匹配尺度和 softmax 饱和。 |
| 27 | 2020 | FFN as Memories | 表示 | FFN 方向关联输入模式与词表。 |
| 28 | 2021 | RoPE | 位置 | 绝对旋转形成相对点积。 |
| 29 | 2021 | ALiBi | 位置 | attention logit 加距离惩罚。 |
| 30 | 2021 | NormFormer | Norm | 在 Pre-LN 内补充归一化和平衡梯度。 |
| 31 | 2021 | Primer | FFN | squared ReLU 与 depthwise QKV conv。 |
| 32 | 2021 | ByT5 | Token | token-free byte-to-byte 预训练。 |
| 33 | 2021 | CANINE | Token | 无显式 tokenizer 的字符级 encoder。 |
| 34 | 2021 | Charformer | Token | 学习软子词块。 |
| 35 | 2022 | DeepNet | 深度 | DeepNorm 与初始化堆至 1,000 层。 |
| 36 | 2022 | xPos | 位置 | attention resolution 与长度外推。 |
| 37 | 2023 | LLaMA | 现代配方 | RMSNorm + SwiGLU + RoPE。 |
| 38 | 2023 | NoPE length study | 位置 | 在特定推理任务比较五类位置方案。 |
| 39 | 2023 | Position Interpolation | 位置 | 把新位置压回训练过的范围。 |
| 40 | 2023 | YaRN | 位置 | 频率分区、温度与高效扩窗。 |
| 41 | 2023 | FIRE | 位置 | 可学习相对位置函数与渐进插值。 |
| 42 | 2024 | LongRoPE | 位置 | 搜索非均匀插值并渐进扩展。 |
| 43 | 2024 | DeepSeek LLM | DeepSeek | Pre-Norm RMSNorm、SwiGLU、RoPE。 |
| 44 | 2024 | DeepSeek-V2 | DeepSeek | MLA 用 decoupled RoPE。 |
| 45 | 2024 | DeepSeek-V3 | DeepSeek | latent Norm 与现代 MoE 配方。 |
| 46 | 2024 | Hyper-Connections | 深度 | 扩宽 residual stream、学习层间映射。 |
| 47 | 2024 | nGPT | Norm/表示 | 表示与权重在 hypersphere 上学习。 |
| 48 | 2024 | Byte Latent Transformer | Token | 以 entropy 动态组成 byte patches。 |
| 49 | 2025 | Kimi Linear | Kimi | KDA 隐式位置 + MLA NoPE。 |
| 50 | 2025 | DeepSeek-V3.2 | DeepSeek | 稀疏注意力继续协同位置路径。 |
| 51 | 2025 | mHC | DeepSeek | 用流形约束 HC 稳定性。 |
| 52 | 2026 | Attention Residuals | Kimi | 在深度维选择先前层/块。 |
| 53 | 2026 | DeepSeek-V4 | DeepSeek | mHC + partial RoPE + Q/KV Norm + clamp。 |
| 54 | 2026 | Kimi K3 | Kimi | NoPE hybrid + Block AttnRes + SiTU-GLU。 |
| 55 | 2018 | GPT-1 | 上下文化 | causal decoder 状态成为迁移表示。 |
| 56 | 2019 | BERT pipeline analysis | 表示 | 不同层呈现不同语言信息探针。 |
| 57 | 2019 | Contextual Representations | 表示 | 线性 probe 做分层语言知识分析。 |
| 58 | 2020 | DeBERTa | 位置 | 内容与位置向量解耦进 attention。 |
| 59 | 2022 | PaLM | FFN | 大规模 decoder 采用 SwiGLU。 |
| 60 | 2022 | OPT | 深度 | Pre-LN decoder 的公开复现坐标。 |
| 61 | 2023 | LLaMA 2 | 现代配方 | 延续 RoPE/RMSNorm/SwiGLU。 |
| 62 | 2023 | OLMo studies | 稳定 | QK-Norm 等规模稳定性证据。 |
| 63 | 2024 | Gemma 2 | Norm | pre/post Norm 与 logit soft-cap。 |
| 64 | 2024 | Massive Activations | 极值 | LLM 隐状态异常大激活的系统观察。 |
| 65 | 2025 | Kimi K2 | Kimi | MLA、RMSNorm 与 MuonClip 的前代。 |
| 66 | 2026 | Stable LatentMoE | Kimi | K3 把 Norm 和有界 GLU 放入专家路径。 |
## 12. 写作与证据禁区
1. 不把 toy simulator 曲线写成真实模型的 loss / gradient 预测。
2. 不把 probing 可读模式写成因果、唯一、稳定的 neuron 功能。
3. 不把“理论上可表示位置”写成“SGD 一定学到位置”。
4. 不把短→长 perplexity 外推等同于 1M retrieval 或 Agent 长轨迹。
5. 不把 RMSNorm、QK-Norm、latent Norm 视为同一插槽。
6. 不把 mHC 和 AttnRes 排成单一优劣榜。
7. 不把 V4 clamping 的经验结论写成一般定理。
8. 不把 SiTU 的函数上界直接等同于整个网络 activation / loss 有界。
9. 不把 K3 的 1M 上下文单因归给 NoPE。
10. DeepSeek/Kimi 的效率、质量和稳定性数字全部保留作者自报、模型、训练与基线边界。