26 KiB
第 03 章研究账本:表示、位置与残差高速公路
核验截止:2026-07-29(Asia/Shanghai)
证据规则:论文原文、正式会议页、作者/团队官方报告和官方实现进入事实层;本站公式演算、类比和 toy simulator 明标“教学推导”。Grok 只做候选召回,隔离在
REPRESENTATION_GROK_LEADS.md。
0. 本章不是“RoPE 名词表”
本章回答四个彼此耦合的问题:
- 表示:离散 token 怎样变成向量;一个固定向量又怎样变成随上下文、层数不断改写的状态?
- 位置:内容匹配本身不含顺序时,绝对位置、相对距离、旋转、偏置和隐式状态分别怎样把顺序送进模型?
- 深度:几十到上百层怎样既保留捷径,又避免幅值增长、梯度失衡和表示稀释?
- 局部非线性:FFN / GLU 怎样加工每个位置;极端激活为什么会在大规模、低精度和 MoE 中成为系统问题?
与相邻章节的边界:
- 第 01 章负责 NPLM、word2vec 与语言模型前史;本章从“token 已选定”继续追踪表示在模型内部的生命史。
- 第 02 章给出位置、Norm、Residual、FFN 的最小闭环;本章逐公式拆解并扩展到 DeepSeek / K3。
- 第 05 章负责 tokenizer 的数据工程与训练;本章只研究它对表示、参数和计算单位的结构性影响。
- 第 07 章负责长上下文算法与真实成本;本章只研究位置几何和长度外推边界。
- 第 09 章负责优化器、精度和训练失稳;本章聚焦架构内部的幅值与信息路径。
1. 二十张正式问题账
| # | 账 | 先问什么 | 最小结论 |
|---|---|---|---|
| 01 | 单位账 | 字符、字节、子词、token、patch 谁是模型一步? | Tokenizer 先决定序列长度、词表和边界,再由 embedding 查表。 |
| 02 | 参数账 | 词表大一倍只是多一点词吗? | 输入表和输出头常各含 V×d 参数;weight tying 会改变这笔账。 |
| 03 | 静态表示账 | 同一个 ID 是否永远同义? | 初始 embedding 固定,但进入网络后的 hidden state 随上下文和层而变。 |
| 04 | 上下文化账 | 多义性在哪里被展开? | 序列混合和逐位置 FFN 反复改写 token state。 |
| 05 | 输出几何账 | 下一个 token 怎样被选出? | hidden state 与输出向量点积生成 logits;向量空间同时是分类接口。 |
| 06 | 对称性账 | 没有位置时 Attention 知道先后吗? | 裸 self-attention 对输入排列等变;causal mask 只提供有向可见性。 |
| 07 | 绝对位置账 | “第 37 位”怎样进入表示? | learned / sinusoidal vector 可与内容相加,但内容与位置从入口就纠缠。 |
| 08 | 相对位置账 | “相距 3”怎样进入匹配? | 相对向量或 bias 直接改变位置对的 attention score / value。 |
| 09 | 旋转账 | RoPE 为什么用二维旋转? | 位置 m,n 的 Q/K 点积可写成与 n−m 有关的相对旋转。 |
| 10 | 外推账 | 训练窗外为何会坏? | 新距离改变相位、bias 区间和 attention resolution;可计算不等于会利用。 |
| 11 | NoPE 账 | 不显式编码位置是否等于无顺序? | 因果边界、递归衰减和内容统计可隐式编码顺序;机制必须逐模型说明。 |
| 12 | 统计账 | Norm 究竟归一化谁? | LayerNorm 控制单 token 特征的均值/方差,RMSNorm只控制 RMS,QK-Norm控制匹配向量。 |
| 13 | 拓扑账 | Norm 放在分支前还是相加后? | Pre/Post 改变 identity path、初始化梯度和深度动态。 |
| 14 | 幅值账 | Residual 为什么仍会长大? | x_{l+1}=x_l+f_l 固定单位累加;分支不为零时尺度通常随深度积累。 |
| 15 | 梯度账 | 有捷径为何仍难训练? | 捷径改善可达性,却不自动平衡各层更新、attention logits 和输出幅值。 |
| 16 | 稀释账 | 早期层为何会“听不见”? | 所有层固定相加会把单层贡献占比压低;Kimi 把它称为 PreNorm dilution。 |
| 17 | 拓宽账 | residual stream 必须只有一条吗? | HC 展开为多条流并学习层间连接;mHC 再约束映射稳定性。 |
| 18 | 选择账 | 深度能否像序列一样 attention? | AttnRes 对先前层/块表示做 softmax 选择,而非全用单位权重。 |
| 19 | FFN 账 | Attention 后为何还要大 MLP? | Attention 搬运跨 token 信息;FFN 在每个位置做共享非线性特征变换,并占大量参数。 |
| 20 | 极值账 | 门控为何也会爆? | SwiGLU 两个乘法因子都可无界;clamp 与 SiTU 用不同方式限制异常值。 |
2. 八次历史转向
| 时期 | 被解决的瓶颈 | 转向 | 仍留下什么 |
|---|---|---|---|
| 2003–13 | one-hot 不能共享统计 | 稠密 distributed representation、word2vec | 同一词仍只有一个静态向量 |
| 2015–18 | 稀有词、开放词表与多义性 | BPE / SentencePiece + ELMo / BERT 上下文化 | token 边界仍由固定 tokenizer 先决定 |
| 2015–17 | 深网退化与序列 batch 统计不便 | ResNet + LayerNorm | fixed residual sum 仍会积累尺度 |
| 2018–21 | Attention 缺少顺序 | relative position、Transformer-XL、T5 bias、RoPE、ALiBi | 长度外推不自动成立 |
| 2019–22 | Transformer 堆深不稳 | RMSNorm、Pre-LN、ReZero、Admin、NormFormer、DeepNorm | 稳定和表示质量存在张力 |
| 2021–24 | 训练窗外的位置分布变了 | xPos、NoPE study、PI、YaRN、FIRE、LongRoPE | 位置修补不等于长程检索能力 |
| 2024–26 | 一条 fixed residual stream 成为深度瓶颈 | HC、nGPT、mHC、AttnRes | 更丰富拓扑带来状态/通信/约束成本 |
| 2024–26 | 前沿规模下位置与激活要协同设计 | DeepSeek-V2/V4、Kimi Linear/K3 | 结论必须绑定整个架构与训练配方 |
3. 表示:从查表到上下文化状态
3.1 五个常被混成“词向量”的对象
给 token ID t、词表大小 V、hidden width d:
- ID:离散整数,本身没有几何。
- 输入 embedding:
e_t = E[t],E∈R^{V×d};这是进入第 0 层的查表结果。 - hidden state:
h_t^l;同一个 ID 在不同句子、位置、层中通常不同。 - 输出向量:输出矩阵
W_out∈R^{V×d}的一行;z_v = W_out[v]·h + b_v。 - 概率:
p(v|context)=softmax(z)_v;概率是整个上下文计算的结果,不是 embedding 自带属性。
Press & Wolf 2016 研究顶层权重矩阵,指出它本身是有效 word embedding,并推荐 input/output weight tying;Inan et al. 2016 从 loss framework 得到相同 tying 方向。共享矩阵减少约 V×d 参数,但输入“读向量”与输出“分类”的计算角色仍不同。
来源:Output Embedding、Tying Word Vectors。
3.2 静态向量不是终点
ELMo 把词向量定义为深双向语言模型内部状态的函数,并允许下游任务混合不同层;论文明确以复杂词用法和 polysemy 为动机。BERT 后续把上下文化预训练推到 Transformer encoder。历史转向是:
token type → 初始向量 → 句内交互 → 每个 occurrence 的状态
3.3 Tokenizer 先决定结构成本
- 固定词表方案:embedding / output head 参数随
V×d增长;序列计算随 token 数增长。 - byte-level:去掉固定子词词表依赖,但通常产生更长序列。
- BLT 2024 把 byte 按 next-byte entropy 分成动态 patch,让高复杂度区域获得更多计算;论文报告的是特定 FLOP-controlled scaling study,不能泛化为“byte 模型已全面更优”。
3.4 FFN 也是表示系统
Geva et al. 把 Transformer FFN 分析为 key-value memories:第一层方向与输入文本模式相关,第二层方向诱导输出词表分布;低层偏浅层模式,高层更语义化。这个分析支持“FFN 不只是扩维再缩维”,但不证明每个 neuron 都是一条独立、稳定、可编辑的事实。
来源:Transformer Feed-Forward Layers Are Key-Value Memories。
4. 位置:把排列对称打破到什么程度
4.1 无位置的 self-attention
若同时对 token 行做同一个排列 P,且没有 mask / position:
Attn(PX)=P Attn(X)
它会跟着输入一起排列,却无法区分“相同内容的不同顺序”。Causal mask 已经打破完全对称:位置 t 只能看到前缀 ≤t,所以 NoPE decoder 并非完全没有顺序信号。但它没有显式给每对 Q/K 一个距离坐标。
4.2 四种主流写法
- absolute add:
x_t=e_t+p_t;原始 Transformer 的 fixed sinusoid 与 learned variant 属于此类。 - relative representation / bias:score 依赖
i−j;Shaw 2018、Transformer-XL、T5 buckets。 - RoPE:
q_m=R_m q, k_n=R_n k,于是q_mᵀk_n=qᵀR_{n−m}k。 - ALiBi:
score_{ij}=q_iᵀk_j/√d − m_h(i−j);不向 embedding 加位置向量。
来源:Transformer、Relative Position、Transformer-XL、T5、RoFormer、ALiBi。
4.3 RoPE 的最小几何
对一对维度,把位置 m 写成旋转角 mθ:
R_m=[cos(mθ),−sin(mθ); sin(mθ),cos(mθ)]
因为 R_mᵀR_n=R_{n−m},Q/K 点积自然依赖相对位移。不同维度对使用不同频率:高频区分近邻,低频覆盖较长尺度。测试距离越过训练分布时,相位组合、周期和 attention resolution 都可能陌生;“公式可算任意 m”不等于模型学会任意长度。
4.4 长度外推的四条路线
- xPos 提出 attention resolution,并通过位置设计与 blockwise causal attention 改善外推。
- Kazemnejad et al. 在特定 decoder-only reasoning / math tasks 比较 APE、T5 RPE、ALiBi、RoPE 与 NoPE,报告 NoPE 最好;它不是所有语言建模场景的总定律。
- Position Interpolation / YaRN 将超长位置映回更熟悉的 RoPE 范围;FIRE 学习相对位置函数并渐进插值。
- LongRoPE 搜索不同维度/位置的非均匀插值,并做渐进扩展和短上下文恢复;其 2,048K 是论文模型与训练设定的结果。
来源:xPos、NoPE study、Position Interpolation、YaRN、FIRE、LongRoPE。
5. Norm:不是“把数字变小”
5.1 三个归一化对象
对单 token 向量 x∈R^d:
- LayerNorm:
(x−μ)/√(σ²+ε) ⊙ γ + β,控制均值和方差。 - RMSNorm:
x/√(mean(x²)+ε) ⊙ γ,保留均值方向,只提供 re-scaling invariance。 - QK-Norm:先按 attention head 归一化 Q、K,再用可学习 scale 形成 logits;它处理 softmax saturation,不替代整个 block 的 PreNorm。
5.2 Pre-LN 与 Post-LN 是拓扑
- Post-LN:
x_{l+1}=Norm(x_l+F(x_l)) - Pre-LN:
x_{l+1}=x_l+F(Norm(x_l))
Pre-LN 的 identity path 不经过 Norm,通常更易优化;Xiong et al. 用 mean-field 分析初始化梯度和 warm-up。代价是所有分支固定相加可能造成 hidden-state growth 与层贡献稀释。NormFormer 在 Pre-LN block 内增加 attention 后 Norm、head-wise scaling 和 FFN 内 Norm,以改善深浅层梯度尺度。
来源:Pre-LN analysis、Transformers without Tears、NormFormer。
5.3 稳定堆深的谱系
- Fixup 通过初始化缩放让 residual net 在无 normalization 下稳定。
- ReZero 为每条 residual 分支乘零初始化标量,初始网络接近 identity;论文应用到 120-layer Transformer。
- Admin 把训练不稳归因于 residual branch 对参数扰动的放大效应,并做适应性初始化。
- DeepNorm 修改 residual scale 并配套初始化,报告训练到 1,000 Transformer layers。
- nGPT 把 embedding、权重和 hidden state 归一化到 hypersphere;论文的 4–20× steps reduction 依赖其任务和长度设置。
来源:Fixup、ReZero、Admin、DeepNet、nGPT。
6. Residual:从固定加法路到可学习深度路由
6.1 成就与盲点
ResNet 把目标写成 H(x)=x+F(x),让 identity shortcut 提供直接路径。现代 Pre-LN LLM 进一步保持裸 identity path。然而:
h_L=h_0+Σ F_l(Norm(h_l))
所有分支以固定单位系数进入同一个状态。捷径保证“能到”,不保证“每层被同等听见”,也不控制总幅值。
来源:ResNet。
6.2 Hyper-Connections 与 mHC
HC 把 residual stream 从 R^d 扩为 R^{n×d}:
X_{l+1}=B_l X_l + C_l F_l(A_l X_l)
mHC 指出 unconstrained HC 会破坏 residual 的 identity property并导致训练不稳;它把 B_l 投影到 doubly stochastic matrices 的 Birkhoff polytope。DeepSeek-V4 报告写明该约束令 ||B_l||₂≤1、映射 non-expansive,且集合在矩阵乘法下封闭;实现用 Sinkhorn-Knopp 近似投影。这是论文/报告的理论与设计主张,页面不把它写成所有场景的完备稳定性证明。
来源:Hyper-Connections、mHC、DeepSeek-V4。
6.3 Attention Residuals
Kimi Team 把“沿序列注意力”移到“沿深度注意力”:
α_{i→l}=exp(q_lᵀ RMSNorm(k_i)) / Σ_j exp(q_lᵀ RMSNorm(k_j))
h_l=Σ_i α_{i→l}v_i
Block AttnRes 先把层分块,每块内部累加,再只在 block representations 上做 depth attention,把存储/通信从 O(Ld) 降到 O(Nd)。独立报告使用 48B total / 3B active、1.4T tokens 验证;K3 则把方案放进更大完整系统。
K3 的具体配置:93 backbone layers;按 12 层划成 8 个 layer blocks(7 个完整 12 层 block + 1 个 partial block),embedding 另作一个 source,因此共有 9 个 block-level depth sources。这里纠正早期草案里“block size 2”的误读。
来源:Attention Residuals、Kimi K3,本地证据 research/sources/kimi-k3/k3_tech_report.txt:373-425。
7. 激活与 FFN:从选择性通过到有界门控
7.1 公式谱系
- ReLU:
max(0,x)。 - GELU:
x Φ(x)。 - GLU:
(xW+b) ⊙ σ(xV+c)。 - Swish / SiLU:
x σ(βx)。 - SwiGLU:
Swish(xW_g) ⊙ (xW_u);两个乘法因子都可无界。
来源:GELU、GLU、Swish、GLU Variants、LLaMA。
7.2 DeepSeek-V4:clamp 两条分支
V4 报告称训练中把 SwiGLU linear component clamp 到 [-10,10],gate component 只把上界 cap 为 10,并报告消除 outliers、帮助稳定且未损害性能。它是作者在 V4 设置中的经验报告,不是一般数学保证。
本地证据:research/sources/long-context/2606.19348.txt:1483-1493。
7.3 K3:SiTU-GLU 的平滑上界
K3 Stable LatentMoE 在 routed experts 聚合后、up projection 前加入 RMSNorm,并定义:
SiTU-GLU(x)=β₁ tanh(W_gx/β₁) ⊙ Sigmoid(W_gx) ⊙ β₂ tanh(W_ux/β₂)
报告使用 β₁=4, β₂=25,所以输出逐点绝对值严格小于 β₁β₂=100。在原点附近一阶近似 SwiGLU,β→∞ 时逐点恢复;相较 hard clamp,tanh cap 在饱和区仍有非零但很小的梯度。函数上界不等于整个网络 activation / loss 有界。
本地证据:research/sources/kimi-k3/k3_tech_report.txt:458-505,2700-2815。
8. DeepSeek 重点谱系
8.1 DeepSeek LLM / V3:现代基线配方
- DeepSeek LLM 使用 Pre-Norm RMSNorm、SwiGLU 和 RoPE。
- V3 在 compressed latent vectors 后加入额外 RMSNorm;不能把 latent Norm 与 block PreNorm 混成一个位置。
8.2 DeepSeek-V2:把内容与位置拆开缓存
MLA 想把 content K/V 压入 latent 并把 up-projection 吸收到 query 侧;若把 RoPE 直接夹在 key up-projection 中,位置相关旋转阻止矩阵吸收。V2 因而增加独立 multi-head RoPE query 和 shared RoPE key,再与 content Q/K 拼接。它是 decoupled RoPE,不是 NoPE。
本地证据:research/sources/long-context/2405.04434.txt:350-395。
8.3 DeepSeek-V4:四件事一起看
- mHC 把 residual width 扩为 4,并约束 depth mixing。
- CSA / HCA 的 query head 与 compressed KV entry 分别做额外 RMSNorm。
- Q、KV 和 core attention output 的最后 64 维使用 partial RoPE;output 再用负位置旋转恢复相对位置含义。
- SwiGLU 两条分支使用非对称 clamp。
本地证据:research/sources/long-context/2606.19348.txt:355-432,715-747,1483-1493。
9. Kimi K3 逐节复原
9.1 NoPE 不是删除顺序
- K3 以 3 个 KDA + 1 个 Gated MLA 的比例构成 hybrid backbone。
- 所有 MLA layers 不给 Q/K 施加显式 position encoding。
- KDA 的 channel-wise recurrent gate / decay 提供 position-sensitive、recency-aware sequence mixing。
- 报告因此不需要在扩窗时修改 RoPE base 或 YaRN 参数。
报告称模型能直接外推到 1M,但同一 §3.4 还明确使用 long-context cleaning/synthesis、8K→64K→256K→1M 的渐进课程和序列并行。不得写成“NoPE 单独造出 1M”。
本地证据:research/sources/kimi-k3/k3_tech_report.txt:352-370,780-811。
9.2 Block AttnRes 是深度轴的选择器
RMSNorm(k)防止大幅值层仅凭尺度支配 softmax。- Full 形式 arithmetic
O(L²d)在不足百层仍可接受,真正问题是保存所有层输出的O(Ld)memory / pipeline communication。 - K3 的 Block 形式把 93 层按 12 层划块,降低到
O(Nd)。
9.3 Stable LatentMoE 是表示幅值控制
- routed experts 先在 latent space 聚合,再上投影回 full width;
- 额外 RMSNorm 控制 routed latent variation;
- SiTU-GLU 给乘法门控输出明确的 smooth bound;
- 两项与 MoE 路由、通信优化一起构成 Stable LatentMoE,不能只摘一个公式解释整套训练收益。
10. 四联交互实验合同
Lab A / Token 与表示
输入:文本预设、token unit(word/subword/byte)、V、d、weight tying、上下文开关。
输出:toy token sequence、tokens/characters、embedding/head 参数、同一 token 的 base/context states。明标不是任何真实 tokenizer / checkpoint。
Lab B / 位置几何
输入:scheme(absolute/RoPE/ALiBi/NoPE)、位置 i,j、训练长度、RoPE base / ALiBi slope。
输出:relative distance、2D Q/K 旋转图、dot similarity、train-window / extrapolation 状态。NoPE 只表示“没有显式项”。
Lab C / Norm 与深度
输入:topology(Post-LN/Pre-LN/RMS-Pre/QK+RMS)、depth、branch scale、attention logit scale。
输出:toy residual magnitude、identity gradient path、softmax peak / saturation。曲线不是训练预测器。
Lab D / Residual 与 FFN
输入:residual route(plain/HC/mHC/AttnRes)、depth source scores、activation(GELU/SwiGLU/V4 clamp/SiTU)、input range。
输出:depth weights/path、memory-state count、activation response、最大绝对输出与理论上界;K3 preset 用 β₁=4,β₂=25。
共同验收:四 tabs / panels 一一对应,ARIA 与左右方向键可用;1440px / 390px 无横向溢出;控件变化更新数值与解释;公式事实、作者报告、本站推导不可混用。
11. 正式论文链(66 个教学节点)
| # | 年 | 节点 | 主账 | 一句话位置 |
|---|---|---|---|---|
| 01 | 2003 | Neural Probabilistic LM | 表示 | 离散词变成共同学习的连续向量。 |
| 02 | 2013 | word2vec | 表示 | 高效学习静态分布式表示。 |
| 03 | 2015 | BatchNorm | Norm | 跨 batch 统计的归一化前史。 |
| 04 | 2015 | ResNet | 深度 | identity shortcut 让残差学习成为主干。 |
| 05 | 2015 | BPE for NMT | Token | 以子词处理开放词表与稀有词。 |
| 06 | 2016 | LayerNorm | Norm | 单样本内按特征归一化。 |
| 07 | 2016 | Output Embedding | 表示 | 输出 classifier 也是 embedding,可与输入表共享。 |
| 08 | 2016 | Tying Word Vectors | 表示 | 从 loss framework 推导 weight tying。 |
| 09 | 2016 | GELU | FFN | 平滑、输入相关的激活。 |
| 10 | 2016 | GLU | FFN | 内容分支乘 sigmoid gate。 |
| 11 | 2017 | Transformer | 位置/深度 | sinusoid + Post-LN residual 的原始组合。 |
| 12 | 2017 | Swish | FFN | x·sigmoid(βx) 的平滑非单调激活。 |
| 13 | 2018 | SentencePiece | Token | 从原始句子训练语言无关子词模型。 |
| 14 | 2018 | ELMo | 上下文化 | occurrence 表示来自深双向 LM 内部状态。 |
| 15 | 2018 | Relative Position | 位置 | 相对距离进入 self-attention。 |
| 16 | 2018 | BERT | 上下文化 | 深双向 Transformer 表示成为迁移接口。 |
| 17 | 2019 | Transformer-XL | 位置 | segment recurrence 与相对位置。 |
| 18 | 2019 | Fixup | 深度 | 用初始化而非 Norm 控制 residual 更新。 |
| 19 | 2019 | RMSNorm | Norm | 去 re-centering,只按 RMS 缩放。 |
| 20 | 2019 | T5 | 位置 | bucketed relative position bias。 |
| 21 | 2019 | ScaleNorm / FixNorm | Norm | 以固定范数和单一 scale 简化归一化。 |
| 22 | 2020 | Pre-LN analysis | 拓扑 | Norm 位置改变初始化梯度与 warm-up。 |
| 23 | 2020 | GLU Variants | FFN | GEGLU / SwiGLU 进入 Transformer FFN。 |
| 24 | 2020 | ReZero | 深度 | 零初始化 residual gate,从 identity 开始。 |
| 25 | 2020 | Admin | 深度 | 控制 residual 对参数扰动的放大。 |
| 26 | 2020 | QK-Norm | Norm | 限制 Q/K 匹配尺度和 softmax 饱和。 |
| 27 | 2020 | FFN as Memories | 表示 | FFN 方向关联输入模式与词表。 |
| 28 | 2021 | RoPE | 位置 | 绝对旋转形成相对点积。 |
| 29 | 2021 | ALiBi | 位置 | attention logit 加距离惩罚。 |
| 30 | 2021 | NormFormer | Norm | 在 Pre-LN 内补充归一化和平衡梯度。 |
| 31 | 2021 | Primer | FFN | squared ReLU 与 depthwise QKV conv。 |
| 32 | 2021 | ByT5 | Token | token-free byte-to-byte 预训练。 |
| 33 | 2021 | CANINE | Token | 无显式 tokenizer 的字符级 encoder。 |
| 34 | 2021 | Charformer | Token | 学习软子词块。 |
| 35 | 2022 | DeepNet | 深度 | DeepNorm 与初始化堆至 1,000 层。 |
| 36 | 2022 | xPos | 位置 | attention resolution 与长度外推。 |
| 37 | 2023 | LLaMA | 现代配方 | RMSNorm + SwiGLU + RoPE。 |
| 38 | 2023 | NoPE length study | 位置 | 在特定推理任务比较五类位置方案。 |
| 39 | 2023 | Position Interpolation | 位置 | 把新位置压回训练过的范围。 |
| 40 | 2023 | YaRN | 位置 | 频率分区、温度与高效扩窗。 |
| 41 | 2023 | FIRE | 位置 | 可学习相对位置函数与渐进插值。 |
| 42 | 2024 | LongRoPE | 位置 | 搜索非均匀插值并渐进扩展。 |
| 43 | 2024 | DeepSeek LLM | DeepSeek | Pre-Norm RMSNorm、SwiGLU、RoPE。 |
| 44 | 2024 | DeepSeek-V2 | DeepSeek | MLA 用 decoupled RoPE。 |
| 45 | 2024 | DeepSeek-V3 | DeepSeek | latent Norm 与现代 MoE 配方。 |
| 46 | 2024 | Hyper-Connections | 深度 | 扩宽 residual stream、学习层间映射。 |
| 47 | 2024 | nGPT | Norm/表示 | 表示与权重在 hypersphere 上学习。 |
| 48 | 2024 | Byte Latent Transformer | Token | 以 entropy 动态组成 byte patches。 |
| 49 | 2025 | Kimi Linear | Kimi | KDA 隐式位置 + MLA NoPE。 |
| 50 | 2025 | DeepSeek-V3.2 | DeepSeek | 稀疏注意力继续协同位置路径。 |
| 51 | 2025 | mHC | DeepSeek | 用流形约束 HC 稳定性。 |
| 52 | 2026 | Attention Residuals | Kimi | 在深度维选择先前层/块。 |
| 53 | 2026 | DeepSeek-V4 | DeepSeek | mHC + partial RoPE + Q/KV Norm + clamp。 |
| 54 | 2026 | Kimi K3 | Kimi | NoPE hybrid + Block AttnRes + SiTU-GLU。 |
| 55 | 2018 | GPT-1 | 上下文化 | causal decoder 状态成为迁移表示。 |
| 56 | 2019 | BERT pipeline analysis | 表示 | 不同层呈现不同语言信息探针。 |
| 57 | 2019 | Contextual Representations | 表示 | 线性 probe 做分层语言知识分析。 |
| 58 | 2020 | DeBERTa | 位置 | 内容与位置向量解耦进 attention。 |
| 59 | 2022 | PaLM | FFN | 大规模 decoder 采用 SwiGLU。 |
| 60 | 2022 | OPT | 深度 | Pre-LN decoder 的公开复现坐标。 |
| 61 | 2023 | LLaMA 2 | 现代配方 | 延续 RoPE/RMSNorm/SwiGLU。 |
| 62 | 2023 | OLMo studies | 稳定 | QK-Norm 等规模稳定性证据。 |
| 63 | 2024 | Gemma 2 | Norm | pre/post Norm 与 logit soft-cap。 |
| 64 | 2024 | Massive Activations | 极值 | LLM 隐状态异常大激活的系统观察。 |
| 65 | 2025 | Kimi K2 | Kimi | MLA、RMSNorm 与 MuonClip 的前代。 |
| 66 | 2026 | Stable LatentMoE | Kimi | K3 把 Norm 和有界 GLU 放入专家路径。 |
12. 写作与证据禁区
- 不把 toy simulator 曲线写成真实模型的 loss / gradient 预测。
- 不把 probing 可读模式写成因果、唯一、稳定的 neuron 功能。
- 不把“理论上可表示位置”写成“SGD 一定学到位置”。
- 不把短→长 perplexity 外推等同于 1M retrieval 或 Agent 长轨迹。
- 不把 RMSNorm、QK-Norm、latent Norm 视为同一插槽。
- 不把 mHC 和 AttnRes 排成单一优劣榜。
- 不把 V4 clamping 的经验结论写成一般定理。
- 不把 SiTU 的函数上界直接等同于整个网络 activation / loss 有界。
- 不把 K3 的 1M 上下文单因归给 NoPE。
- DeepSeek/Kimi 的效率、质量和稳定性数字全部保留作者自报、模型、训练与基线边界。