feat: publish representation and depth chapter
This commit is contained in:
@@ -0,0 +1,136 @@
|
||||
# 表示、位置与残差:Grok 候选线索
|
||||
|
||||
> 状态:**UNVERIFIED / 未核验发现队列,不是正式证据。**
|
||||
>
|
||||
> 生成方式:2026-07-29 使用本机 Grok CLI Headless(禁用子代理)扩展候选召回。Grok 的作用仅是提出“还应查什么”;正文中的事实、数字、年份、公式和优先级都必须重新回到论文原文、正式会议页或官方技术报告。
|
||||
|
||||
## 1. Grok 建议的二十张问题账
|
||||
|
||||
1. 表示与参数:token ID、embedding、hidden state、logit、概率各是什么,为什么不能混称“词向量”?
|
||||
2. 静态词向量:同一个词只有一个向量时,多义性和上下文差异怎样被压扁?
|
||||
3. 上下文化:ELMo、BERT 与自回归 LLM 怎样把“词典条目”变成“此刻的状态”?
|
||||
4. 输入与输出空间:为什么输入 embedding 与输出 classifier 可以共享参数?
|
||||
5. Tokenizer:词、子词、字符、字节与动态 patch 分别把什么成本写进序列长度和词表?
|
||||
6. 绝对位置:为什么把位置向量加到 token embedding 能破坏 Attention 的置换对称?
|
||||
7. 相对位置:为什么语言规律往往更关心“相隔几步”而非“绝对第几位”?
|
||||
8. RoPE:二维旋转怎样让 Q·K 只通过相对角度看到位移?
|
||||
9. ALiBi / relative bias:把距离写进 logit 和写进向量有什么不同?
|
||||
10. NoPE:没有显式位置向量是否真的等于模型不知道顺序?
|
||||
11. 长度外推:训练长度外的新相位、距离和注意力分辨率为什么会失真?
|
||||
12. 归一化对象:LayerNorm、RMSNorm、QK-Norm 分别控制哪一个量?
|
||||
13. Norm 位置:Post-LN、Pre-LN 与 sandwich norm 怎样改变捷径和梯度?
|
||||
14. 深度退化:信息能通过捷径不等于每一层贡献不会被稀释。
|
||||
15. 残差缩放:初始化、门控、DeepNorm 怎样控制累计更新的量级?
|
||||
16. 残差宽度:Hyper-Connections 为什么把一条 residual stream 展开成多条?
|
||||
17. 残差选择:AttnRes 为什么把“固定相加”改成“沿深度做注意力”?
|
||||
18. 激活谱系:ReLU、GELU、GLU、SwiGLU 的非线性与乘法门控分别在做什么?
|
||||
19. FFN 记忆:为什么逐 token 的 FFN 仍可承载大量模式和事实关联?
|
||||
20. 极值稳定:DeepSeek-V4 的 clamping 与 K3 的 SiTU-GLU 分别怎样限制异常激活?
|
||||
|
||||
## 2. 候选历史波次
|
||||
|
||||
| 波次 | Grok 提议的主问题 | 候选锚点 |
|
||||
|---|---|---|
|
||||
| 1986–2013 | 离散符号怎样进入可学习几何? | distributed representation、word2vec、BPE |
|
||||
| 2014–2018 | 同一符号怎样随上下文改变? | Seq2Seq、ELMo、BERT |
|
||||
| 2015–2017 | 深网怎样先“走得通”? | BatchNorm、ResNet、LayerNorm、Transformer |
|
||||
| 2018–2021 | 顺序怎样进入 Attention? | relative position、Transformer-XL、T5 bias、RoPE、ALiBi |
|
||||
| 2019–2022 | Transformer 怎样稳定堆深? | RMSNorm、Pre-LN、Fixup、ReZero、Admin、NormFormer、DeepNet |
|
||||
| 2021–2024 | 位置怎样跨出训练窗口? | xPos、NoPE study、Position Interpolation、YaRN、FIRE、LongRoPE |
|
||||
| 2024–2026 | residual stream 能否从一条路变成可学习拓扑? | Hyper-Connections、nGPT、mHC、AttnRes |
|
||||
| 2024–2026 | 位置、残差与激活怎样成为前沿模型系统设计? | DeepSeek-V2/V4、Kimi Linear/K3 |
|
||||
|
||||
## 3. 候选论文池
|
||||
|
||||
### Token、embedding 与上下文化
|
||||
|
||||
- Bengio et al. — *A Neural Probabilistic Language Model*
|
||||
- Mikolov et al. — *Efficient Estimation of Word Representations in Vector Space*
|
||||
- Sennrich et al. — *Neural Machine Translation of Rare Words with Subword Units*
|
||||
- Kudo & Richardson — *SentencePiece*
|
||||
- Press & Wolf — *Using the Output Embedding to Improve Language Models*
|
||||
- Inan et al. — *Tying Word Vectors and Word Classifiers*
|
||||
- Peters et al. — *Deep contextualized word representations*
|
||||
- Devlin et al. — BERT
|
||||
- Geva et al. — *Transformer Feed-Forward Layers Are Key-Value Memories*
|
||||
- Clark et al. — CANINE
|
||||
- Xue et al. — ByT5
|
||||
- Tay et al. — Charformer
|
||||
- Pagnoni et al. — Byte Latent Transformer
|
||||
|
||||
### 位置与长度外推
|
||||
|
||||
- Vaswani et al. — sinusoidal absolute position
|
||||
- Shaw et al. — relative position representations
|
||||
- Dai et al. — Transformer-XL
|
||||
- Raffel et al. — T5 relative position buckets
|
||||
- Su et al. — RoFormer / RoPE
|
||||
- Press et al. — ALiBi
|
||||
- Sun et al. — xPos / Length-Extrapolatable Transformer
|
||||
- Kazemnejad et al. — NoPE length-generalization study
|
||||
- Chen et al. — Position Interpolation
|
||||
- Peng et al. — YaRN
|
||||
- Li et al. — FIRE
|
||||
- Ding et al. — LongRoPE
|
||||
|
||||
### 归一化、深度与 residual stream
|
||||
|
||||
- Ioffe & Szegedy — BatchNorm
|
||||
- He et al. — ResNet
|
||||
- Ba et al. — LayerNorm
|
||||
- Zhang & Sennrich — RMSNorm
|
||||
- Nguyen & Salazar — ScaleNorm / FixNorm / PreNorm
|
||||
- Zhang et al. — Fixup
|
||||
- Xiong et al. — Pre-LN / Post-LN analysis
|
||||
- Bachlechner et al. — ReZero
|
||||
- Liu et al. — Admin
|
||||
- Henry et al. — QK-Norm
|
||||
- Shleifer et al. — NormFormer
|
||||
- Wang et al. — DeepNet / DeepNorm
|
||||
- Zhu et al. — Hyper-Connections
|
||||
- Loshchilov et al. — nGPT
|
||||
- Xie et al. — mHC
|
||||
- Kimi Team — Attention Residuals
|
||||
|
||||
### 激活与 FFN
|
||||
|
||||
- Nair & Hinton — ReLU
|
||||
- Hendrycks & Gimpel — GELU
|
||||
- Dauphin et al. — GLU
|
||||
- Ramachandran et al. — Swish
|
||||
- Shazeer — GLU Variants / SwiGLU
|
||||
- Geva et al. — FFN as key-value memories
|
||||
- So et al. — Primer / squared ReLU
|
||||
- LLaMA — RMSNorm + SwiGLU 的现代配方
|
||||
- DeepSeek-V4 — SwiGLU clamping
|
||||
- Kimi K3 — SiTU-GLU
|
||||
|
||||
### DeepSeek / Kimi 重点候选
|
||||
|
||||
- DeepSeek-V2:MLA 的 decoupled RoPE
|
||||
- DeepSeek-V3:RMSNorm、SwiGLU 与 latent normalization
|
||||
- DeepSeek-V3.2:稀疏索引与 MLA 中的位置路径
|
||||
- DeepSeek-V4:mHC、partial RoPE、head-wise Q/KV RMSNorm、SwiGLU clamping
|
||||
- Kimi Linear:混合 KDA / MLA 与 NoPE
|
||||
- Attention Residuals:Full / Block AttnRes
|
||||
- Kimi K3:KDA 隐式顺序、MLA NoPE、Block AttnRes、SiTU-GLU
|
||||
|
||||
## 4. Grok 提出的四个交互实验草案
|
||||
|
||||
1. **Token / 表示工作台**:切换词、子词、字节,观察序列长度、词表参数、输入/输出权重共享,以及同一 token 在不同上下文中的状态。
|
||||
2. **位置几何台**:拖动两个位置,比较 absolute、relative bias、RoPE、ALiBi、NoPE 在训练窗内外怎样改变相似度。
|
||||
3. **Norm / 深度台**:切换 Post-LN、Pre-LN、RMSNorm、QK-Norm,观察 toy residual scale、gradient path 与 logit saturation。
|
||||
4. **Residual / FFN 台**:切换 plain residual、HC、mHC、AttnRes,并比较 GELU、SwiGLU、clamp、SiTU 对极值的响应。
|
||||
|
||||
## 5. 永久不得直接进入事实层的表述
|
||||
|
||||
- “embedding 就是模型的知识”:embedding 只是输入/输出接口的一部分,深层状态和参数共同构成模型行为。
|
||||
- “一个 token 对应一个词”:子词、字符、字节和多模态 token 都反例明显。
|
||||
- “RoPE 天然支持无限长度”:训练窗外相位分布与注意力分辨率仍可能失真。
|
||||
- “NoPE 没有位置信息”:因果 mask、递归状态或数据模式都可能让顺序被隐式编码。
|
||||
- “Pre-LN 全面优于 Post-LN”:优化稳定性、表示变化和最终性能是不同维度。
|
||||
- “RMSNorm 就是更快的 LayerNorm”:它去掉 re-centering,数学不变量与实现也不同。
|
||||
- “残差连接保证每层都被使用”:固定单位累加仍可能造成幅值增长和单层贡献稀释。
|
||||
- “FFN 只是无关紧要的两层 MLP”:它通常占大量参数,并可表现出模式/词汇关联。
|
||||
- “SwiGLU 永远最好”:论文只在具体架构、预算与任务上比较。
|
||||
- “K3 的 1M 能力只来自 NoPE”:报告还包含 KDA、长上下文数据、渐进式扩窗与系统并行;不得单因归因。
|
||||
@@ -0,0 +1,391 @@
|
||||
# 第 03 章研究账本:表示、位置与残差高速公路
|
||||
|
||||
> 核验截止:2026-07-29(Asia/Shanghai)
|
||||
>
|
||||
> 证据规则:论文原文、正式会议页、作者/团队官方报告和官方实现进入事实层;本站公式演算、类比和 toy simulator 明标“教学推导”。Grok 只做候选召回,隔离在 `REPRESENTATION_GROK_LEADS.md`。
|
||||
|
||||
## 0. 本章不是“RoPE 名词表”
|
||||
|
||||
本章回答四个彼此耦合的问题:
|
||||
|
||||
1. **表示**:离散 token 怎样变成向量;一个固定向量又怎样变成随上下文、层数不断改写的状态?
|
||||
2. **位置**:内容匹配本身不含顺序时,绝对位置、相对距离、旋转、偏置和隐式状态分别怎样把顺序送进模型?
|
||||
3. **深度**:几十到上百层怎样既保留捷径,又避免幅值增长、梯度失衡和表示稀释?
|
||||
4. **局部非线性**:FFN / GLU 怎样加工每个位置;极端激活为什么会在大规模、低精度和 MoE 中成为系统问题?
|
||||
|
||||
与相邻章节的边界:
|
||||
|
||||
- 第 01 章负责 NPLM、word2vec 与语言模型前史;本章从“token 已选定”继续追踪表示在模型内部的生命史。
|
||||
- 第 02 章给出位置、Norm、Residual、FFN 的最小闭环;本章逐公式拆解并扩展到 DeepSeek / K3。
|
||||
- 第 05 章负责 tokenizer 的数据工程与训练;本章只研究它对表示、参数和计算单位的结构性影响。
|
||||
- 第 07 章负责长上下文算法与真实成本;本章只研究位置几何和长度外推边界。
|
||||
- 第 09 章负责优化器、精度和训练失稳;本章聚焦架构内部的幅值与信息路径。
|
||||
|
||||
## 1. 二十张正式问题账
|
||||
|
||||
| # | 账 | 先问什么 | 最小结论 |
|
||||
|---:|---|---|---|
|
||||
| 01 | 单位账 | 字符、字节、子词、token、patch 谁是模型一步? | Tokenizer 先决定序列长度、词表和边界,再由 embedding 查表。 |
|
||||
| 02 | 参数账 | 词表大一倍只是多一点词吗? | 输入表和输出头常各含 `V×d` 参数;weight tying 会改变这笔账。 |
|
||||
| 03 | 静态表示账 | 同一个 ID 是否永远同义? | 初始 embedding 固定,但进入网络后的 hidden state 随上下文和层而变。 |
|
||||
| 04 | 上下文化账 | 多义性在哪里被展开? | 序列混合和逐位置 FFN 反复改写 token state。 |
|
||||
| 05 | 输出几何账 | 下一个 token 怎样被选出? | hidden state 与输出向量点积生成 logits;向量空间同时是分类接口。 |
|
||||
| 06 | 对称性账 | 没有位置时 Attention 知道先后吗? | 裸 self-attention 对输入排列等变;causal mask 只提供有向可见性。 |
|
||||
| 07 | 绝对位置账 | “第 37 位”怎样进入表示? | learned / sinusoidal vector 可与内容相加,但内容与位置从入口就纠缠。 |
|
||||
| 08 | 相对位置账 | “相距 3”怎样进入匹配? | 相对向量或 bias 直接改变位置对的 attention score / value。 |
|
||||
| 09 | 旋转账 | RoPE 为什么用二维旋转? | 位置 `m,n` 的 Q/K 点积可写成与 `n−m` 有关的相对旋转。 |
|
||||
| 10 | 外推账 | 训练窗外为何会坏? | 新距离改变相位、bias 区间和 attention resolution;可计算不等于会利用。 |
|
||||
| 11 | NoPE 账 | 不显式编码位置是否等于无顺序? | 因果边界、递归衰减和内容统计可隐式编码顺序;机制必须逐模型说明。 |
|
||||
| 12 | 统计账 | Norm 究竟归一化谁? | LayerNorm 控制单 token 特征的均值/方差,RMSNorm只控制 RMS,QK-Norm控制匹配向量。 |
|
||||
| 13 | 拓扑账 | Norm 放在分支前还是相加后? | Pre/Post 改变 identity path、初始化梯度和深度动态。 |
|
||||
| 14 | 幅值账 | Residual 为什么仍会长大? | `x_{l+1}=x_l+f_l` 固定单位累加;分支不为零时尺度通常随深度积累。 |
|
||||
| 15 | 梯度账 | 有捷径为何仍难训练? | 捷径改善可达性,却不自动平衡各层更新、attention logits 和输出幅值。 |
|
||||
| 16 | 稀释账 | 早期层为何会“听不见”? | 所有层固定相加会把单层贡献占比压低;Kimi 把它称为 PreNorm dilution。 |
|
||||
| 17 | 拓宽账 | residual stream 必须只有一条吗? | HC 展开为多条流并学习层间连接;mHC 再约束映射稳定性。 |
|
||||
| 18 | 选择账 | 深度能否像序列一样 attention? | AttnRes 对先前层/块表示做 softmax 选择,而非全用单位权重。 |
|
||||
| 19 | FFN 账 | Attention 后为何还要大 MLP? | Attention 搬运跨 token 信息;FFN 在每个位置做共享非线性特征变换,并占大量参数。 |
|
||||
| 20 | 极值账 | 门控为何也会爆? | SwiGLU 两个乘法因子都可无界;clamp 与 SiTU 用不同方式限制异常值。 |
|
||||
|
||||
## 2. 八次历史转向
|
||||
|
||||
| 时期 | 被解决的瓶颈 | 转向 | 仍留下什么 |
|
||||
|---|---|---|---|
|
||||
| 2003–13 | one-hot 不能共享统计 | 稠密 distributed representation、word2vec | 同一词仍只有一个静态向量 |
|
||||
| 2015–18 | 稀有词、开放词表与多义性 | BPE / SentencePiece + ELMo / BERT 上下文化 | token 边界仍由固定 tokenizer 先决定 |
|
||||
| 2015–17 | 深网退化与序列 batch 统计不便 | ResNet + LayerNorm | fixed residual sum 仍会积累尺度 |
|
||||
| 2018–21 | Attention 缺少顺序 | relative position、Transformer-XL、T5 bias、RoPE、ALiBi | 长度外推不自动成立 |
|
||||
| 2019–22 | Transformer 堆深不稳 | RMSNorm、Pre-LN、ReZero、Admin、NormFormer、DeepNorm | 稳定和表示质量存在张力 |
|
||||
| 2021–24 | 训练窗外的位置分布变了 | xPos、NoPE study、PI、YaRN、FIRE、LongRoPE | 位置修补不等于长程检索能力 |
|
||||
| 2024–26 | 一条 fixed residual stream 成为深度瓶颈 | HC、nGPT、mHC、AttnRes | 更丰富拓扑带来状态/通信/约束成本 |
|
||||
| 2024–26 | 前沿规模下位置与激活要协同设计 | DeepSeek-V2/V4、Kimi Linear/K3 | 结论必须绑定整个架构与训练配方 |
|
||||
|
||||
## 3. 表示:从查表到上下文化状态
|
||||
|
||||
### 3.1 五个常被混成“词向量”的对象
|
||||
|
||||
给 token ID `t`、词表大小 `V`、hidden width `d`:
|
||||
|
||||
1. **ID**:离散整数,本身没有几何。
|
||||
2. **输入 embedding**:`e_t = E[t]`,`E∈R^{V×d}`;这是进入第 0 层的查表结果。
|
||||
3. **hidden state**:`h_t^l`;同一个 ID 在不同句子、位置、层中通常不同。
|
||||
4. **输出向量**:输出矩阵 `W_out∈R^{V×d}` 的一行;`z_v = W_out[v]·h + b_v`。
|
||||
5. **概率**:`p(v|context)=softmax(z)_v`;概率是整个上下文计算的结果,不是 embedding 自带属性。
|
||||
|
||||
Press & Wolf 2016 研究顶层权重矩阵,指出它本身是有效 word embedding,并推荐 input/output weight tying;Inan et al. 2016 从 loss framework 得到相同 tying 方向。共享矩阵减少约 `V×d` 参数,但输入“读向量”与输出“分类”的计算角色仍不同。
|
||||
|
||||
来源:[Output Embedding](https://arxiv.org/abs/1608.05859)、[Tying Word Vectors](https://arxiv.org/abs/1611.01462)。
|
||||
|
||||
### 3.2 静态向量不是终点
|
||||
|
||||
ELMo 把词向量定义为深双向语言模型内部状态的函数,并允许下游任务混合不同层;论文明确以复杂词用法和 polysemy 为动机。BERT 后续把上下文化预训练推到 Transformer encoder。历史转向是:
|
||||
|
||||
`token type → 初始向量 → 句内交互 → 每个 occurrence 的状态`
|
||||
|
||||
来源:[ELMo](https://arxiv.org/abs/1802.05365)、[BERT](https://arxiv.org/abs/1810.04805)。
|
||||
|
||||
### 3.3 Tokenizer 先决定结构成本
|
||||
|
||||
- 固定词表方案:embedding / output head 参数随 `V×d` 增长;序列计算随 token 数增长。
|
||||
- byte-level:去掉固定子词词表依赖,但通常产生更长序列。
|
||||
- BLT 2024 把 byte 按 next-byte entropy 分成动态 patch,让高复杂度区域获得更多计算;论文报告的是特定 FLOP-controlled scaling study,不能泛化为“byte 模型已全面更优”。
|
||||
|
||||
来源:[Byte Latent Transformer](https://arxiv.org/abs/2412.09871)。
|
||||
|
||||
### 3.4 FFN 也是表示系统
|
||||
|
||||
Geva et al. 把 Transformer FFN 分析为 key-value memories:第一层方向与输入文本模式相关,第二层方向诱导输出词表分布;低层偏浅层模式,高层更语义化。这个分析支持“FFN 不只是扩维再缩维”,但不证明每个 neuron 都是一条独立、稳定、可编辑的事实。
|
||||
|
||||
来源:[Transformer Feed-Forward Layers Are Key-Value Memories](https://arxiv.org/abs/2012.14913)。
|
||||
|
||||
## 4. 位置:把排列对称打破到什么程度
|
||||
|
||||
### 4.1 无位置的 self-attention
|
||||
|
||||
若同时对 token 行做同一个排列 `P`,且没有 mask / position:
|
||||
|
||||
`Attn(PX)=P Attn(X)`
|
||||
|
||||
它会跟着输入一起排列,却无法区分“相同内容的不同顺序”。Causal mask 已经打破完全对称:位置 `t` 只能看到前缀 `≤t`,所以 NoPE decoder 并非完全没有顺序信号。但它没有显式给每对 Q/K 一个距离坐标。
|
||||
|
||||
### 4.2 四种主流写法
|
||||
|
||||
1. **absolute add**:`x_t=e_t+p_t`;原始 Transformer 的 fixed sinusoid 与 learned variant 属于此类。
|
||||
2. **relative representation / bias**:score 依赖 `i−j`;Shaw 2018、Transformer-XL、T5 buckets。
|
||||
3. **RoPE**:`q_m=R_m q, k_n=R_n k`,于是 `q_mᵀk_n=qᵀR_{n−m}k`。
|
||||
4. **ALiBi**:`score_{ij}=q_iᵀk_j/√d − m_h(i−j)`;不向 embedding 加位置向量。
|
||||
|
||||
来源:[Transformer](https://proceedings.neurips.cc/paper/7181-attention-is-all-you-need)、[Relative Position](https://aclanthology.org/N18-2074/)、[Transformer-XL](https://aclanthology.org/P19-1285/)、[T5](https://jmlr.org/papers/v21/20-074.html)、[RoFormer](https://arxiv.org/abs/2104.09864)、[ALiBi](https://arxiv.org/abs/2108.12409)。
|
||||
|
||||
### 4.3 RoPE 的最小几何
|
||||
|
||||
对一对维度,把位置 `m` 写成旋转角 `mθ`:
|
||||
|
||||
`R_m=[cos(mθ),−sin(mθ); sin(mθ),cos(mθ)]`
|
||||
|
||||
因为 `R_mᵀR_n=R_{n−m}`,Q/K 点积自然依赖相对位移。不同维度对使用不同频率:高频区分近邻,低频覆盖较长尺度。测试距离越过训练分布时,相位组合、周期和 attention resolution 都可能陌生;“公式可算任意 m”不等于模型学会任意长度。
|
||||
|
||||
### 4.4 长度外推的四条路线
|
||||
|
||||
- xPos 提出 attention resolution,并通过位置设计与 blockwise causal attention 改善外推。
|
||||
- Kazemnejad et al. 在特定 decoder-only reasoning / math tasks 比较 APE、T5 RPE、ALiBi、RoPE 与 NoPE,报告 NoPE 最好;它不是所有语言建模场景的总定律。
|
||||
- Position Interpolation / YaRN 将超长位置映回更熟悉的 RoPE 范围;FIRE 学习相对位置函数并渐进插值。
|
||||
- LongRoPE 搜索不同维度/位置的非均匀插值,并做渐进扩展和短上下文恢复;其 2,048K 是论文模型与训练设定的结果。
|
||||
|
||||
来源:[xPos](https://arxiv.org/abs/2212.10554)、[NoPE study](https://arxiv.org/abs/2305.19466)、[Position Interpolation](https://arxiv.org/abs/2306.15595)、[YaRN](https://arxiv.org/abs/2309.00071)、[FIRE](https://arxiv.org/abs/2310.04418)、[LongRoPE](https://arxiv.org/abs/2402.13753)。
|
||||
|
||||
## 5. Norm:不是“把数字变小”
|
||||
|
||||
### 5.1 三个归一化对象
|
||||
|
||||
对单 token 向量 `x∈R^d`:
|
||||
|
||||
- LayerNorm:`(x−μ)/√(σ²+ε) ⊙ γ + β`,控制均值和方差。
|
||||
- RMSNorm:`x/√(mean(x²)+ε) ⊙ γ`,保留均值方向,只提供 re-scaling invariance。
|
||||
- QK-Norm:先按 attention head 归一化 Q、K,再用可学习 scale 形成 logits;它处理 softmax saturation,不替代整个 block 的 PreNorm。
|
||||
|
||||
来源:[LayerNorm](https://arxiv.org/abs/1607.06450)、[RMSNorm](https://arxiv.org/abs/1910.07467)、[QK-Norm](https://arxiv.org/abs/2010.04245)。
|
||||
|
||||
### 5.2 Pre-LN 与 Post-LN 是拓扑
|
||||
|
||||
- Post-LN:`x_{l+1}=Norm(x_l+F(x_l))`
|
||||
- Pre-LN:`x_{l+1}=x_l+F(Norm(x_l))`
|
||||
|
||||
Pre-LN 的 identity path 不经过 Norm,通常更易优化;Xiong et al. 用 mean-field 分析初始化梯度和 warm-up。代价是所有分支固定相加可能造成 hidden-state growth 与层贡献稀释。NormFormer 在 Pre-LN block 内增加 attention 后 Norm、head-wise scaling 和 FFN 内 Norm,以改善深浅层梯度尺度。
|
||||
|
||||
来源:[Pre-LN analysis](https://arxiv.org/abs/2002.04745)、[Transformers without Tears](https://arxiv.org/abs/1910.05895)、[NormFormer](https://arxiv.org/abs/2110.09456)。
|
||||
|
||||
### 5.3 稳定堆深的谱系
|
||||
|
||||
- Fixup 通过初始化缩放让 residual net 在无 normalization 下稳定。
|
||||
- ReZero 为每条 residual 分支乘零初始化标量,初始网络接近 identity;论文应用到 120-layer Transformer。
|
||||
- Admin 把训练不稳归因于 residual branch 对参数扰动的放大效应,并做适应性初始化。
|
||||
- DeepNorm 修改 residual scale 并配套初始化,报告训练到 1,000 Transformer layers。
|
||||
- nGPT 把 embedding、权重和 hidden state 归一化到 hypersphere;论文的 4–20× steps reduction 依赖其任务和长度设置。
|
||||
|
||||
来源:[Fixup](https://arxiv.org/abs/1901.09321)、[ReZero](https://arxiv.org/abs/2003.04887)、[Admin](https://arxiv.org/abs/2004.08249)、[DeepNet](https://arxiv.org/abs/2203.00555)、[nGPT](https://arxiv.org/abs/2410.01131)。
|
||||
|
||||
## 6. Residual:从固定加法路到可学习深度路由
|
||||
|
||||
### 6.1 成就与盲点
|
||||
|
||||
ResNet 把目标写成 `H(x)=x+F(x)`,让 identity shortcut 提供直接路径。现代 Pre-LN LLM 进一步保持裸 identity path。然而:
|
||||
|
||||
`h_L=h_0+Σ F_l(Norm(h_l))`
|
||||
|
||||
所有分支以固定单位系数进入同一个状态。捷径保证“能到”,不保证“每层被同等听见”,也不控制总幅值。
|
||||
|
||||
来源:[ResNet](https://openaccess.thecvf.com/content_cvpr_2016/html/He_Deep_Residual_Learning_CVPR_2016_paper.html)。
|
||||
|
||||
### 6.2 Hyper-Connections 与 mHC
|
||||
|
||||
HC 把 residual stream 从 `R^d` 扩为 `R^{n×d}`:
|
||||
|
||||
`X_{l+1}=B_l X_l + C_l F_l(A_l X_l)`
|
||||
|
||||
mHC 指出 unconstrained HC 会破坏 residual 的 identity property并导致训练不稳;它把 `B_l` 投影到 doubly stochastic matrices 的 Birkhoff polytope。DeepSeek-V4 报告写明该约束令 `||B_l||₂≤1`、映射 non-expansive,且集合在矩阵乘法下封闭;实现用 Sinkhorn-Knopp 近似投影。这是论文/报告的理论与设计主张,页面不把它写成所有场景的完备稳定性证明。
|
||||
|
||||
来源:[Hyper-Connections](https://arxiv.org/abs/2409.19606)、[mHC](https://arxiv.org/abs/2512.24880)、[DeepSeek-V4](https://arxiv.org/abs/2606.19348)。
|
||||
|
||||
### 6.3 Attention Residuals
|
||||
|
||||
Kimi Team 把“沿序列注意力”移到“沿深度注意力”:
|
||||
|
||||
`α_{i→l}=exp(q_lᵀ RMSNorm(k_i)) / Σ_j exp(q_lᵀ RMSNorm(k_j))`
|
||||
|
||||
`h_l=Σ_i α_{i→l}v_i`
|
||||
|
||||
Block AttnRes 先把层分块,每块内部累加,再只在 block representations 上做 depth attention,把存储/通信从 `O(Ld)` 降到 `O(Nd)`。独立报告使用 48B total / 3B active、1.4T tokens 验证;K3 则把方案放进更大完整系统。
|
||||
|
||||
K3 的具体配置:93 backbone layers;按 12 层划成 8 个 layer blocks(7 个完整 12 层 block + 1 个 partial block),embedding 另作一个 source,因此共有 9 个 block-level depth sources。这里纠正早期草案里“block size 2”的误读。
|
||||
|
||||
来源:[Attention Residuals](https://arxiv.org/abs/2603.15031)、[Kimi K3](https://arxiv.org/abs/2607.24653),本地证据 `research/sources/kimi-k3/k3_tech_report.txt:373-425`。
|
||||
|
||||
## 7. 激活与 FFN:从选择性通过到有界门控
|
||||
|
||||
### 7.1 公式谱系
|
||||
|
||||
- ReLU:`max(0,x)`。
|
||||
- GELU:`x Φ(x)`。
|
||||
- GLU:`(xW+b) ⊙ σ(xV+c)`。
|
||||
- Swish / SiLU:`x σ(βx)`。
|
||||
- SwiGLU:`Swish(xW_g) ⊙ (xW_u)`;两个乘法因子都可无界。
|
||||
|
||||
来源:[GELU](https://arxiv.org/abs/1606.08415)、[GLU](https://arxiv.org/abs/1612.08083)、[Swish](https://arxiv.org/abs/1710.05941)、[GLU Variants](https://arxiv.org/abs/2002.05202)、[LLaMA](https://arxiv.org/abs/2302.13971)。
|
||||
|
||||
### 7.2 DeepSeek-V4:clamp 两条分支
|
||||
|
||||
V4 报告称训练中把 SwiGLU linear component clamp 到 `[-10,10]`,gate component 只把上界 cap 为 `10`,并报告消除 outliers、帮助稳定且未损害性能。它是作者在 V4 设置中的经验报告,不是一般数学保证。
|
||||
|
||||
本地证据:`research/sources/long-context/2606.19348.txt:1483-1493`。
|
||||
|
||||
### 7.3 K3:SiTU-GLU 的平滑上界
|
||||
|
||||
K3 Stable LatentMoE 在 routed experts 聚合后、up projection 前加入 RMSNorm,并定义:
|
||||
|
||||
`SiTU-GLU(x)=β₁ tanh(W_gx/β₁) ⊙ Sigmoid(W_gx) ⊙ β₂ tanh(W_ux/β₂)`
|
||||
|
||||
报告使用 `β₁=4, β₂=25`,所以输出逐点绝对值严格小于 `β₁β₂=100`。在原点附近一阶近似 SwiGLU,`β→∞` 时逐点恢复;相较 hard clamp,tanh cap 在饱和区仍有非零但很小的梯度。函数上界不等于整个网络 activation / loss 有界。
|
||||
|
||||
本地证据:`research/sources/kimi-k3/k3_tech_report.txt:458-505,2700-2815`。
|
||||
|
||||
## 8. DeepSeek 重点谱系
|
||||
|
||||
### 8.1 DeepSeek LLM / V3:现代基线配方
|
||||
|
||||
- DeepSeek LLM 使用 Pre-Norm RMSNorm、SwiGLU 和 RoPE。
|
||||
- V3 在 compressed latent vectors 后加入额外 RMSNorm;不能把 latent Norm 与 block PreNorm 混成一个位置。
|
||||
|
||||
来源:[DeepSeek LLM](https://arxiv.org/abs/2401.02954)、[DeepSeek-V3](https://arxiv.org/abs/2412.19437)。
|
||||
|
||||
### 8.2 DeepSeek-V2:把内容与位置拆开缓存
|
||||
|
||||
MLA 想把 content K/V 压入 latent 并把 up-projection 吸收到 query 侧;若把 RoPE 直接夹在 key up-projection 中,位置相关旋转阻止矩阵吸收。V2 因而增加独立 multi-head RoPE query 和 shared RoPE key,再与 content Q/K 拼接。它是 **decoupled RoPE**,不是 NoPE。
|
||||
|
||||
本地证据:`research/sources/long-context/2405.04434.txt:350-395`。
|
||||
|
||||
### 8.3 DeepSeek-V4:四件事一起看
|
||||
|
||||
1. mHC 把 residual width 扩为 4,并约束 depth mixing。
|
||||
2. CSA / HCA 的 query head 与 compressed KV entry 分别做额外 RMSNorm。
|
||||
3. Q、KV 和 core attention output 的最后 64 维使用 partial RoPE;output 再用负位置旋转恢复相对位置含义。
|
||||
4. SwiGLU 两条分支使用非对称 clamp。
|
||||
|
||||
本地证据:`research/sources/long-context/2606.19348.txt:355-432,715-747,1483-1493`。
|
||||
|
||||
## 9. Kimi K3 逐节复原
|
||||
|
||||
### 9.1 NoPE 不是删除顺序
|
||||
|
||||
- K3 以 3 个 KDA + 1 个 Gated MLA 的比例构成 hybrid backbone。
|
||||
- 所有 MLA layers 不给 Q/K 施加显式 position encoding。
|
||||
- KDA 的 channel-wise recurrent gate / decay 提供 position-sensitive、recency-aware sequence mixing。
|
||||
- 报告因此不需要在扩窗时修改 RoPE base 或 YaRN 参数。
|
||||
|
||||
报告称模型能直接外推到 1M,但同一 §3.4 还明确使用 long-context cleaning/synthesis、8K→64K→256K→1M 的渐进课程和序列并行。不得写成“NoPE 单独造出 1M”。
|
||||
|
||||
本地证据:`research/sources/kimi-k3/k3_tech_report.txt:352-370,780-811`。
|
||||
|
||||
### 9.2 Block AttnRes 是深度轴的选择器
|
||||
|
||||
- `RMSNorm(k)` 防止大幅值层仅凭尺度支配 softmax。
|
||||
- Full 形式 arithmetic `O(L²d)` 在不足百层仍可接受,真正问题是保存所有层输出的 `O(Ld)` memory / pipeline communication。
|
||||
- K3 的 Block 形式把 93 层按 12 层划块,降低到 `O(Nd)`。
|
||||
|
||||
### 9.3 Stable LatentMoE 是表示幅值控制
|
||||
|
||||
- routed experts 先在 latent space 聚合,再上投影回 full width;
|
||||
- 额外 RMSNorm 控制 routed latent variation;
|
||||
- SiTU-GLU 给乘法门控输出明确的 smooth bound;
|
||||
- 两项与 MoE 路由、通信优化一起构成 Stable LatentMoE,不能只摘一个公式解释整套训练收益。
|
||||
|
||||
## 10. 四联交互实验合同
|
||||
|
||||
### Lab A / Token 与表示
|
||||
|
||||
输入:文本预设、token unit(word/subword/byte)、`V`、`d`、weight tying、上下文开关。
|
||||
|
||||
输出:toy token sequence、tokens/characters、embedding/head 参数、同一 token 的 base/context states。明标不是任何真实 tokenizer / checkpoint。
|
||||
|
||||
### Lab B / 位置几何
|
||||
|
||||
输入:scheme(absolute/RoPE/ALiBi/NoPE)、位置 `i,j`、训练长度、RoPE base / ALiBi slope。
|
||||
|
||||
输出:relative distance、2D Q/K 旋转图、dot similarity、train-window / extrapolation 状态。NoPE 只表示“没有显式项”。
|
||||
|
||||
### Lab C / Norm 与深度
|
||||
|
||||
输入:topology(Post-LN/Pre-LN/RMS-Pre/QK+RMS)、depth、branch scale、attention logit scale。
|
||||
|
||||
输出:toy residual magnitude、identity gradient path、softmax peak / saturation。曲线不是训练预测器。
|
||||
|
||||
### Lab D / Residual 与 FFN
|
||||
|
||||
输入:residual route(plain/HC/mHC/AttnRes)、depth source scores、activation(GELU/SwiGLU/V4 clamp/SiTU)、input range。
|
||||
|
||||
输出:depth weights/path、memory-state count、activation response、最大绝对输出与理论上界;K3 preset 用 `β₁=4,β₂=25`。
|
||||
|
||||
共同验收:四 tabs / panels 一一对应,ARIA 与左右方向键可用;1440px / 390px 无横向溢出;控件变化更新数值与解释;公式事实、作者报告、本站推导不可混用。
|
||||
|
||||
## 11. 正式论文链(66 个教学节点)
|
||||
|
||||
| # | 年 | 节点 | 主账 | 一句话位置 |
|
||||
|---:|---:|---|---|---|
|
||||
| 01 | 2003 | Neural Probabilistic LM | 表示 | 离散词变成共同学习的连续向量。 |
|
||||
| 02 | 2013 | word2vec | 表示 | 高效学习静态分布式表示。 |
|
||||
| 03 | 2015 | BatchNorm | Norm | 跨 batch 统计的归一化前史。 |
|
||||
| 04 | 2015 | ResNet | 深度 | identity shortcut 让残差学习成为主干。 |
|
||||
| 05 | 2015 | BPE for NMT | Token | 以子词处理开放词表与稀有词。 |
|
||||
| 06 | 2016 | LayerNorm | Norm | 单样本内按特征归一化。 |
|
||||
| 07 | 2016 | Output Embedding | 表示 | 输出 classifier 也是 embedding,可与输入表共享。 |
|
||||
| 08 | 2016 | Tying Word Vectors | 表示 | 从 loss framework 推导 weight tying。 |
|
||||
| 09 | 2016 | GELU | FFN | 平滑、输入相关的激活。 |
|
||||
| 10 | 2016 | GLU | FFN | 内容分支乘 sigmoid gate。 |
|
||||
| 11 | 2017 | Transformer | 位置/深度 | sinusoid + Post-LN residual 的原始组合。 |
|
||||
| 12 | 2017 | Swish | FFN | `x·sigmoid(βx)` 的平滑非单调激活。 |
|
||||
| 13 | 2018 | SentencePiece | Token | 从原始句子训练语言无关子词模型。 |
|
||||
| 14 | 2018 | ELMo | 上下文化 | occurrence 表示来自深双向 LM 内部状态。 |
|
||||
| 15 | 2018 | Relative Position | 位置 | 相对距离进入 self-attention。 |
|
||||
| 16 | 2018 | BERT | 上下文化 | 深双向 Transformer 表示成为迁移接口。 |
|
||||
| 17 | 2019 | Transformer-XL | 位置 | segment recurrence 与相对位置。 |
|
||||
| 18 | 2019 | Fixup | 深度 | 用初始化而非 Norm 控制 residual 更新。 |
|
||||
| 19 | 2019 | RMSNorm | Norm | 去 re-centering,只按 RMS 缩放。 |
|
||||
| 20 | 2019 | T5 | 位置 | bucketed relative position bias。 |
|
||||
| 21 | 2019 | ScaleNorm / FixNorm | Norm | 以固定范数和单一 scale 简化归一化。 |
|
||||
| 22 | 2020 | Pre-LN analysis | 拓扑 | Norm 位置改变初始化梯度与 warm-up。 |
|
||||
| 23 | 2020 | GLU Variants | FFN | GEGLU / SwiGLU 进入 Transformer FFN。 |
|
||||
| 24 | 2020 | ReZero | 深度 | 零初始化 residual gate,从 identity 开始。 |
|
||||
| 25 | 2020 | Admin | 深度 | 控制 residual 对参数扰动的放大。 |
|
||||
| 26 | 2020 | QK-Norm | Norm | 限制 Q/K 匹配尺度和 softmax 饱和。 |
|
||||
| 27 | 2020 | FFN as Memories | 表示 | FFN 方向关联输入模式与词表。 |
|
||||
| 28 | 2021 | RoPE | 位置 | 绝对旋转形成相对点积。 |
|
||||
| 29 | 2021 | ALiBi | 位置 | attention logit 加距离惩罚。 |
|
||||
| 30 | 2021 | NormFormer | Norm | 在 Pre-LN 内补充归一化和平衡梯度。 |
|
||||
| 31 | 2021 | Primer | FFN | squared ReLU 与 depthwise QKV conv。 |
|
||||
| 32 | 2021 | ByT5 | Token | token-free byte-to-byte 预训练。 |
|
||||
| 33 | 2021 | CANINE | Token | 无显式 tokenizer 的字符级 encoder。 |
|
||||
| 34 | 2021 | Charformer | Token | 学习软子词块。 |
|
||||
| 35 | 2022 | DeepNet | 深度 | DeepNorm 与初始化堆至 1,000 层。 |
|
||||
| 36 | 2022 | xPos | 位置 | attention resolution 与长度外推。 |
|
||||
| 37 | 2023 | LLaMA | 现代配方 | RMSNorm + SwiGLU + RoPE。 |
|
||||
| 38 | 2023 | NoPE length study | 位置 | 在特定推理任务比较五类位置方案。 |
|
||||
| 39 | 2023 | Position Interpolation | 位置 | 把新位置压回训练过的范围。 |
|
||||
| 40 | 2023 | YaRN | 位置 | 频率分区、温度与高效扩窗。 |
|
||||
| 41 | 2023 | FIRE | 位置 | 可学习相对位置函数与渐进插值。 |
|
||||
| 42 | 2024 | LongRoPE | 位置 | 搜索非均匀插值并渐进扩展。 |
|
||||
| 43 | 2024 | DeepSeek LLM | DeepSeek | Pre-Norm RMSNorm、SwiGLU、RoPE。 |
|
||||
| 44 | 2024 | DeepSeek-V2 | DeepSeek | MLA 用 decoupled RoPE。 |
|
||||
| 45 | 2024 | DeepSeek-V3 | DeepSeek | latent Norm 与现代 MoE 配方。 |
|
||||
| 46 | 2024 | Hyper-Connections | 深度 | 扩宽 residual stream、学习层间映射。 |
|
||||
| 47 | 2024 | nGPT | Norm/表示 | 表示与权重在 hypersphere 上学习。 |
|
||||
| 48 | 2024 | Byte Latent Transformer | Token | 以 entropy 动态组成 byte patches。 |
|
||||
| 49 | 2025 | Kimi Linear | Kimi | KDA 隐式位置 + MLA NoPE。 |
|
||||
| 50 | 2025 | DeepSeek-V3.2 | DeepSeek | 稀疏注意力继续协同位置路径。 |
|
||||
| 51 | 2025 | mHC | DeepSeek | 用流形约束 HC 稳定性。 |
|
||||
| 52 | 2026 | Attention Residuals | Kimi | 在深度维选择先前层/块。 |
|
||||
| 53 | 2026 | DeepSeek-V4 | DeepSeek | mHC + partial RoPE + Q/KV Norm + clamp。 |
|
||||
| 54 | 2026 | Kimi K3 | Kimi | NoPE hybrid + Block AttnRes + SiTU-GLU。 |
|
||||
| 55 | 2018 | GPT-1 | 上下文化 | causal decoder 状态成为迁移表示。 |
|
||||
| 56 | 2019 | BERT pipeline analysis | 表示 | 不同层呈现不同语言信息探针。 |
|
||||
| 57 | 2019 | Contextual Representations | 表示 | 线性 probe 做分层语言知识分析。 |
|
||||
| 58 | 2020 | DeBERTa | 位置 | 内容与位置向量解耦进 attention。 |
|
||||
| 59 | 2022 | PaLM | FFN | 大规模 decoder 采用 SwiGLU。 |
|
||||
| 60 | 2022 | OPT | 深度 | Pre-LN decoder 的公开复现坐标。 |
|
||||
| 61 | 2023 | LLaMA 2 | 现代配方 | 延续 RoPE/RMSNorm/SwiGLU。 |
|
||||
| 62 | 2023 | OLMo studies | 稳定 | QK-Norm 等规模稳定性证据。 |
|
||||
| 63 | 2024 | Gemma 2 | Norm | pre/post Norm 与 logit soft-cap。 |
|
||||
| 64 | 2024 | Massive Activations | 极值 | LLM 隐状态异常大激活的系统观察。 |
|
||||
| 65 | 2025 | Kimi K2 | Kimi | MLA、RMSNorm 与 MuonClip 的前代。 |
|
||||
| 66 | 2026 | Stable LatentMoE | Kimi | K3 把 Norm 和有界 GLU 放入专家路径。 |
|
||||
|
||||
## 12. 写作与证据禁区
|
||||
|
||||
1. 不把 toy simulator 曲线写成真实模型的 loss / gradient 预测。
|
||||
2. 不把 probing 可读模式写成因果、唯一、稳定的 neuron 功能。
|
||||
3. 不把“理论上可表示位置”写成“SGD 一定学到位置”。
|
||||
4. 不把短→长 perplexity 外推等同于 1M retrieval 或 Agent 长轨迹。
|
||||
5. 不把 RMSNorm、QK-Norm、latent Norm 视为同一插槽。
|
||||
6. 不把 mHC 和 AttnRes 排成单一优劣榜。
|
||||
7. 不把 V4 clamping 的经验结论写成一般定理。
|
||||
8. 不把 SiTU 的函数上界直接等同于整个网络 activation / loss 有界。
|
||||
9. 不把 K3 的 1M 上下文单因归给 NoPE。
|
||||
10. DeepSeek/Kimi 的效率、质量和稳定性数字全部保留作者自报、模型、训练与基线边界。
|
||||
@@ -80,3 +80,15 @@ DeepSeek-VL/VL2、Janus、OCR 三分支,Kimi 三代 MoonViT、十六张问题
|
||||
未影响文本核验。二十二张测量账、80 节点阅读链、DeepSeek/K3 协议谱系、四实验合同与证据边界见
|
||||
`../EVALUATION_SAFETY_RESEARCH.md`。Grok Headless 仅生成教学问题和候选线索,永久隔离在
|
||||
`../EVALUATION_SAFETY_GROK_LEADS.md`,不能作为正式事实来源。
|
||||
|
||||
表示、位置与残差首轮缓存位于 `representation/`(不提交 PDF/TXT/XML):
|
||||
|
||||
- 表示与 token:output embedding / weight tying、ELMo、FFN memories 与 Byte Latent Transformer;
|
||||
- 位置与外推:RoPE、ALiBi、xPos、NoPE study、Position Interpolation、YaRN、FIRE 与 LongRoPE;
|
||||
- 归一化与深度:LayerNorm、RMSNorm、Pre-LN、Fixup、ReZero、Admin、QK-Norm、NormFormer、DeepNet 与 nGPT;
|
||||
- 深度路由与激活:Hyper-Connections、mHC、Attention Residuals、GLU / SwiGLU;
|
||||
- DeepSeek-V2/V3/V4 与 Kimi Linear/K3 复用 `long-context/`、`moe/`、`numerics/` 和 `kimi-k3/` 的官方报告缓存。
|
||||
|
||||
二十张问题账、66 节点阅读链、DeepSeek / Kimi 对照、公式边界与四实验合同见
|
||||
`../REPRESENTATION_RESEARCH.md`。Grok Headless 只扩展候选召回,未核验线索永久隔离在
|
||||
`../REPRESENTATION_GROK_LEADS.md`,不得直接作为正文证据。
|
||||
|
||||
Reference in New Issue
Block a user