feat: publish representation and depth chapter

This commit is contained in:
wuyang
2026-07-29 10:32:33 +08:00
parent a9afa12c7c
commit a2c9298d35
28 changed files with 2960 additions and 51 deletions
+136
View File
@@ -0,0 +1,136 @@
# 表示、位置与残差:Grok 候选线索
> 状态:**UNVERIFIED / 未核验发现队列,不是正式证据。**
>
> 生成方式:2026-07-29 使用本机 Grok CLI Headless(禁用子代理)扩展候选召回。Grok 的作用仅是提出“还应查什么”;正文中的事实、数字、年份、公式和优先级都必须重新回到论文原文、正式会议页或官方技术报告。
## 1. Grok 建议的二十张问题账
1. 表示与参数:token ID、embedding、hidden state、logit、概率各是什么,为什么不能混称“词向量”?
2. 静态词向量:同一个词只有一个向量时,多义性和上下文差异怎样被压扁?
3. 上下文化:ELMo、BERT 与自回归 LLM 怎样把“词典条目”变成“此刻的状态”?
4. 输入与输出空间:为什么输入 embedding 与输出 classifier 可以共享参数?
5. Tokenizer:词、子词、字符、字节与动态 patch 分别把什么成本写进序列长度和词表?
6. 绝对位置:为什么把位置向量加到 token embedding 能破坏 Attention 的置换对称?
7. 相对位置:为什么语言规律往往更关心“相隔几步”而非“绝对第几位”?
8. RoPE:二维旋转怎样让 Q·K 只通过相对角度看到位移?
9. ALiBi / relative bias:把距离写进 logit 和写进向量有什么不同?
10. NoPE:没有显式位置向量是否真的等于模型不知道顺序?
11. 长度外推:训练长度外的新相位、距离和注意力分辨率为什么会失真?
12. 归一化对象:LayerNorm、RMSNorm、QK-Norm 分别控制哪一个量?
13. Norm 位置:Post-LN、Pre-LN 与 sandwich norm 怎样改变捷径和梯度?
14. 深度退化:信息能通过捷径不等于每一层贡献不会被稀释。
15. 残差缩放:初始化、门控、DeepNorm 怎样控制累计更新的量级?
16. 残差宽度:Hyper-Connections 为什么把一条 residual stream 展开成多条?
17. 残差选择:AttnRes 为什么把“固定相加”改成“沿深度做注意力”?
18. 激活谱系:ReLU、GELU、GLU、SwiGLU 的非线性与乘法门控分别在做什么?
19. FFN 记忆:为什么逐 token 的 FFN 仍可承载大量模式和事实关联?
20. 极值稳定:DeepSeek-V4 的 clamping 与 K3 的 SiTU-GLU 分别怎样限制异常激活?
## 2. 候选历史波次
| 波次 | Grok 提议的主问题 | 候选锚点 |
|---|---|---|
| 1986–2013 | 离散符号怎样进入可学习几何? | distributed representation、word2vec、BPE |
| 2014–2018 | 同一符号怎样随上下文改变? | Seq2Seq、ELMo、BERT |
| 2015–2017 | 深网怎样先“走得通”? | BatchNorm、ResNet、LayerNorm、Transformer |
| 2018–2021 | 顺序怎样进入 Attention? | relative position、Transformer-XL、T5 bias、RoPE、ALiBi |
| 2019–2022 | Transformer 怎样稳定堆深? | RMSNorm、Pre-LN、Fixup、ReZero、Admin、NormFormer、DeepNet |
| 2021–2024 | 位置怎样跨出训练窗口? | xPos、NoPE study、Position Interpolation、YaRN、FIRE、LongRoPE |
| 2024–2026 | residual stream 能否从一条路变成可学习拓扑? | Hyper-Connections、nGPT、mHC、AttnRes |
| 2024–2026 | 位置、残差与激活怎样成为前沿模型系统设计? | DeepSeek-V2/V4、Kimi Linear/K3 |
## 3. 候选论文池
### Token、embedding 与上下文化
- Bengio et al. — *A Neural Probabilistic Language Model*
- Mikolov et al. — *Efficient Estimation of Word Representations in Vector Space*
- Sennrich et al. — *Neural Machine Translation of Rare Words with Subword Units*
- Kudo & Richardson — *SentencePiece*
- Press & Wolf — *Using the Output Embedding to Improve Language Models*
- Inan et al. — *Tying Word Vectors and Word Classifiers*
- Peters et al. — *Deep contextualized word representations*
- Devlin et al. — BERT
- Geva et al. — *Transformer Feed-Forward Layers Are Key-Value Memories*
- Clark et al. — CANINE
- Xue et al. — ByT5
- Tay et al. — Charformer
- Pagnoni et al. — Byte Latent Transformer
### 位置与长度外推
- Vaswani et al. — sinusoidal absolute position
- Shaw et al. — relative position representations
- Dai et al. — Transformer-XL
- Raffel et al. — T5 relative position buckets
- Su et al. — RoFormer / RoPE
- Press et al. — ALiBi
- Sun et al. — xPos / Length-Extrapolatable Transformer
- Kazemnejad et al. — NoPE length-generalization study
- Chen et al. — Position Interpolation
- Peng et al. — YaRN
- Li et al. — FIRE
- Ding et al. — LongRoPE
### 归一化、深度与 residual stream
- Ioffe & Szegedy — BatchNorm
- He et al. — ResNet
- Ba et al. — LayerNorm
- Zhang & Sennrich — RMSNorm
- Nguyen & Salazar — ScaleNorm / FixNorm / PreNorm
- Zhang et al. — Fixup
- Xiong et al. — Pre-LN / Post-LN analysis
- Bachlechner et al. — ReZero
- Liu et al. — Admin
- Henry et al. — QK-Norm
- Shleifer et al. — NormFormer
- Wang et al. — DeepNet / DeepNorm
- Zhu et al. — Hyper-Connections
- Loshchilov et al. — nGPT
- Xie et al. — mHC
- Kimi Team — Attention Residuals
### 激活与 FFN
- Nair & Hinton — ReLU
- Hendrycks & Gimpel — GELU
- Dauphin et al. — GLU
- Ramachandran et al. — Swish
- Shazeer — GLU Variants / SwiGLU
- Geva et al. — FFN as key-value memories
- So et al. — Primer / squared ReLU
- LLaMA — RMSNorm + SwiGLU 的现代配方
- DeepSeek-V4 — SwiGLU clamping
- Kimi K3 — SiTU-GLU
### DeepSeek / Kimi 重点候选
- DeepSeek-V2:MLA 的 decoupled RoPE
- DeepSeek-V3:RMSNorm、SwiGLU 与 latent normalization
- DeepSeek-V3.2:稀疏索引与 MLA 中的位置路径
- DeepSeek-V4:mHC、partial RoPE、head-wise Q/KV RMSNorm、SwiGLU clamping
- Kimi Linear:混合 KDA / MLA 与 NoPE
- Attention Residuals:Full / Block AttnRes
- Kimi K3:KDA 隐式顺序、MLA NoPE、Block AttnRes、SiTU-GLU
## 4. Grok 提出的四个交互实验草案
1. **Token / 表示工作台**:切换词、子词、字节,观察序列长度、词表参数、输入/输出权重共享,以及同一 token 在不同上下文中的状态。
2. **位置几何台**:拖动两个位置,比较 absolute、relative bias、RoPE、ALiBi、NoPE 在训练窗内外怎样改变相似度。
3. **Norm / 深度台**:切换 Post-LN、Pre-LN、RMSNorm、QK-Norm,观察 toy residual scale、gradient path 与 logit saturation。
4. **Residual / FFN 台**:切换 plain residual、HC、mHC、AttnRes,并比较 GELU、SwiGLU、clamp、SiTU 对极值的响应。
## 5. 永久不得直接进入事实层的表述
- “embedding 就是模型的知识”:embedding 只是输入/输出接口的一部分,深层状态和参数共同构成模型行为。
- “一个 token 对应一个词”:子词、字符、字节和多模态 token 都反例明显。
- “RoPE 天然支持无限长度”:训练窗外相位分布与注意力分辨率仍可能失真。
- “NoPE 没有位置信息”:因果 mask、递归状态或数据模式都可能让顺序被隐式编码。
- “Pre-LN 全面优于 Post-LN”:优化稳定性、表示变化和最终性能是不同维度。
- “RMSNorm 就是更快的 LayerNorm”:它去掉 re-centering,数学不变量与实现也不同。
- “残差连接保证每层都被使用”:固定单位累加仍可能造成幅值增长和单层贡献稀释。
- “FFN 只是无关紧要的两层 MLP”:它通常占大量参数,并可表现出模式/词汇关联。
- “SwiGLU 永远最好”:论文只在具体架构、预算与任务上比较。
- “K3 的 1M 能力只来自 NoPE”:报告还包含 KDA、长上下文数据、渐进式扩窗与系统并行;不得单因归因。