Files
llm-atlas/research/REPRESENTATION_GROK_LEADS.md

137 lines
7.5 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 表示、位置与残差:Grok 候选线索
> 状态:**UNVERIFIED / 未核验发现队列,不是正式证据。**
>
> 生成方式:2026-07-29 使用本机 Grok CLI Headless(禁用子代理)扩展候选召回。Grok 的作用仅是提出“还应查什么”;正文中的事实、数字、年份、公式和优先级都必须重新回到论文原文、正式会议页或官方技术报告。
## 1. Grok 建议的二十张问题账
1. 表示与参数:token ID、embedding、hidden state、logit、概率各是什么,为什么不能混称“词向量”?
2. 静态词向量:同一个词只有一个向量时,多义性和上下文差异怎样被压扁?
3. 上下文化:ELMo、BERT 与自回归 LLM 怎样把“词典条目”变成“此刻的状态”?
4. 输入与输出空间:为什么输入 embedding 与输出 classifier 可以共享参数?
5. Tokenizer:词、子词、字符、字节与动态 patch 分别把什么成本写进序列长度和词表?
6. 绝对位置:为什么把位置向量加到 token embedding 能破坏 Attention 的置换对称?
7. 相对位置:为什么语言规律往往更关心“相隔几步”而非“绝对第几位”?
8. RoPE:二维旋转怎样让 Q·K 只通过相对角度看到位移?
9. ALiBi / relative bias:把距离写进 logit 和写进向量有什么不同?
10. NoPE:没有显式位置向量是否真的等于模型不知道顺序?
11. 长度外推:训练长度外的新相位、距离和注意力分辨率为什么会失真?
12. 归一化对象:LayerNorm、RMSNorm、QK-Norm 分别控制哪一个量?
13. Norm 位置:Post-LN、Pre-LN 与 sandwich norm 怎样改变捷径和梯度?
14. 深度退化:信息能通过捷径不等于每一层贡献不会被稀释。
15. 残差缩放:初始化、门控、DeepNorm 怎样控制累计更新的量级?
16. 残差宽度:Hyper-Connections 为什么把一条 residual stream 展开成多条?
17. 残差选择:AttnRes 为什么把“固定相加”改成“沿深度做注意力”?
18. 激活谱系:ReLU、GELU、GLU、SwiGLU 的非线性与乘法门控分别在做什么?
19. FFN 记忆:为什么逐 token 的 FFN 仍可承载大量模式和事实关联?
20. 极值稳定:DeepSeek-V4 的 clamping 与 K3 的 SiTU-GLU 分别怎样限制异常激活?
## 2. 候选历史波次
| 波次 | Grok 提议的主问题 | 候选锚点 |
|---|---|---|
| 1986–2013 | 离散符号怎样进入可学习几何? | distributed representation、word2vec、BPE |
| 2014–2018 | 同一符号怎样随上下文改变? | Seq2Seq、ELMo、BERT |
| 2015–2017 | 深网怎样先“走得通”? | BatchNorm、ResNet、LayerNorm、Transformer |
| 2018–2021 | 顺序怎样进入 Attention? | relative position、Transformer-XL、T5 bias、RoPE、ALiBi |
| 2019–2022 | Transformer 怎样稳定堆深? | RMSNorm、Pre-LN、Fixup、ReZero、Admin、NormFormer、DeepNet |
| 2021–2024 | 位置怎样跨出训练窗口? | xPos、NoPE study、Position Interpolation、YaRN、FIRE、LongRoPE |
| 2024–2026 | residual stream 能否从一条路变成可学习拓扑? | Hyper-Connections、nGPT、mHC、AttnRes |
| 2024–2026 | 位置、残差与激活怎样成为前沿模型系统设计? | DeepSeek-V2/V4、Kimi Linear/K3 |
## 3. 候选论文池
### Token、embedding 与上下文化
- Bengio et al. — *A Neural Probabilistic Language Model*
- Mikolov et al. — *Efficient Estimation of Word Representations in Vector Space*
- Sennrich et al. — *Neural Machine Translation of Rare Words with Subword Units*
- Kudo & Richardson — *SentencePiece*
- Press & Wolf — *Using the Output Embedding to Improve Language Models*
- Inan et al. — *Tying Word Vectors and Word Classifiers*
- Peters et al. — *Deep contextualized word representations*
- Devlin et al. — BERT
- Geva et al. — *Transformer Feed-Forward Layers Are Key-Value Memories*
- Clark et al. — CANINE
- Xue et al. — ByT5
- Tay et al. — Charformer
- Pagnoni et al. — Byte Latent Transformer
### 位置与长度外推
- Vaswani et al. — sinusoidal absolute position
- Shaw et al. — relative position representations
- Dai et al. — Transformer-XL
- Raffel et al. — T5 relative position buckets
- Su et al. — RoFormer / RoPE
- Press et al. — ALiBi
- Sun et al. — xPos / Length-Extrapolatable Transformer
- Kazemnejad et al. — NoPE length-generalization study
- Chen et al. — Position Interpolation
- Peng et al. — YaRN
- Li et al. — FIRE
- Ding et al. — LongRoPE
### 归一化、深度与 residual stream
- Ioffe & Szegedy — BatchNorm
- He et al. — ResNet
- Ba et al. — LayerNorm
- Zhang & Sennrich — RMSNorm
- Nguyen & Salazar — ScaleNorm / FixNorm / PreNorm
- Zhang et al. — Fixup
- Xiong et al. — Pre-LN / Post-LN analysis
- Bachlechner et al. — ReZero
- Liu et al. — Admin
- Henry et al. — QK-Norm
- Shleifer et al. — NormFormer
- Wang et al. — DeepNet / DeepNorm
- Zhu et al. — Hyper-Connections
- Loshchilov et al. — nGPT
- Xie et al. — mHC
- Kimi Team — Attention Residuals
### 激活与 FFN
- Nair & Hinton — ReLU
- Hendrycks & Gimpel — GELU
- Dauphin et al. — GLU
- Ramachandran et al. — Swish
- Shazeer — GLU Variants / SwiGLU
- Geva et al. — FFN as key-value memories
- So et al. — Primer / squared ReLU
- LLaMA — RMSNorm + SwiGLU 的现代配方
- DeepSeek-V4 — SwiGLU clamping
- Kimi K3 — SiTU-GLU
### DeepSeek / Kimi 重点候选
- DeepSeek-V2:MLA 的 decoupled RoPE
- DeepSeek-V3:RMSNorm、SwiGLU 与 latent normalization
- DeepSeek-V3.2:稀疏索引与 MLA 中的位置路径
- DeepSeek-V4:mHC、partial RoPE、head-wise Q/KV RMSNorm、SwiGLU clamping
- Kimi Linear:混合 KDA / MLA 与 NoPE
- Attention Residuals:Full / Block AttnRes
- Kimi K3:KDA 隐式顺序、MLA NoPE、Block AttnRes、SiTU-GLU
## 4. Grok 提出的四个交互实验草案
1. **Token / 表示工作台**:切换词、子词、字节,观察序列长度、词表参数、输入/输出权重共享,以及同一 token 在不同上下文中的状态。
2. **位置几何台**:拖动两个位置,比较 absolute、relative bias、RoPE、ALiBi、NoPE 在训练窗内外怎样改变相似度。
3. **Norm / 深度台**:切换 Post-LN、Pre-LN、RMSNorm、QK-Norm,观察 toy residual scale、gradient path 与 logit saturation。
4. **Residual / FFN 台**:切换 plain residual、HC、mHC、AttnRes,并比较 GELU、SwiGLU、clamp、SiTU 对极值的响应。
## 5. 永久不得直接进入事实层的表述
- “embedding 就是模型的知识”:embedding 只是输入/输出接口的一部分,深层状态和参数共同构成模型行为。
- “一个 token 对应一个词”:子词、字符、字节和多模态 token 都反例明显。
- “RoPE 天然支持无限长度”:训练窗外相位分布与注意力分辨率仍可能失真。
- “NoPE 没有位置信息”:因果 mask、递归状态或数据模式都可能让顺序被隐式编码。
- “Pre-LN 全面优于 Post-LN”:优化稳定性、表示变化和最终性能是不同维度。
- “RMSNorm 就是更快的 LayerNorm”:它去掉 re-centering,数学不变量与实现也不同。
- “残差连接保证每层都被使用”:固定单位累加仍可能造成幅值增长和单层贡献稀释。
- “FFN 只是无关紧要的两层 MLP”:它通常占大量参数,并可表现出模式/词汇关联。
- “SwiGLU 永远最好”:论文只在具体架构、预算与任务上比较。
- “K3 的 1M 能力只来自 NoPE”:报告还包含 KDA、长上下文数据、渐进式扩窗与系统并行;不得单因归因。