# 表示、位置与残差:Grok 候选线索 > 状态:**UNVERIFIED / 未核验发现队列,不是正式证据。** > > 生成方式:2026-07-29 使用本机 Grok CLI Headless(禁用子代理)扩展候选召回。Grok 的作用仅是提出“还应查什么”;正文中的事实、数字、年份、公式和优先级都必须重新回到论文原文、正式会议页或官方技术报告。 ## 1. Grok 建议的二十张问题账 1. 表示与参数:token ID、embedding、hidden state、logit、概率各是什么,为什么不能混称“词向量”? 2. 静态词向量:同一个词只有一个向量时,多义性和上下文差异怎样被压扁? 3. 上下文化:ELMo、BERT 与自回归 LLM 怎样把“词典条目”变成“此刻的状态”? 4. 输入与输出空间:为什么输入 embedding 与输出 classifier 可以共享参数? 5. Tokenizer:词、子词、字符、字节与动态 patch 分别把什么成本写进序列长度和词表? 6. 绝对位置:为什么把位置向量加到 token embedding 能破坏 Attention 的置换对称? 7. 相对位置:为什么语言规律往往更关心“相隔几步”而非“绝对第几位”? 8. RoPE:二维旋转怎样让 Q·K 只通过相对角度看到位移? 9. ALiBi / relative bias:把距离写进 logit 和写进向量有什么不同? 10. NoPE:没有显式位置向量是否真的等于模型不知道顺序? 11. 长度外推:训练长度外的新相位、距离和注意力分辨率为什么会失真? 12. 归一化对象:LayerNorm、RMSNorm、QK-Norm 分别控制哪一个量? 13. Norm 位置:Post-LN、Pre-LN 与 sandwich norm 怎样改变捷径和梯度? 14. 深度退化:信息能通过捷径不等于每一层贡献不会被稀释。 15. 残差缩放:初始化、门控、DeepNorm 怎样控制累计更新的量级? 16. 残差宽度:Hyper-Connections 为什么把一条 residual stream 展开成多条? 17. 残差选择:AttnRes 为什么把“固定相加”改成“沿深度做注意力”? 18. 激活谱系:ReLU、GELU、GLU、SwiGLU 的非线性与乘法门控分别在做什么? 19. FFN 记忆:为什么逐 token 的 FFN 仍可承载大量模式和事实关联? 20. 极值稳定:DeepSeek-V4 的 clamping 与 K3 的 SiTU-GLU 分别怎样限制异常激活? ## 2. 候选历史波次 | 波次 | Grok 提议的主问题 | 候选锚点 | |---|---|---| | 1986–2013 | 离散符号怎样进入可学习几何? | distributed representation、word2vec、BPE | | 2014–2018 | 同一符号怎样随上下文改变? | Seq2Seq、ELMo、BERT | | 2015–2017 | 深网怎样先“走得通”? | BatchNorm、ResNet、LayerNorm、Transformer | | 2018–2021 | 顺序怎样进入 Attention? | relative position、Transformer-XL、T5 bias、RoPE、ALiBi | | 2019–2022 | Transformer 怎样稳定堆深? | RMSNorm、Pre-LN、Fixup、ReZero、Admin、NormFormer、DeepNet | | 2021–2024 | 位置怎样跨出训练窗口? | xPos、NoPE study、Position Interpolation、YaRN、FIRE、LongRoPE | | 2024–2026 | residual stream 能否从一条路变成可学习拓扑? | Hyper-Connections、nGPT、mHC、AttnRes | | 2024–2026 | 位置、残差与激活怎样成为前沿模型系统设计? | DeepSeek-V2/V4、Kimi Linear/K3 | ## 3. 候选论文池 ### Token、embedding 与上下文化 - Bengio et al. — *A Neural Probabilistic Language Model* - Mikolov et al. — *Efficient Estimation of Word Representations in Vector Space* - Sennrich et al. — *Neural Machine Translation of Rare Words with Subword Units* - Kudo & Richardson — *SentencePiece* - Press & Wolf — *Using the Output Embedding to Improve Language Models* - Inan et al. — *Tying Word Vectors and Word Classifiers* - Peters et al. — *Deep contextualized word representations* - Devlin et al. — BERT - Geva et al. — *Transformer Feed-Forward Layers Are Key-Value Memories* - Clark et al. — CANINE - Xue et al. — ByT5 - Tay et al. — Charformer - Pagnoni et al. — Byte Latent Transformer ### 位置与长度外推 - Vaswani et al. — sinusoidal absolute position - Shaw et al. — relative position representations - Dai et al. — Transformer-XL - Raffel et al. — T5 relative position buckets - Su et al. — RoFormer / RoPE - Press et al. — ALiBi - Sun et al. — xPos / Length-Extrapolatable Transformer - Kazemnejad et al. — NoPE length-generalization study - Chen et al. — Position Interpolation - Peng et al. — YaRN - Li et al. — FIRE - Ding et al. — LongRoPE ### 归一化、深度与 residual stream - Ioffe & Szegedy — BatchNorm - He et al. — ResNet - Ba et al. — LayerNorm - Zhang & Sennrich — RMSNorm - Nguyen & Salazar — ScaleNorm / FixNorm / PreNorm - Zhang et al. — Fixup - Xiong et al. — Pre-LN / Post-LN analysis - Bachlechner et al. — ReZero - Liu et al. — Admin - Henry et al. — QK-Norm - Shleifer et al. — NormFormer - Wang et al. — DeepNet / DeepNorm - Zhu et al. — Hyper-Connections - Loshchilov et al. — nGPT - Xie et al. — mHC - Kimi Team — Attention Residuals ### 激活与 FFN - Nair & Hinton — ReLU - Hendrycks & Gimpel — GELU - Dauphin et al. — GLU - Ramachandran et al. — Swish - Shazeer — GLU Variants / SwiGLU - Geva et al. — FFN as key-value memories - So et al. — Primer / squared ReLU - LLaMA — RMSNorm + SwiGLU 的现代配方 - DeepSeek-V4 — SwiGLU clamping - Kimi K3 — SiTU-GLU ### DeepSeek / Kimi 重点候选 - DeepSeek-V2:MLA 的 decoupled RoPE - DeepSeek-V3:RMSNorm、SwiGLU 与 latent normalization - DeepSeek-V3.2:稀疏索引与 MLA 中的位置路径 - DeepSeek-V4:mHC、partial RoPE、head-wise Q/KV RMSNorm、SwiGLU clamping - Kimi Linear:混合 KDA / MLA 与 NoPE - Attention Residuals:Full / Block AttnRes - Kimi K3:KDA 隐式顺序、MLA NoPE、Block AttnRes、SiTU-GLU ## 4. Grok 提出的四个交互实验草案 1. **Token / 表示工作台**:切换词、子词、字节,观察序列长度、词表参数、输入/输出权重共享,以及同一 token 在不同上下文中的状态。 2. **位置几何台**:拖动两个位置,比较 absolute、relative bias、RoPE、ALiBi、NoPE 在训练窗内外怎样改变相似度。 3. **Norm / 深度台**:切换 Post-LN、Pre-LN、RMSNorm、QK-Norm,观察 toy residual scale、gradient path 与 logit saturation。 4. **Residual / FFN 台**:切换 plain residual、HC、mHC、AttnRes,并比较 GELU、SwiGLU、clamp、SiTU 对极值的响应。 ## 5. 永久不得直接进入事实层的表述 - “embedding 就是模型的知识”:embedding 只是输入/输出接口的一部分,深层状态和参数共同构成模型行为。 - “一个 token 对应一个词”:子词、字符、字节和多模态 token 都反例明显。 - “RoPE 天然支持无限长度”:训练窗外相位分布与注意力分辨率仍可能失真。 - “NoPE 没有位置信息”:因果 mask、递归状态或数据模式都可能让顺序被隐式编码。 - “Pre-LN 全面优于 Post-LN”:优化稳定性、表示变化和最终性能是不同维度。 - “RMSNorm 就是更快的 LayerNorm”:它去掉 re-centering,数学不变量与实现也不同。 - “残差连接保证每层都被使用”:固定单位累加仍可能造成幅值增长和单层贡献稀释。 - “FFN 只是无关紧要的两层 MLP”:它通常占大量参数,并可表现出模式/词汇关联。 - “SwiGLU 永远最好”:论文只在具体架构、预算与任务上比较。 - “K3 的 1M 能力只来自 NoPE”:报告还包含 KDA、长上下文数据、渐进式扩窗与系统并行;不得单因归因。