Files
llm-atlas/research/REPRESENTATION_GROK_LEADS.md
T

7.5 KiB
Raw Blame History

表示、位置与残差:Grok 候选线索

状态:UNVERIFIED / 未核验发现队列,不是正式证据。

生成方式:2026-07-29 使用本机 Grok CLI Headless(禁用子代理)扩展候选召回。Grok 的作用仅是提出“还应查什么”;正文中的事实、数字、年份、公式和优先级都必须重新回到论文原文、正式会议页或官方技术报告。

1. Grok 建议的二十张问题账

  1. 表示与参数:token ID、embedding、hidden state、logit、概率各是什么,为什么不能混称“词向量”?
  2. 静态词向量:同一个词只有一个向量时,多义性和上下文差异怎样被压扁?
  3. 上下文化:ELMo、BERT 与自回归 LLM 怎样把“词典条目”变成“此刻的状态”?
  4. 输入与输出空间:为什么输入 embedding 与输出 classifier 可以共享参数?
  5. Tokenizer:词、子词、字符、字节与动态 patch 分别把什么成本写进序列长度和词表?
  6. 绝对位置:为什么把位置向量加到 token embedding 能破坏 Attention 的置换对称?
  7. 相对位置:为什么语言规律往往更关心“相隔几步”而非“绝对第几位”?
  8. RoPE:二维旋转怎样让 Q·K 只通过相对角度看到位移?
  9. ALiBi / relative bias:把距离写进 logit 和写进向量有什么不同?
  10. NoPE:没有显式位置向量是否真的等于模型不知道顺序?
  11. 长度外推:训练长度外的新相位、距离和注意力分辨率为什么会失真?
  12. 归一化对象:LayerNorm、RMSNorm、QK-Norm 分别控制哪一个量?
  13. Norm 位置:Post-LN、Pre-LN 与 sandwich norm 怎样改变捷径和梯度?
  14. 深度退化:信息能通过捷径不等于每一层贡献不会被稀释。
  15. 残差缩放:初始化、门控、DeepNorm 怎样控制累计更新的量级?
  16. 残差宽度:Hyper-Connections 为什么把一条 residual stream 展开成多条?
  17. 残差选择:AttnRes 为什么把“固定相加”改成“沿深度做注意力”?
  18. 激活谱系:ReLU、GELU、GLU、SwiGLU 的非线性与乘法门控分别在做什么?
  19. FFN 记忆:为什么逐 token 的 FFN 仍可承载大量模式和事实关联?
  20. 极值稳定:DeepSeek-V4 的 clamping 与 K3 的 SiTU-GLU 分别怎样限制异常激活?

2. 候选历史波次

波次 Grok 提议的主问题 候选锚点
1986–2013 离散符号怎样进入可学习几何? distributed representation、word2vec、BPE
2014–2018 同一符号怎样随上下文改变? Seq2Seq、ELMo、BERT
2015–2017 深网怎样先“走得通”? BatchNorm、ResNet、LayerNorm、Transformer
2018–2021 顺序怎样进入 Attention? relative position、Transformer-XL、T5 bias、RoPE、ALiBi
2019–2022 Transformer 怎样稳定堆深? RMSNorm、Pre-LN、Fixup、ReZero、Admin、NormFormer、DeepNet
2021–2024 位置怎样跨出训练窗口? xPos、NoPE study、Position Interpolation、YaRN、FIRE、LongRoPE
2024–2026 residual stream 能否从一条路变成可学习拓扑? Hyper-Connections、nGPT、mHC、AttnRes
2024–2026 位置、残差与激活怎样成为前沿模型系统设计? DeepSeek-V2/V4、Kimi Linear/K3

3. 候选论文池

Token、embedding 与上下文化

  • Bengio et al. — A Neural Probabilistic Language Model
  • Mikolov et al. — Efficient Estimation of Word Representations in Vector Space
  • Sennrich et al. — Neural Machine Translation of Rare Words with Subword Units
  • Kudo & Richardson — SentencePiece
  • Press & Wolf — Using the Output Embedding to Improve Language Models
  • Inan et al. — Tying Word Vectors and Word Classifiers
  • Peters et al. — Deep contextualized word representations
  • Devlin et al. — BERT
  • Geva et al. — Transformer Feed-Forward Layers Are Key-Value Memories
  • Clark et al. — CANINE
  • Xue et al. — ByT5
  • Tay et al. — Charformer
  • Pagnoni et al. — Byte Latent Transformer

位置与长度外推

  • Vaswani et al. — sinusoidal absolute position
  • Shaw et al. — relative position representations
  • Dai et al. — Transformer-XL
  • Raffel et al. — T5 relative position buckets
  • Su et al. — RoFormer / RoPE
  • Press et al. — ALiBi
  • Sun et al. — xPos / Length-Extrapolatable Transformer
  • Kazemnejad et al. — NoPE length-generalization study
  • Chen et al. — Position Interpolation
  • Peng et al. — YaRN
  • Li et al. — FIRE
  • Ding et al. — LongRoPE

归一化、深度与 residual stream

  • Ioffe & Szegedy — BatchNorm
  • He et al. — ResNet
  • Ba et al. — LayerNorm
  • Zhang & Sennrich — RMSNorm
  • Nguyen & Salazar — ScaleNorm / FixNorm / PreNorm
  • Zhang et al. — Fixup
  • Xiong et al. — Pre-LN / Post-LN analysis
  • Bachlechner et al. — ReZero
  • Liu et al. — Admin
  • Henry et al. — QK-Norm
  • Shleifer et al. — NormFormer
  • Wang et al. — DeepNet / DeepNorm
  • Zhu et al. — Hyper-Connections
  • Loshchilov et al. — nGPT
  • Xie et al. — mHC
  • Kimi Team — Attention Residuals

激活与 FFN

  • Nair & Hinton — ReLU
  • Hendrycks & Gimpel — GELU
  • Dauphin et al. — GLU
  • Ramachandran et al. — Swish
  • Shazeer — GLU Variants / SwiGLU
  • Geva et al. — FFN as key-value memories
  • So et al. — Primer / squared ReLU
  • LLaMA — RMSNorm + SwiGLU 的现代配方
  • DeepSeek-V4 — SwiGLU clamping
  • Kimi K3 — SiTU-GLU

DeepSeek / Kimi 重点候选

  • DeepSeek-V2:MLA 的 decoupled RoPE
  • DeepSeek-V3:RMSNorm、SwiGLU 与 latent normalization
  • DeepSeek-V3.2:稀疏索引与 MLA 中的位置路径
  • DeepSeek-V4:mHC、partial RoPE、head-wise Q/KV RMSNorm、SwiGLU clamping
  • Kimi Linear:混合 KDA / MLA 与 NoPE
  • Attention Residuals:Full / Block AttnRes
  • Kimi K3:KDA 隐式顺序、MLA NoPE、Block AttnRes、SiTU-GLU

4. Grok 提出的四个交互实验草案

  1. Token / 表示工作台:切换词、子词、字节,观察序列长度、词表参数、输入/输出权重共享,以及同一 token 在不同上下文中的状态。
  2. 位置几何台:拖动两个位置,比较 absolute、relative bias、RoPE、ALiBi、NoPE 在训练窗内外怎样改变相似度。
  3. Norm / 深度台:切换 Post-LN、Pre-LN、RMSNorm、QK-Norm,观察 toy residual scale、gradient path 与 logit saturation。
  4. Residual / FFN 台:切换 plain residual、HC、mHC、AttnRes,并比较 GELU、SwiGLU、clamp、SiTU 对极值的响应。

5. 永久不得直接进入事实层的表述

  • “embedding 就是模型的知识”:embedding 只是输入/输出接口的一部分,深层状态和参数共同构成模型行为。
  • “一个 token 对应一个词”:子词、字符、字节和多模态 token 都反例明显。
  • “RoPE 天然支持无限长度”:训练窗外相位分布与注意力分辨率仍可能失真。
  • “NoPE 没有位置信息”:因果 mask、递归状态或数据模式都可能让顺序被隐式编码。
  • “Pre-LN 全面优于 Post-LN”:优化稳定性、表示变化和最终性能是不同维度。
  • “RMSNorm 就是更快的 LayerNorm”:它去掉 re-centering,数学不变量与实现也不同。
  • “残差连接保证每层都被使用”:固定单位累加仍可能造成幅值增长和单层贡献稀释。
  • “FFN 只是无关紧要的两层 MLP”:它通常占大量参数,并可表现出模式/词汇关联。
  • “SwiGLU 永远最好”:论文只在具体架构、预算与任务上比较。
  • “K3 的 1M 能力只来自 NoPE”:报告还包含 KDA、长上下文数据、渐进式扩窗与系统并行;不得单因归因。