feat: deepen attention and transformer chapter

This commit is contained in:
wuyang
2026-07-29 05:26:59 +08:00
parent 266eac8fd6
commit 252e7d6b63
20 changed files with 3131 additions and 666 deletions
File diff suppressed because it is too large Load Diff
+1 -1
View File
@@ -12,5 +12,5 @@
<a href="https://git.k1412.top/wuyang/llm-atlas" rel="noreferrer">开放源码</a>
<a href="https://github.com/MoonshotAI/Kimi-K3" rel="noreferrer">K3 官方报告</a>
</div>
<p class="footer-legal">代码 MIT · 原创内容 CC BY-SA 4.0 · 研究截止 2026-07-28</p>
<p class="footer-legal">代码 MIT · 原创内容 CC BY-SA 4.0 · 研究截止 2026-07-29</p>
</footer>
+4 -4
View File
@@ -47,12 +47,12 @@ export const chapters: Chapter[] = [
title: "注意力与 Transformer",
kicker: "TRANSFORMER",
question: "一句话里的每个词,怎样直接找到真正相关的词?",
summary: "用可操作的小例子拆开 Q、K、V、自注意力、多头、因果掩码、残差与前馈网络。",
summary: "用十张问题账与四联实验拆开 Q/K/V、Mask、多头、位置、深度、架构目标、KV/IO,并映射 DeepSeek 与 K3。",
status: "published",
progress: 45,
papers: 12,
progress: 79,
papers: 40,
prerequisites: ["01"],
highlights: ["Q / K / V", "交互实验", "张量形状"],
highlights: ["十张问题账", "四联实验", "DeepSeek / K3"],
},
{
number: "03",
+88
View File
@@ -273,6 +273,30 @@ export const papers: Paper[] = [
contribution: "以门控网络让多个局部专家竞争分工,是现代 MoE 的概念起点。",
verified: true,
},
{
year: 2015,
title: "Pointer Networks",
url: "https://arxiv.org/abs/1506.03134",
topics: ["Transformer"],
contribution: "让 Attention 分布直接指向输入位置,展示软路由不仅能混合表示,也能定义可变输出字典。",
verified: true,
},
{
year: 2016,
title: "Deep Residual Learning for Image Recognition",
url: "https://openaccess.thecvf.com/content_cvpr_2016/html/He_Deep_Residual_Learning_CVPR_2016_paper.html",
topics: ["Transformer"],
contribution: "以加法捷径学习残差映射,是 Transformer 深度信息高速公路的视觉前史。",
verified: true,
},
{
year: 2016,
title: "Layer Normalization",
url: "https://arxiv.org/abs/1607.06450",
topics: ["Transformer"],
contribution: "在单个样本内按层输入统计量归一化,为序列模型提供训练/推理一致的尺度控制。",
verified: true,
},
{
year: 2017,
title: "Attention Is All You Need",
@@ -281,6 +305,14 @@ export const papers: Paper[] = [
contribution: "用多头自注意力与 FFN 取代循环,开启高度并行预训练。",
verified: true,
},
{
year: 2018,
title: "Self-Attention with Relative Position Representations",
url: "https://aclanthology.org/N18-2074/",
topics: ["Transformer", "长上下文"],
contribution: "把相对距离表示引入 Self-Attention,并把方法扩展为 relation-aware attention。",
verified: true,
},
{
year: 2018,
title: "SentencePiece: A simple and language independent subword tokenizer",
@@ -321,6 +353,14 @@ export const papers: Paper[] = [
contribution: "T5 统一 text-to-text 接口,并以 C4 建立现代 Common Crawl 清洗基线。",
verified: true,
},
{
year: 2019,
title: "Unified Language Model Pre-training for Natural Language Understanding and Generation",
url: "https://arxiv.org/abs/1905.03197",
topics: ["Transformer"],
contribution: "用 Attention mask 在同一 Transformer 中切换单向、双向与序列到序列预训练。",
verified: true,
},
{
year: 2019,
title: "Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context",
@@ -337,6 +377,38 @@ export const papers: Paper[] = [
contribution: "不做均值中心化的轻量归一化,成为现代 LLM 常用组件。",
verified: true,
},
{
year: 2019,
title: "Are Sixteen Heads Really Better than One?",
url: "https://papers.neurips.cc/paper_files/paper/2019/hash/2c601ad9d2ff9bc8b282670cdd54f69f-Abstract.html",
topics: ["Transformer", "评测"],
contribution: "测试时剪枝显示大量 Attention heads 存在冗余,但不证明这些 head 在训练阶段无用。",
verified: true,
},
{
year: 2019,
title: "What Does BERT Look at? An Analysis of BERTs Attention",
url: "https://aclanthology.org/W19-4828/",
topics: ["Transformer", "评测"],
contribution: "在 BERT heads 中观察位置、分隔符、句法和共指模式,为后验分析提供系统案例。",
verified: true,
},
{
year: 2019,
title: "Attention is not Explanation",
url: "https://aclanthology.org/N19-1357/",
topics: ["Transformer", "评测"],
contribution: "展示 Attention 权重与特征重要性可能不相关,且不同权重可产生近似预测,划定解释边界。",
verified: true,
},
{
year: 2019,
title: "Attention is not not Explanation",
url: "https://aclanthology.org/D19-1002/",
topics: ["Transformer", "评测"],
contribution: "指出解释结论依赖定义、模型整体、基线与测试协议,为 Attention 解释争论补充对照。",
verified: true,
},
{
year: 2020,
title: "Language Models are Few-Shot Learners",
@@ -353,6 +425,22 @@ export const papers: Paper[] = [
contribution: "系统比较 GLU 变体,SwiGLU 进入现代 FFN 配方。",
verified: true,
},
{
year: 2020,
title: "On Layer Normalization in the Transformer Architecture",
url: "https://proceedings.mlr.press/v119/xiong20b.html",
topics: ["Transformer", "训练系统"],
contribution: "从初始化梯度分析 Post-LN 的 warm-up 需求与 Pre-LN 的优化差异。",
verified: true,
},
{
year: 2021,
title: "NormFormer: Improved Transformer Pretraining with Extra Normalization",
url: "https://arxiv.org/abs/2110.09456",
topics: ["Transformer", "训练系统"],
contribution: "在 Pre-LN block 内增加归一化以改善层间梯度尺度与预训练稳定性。",
verified: true,
},
{
year: 2020,
title: "Longformer: The Long-Document Transformer",
File diff suppressed because it is too large Load Diff
+28 -1
View File
@@ -81,6 +81,7 @@ const paths = [
<div class="hero-actions">
<a class="button primary" href="/roadmap/">选择学习路径 <span aria-hidden="true">↓</span></a>
<a class="button" href="/foundations/language-models/">语言模型从哪里来</a>
<a class="button" href="/foundations/">注意力与 Transformer</a>
<a class="button" href="/k3/">直接解剖 K3</a>
<a class="button" href="/deepseek/">DeepSeek 专题</a>
<a class="button" href="/scaling/">Scaling Laws 专题</a>
@@ -99,7 +100,7 @@ const paths = [
<div class="hero-stats">
<div><b>16</b><span>核心专题</span></div>
<div><b>151</b><span>K3 报告来源</span></div>
<div><b>247</b><span>关键论文索引</span></div>
<div><b>258</b><span>关键论文索引</span></div>
<div><b>47p</b><span>K3 技术报告</span></div>
</div>
</aside>
@@ -113,6 +114,22 @@ const paths = [
<section class="section compact release-section" id="new-chapters">
<div class="release-grid">
<a class="release-card transformer-release" href="/foundations/">
<div>
<p class="eyebrow"><span>NEW / CHAPTER 02</span> ATTENTION · TRANSFORMER</p>
<h2>Attention 不只是“看哪里”,Transformer 也不只有一种 Block</h2>
<p>
用信息路径、匹配几何、可见性、多头、位置、局部计算、深度、架构目标、系统成本与当代映射十张账,
从 Bahdanau 软对齐和 2017 原始 encoderdecoder,一路走到 FlashAttention、DeepSeek MLA 与 Kimi K3。
</p>
</div>
<dl>
<div><dt>LINEAGE</dt><dd>2014 → 2026</dd></div>
<div><dt>PAPERS</dt><dd>40 个一手节点</dd></div>
<div><dt>LAB</dt><dd>QKV · Mask · 多头位置 · Block 成本</dd></div>
</dl>
<span class="release-arrow" aria-hidden="true">从软对齐进入现代 LLM 骨架 →</span>
</a>
<a class="release-card foundation-release" href="/foundations/language-models/">
<div>
<p class="eyebrow"><span>NEW / CHAPTER 01</span> LANGUAGE MODELING ORIGINS</p>
@@ -474,6 +491,7 @@ const paths = [
transition: transform 180ms ease, border-color 180ms ease;
}
.transformer-release,
.foundation-release,
.numerics-release,
.data-release,
@@ -500,6 +518,14 @@ const paths = [
var(--paper-raised);
}
.transformer-release {
background:
radial-gradient(circle at 82% 18%, rgba(56, 91, 128, 0.21), transparent 30%),
radial-gradient(circle at 60% 74%, rgba(159, 91, 52, 0.12), transparent 26%),
repeating-linear-gradient(90deg, transparent 0 64px, rgba(56, 91, 128, 0.04) 64px 65px),
var(--paper-raised);
}
.data-release {
background:
radial-gradient(circle at 82% 18%, rgba(76, 118, 112, 0.2), transparent 30%),
@@ -590,6 +616,7 @@ const paths = [
padding-bottom: 76px;
}
.transformer-release,
.foundation-release,
.numerics-release,
.data-release,
+8 -4
View File
@@ -11,7 +11,7 @@ const workstreams = [
{ label: "网站设计系统", value: 89, next: "打印样式与更多通用可视化组件" },
{ label: "Kimi K3 深读", value: 66, next: "扩写 pre-training / infra 逐图笔记" },
{ label: "语言模型前史", value: 78, next: "逐图精读 KneserNey、LSTM 与 Bahdanau,并加入真实小语料复现" },
{ label: "Transformer 基础", value: 52, next: "加入矩阵形状动画与手算练习" },
{ label: "Transformer 基础", value: 79, next: "逐图精读多头电路、Pre/Post-LN 与真实 kernel / KV 配置" },
{ label: "Scaling Laws", value: 74, next: "加入真实拟合复现、置信区间与更多模型族对照" },
{ label: "数据工程与预训练配方", value: 73, next: "逐图精读 FineWeb / DCLM,加入真实去重与 mixture traces" },
{ label: "DeepSeek 专题", value: 71, next: "补 R1 / DAPO 的逐图训练轨迹与复现对照" },
@@ -44,7 +44,7 @@ const workstreams = [
<div><dt>OVERALL</dt><dd>专题平均 {average}%</dd></div>
<div><dt>READABLE</dt><dd>{published} 个首版可读专题</dd></div>
<div><dt>ACTIVE</dt><dd>{researching} 个研究/写作中</dd></div>
<div><dt>UPDATED</dt><dd>2026-07-29 04:48 CST</dd></div>
<div><dt>UPDATED</dt><dd>2026-07-29 05:20 CST</dd></div>
<div><dt>MODE</dt><dd>持续迭代,不锁死版本</dd></div>
</dl>
</div>
@@ -91,9 +91,10 @@ const workstreams = [
<article><span>✓</span><h3>K3 报告已结构化拆解</h3><p>47 页报告目录、151 条参考来源和架构/后训练/系统主线已经提取。</p></article>
<article><span>✓</span><h3>16 专题知识图</h3><p>从语言模型基础到评测安全,包含先修依赖和三条贯穿案例。</p></article>
<article><span>✓</span><h3>编辑式网站系统</h3><p>响应式导航、章节模板、侧栏、进度、论文链和证据提示组件。</p></article>
<article><span>✓</span><h3>二十八个原创交互视图</h3><p>K3、语言模型前史、注意力、DeepSeek、长上下文、MoE、推理,以及训练系统、Scaling、数据工程和数值专题的多页签实验。</p></article>
<article><span>✓</span><h3>三十一个原创交互视图</h3><p>K3、语言模型前史、Transformer 四联实验、DeepSeek、长上下文、MoE、推理,以及训练系统、Scaling、数据工程和数值专题。</p></article>
<article><span>✓</span><h3>十一篇首版长文</h3><p>K3、语言模型前史、Transformer、DeepSeek、Scaling、数据工程、长上下文、MoE、推理、训练系统与数值优化专题。</p></article>
<article><span>✓</span><h3>语言模型前史深度专题</h3><p>八张独立问题账、33 个正式节点、20 段长文与概率—向量—记忆—对齐四联实验。</p></article>
<article><span>✓</span><h3>Transformer 深度专题</h3><p>十张独立问题账、40 个正式节点、21 段正文与 QKV—Mask—多头位置—Block 成本四联实验。</p></article>
<article><span>✓</span><h3>Scaling Laws 深度专题</h3><p>九张账、29 个一手节点、DeepSeek/Kimi 双谱系与曲面—部署—复用—涌现四联实验。</p></article>
<article><span>✓</span><h3>数据工程深度专题</h3><p>十二张账、31 个一手节点、DeepSeek/Kimi 双谱系与流水线—去重—混合—改写四联实验。</p></article>
<article><span>✓</span><h3>长上下文深度专题</h3><p>五张成本账、26 篇一手论文、10+ 机制图与 8 策略交互实验室。</p></article>
@@ -101,7 +102,7 @@ const workstreams = [
<article><span>✓</span><h3>推理深度专题</h3><p>八张账、30 篇一手论文链、DeepSeek/Kimi 双主线与三页签互动实验室。</p></article>
<article><span>✓</span><h3>训练系统深度专题</h3><p>九张账、37 个一手节点、DeepSeek/Kimi 双谱系与显存—网格—气泡—通信实验室。</p></article>
<article><span>✓</span><h3>数值、优化器与稳定性深度专题</h3><p>十张账、36 个一手节点、K2/K3 与 DeepSeek-V3/V4 双谱系,以及格式—状态—更新—失稳四联实验。</p></article>
<article><span>✓</span><h3>247 篇关键论文索引</h3><p>新增 24 个语言模型前史节点,并把 DeepSeek-V3/V4 与 K3 映射回 next-token 主线。</p></article>
<article><span>✓</span><h3>258 篇关键论文索引</h3><p>补齐 Residual/Norm、相对位置、UniLM、多头冗余、Attention 解释争论与 NormFormer 等 11 个节点。</p></article>
<article><span>✓</span><h3>公开仓库与自托管发布</h3><p>源码公开到 git.k1412.top,网站由不可变镜像、Compose Manager 与 HTTPS 交付。</p></article>
</div>
</section>
@@ -116,6 +117,7 @@ const workstreams = [
</div>
<div class="queue-table">
<div class="head"><b>优先级</b><b>专题</b><b>本轮交付</b><b>完成闸门</b></div>
<div><span>P0</span><strong>Transformer 二轮</strong><p>多头电路逐图 → Pre/Post-LN 真实 traces → Flash/KV 配置与 kernel 对照</p><em>逐图笔记 + 实测边界</em></div>
<div><span>P0</span><strong>语言模型前史二轮</strong><p>KneserNey / LSTM / Bahdanau 逐图 → 真实小语料复现 → tokenizer 公平性</p><em>可复现实验 + 逐图笔记</em></div>
<div><span>P0</span><strong>Scaling Laws 二轮</strong><p>真实拟合复现 → 置信区间 → 更多模型族与下游任务外推</p><em>可复现实验 + 逐图笔记</em></div>
<div><span>P1</span><strong>数据工程二轮</strong><p>FineWeb / DCLM 逐图 → 真实去重误伤 → mixture traces 与污染案例</p><em>逐图笔记 + 案例库</em></div>
@@ -172,6 +174,8 @@ const workstreams = [
<div><time>2026-07-29</time><b>低精度结论必须写完整角色合同</b><p>对象、格式、scale 粒度、accumulator、输出与硬件不再被压缩成一个 dtype 标签。</p></div>
<div><time>2026-07-29</time><b>语言模型前史按八张账组织</b><p>预测单位、概率信息、上下文、稀疏性、分布式表示、循环记忆、序列转导与系统成本不再混成单一架构年表。</p></div>
<div><time>2026-07-29</time><b>NTP、MTP 与多模态永久分角色</b><p>K3 的统一视觉/文本 next-token objective、one MTP layer 与 EAGLE-3 draft bridge 分开记账;DeepSeek MTP 也不写成取代自回归。</p></div>
<div><time>2026-07-29</time><b>Transformer 按十张账组织</b><p>信息路径、几何、可见性、多头、位置、局部计算、深度、目标、系统成本与当代映射不再混成一个 Block。</p></div>
<div><time>2026-07-29</time><b>Attention 权重与因果解释永久分离</b><p>热力图可描述中间权重和提出假设;因果结论必须补消融、patching 或反事实干预。</p></div>
</div>
</section>