feat: publish language model origins chapter

This commit is contained in:
wuyang
2026-07-29 04:47:36 +08:00
parent 2997434f7f
commit a54152dc24
22 changed files with 5521 additions and 35 deletions
+7 -1
View File
@@ -23,7 +23,13 @@
### 01. 语言模型从哪里来
N-gram → 神经概率语言模型 → 分布式词表示 → RNN/LSTM → Seq2Seq。解释“预测下一个词”为何最终能长成通用模型
Shannon → N-gram → GoodTuring / Katz / KneserNey → 神经概率语言模型 → 分布式词表示 → RNN/LSTM → Seq2Seq → Attention 前夜
用“预测单位、概率信息、上下文、稀疏性、分布式表示、循环记忆、序列转导、评测与成本”八张账,
解释 next-token 目标为什么能持续到 Kimi K3 与 DeepSeek,也明确它没有自动保证事实性、忠实推理与行为对齐。
首版已发布:20 段长文、33 个正式节点、19 组原创机制图,以及概率显微镜、Embedding 几何、
循环记忆衰减、Seq2Seq 瓶颈/Attention 桥四个独立实验。正文显式分开 K3 的统一视觉/文本 NTP、
one MTP layer 与 EAGLE-3 draft bridge,并与 DeepSeek-V3/V4 的顺序 MTP 对照。
### 02. 注意力与 Transformer