feat: publish language model origins chapter
This commit is contained in:
+7
-1
@@ -23,7 +23,13 @@
|
||||
|
||||
### 01. 语言模型从哪里来
|
||||
|
||||
N-gram → 神经概率语言模型 → 分布式词表示 → RNN/LSTM → Seq2Seq。解释“预测下一个词”为何最终能长成通用模型。
|
||||
Shannon → N-gram → Good–Turing / Katz / Kneser–Ney → 神经概率语言模型 → 分布式词表示 → RNN/LSTM → Seq2Seq → Attention 前夜。
|
||||
用“预测单位、概率信息、上下文、稀疏性、分布式表示、循环记忆、序列转导、评测与成本”八张账,
|
||||
解释 next-token 目标为什么能持续到 Kimi K3 与 DeepSeek,也明确它没有自动保证事实性、忠实推理与行为对齐。
|
||||
|
||||
首版已发布:20 段长文、33 个正式节点、19 组原创机制图,以及概率显微镜、Embedding 几何、
|
||||
循环记忆衰减、Seq2Seq 瓶颈/Attention 桥四个独立实验。正文显式分开 K3 的统一视觉/文本 NTP、
|
||||
one MTP layer 与 EAGLE-3 draft bridge,并与 DeepSeek-V3/V4 的顺序 MTP 对照。
|
||||
|
||||
### 02. 注意力与 Transformer
|
||||
|
||||
|
||||
Reference in New Issue
Block a user