Files
llm-atlas/README.md
T
2026-07-30 06:15:45 +08:00

137 lines
11 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# LLM Atlas
一套以 Kimi K3 技术报告为锚点、从第一性原理重新梳理大语言模型技术发展的中文开放课程。
项目不把论文按年份堆成目录,而是持续回答四个问题:
1. 当时真正卡住研究者的问题是什么?
2. 旧方法为什么不够?
3. 关键论文改变了哪个假设或工程瓶颈?
4. 这条思路如何汇入今天的 Kimi K3、DeepSeek 与前沿 Agent 系统?
## 当前交付
- 网站:`https://llm-atlas.k1412.top/`
- 开源仓库:`https://git.k1412.top/wuyang/llm-atlas`
- 研究路线:[ROADMAP.md](./ROADMAP.md)
- 持续进度:[PROGRESS.md](./PROGRESS.md)
- 证据与写作规范:[research/METHODOLOGY.md](./research/METHODOLOGY.md)
当前里程碑包含 17 专题学习地图、486 篇关键论文索引、Kimi K3 完整导读,
语言模型前史、Transformer 基础、表示/位置/残差、DeepSeek 技术谱系、Scaling Laws、数据工程、长上下文、MoE、指令微调与人类偏好、推理、工具使用与长程 Agent、原生多模态、训练系统、推理服务、数值优化,以及评测与安全深度专题,
以及 89 个覆盖核心机制的原创交互视图。K3 二轮导读以 32 张问题账、16 图 / 5 表审计、
8 个交互实验和 100 个一手/官方节点,完整覆盖架构、预训练、后训练、系统、评测、案例与附录。
第三轮已完成开放工件与首个真实 kernel 里程碑:固定官方模型与 FlashKDA revisions,审计 96 个 checkpoint shards、
497,220 个 tensor entries、真实 KDA / MLA / MoE / MoonViT shapes 与小范围参数统计,并用 4 个新视图
明确区分官方观测、确定性推导、本机执行、合成探针和未决矛盾;同时用隔离 CUDA 13.0 环境编译
`sm_120a` wheel,在 RTX 5090 上完成 6/6 官方参考 exact-match 和 K3 fixed / varlen 形状计时。详见
[K3_ARTIFACT_AUDIT.md](./research/K3_ARTIFACT_AUDIT.md) 与
[checkpoint_probe.py](./experiments/k3/checkpoint_probe.py)、[FlashKDA probe](./experiments/k3/flashkda/)。
DeepSeek 八轮专题以 24 张问题账、10 次技术转向、
22 个交互实验和 60 个一手/官方节点,串起 Dense、MoE、MLA、V3 协同、R1 与 V4;
并固定官方 V2-Lite revision,在 RTX 5090 上连续执行 7/27 层,记录 3,240 次真实专家选择、
MLA/HF eager cache shapes 与 `31/31` exact 独立复跑;进一步用真实 layer-1 权重执行官方 V3
naive/absorb 路径,实际写入 576 元素 latent cache,并以 FP32 将两种结合顺序的最大误差压到
`1.19e-7`;再以 WikiText-2、TNEWS、HumanEval、GSM8K 各 32 条固定样本执行 304,560 次
真实 top-6 路由,用 2,000 次 prompt-level 分层 bootstrap 同报点估计与 95% 区间,独立重跑
整份 JSON byte-exact。随后又对同一批 128 条、源长度至少 24 tokens 的 prompt 执行
16 / 24-token 嵌套前缀对照,新增 184,320 次真实路由;paired bootstrap 显示延长前缀通常
降低 CV,尤其 Layer 2 代码为 `−0.251 [−0.283, −0.215]`,但六层中文↔代码 JSD 仍未消失。
最新一轮再用官方 chat template 对同一段内容构造 raw / user / generation 三个条件,
新增 382,032 次真实路由:精确对齐 2,874 个内容 token 后,RAW→USER 的方向随层与域改变,
而 USER→GENERATION 的 21,852 个共享前缀 ordered top-6 全部 exact,验证未来 suffix
不能改写过去路由。随后又把 system 与 one-shot 组成固定 16 / 17-token 正交增量的
2×2 实验,新增 865,440 次真实路由;在目标内容上,加入 one-shot 历史后 system-edge
TV 在 24 / 24 个 layer×domain 中都下降,均值从 `0.073` 降至 `0.019`,但这一模式不被
越界解释为示例语义或能力提升。最新一步再加入与原 one-shot 精确等长的重复词元 filler,
新增 1,376,496 次真实路由:system-edge TV 呈 `0.0738→0.0378→0.0188`
的 none→filler→demo 两级阶梯,两个台阶都在 24 / 24 格下降且 paired 区间完全低于零;
但 filler 仍是学习过的 token,不能冒充纯距离因果。随后在固定 filler 历史中只把 assistant
后的官方 EOS ID 替换为 `x`、句点或换行,新增 2,044,224 次真实路由;三种替换逐条同长度、
同目标位置且相对官方序列恰好只改一个 ID。目标内容的平均 system-edge TV 为
`.0374 / .0539 / .0553 / .0492`(EOS / x / 句点 / 换行);X 与句点在 24 / 24 格高于
EOS,换行为 23 / 24,但 base checkpoint、非法反事实序列和无行为指标的边界被明确保留。
再往前一步只替换目标 `User:` 或生成 `Assistant:` 的第一个普通 token ID,新增
2,044,224 次真实路由:前置 `User→Assistant` / `User→x` 的 direct target TV 均约
`.02–.03`,说明一个词头 ID 足以条件化后续专家集合;但二者对 system-edge 的 24 格方向
分别为 12↑12↓ / 13↑11↓,不能写成统一的 system 调制。后置 `Assistant→User`
则在 34,488 / 34,488 个目标 ordered top-6 上 exact,direct TV / JSD / ΔCV 全为零,
形成严格 causal suffix 负对照。进一步穷尽 tokenizer 的 BOS/EOS special inventory,
并以 `User/Assistant × :/x` 完成两-token 角色块因子分解;两组实验各新增 2,044,224
次真实路由、完整 JSON 独立复跑 byte-exact。当前累计 11,289,744 次公开语料路由。
Round 04 又固定官方 `DeepSeek-V2-Lite-Chat` revision,加载 31.4 GB 完整 BF16 权重,
以 GPU 25 层 + CPU 2 层和输出头的透明 offload 执行 16 个公开来源、8 种 system ×
边界条件,共 128 个 greedy 输出;四域中 31 个自然命中 EOS、97 个在 128 新 token
上限处截断,因此只把十条成对边写成“生成分歧”,不把它们冒充能力评测。每域独立抽取
1 个来源的 32 个输出再次运行,prompt hash、生成 token IDs、文本与 EOS 状态均为
`32 / 32` exact。FlashMLA 的 SM90/SM100 官方支持矩阵与本机 SM120 边界单独记账。
Round 05 再让全部 128 格统一使用 512-token 预算:自然 EOS 从 `31 / 128` 提升到
`121 / 128`,剩余 7 格仍按截断处理;GSM8K 严格完成且数值 exact 为 `23 / 32`,
HumanEval 官方 tests pass 为 `24 / 32`,四任务/域不外推为 benchmark。相同 Chat
checkpoint 又执行 embedding、27 层、final norm 与 26 个 MoE gate 的 prompt-only
全深度 trace,在 1,537 个精确 interior content tokens / condition 上记录
1,918,176 次 top-6 路由决定。新进程子集复跑达到 `1,856 / 1,856` hidden tensor hashes、
`1,664 / 1,664` ordered route hashes 与 `1,664 / 1,664` route-weight hashes exact。
Round 06 冻结 4 条 source、8 个 SHA-256 派生 seed 与 8 个 condition,启用 checkpoint
随附的 `temperature=.3 / top_p=.95` 并显式 `top_k=0`,生成 256 条 sampled outputs:
251 条 natural EOS,242 个完整 token trajectory hashes;单条 GSM8K 的 strict exact
为 `62 / 64`,单条 HumanEval 的官方 tests pass 为 `63 / 64`,不外推为 benchmark。
全新进程复跑 R0/R1 后,run seed、prompt hash、完整 token IDs、文本、停止状态与
CPU/CUDA RNG pre-state 八项均为 `64 / 64` exact。
Round 07 保持 256 条输出预算不变,改为 16 条预先冻结的 source、4 个 seed 与
`system off/on × EOS/句点` 四格;source 是覆盖单位,seed 只是题内重复。正式结果为
250 / 256 natural EOS、247 个完整 token trajectory hashes,四道 GSM8K 分别
`14/16 · 16/16 · 8/16 · 9/16`,四道 HumanEval 分别
`16/16 · 8/16 · 12/16 · 16/16`。句点在 11 / 16 条 source 上缩短平均长度,但
English 的首条 source 为 `−121`、其余三条为正,证明单题均值会与多数 source
方向相反;新进程 R0 的八项合同字段仍为 `64 / 64` exact。
Round 08 再把覆盖扩大到 HumanEval / GSM8K 各 32 条冻结任务,并以 SHA-256 显式
uniform tape 代替“重置同一 seed”的伪共同随机数:T0 全任务四条件 256 条、额外三条
随机带诊断 96 条,共 352 条正式输出,343 条 natural EOS、320 个完整 trajectory hashes。
两个域分别做 10,000 次选定任务 paired bootstrap;八个正确性区间全部跨零,但
system-at-period 的输出长度在 Code 为 `−130.9 [−178.7,−83.2]`、在 Math 为
`+25.1 [7.9,44.5]`,说明干预方向依赖任务域。全新进程对 64 条输出的 uniform hash、
token IDs、文本与停止等十二字段逐一重放,`64 / 64` exact;同时公开评分金标准被运行器
提前加载、但没有进入 prompt / logits / CDF / tape / selection 的流程偏差。
详见
[DEEPSEEK_V2_LITE_TRACE.md](./research/DEEPSEEK_V2_LITE_TRACE.md) 与
[DEEPSEEK_MLA_ABSORB_AUDIT.md](./research/DEEPSEEK_MLA_ABSORB_AUDIT.md)、
[DEEPSEEK_ROUTING_CORPUS_AUDIT.md](./research/DEEPSEEK_ROUTING_CORPUS_AUDIT.md)、
[DEEPSEEK_ROUTING_LENGTH_CONTROL_AUDIT.md](./research/DEEPSEEK_ROUTING_LENGTH_CONTROL_AUDIT.md) 与
[DEEPSEEK_ROUTING_TEMPLATE_AUDIT.md](./research/DEEPSEEK_ROUTING_TEMPLATE_AUDIT.md)、
[DEEPSEEK_ROUTING_HISTORY_FACTORIAL_AUDIT.md](./research/DEEPSEEK_ROUTING_HISTORY_FACTORIAL_AUDIT.md)、
[DEEPSEEK_ROUTING_HISTORY_DISTANCE_CONTROL_AUDIT.md](./research/DEEPSEEK_ROUTING_HISTORY_DISTANCE_CONTROL_AUDIT.md) 与
[DEEPSEEK_ROUTING_HISTORY_BOUNDARY_TOKEN_AUDIT.md](./research/DEEPSEEK_ROUTING_HISTORY_BOUNDARY_TOKEN_AUDIT.md) 与
[DEEPSEEK_ROUTING_ROLE_MARKER_HEAD_AUDIT.md](./research/DEEPSEEK_ROUTING_ROLE_MARKER_HEAD_AUDIT.md)、
[DEEPSEEK_ROUTING_SPECIAL_TOKEN_FAMILY_AUDIT.md](./research/DEEPSEEK_ROUTING_SPECIAL_TOKEN_FAMILY_AUDIT.md) 与
[DEEPSEEK_ROUTING_ROLE_MARKER_BLOCK_AUDIT.md](./research/DEEPSEEK_ROUTING_ROLE_MARKER_BLOCK_AUDIT.md),以及
[DEEPSEEK_V2_LITE_CHAT_BEHAVIOR_AUDIT.md](./research/DEEPSEEK_V2_LITE_CHAT_BEHAVIOR_AUDIT.md) 与
[DEEPSEEK_V2_LITE_CHAT_COMPLETION_DEPTH_AUDIT.md](./research/DEEPSEEK_V2_LITE_CHAT_COMPLETION_DEPTH_AUDIT.md)、
[DEEPSEEK_V2_LITE_CHAT_SAMPLING_PROTOCOL.md](./research/DEEPSEEK_V2_LITE_CHAT_SAMPLING_PROTOCOL.md) 与
[DEEPSEEK_V2_LITE_CHAT_SAMPLING_AUDIT.md](./research/DEEPSEEK_V2_LITE_CHAT_SAMPLING_AUDIT.md),以及
[DEEPSEEK_V2_LITE_CHAT_CROSS_SOURCE_SAMPLING_PROTOCOL.md](./research/DEEPSEEK_V2_LITE_CHAT_CROSS_SOURCE_SAMPLING_PROTOCOL.md) 与
[DEEPSEEK_V2_LITE_CHAT_CROSS_SOURCE_SAMPLING_AUDIT.md](./research/DEEPSEEK_V2_LITE_CHAT_CROSS_SOURCE_SAMPLING_AUDIT.md),以及
[DEEPSEEK_V2_LITE_CHAT_TASK_BOOTSTRAP_PROTOCOL.md](./research/DEEPSEEK_V2_LITE_CHAT_TASK_BOOTSTRAP_PROTOCOL.md) 与
[DEEPSEEK_V2_LITE_CHAT_TASK_BOOTSTRAP_CRN_AUDIT.md](./research/DEEPSEEK_V2_LITE_CHAT_TASK_BOOTSTRAP_CRN_AUDIT.md)。
其余专题按进度账本持续扩建。
## 本地开发
```bash
npm install
npm run dev
```
生产构建与检查:
```bash
npm run check
npm run build
```
## 内容与代码许可
- 网站代码采用 MIT License。
- 原创文字与重绘图采用 [CC BY-SA 4.0](https://creativecommons.org/licenses/by-sa/4.0/deed.zh-hans)。
- 被引用论文、图表、模型与商标仍归各自权利人所有;项目优先链接一手来源,并明确标注改绘与推断。