162 lines
13 KiB
Markdown
162 lines
13 KiB
Markdown
# LLM Atlas
|
||
|
||
一套以 Kimi K3 技术报告为锚点、从第一性原理重新梳理大语言模型技术发展的中文开放课程。
|
||
|
||
项目不把论文按年份堆成目录,而是持续回答四个问题:
|
||
|
||
1. 当时真正卡住研究者的问题是什么?
|
||
2. 旧方法为什么不够?
|
||
3. 关键论文改变了哪个假设或工程瓶颈?
|
||
4. 这条思路如何汇入今天的 Kimi K3、DeepSeek 与前沿 Agent 系统?
|
||
|
||
## 当前交付
|
||
|
||
- 网站:`https://llm-atlas.k1412.top/`
|
||
- 开源仓库:`https://git.k1412.top/wuyang/llm-atlas`
|
||
- 研究路线:[ROADMAP.md](./ROADMAP.md)
|
||
- 持续进度:[PROGRESS.md](./PROGRESS.md)
|
||
- 证据与写作规范:[research/METHODOLOGY.md](./research/METHODOLOGY.md)
|
||
|
||
当前里程碑包含 17 专题学习地图、486 篇关键论文索引、Kimi K3 完整导读,
|
||
语言模型前史、Transformer 基础、表示/位置/残差、DeepSeek 技术谱系、Scaling Laws、数据工程、长上下文、MoE、指令微调与人类偏好、推理、工具使用与长程 Agent、原生多模态、训练系统、推理服务、数值优化,以及评测与安全深度专题,
|
||
以及 99 个覆盖核心机制的原创交互视图。K3 二轮导读以 32 张问题账、16 图 / 5 表审计、
|
||
8 个交互实验和 100 个一手/官方节点,完整覆盖架构、预训练、后训练、系统、评测、案例与附录。
|
||
第三轮已完成开放工件与首个真实 kernel 里程碑:固定官方模型与 FlashKDA revisions,审计 96 个 checkpoint shards、
|
||
497,220 个 tensor entries、真实 KDA / MLA / MoE / MoonViT shapes 与小范围参数统计,并用 4 个新视图
|
||
明确区分官方观测、确定性推导、本机执行、合成探针和未决矛盾;同时用隔离 CUDA 13.0 环境编译
|
||
`sm_120a` wheel,在 RTX 5090 上完成 6/6 官方参考 exact-match 和 K3 fixed / varlen 形状计时。详见
|
||
[K3_ARTIFACT_AUDIT.md](./research/K3_ARTIFACT_AUDIT.md) 与
|
||
[checkpoint_probe.py](./experiments/k3/checkpoint_probe.py)、[FlashKDA probe](./experiments/k3/flashkda/)。
|
||
第四轮不裁剪仍未解释的 `A_log [128]` 去伪造 K3 forward,而是先冻结
|
||
`llm-atlas-k3-attnres-reduced-v1`,用相同 16-block / 32-sublayer Transformer 主干、
|
||
相同 WikiText-2 byte windows 与三个共同初始化 seed,从零训练 Baseline、Full AttnRes
|
||
与 Block AttnRes 共 9 个 2,000-step 正式格。最终 Full / Block 相对 Baseline 的三 seed
|
||
平均 paired delta 分别为 `−0.01457 / −0.04247 BPC`,都满足预注册的本协议内方向支持规则;
|
||
但核心参数梯度 RMS 的跨 block CV 为 `0.3447 / 0.5087 / 0.6306`,没有复现论文式
|
||
梯度均匀性叙述。指定 Block / seed-1 的全新进程 2,000-step replay 在八组数值与哈希字段
|
||
上全部 exact,计时不要求 exact。完整 9-run JSON、compact payload、复现清单、训练/
|
||
聚合代码与五视图实验室均进入开源树。详见
|
||
[K3_ATTNRES_REDUCED_PROTOCOL.md](./research/K3_ATTNRES_REDUCED_PROTOCOL.md)、
|
||
[K3_ATTNRES_REDUCED_AUDIT.md](./research/K3_ATTNRES_REDUCED_AUDIT.md) 与
|
||
[AttnRes experiment](./experiments/k3/attnres/)。
|
||
第五轮先审计 Attention Residuals Figure 5 的公开定义边界,再冻结
|
||
`llm-atlas-k3-attnres-gradient-scale-v1`:以 post-MLP block output activation gradient
|
||
为公开 operationalization,把深度扩为 16 / 32 blocks、预算扩为每格 8,000 steps,
|
||
完成 Baseline / Block × 三 seed 共 12 格、786,432,000 formal target bytes。结果把
|
||
“更均匀”拆成两个相反方向:Block 在 6 / 6 配对中把首/末四分位失衡改善 56%–81%,
|
||
却因中后段局部尖峰让全层 CV 在 6 / 6 配对中恶化;两个深度都按预注册联合规则判为
|
||
mixed / inconclusive。验证 BPC 仍在 6 / 6 配对中更低,但实际 step time 约 2.6×、
|
||
peak allocated memory 约 2.2×,不冒充同算力优势。指定 depth-32 / Block / seed-1
|
||
从零重训完整 8,000 steps,全部冻结字段以及 model / optimizer state hashes exact。
|
||
详见
|
||
[K3_ATTNRES_GRADIENT_DEFINITION_AUDIT.md](./research/K3_ATTNRES_GRADIENT_DEFINITION_AUDIT.md)、
|
||
[K3_ATTNRES_GRADIENT_SCALE_AUDIT.md](./research/K3_ATTNRES_GRADIENT_SCALE_AUDIT.md) 与
|
||
[gradient experiment](./experiments/k3/attnres_gradient/)。
|
||
DeepSeek 八轮专题以 24 张问题账、10 次技术转向、
|
||
22 个交互实验和 60 个一手/官方节点,串起 Dense、MoE、MLA、V3 协同、R1 与 V4;
|
||
并固定官方 V2-Lite revision,在 RTX 5090 上连续执行 7/27 层,记录 3,240 次真实专家选择、
|
||
MLA/HF eager cache shapes 与 `31/31` exact 独立复跑;进一步用真实 layer-1 权重执行官方 V3
|
||
naive/absorb 路径,实际写入 576 元素 latent cache,并以 FP32 将两种结合顺序的最大误差压到
|
||
`1.19e-7`;再以 WikiText-2、TNEWS、HumanEval、GSM8K 各 32 条固定样本执行 304,560 次
|
||
真实 top-6 路由,用 2,000 次 prompt-level 分层 bootstrap 同报点估计与 95% 区间,独立重跑
|
||
整份 JSON byte-exact。随后又对同一批 128 条、源长度至少 24 tokens 的 prompt 执行
|
||
16 / 24-token 嵌套前缀对照,新增 184,320 次真实路由;paired bootstrap 显示延长前缀通常
|
||
降低 CV,尤其 Layer 2 代码为 `−0.251 [−0.283, −0.215]`,但六层中文↔代码 JSD 仍未消失。
|
||
最新一轮再用官方 chat template 对同一段内容构造 raw / user / generation 三个条件,
|
||
新增 382,032 次真实路由:精确对齐 2,874 个内容 token 后,RAW→USER 的方向随层与域改变,
|
||
而 USER→GENERATION 的 21,852 个共享前缀 ordered top-6 全部 exact,验证未来 suffix
|
||
不能改写过去路由。随后又把 system 与 one-shot 组成固定 16 / 17-token 正交增量的
|
||
2×2 实验,新增 865,440 次真实路由;在目标内容上,加入 one-shot 历史后 system-edge
|
||
TV 在 24 / 24 个 layer×domain 中都下降,均值从 `0.073` 降至 `0.019`,但这一模式不被
|
||
越界解释为示例语义或能力提升。最新一步再加入与原 one-shot 精确等长的重复词元 filler,
|
||
新增 1,376,496 次真实路由:system-edge TV 呈 `0.0738→0.0378→0.0188`
|
||
的 none→filler→demo 两级阶梯,两个台阶都在 24 / 24 格下降且 paired 区间完全低于零;
|
||
但 filler 仍是学习过的 token,不能冒充纯距离因果。随后在固定 filler 历史中只把 assistant
|
||
后的官方 EOS ID 替换为 `x`、句点或换行,新增 2,044,224 次真实路由;三种替换逐条同长度、
|
||
同目标位置且相对官方序列恰好只改一个 ID。目标内容的平均 system-edge TV 为
|
||
`.0374 / .0539 / .0553 / .0492`(EOS / x / 句点 / 换行);X 与句点在 24 / 24 格高于
|
||
EOS,换行为 23 / 24,但 base checkpoint、非法反事实序列和无行为指标的边界被明确保留。
|
||
再往前一步只替换目标 `User:` 或生成 `Assistant:` 的第一个普通 token ID,新增
|
||
2,044,224 次真实路由:前置 `User→Assistant` / `User→x` 的 direct target TV 均约
|
||
`.02–.03`,说明一个词头 ID 足以条件化后续专家集合;但二者对 system-edge 的 24 格方向
|
||
分别为 12↑12↓ / 13↑11↓,不能写成统一的 system 调制。后置 `Assistant→User`
|
||
则在 34,488 / 34,488 个目标 ordered top-6 上 exact,direct TV / JSD / ΔCV 全为零,
|
||
形成严格 causal suffix 负对照。进一步穷尽 tokenizer 的 BOS/EOS special inventory,
|
||
并以 `User/Assistant × :/x` 完成两-token 角色块因子分解;两组实验各新增 2,044,224
|
||
次真实路由、完整 JSON 独立复跑 byte-exact。当前累计 11,289,744 次公开语料路由。
|
||
Round 04 又固定官方 `DeepSeek-V2-Lite-Chat` revision,加载 31.4 GB 完整 BF16 权重,
|
||
以 GPU 25 层 + CPU 2 层和输出头的透明 offload 执行 16 个公开来源、8 种 system ×
|
||
边界条件,共 128 个 greedy 输出;四域中 31 个自然命中 EOS、97 个在 128 新 token
|
||
上限处截断,因此只把十条成对边写成“生成分歧”,不把它们冒充能力评测。每域独立抽取
|
||
1 个来源的 32 个输出再次运行,prompt hash、生成 token IDs、文本与 EOS 状态均为
|
||
`32 / 32` exact。FlashMLA 的 SM90/SM100 官方支持矩阵与本机 SM120 边界单独记账。
|
||
Round 05 再让全部 128 格统一使用 512-token 预算:自然 EOS 从 `31 / 128` 提升到
|
||
`121 / 128`,剩余 7 格仍按截断处理;GSM8K 严格完成且数值 exact 为 `23 / 32`,
|
||
HumanEval 官方 tests pass 为 `24 / 32`,四任务/域不外推为 benchmark。相同 Chat
|
||
checkpoint 又执行 embedding、27 层、final norm 与 26 个 MoE gate 的 prompt-only
|
||
全深度 trace,在 1,537 个精确 interior content tokens / condition 上记录
|
||
1,918,176 次 top-6 路由决定。新进程子集复跑达到 `1,856 / 1,856` hidden tensor hashes、
|
||
`1,664 / 1,664` ordered route hashes 与 `1,664 / 1,664` route-weight hashes exact。
|
||
Round 06 冻结 4 条 source、8 个 SHA-256 派生 seed 与 8 个 condition,启用 checkpoint
|
||
随附的 `temperature=.3 / top_p=.95` 并显式 `top_k=0`,生成 256 条 sampled outputs:
|
||
251 条 natural EOS,242 个完整 token trajectory hashes;单条 GSM8K 的 strict exact
|
||
为 `62 / 64`,单条 HumanEval 的官方 tests pass 为 `63 / 64`,不外推为 benchmark。
|
||
全新进程复跑 R0/R1 后,run seed、prompt hash、完整 token IDs、文本、停止状态与
|
||
CPU/CUDA RNG pre-state 八项均为 `64 / 64` exact。
|
||
Round 07 保持 256 条输出预算不变,改为 16 条预先冻结的 source、4 个 seed 与
|
||
`system off/on × EOS/句点` 四格;source 是覆盖单位,seed 只是题内重复。正式结果为
|
||
250 / 256 natural EOS、247 个完整 token trajectory hashes,四道 GSM8K 分别
|
||
`14/16 · 16/16 · 8/16 · 9/16`,四道 HumanEval 分别
|
||
`16/16 · 8/16 · 12/16 · 16/16`。句点在 11 / 16 条 source 上缩短平均长度,但
|
||
English 的首条 source 为 `−121`、其余三条为正,证明单题均值会与多数 source
|
||
方向相反;新进程 R0 的八项合同字段仍为 `64 / 64` exact。
|
||
Round 08 再把覆盖扩大到 HumanEval / GSM8K 各 32 条冻结任务,并以 SHA-256 显式
|
||
uniform tape 代替“重置同一 seed”的伪共同随机数:T0 全任务四条件 256 条、额外三条
|
||
随机带诊断 96 条,共 352 条正式输出,343 条 natural EOS、320 个完整 trajectory hashes。
|
||
两个域分别做 10,000 次选定任务 paired bootstrap;八个正确性区间全部跨零,但
|
||
system-at-period 的输出长度在 Code 为 `−130.9 [−178.7,−83.2]`、在 Math 为
|
||
`+25.1 [7.9,44.5]`,说明干预方向依赖任务域。全新进程对 64 条输出的 uniform hash、
|
||
token IDs、文本与停止等十二字段逐一重放,`64 / 64` exact;同时公开评分金标准被运行器
|
||
提前加载、但没有进入 prompt / logits / CDF / tape / selection 的流程偏差。
|
||
详见
|
||
[DEEPSEEK_V2_LITE_TRACE.md](./research/DEEPSEEK_V2_LITE_TRACE.md) 与
|
||
[DEEPSEEK_MLA_ABSORB_AUDIT.md](./research/DEEPSEEK_MLA_ABSORB_AUDIT.md)、
|
||
[DEEPSEEK_ROUTING_CORPUS_AUDIT.md](./research/DEEPSEEK_ROUTING_CORPUS_AUDIT.md)、
|
||
[DEEPSEEK_ROUTING_LENGTH_CONTROL_AUDIT.md](./research/DEEPSEEK_ROUTING_LENGTH_CONTROL_AUDIT.md) 与
|
||
[DEEPSEEK_ROUTING_TEMPLATE_AUDIT.md](./research/DEEPSEEK_ROUTING_TEMPLATE_AUDIT.md)、
|
||
[DEEPSEEK_ROUTING_HISTORY_FACTORIAL_AUDIT.md](./research/DEEPSEEK_ROUTING_HISTORY_FACTORIAL_AUDIT.md)、
|
||
[DEEPSEEK_ROUTING_HISTORY_DISTANCE_CONTROL_AUDIT.md](./research/DEEPSEEK_ROUTING_HISTORY_DISTANCE_CONTROL_AUDIT.md) 与
|
||
[DEEPSEEK_ROUTING_HISTORY_BOUNDARY_TOKEN_AUDIT.md](./research/DEEPSEEK_ROUTING_HISTORY_BOUNDARY_TOKEN_AUDIT.md) 与
|
||
[DEEPSEEK_ROUTING_ROLE_MARKER_HEAD_AUDIT.md](./research/DEEPSEEK_ROUTING_ROLE_MARKER_HEAD_AUDIT.md)、
|
||
[DEEPSEEK_ROUTING_SPECIAL_TOKEN_FAMILY_AUDIT.md](./research/DEEPSEEK_ROUTING_SPECIAL_TOKEN_FAMILY_AUDIT.md) 与
|
||
[DEEPSEEK_ROUTING_ROLE_MARKER_BLOCK_AUDIT.md](./research/DEEPSEEK_ROUTING_ROLE_MARKER_BLOCK_AUDIT.md),以及
|
||
[DEEPSEEK_V2_LITE_CHAT_BEHAVIOR_AUDIT.md](./research/DEEPSEEK_V2_LITE_CHAT_BEHAVIOR_AUDIT.md) 与
|
||
[DEEPSEEK_V2_LITE_CHAT_COMPLETION_DEPTH_AUDIT.md](./research/DEEPSEEK_V2_LITE_CHAT_COMPLETION_DEPTH_AUDIT.md)、
|
||
[DEEPSEEK_V2_LITE_CHAT_SAMPLING_PROTOCOL.md](./research/DEEPSEEK_V2_LITE_CHAT_SAMPLING_PROTOCOL.md) 与
|
||
[DEEPSEEK_V2_LITE_CHAT_SAMPLING_AUDIT.md](./research/DEEPSEEK_V2_LITE_CHAT_SAMPLING_AUDIT.md),以及
|
||
[DEEPSEEK_V2_LITE_CHAT_CROSS_SOURCE_SAMPLING_PROTOCOL.md](./research/DEEPSEEK_V2_LITE_CHAT_CROSS_SOURCE_SAMPLING_PROTOCOL.md) 与
|
||
[DEEPSEEK_V2_LITE_CHAT_CROSS_SOURCE_SAMPLING_AUDIT.md](./research/DEEPSEEK_V2_LITE_CHAT_CROSS_SOURCE_SAMPLING_AUDIT.md),以及
|
||
[DEEPSEEK_V2_LITE_CHAT_TASK_BOOTSTRAP_PROTOCOL.md](./research/DEEPSEEK_V2_LITE_CHAT_TASK_BOOTSTRAP_PROTOCOL.md) 与
|
||
[DEEPSEEK_V2_LITE_CHAT_TASK_BOOTSTRAP_CRN_AUDIT.md](./research/DEEPSEEK_V2_LITE_CHAT_TASK_BOOTSTRAP_CRN_AUDIT.md)。
|
||
其余专题按进度账本持续扩建。
|
||
|
||
## 本地开发
|
||
|
||
```bash
|
||
npm install
|
||
npm run dev
|
||
```
|
||
|
||
生产构建与检查:
|
||
|
||
```bash
|
||
npm run check
|
||
npm run build
|
||
```
|
||
|
||
## 内容与代码许可
|
||
|
||
- 网站代码采用 MIT License。
|
||
- 原创文字与重绘图采用 [CC BY-SA 4.0](https://creativecommons.org/licenses/by-sa/4.0/deed.zh-hans)。
|
||
- 被引用论文、图表、模型与商标仍归各自权利人所有;项目优先链接一手来源,并明确标注改绘与推断。
|