LLM Atlas
一套以 Kimi K3 技术报告为锚点、从第一性原理重新梳理大语言模型技术发展的中文开放课程。
项目不把论文按年份堆成目录,而是持续回答四个问题:
- 当时真正卡住研究者的问题是什么?
- 旧方法为什么不够?
- 关键论文改变了哪个假设或工程瓶颈?
- 这条思路如何汇入今天的 Kimi K3、DeepSeek 与前沿 Agent 系统?
当前交付
- 网站:
https://llm-atlas.k1412.top/ - 开源仓库:
https://git.k1412.top/wuyang/llm-atlas - 研究路线:ROADMAP.md
- 持续进度:PROGRESS.md
- 证据与写作规范:research/METHODOLOGY.md
当前里程碑包含 17 专题学习地图、486 篇关键论文索引、Kimi K3 完整导读,
语言模型前史、Transformer 基础、表示/位置/残差、DeepSeek 技术谱系、Scaling Laws、数据工程、长上下文、MoE、指令微调与人类偏好、推理、工具使用与长程 Agent、原生多模态、训练系统、推理服务、数值优化,以及评测与安全深度专题,
以及 80 个覆盖核心机制的原创交互视图。K3 二轮导读以 32 张问题账、16 图 / 5 表审计、
8 个交互实验和 100 个一手/官方节点,完整覆盖架构、预训练、后训练、系统、评测、案例与附录。
第三轮已完成开放工件与首个真实 kernel 里程碑:固定官方模型与 FlashKDA revisions,审计 96 个 checkpoint shards、
497,220 个 tensor entries、真实 KDA / MLA / MoE / MoonViT shapes 与小范围参数统计,并用 4 个新视图
明确区分官方观测、确定性推导、本机执行、合成探针和未决矛盾;同时用隔离 CUDA 13.0 环境编译
sm_120a wheel,在 RTX 5090 上完成 6/6 官方参考 exact-match 和 K3 fixed / varlen 形状计时。详见
K3_ARTIFACT_AUDIT.md 与
checkpoint_probe.py、FlashKDA probe。
DeepSeek 三轮专题以 24 张问题账、10 次技术转向、
13 个交互实验和 60 个一手/官方节点,串起 Dense、MoE、MLA、V3 协同、R1 与 V4;
并固定官方 V2-Lite revision,在 RTX 5090 上连续执行 7/27 层,记录 3,240 次真实专家选择、
MLA/HF eager cache shapes 与 31/31 exact 独立复跑;进一步用真实 layer-1 权重执行官方 V3
naive/absorb 路径,实际写入 576 元素 latent cache,并以 FP32 将两种结合顺序的最大误差压到
1.19e-7;再以 WikiText-2、TNEWS、HumanEval、GSM8K 各 32 条固定样本执行 304,560 次
真实 top-6 路由,用 2,000 次 prompt-level 分层 bootstrap 同报点估计与 95% 区间,独立重跑
整份 JSON byte-exact。随后又对同一批 128 条、源长度至少 24 tokens 的 prompt 执行
16 / 24-token 嵌套前缀对照,新增 184,320 次真实路由;paired bootstrap 显示延长前缀通常
降低 CV,尤其 Layer 2 代码为 −0.251 [−0.283, −0.215],但六层中文↔代码 JSD 仍未消失。
最新一轮再用官方 chat template 对同一段内容构造 raw / user / generation 三个条件,
新增 382,032 次真实路由:精确对齐 2,874 个内容 token 后,RAW→USER 的方向随层与域改变,
而 USER→GENERATION 的 21,852 个共享前缀 ordered top-6 全部 exact,验证未来 suffix
不能改写过去路由。随后又把 system 与 one-shot 组成固定 16 / 17-token 正交增量的
2×2 实验,新增 865,440 次真实路由;在目标内容上,加入 one-shot 历史后 system-edge
TV 在 24 / 24 个 layer×domain 中都下降,均值从 0.073 降至 0.019,但这一模式不被
越界解释为示例语义或能力提升。最新一步再加入与原 one-shot 精确等长的重复词元 filler,
新增 1,376,496 次真实路由:system-edge TV 呈 0.0738→0.0378→0.0188
的 none→filler→demo 两级阶梯,两个台阶都在 24 / 24 格下降且 paired 区间完全低于零;
但 filler 仍是学习过的 token,不能冒充纯距离因果。当前累计 3,112,848 次公开语料路由。FlashMLA 的
SM90/SM100 官方支持矩阵与本机 SM120 边界单独记账。详见
DEEPSEEK_V2_LITE_TRACE.md 与
DEEPSEEK_MLA_ABSORB_AUDIT.md、
DEEPSEEK_ROUTING_CORPUS_AUDIT.md、
DEEPSEEK_ROUTING_LENGTH_CONTROL_AUDIT.md 与
DEEPSEEK_ROUTING_TEMPLATE_AUDIT.md、
DEEPSEEK_ROUTING_HISTORY_FACTORIAL_AUDIT.md、
DEEPSEEK_ROUTING_HISTORY_DISTANCE_CONTROL_AUDIT.md。
其余专题按进度账本持续扩建。
本地开发
npm install
npm run dev
生产构建与检查:
npm run check
npm run build
内容与代码许可
- 网站代码采用 MIT License。
- 原创文字与重绘图采用 CC BY-SA 4.0。
- 被引用论文、图表、模型与商标仍归各自权利人所有;项目优先链接一手来源,并明确标注改绘与推断。