LLM Atlas

一套以 Kimi K3 技术报告为锚点、从第一性原理重新梳理大语言模型技术发展的中文开放课程。

项目不把论文按年份堆成目录,而是持续回答四个问题:

  1. 当时真正卡住研究者的问题是什么?
  2. 旧方法为什么不够?
  3. 关键论文改变了哪个假设或工程瓶颈?
  4. 这条思路如何汇入今天的 Kimi K3、DeepSeek 与前沿 Agent 系统?

当前交付

当前里程碑包含 17 专题学习地图、486 篇关键论文索引、Kimi K3 完整导读, 语言模型前史、Transformer 基础、表示/位置/残差、DeepSeek 技术谱系、Scaling Laws、数据工程、长上下文、MoE、指令微调与人类偏好、推理、工具使用与长程 Agent、原生多模态、训练系统、推理服务、数值优化,以及评测与安全深度专题, 以及 71 个覆盖核心机制的原创交互视图。K3 二轮导读以 32 张问题账、16 图 / 5 表审计、 8 个交互实验和 100 个一手/官方节点,完整覆盖架构、预训练、后训练、系统、评测、案例与附录。 第三轮已完成开放工件与首个真实 kernel 里程碑:固定官方模型与 FlashKDA revisions,审计 96 个 checkpoint shards、 497,220 个 tensor entries、真实 KDA / MLA / MoE / MoonViT shapes 与小范围参数统计,并用 4 个新视图 明确区分官方观测、确定性推导、本机执行、合成探针和未决矛盾;同时用隔离 CUDA 13.0 环境编译 sm_120a wheel,在 RTX 5090 上完成 6/6 官方参考 exact-match 和 K3 fixed / varlen 形状计时。详见 K3_ARTIFACT_AUDIT.md 与 checkpoint_probe.py、FlashKDA probe。 DeepSeek 二轮专题以 24 张问题账、10 次技术转向、 4 个交互实验和 60 个一手/官方节点,串起 Dense、MoE、MLA、V3 协同、R1 与 V4。 其余专题按进度账本持续扩建。

本地开发

npm install
npm run dev

生产构建与检查:

npm run check
npm run build

内容与代码许可

  • 网站代码采用 MIT License。
  • 原创文字与重绘图采用 CC BY-SA 4.0。
  • 被引用论文、图表、模型与商标仍归各自权利人所有;项目优先链接一手来源,并明确标注改绘与推断。
S
Description
从第一性原理到 Kimi K3 的中文 LLM 技术全景与开放课程
https://llm-atlas.k1412.top Readme MIT 76 MiB
Languages
Astro 65.2%
Python 19%
JavaScript 11.1%
TypeScript 4.2%
CSS 0.5%