feat: publish native multimodal chapter

This commit is contained in:
wuyang
2026-07-29 07:51:42 +08:00
parent 8e5f08ac21
commit 9f5673213d
24 changed files with 4867 additions and 41 deletions
+8
View File
@@ -108,6 +108,14 @@ Kimi K2→K2.5→K3 的 white-box harness、AET、AgentENV 和百万 Token Agent
ViT/CLIP → Flamingo/BLIP-2/LLaVA → 原生多模态与视频;Kimi-VL、MoonViT-V2 和“视觉进入同一主干”的意义。
首版已完成:以语义空间、连接器、视觉 Token、OCR / 文档、视频、融合、理解 / 生成、SFT、RL、
Agent、幻觉、安全、评测、系统、MoE 与产品谱系十六张账,串起 2012–2026 的 55 个一手节点。
正文把像素、视觉塔、压缩 / projector、主干与输出 / 工具拆成五层;重点讲解 DeepSeek-VL/VL2、
Janus、DeepSeek-OCR 三条不同分支,以及 Kimi-VL → K2.5 → K3 从 SigLIP 初始化和独立对齐,
走到 MoonViT-V2 从头共同 next-token prediction 的训练制度变化。配套视觉 Token、connector /
native、光学上下文压缩与 vision-in-the-loop 四个独立实验,所有作者报告、教学插值和证据外区域
明确分级。
### 14. 推理服务与低成本部署
KV Cache、PagedAttention/vLLM、连续批处理、推测解码、Prefill/Decode 解耦、前缀缓存、集群调度;Mooncake 与 K3 KDA-aware serving。