feat: publish native multimodal chapter
This commit is contained in:
@@ -108,6 +108,14 @@ Kimi K2→K2.5→K3 的 white-box harness、AET、AgentENV 和百万 Token Agent
|
||||
|
||||
ViT/CLIP → Flamingo/BLIP-2/LLaVA → 原生多模态与视频;Kimi-VL、MoonViT-V2 和“视觉进入同一主干”的意义。
|
||||
|
||||
首版已完成:以语义空间、连接器、视觉 Token、OCR / 文档、视频、融合、理解 / 生成、SFT、RL、
|
||||
Agent、幻觉、安全、评测、系统、MoE 与产品谱系十六张账,串起 2012–2026 的 55 个一手节点。
|
||||
正文把像素、视觉塔、压缩 / projector、主干与输出 / 工具拆成五层;重点讲解 DeepSeek-VL/VL2、
|
||||
Janus、DeepSeek-OCR 三条不同分支,以及 Kimi-VL → K2.5 → K3 从 SigLIP 初始化和独立对齐,
|
||||
走到 MoonViT-V2 从头共同 next-token prediction 的训练制度变化。配套视觉 Token、connector /
|
||||
native、光学上下文压缩与 vision-in-the-loop 四个独立实验,所有作者报告、教学插值和证据外区域
|
||||
明确分级。
|
||||
|
||||
### 14. 推理服务与低成本部署
|
||||
|
||||
KV Cache、PagedAttention/vLLM、连续批处理、推测解码、Prefill/Decode 解耦、前缀缓存、集群调度;Mooncake 与 K3 KDA-aware serving。
|
||||
|
||||
Reference in New Issue
Block a user