9.3 KiB
9.3 KiB
原生多模态专题 · Grok 候选召回
生成方式:Grok CLI Headless(
--no-subagents --no-memory) 日期:2026-07-29 角色:只负责扩大候选池、暴露易混边界和提供可视化灵感,不作为事实来源。进入正式课程的技术主张、数字和历史定位,必须回到论文、技术报告或官方代码仓库核验。
1. Grok 建议的十六张问题账
| 编号 | 问题账 | 核心问题 |
|---|---|---|
| Q1 | Visual semantic space | 图像怎样获得可与语言比较的语义表示? |
| Q2 | Connector | 视觉特征怎样接进语言模型,谁负责跨模态翻译? |
| Q3 | Resolution & token budget | 高分辨率细节为何会迅速吃光上下文与算力? |
| Q4 | OCR & documents | 场景文字、文档、表格与公式为何比自然图像更难? |
| Q5 | Video | 时间维度怎样进入模型,帧数与视觉 Token 怎样压缩? |
| Q6 | Fusion timing | early fusion、cross-attention、late fusion 分别交换了什么? |
| Q7 | Understanding vs generation | 图像理解与图像生成能否共用表示和主干? |
| Q8 | Multimodal SFT | 指令数据怎样把视觉表征变成可对话能力? |
| Q9 | Multimodal RL | 奖励怎样越过文字输出,回到视觉观察与动作? |
| Q10 | Agent & tools | 模型怎样主动裁剪、放大、写代码、截图并继续观察? |
| Q11 | Hallucination | 模型为何会相信语言先验而忽略像素证据? |
| Q12 | Safety | 图像中的提示注入、隐私与工具副作用怎样进入威胁模型? |
| Q13 | Evaluation | 感知、OCR、知识、推理、视频和 Agent 应怎样分开测? |
| Q14 | Training systems | 图像尺寸、动态 Token 与数据混合怎样改变并行和吞吐? |
| Q15 | Sparse MoE + vision | 视觉 Token 会怎样影响路由负载、专家专化与稳定性? |
| Q16 | DeepSeek vs Kimi | 两条产品线分别把什么问题当成了主矛盾? |
这些问题不会直接变成十六段论文罗列。正式章节会先建立一条统一的数据流,再让每张问题账回答“瓶颈为什么出现、哪篇论文改变了设计空间、代价是什么”。
2. Grok 召回的七个历史波次
| 波次 | 时间 | 候选主题 | 进入主线前要核验的边界 |
|---|---|---|---|
| W1 | 2012–2017 | AlexNet、ResNet、检测与区域特征 | 这是视觉表示前史,不应伪装成 LLM |
| W2 | 2021–2023 | CLIP、ALIGN、LiT、SigLIP | 对齐表征不等于能开放式对话 |
| W3 | 2021–2023 | Frozen、Flamingo、BLIP-2、LLaVA | “冻结”了谁、训练了谁必须逐篇说明 |
| W4 | 2023–2025 | NaViT、动态切图、OCR、文档、视频 | 更高分辨率的真实代价是视觉 Token 与系统方差 |
| W5 | 2023–2025 | Chameleon、Transfusion、SOLO、统一自回归 | 统一主干、统一序列、统一目标是三个不同命题 |
| W6 | 2024–2025 | DeepSeek-VL/VL2、Janus、Qwen、InternVL、Kimi-VL | 产品线之间不能只用总参数或榜单横比 |
| W7 | 2025–2026 | 视觉推理 RL、视觉工具、GUI Agent、K2.5、K3 | 结果必须记录工具、harness、步数与验证器 |
3. Grok 召回的候选论文池
视觉表示与语言监督
- AlexNet
- ResNet
- Vision Transformer
- CLIP
- ALIGN
- LiT
- SigLIP
- NaViT
连接器与冻结式 VLM
- Frozen
- Flamingo
- BLIP
- BLIP-2
- MiniGPT-4
- LLaVA
- LLaVA-1.5
- InstructBLIP
- Kosmos-2
高分辨率、OCR、文档与视频
- Qwen-VL / Qwen2-VL / Qwen2.5-VL
- InternVL / InternVL 1.5 / InternVL 2.5
- LLaVA-NeXT / LLaVA-OneVision
- Video-LLaVA
- LLaMA-VID
- DeepSeek-VL
- DeepSeek-VL2
- DeepSeek-OCR
- DeepSeek-OCR2
- Kimi-VL
统一理解与生成
- Chameleon
- Transfusion
- SOLO
- Janus
- JanusFlow
- Janus-Pro
多模态推理、工具与 Agent
- Visual Sketchpad
- Vision-R1
- VTool-R1
- ToolsRL
- OSWorld
- VisualWebArena
- Kimi K2.5
- Kimi K3
评测、幻觉与诊断
- MMBench
- MMMU
- MathVista
- OCRBench
- POPE
- HallusionBench
- Video-MME
4. DeepSeek 候选分支:不要画成一条直线
Grok 提醒应把 DeepSeek 多模态工作拆成三条问题导向不同的分支:
- 理解分支:DeepSeek-VL → DeepSeek-VL2
- 关注真实世界高分辨率输入、动态切图、视觉—语言竞争和稀疏语言骨干;
- 核验重点:两代视觉编码器、切图策略、像素重排、激活参数量。
- 统一生成分支:Janus → JanusFlow → Janus-Pro
- 关注理解和生成是否应该共享视觉编码路径;
- 核验重点:解耦的是编码器还是主干,生成目标是离散自回归还是 rectified flow。
- 光学压缩分支:DeepSeek-OCR → DeepSeek-OCR2
- 关注把长文本上下文先压到图像,再以较少视觉 Token 解码;
- 核验重点:DeepEncoder 结构、压缩率定义、官方报告的准确率边界、OCR2 的 token 重排。
正式课程不会用“DeepSeek 一路演进到 OCR”这种线性叙事,因为三条分支优化的是不同目标。
5. Kimi 候选分支:MoonViT 的三次训练制度变化
Grok 给出的候选主线:
Kimi-VL
SigLIP 初始化
+ 对比学习 / caption 视觉预训练
+ MoonViT / NaViT 动态分辨率
↓
Kimi K2.5
MoonViT-3D
+ 图像 / 视频共享参数
+ caption NTP,不再使用对比损失
+ text-only SFT 激活视觉工具
↓
Kimi K3
MoonViT-V2 从头训练
+ 与语言主干共同做 NTP
+ 无事后视觉对齐阶段
+ vision-in-the-loop Agent
这一主线已被选为正式章节的锚点,但每个框中的初始化、损失和训练阶段仍以 Kimi-VL、K2.5、K3 三份官方报告逐项核验。
6. 候选可视化
- 像素 → patch → 视觉 Token → 压缩 → 上下文占比的水流图;
- 224²、1024²、3584² 在不同 patch size 下的 Token 爆炸对比;
- CLIP batch 内成对矩阵与 SigLIP 独立 sigmoid 对比;
- Frozen / Flamingo / BLIP-2 / LLaVA 连接器横截面;
- 固定缩放、动态切图、NaViT packing 的分辨率策略对比;
- image / video 的空间注意力与时间注意力分解;
- 理解、生成、工具行动三种“输出空间”;
- Janus 的双视觉编码路径与共享自回归主干;
- DeepSeek-VL → VL2 的高分辨率路线;
- DeepSeek-OCR 的“文字 Token → 页面图像 → 视觉 Token”压缩漏斗;
- DeepSeek-OCR2 的语义 token 重排;
- Kimi 三代 MoonViT 训练制度时间线;
- K3 原生多模态的数据—训练—Agent 闭环;
- 多模态幻觉的“语言先验压过视觉证据”跷跷板;
- 感知、OCR、推理、视频、Agent 五类评测矩阵。
7. 候选交互实验
Lab A · 视觉 Token 预算
调节分辨率、patch size、帧数、时间池化、2×2 pixel shuffle 与上下文长度,观察原始 patch 数、压缩后 Token 数和上下文占比。
Lab B · 连接器与训练阶段
切换 Flamingo、BLIP-2、LLaVA、Kimi-VL、K2.5、K3,观察哪些模块冻结、哪些目标生效、训练制度怎样变化。
Lab C · 光学上下文压缩
把文档文本 Token 数、页面数和视觉 Token 数转成压缩率。DeepSeek-OCR 的曲线只以“论文报告值”显示;插值区域必须明确标成教学近似。
Lab D · Vision-in-the-loop
比较直接 VQA、文字思维链和工具闭环:裁剪、放大、OCR、Python 图像处理、截图和最终验证分别改变什么观察。
8. Grok 暴露的二十个易错点
- 视觉编码器不等于多模态模型;
- CLIP 的共享语义空间不等于生成式语言能力;
- projector 小不代表视觉信息传输没有瓶颈;
- “冻结 LLM”与“冻结视觉塔”不是同一个训练制度;
- cross-attention 与把视觉 Token 直接塞进序列不是同一种融合;
- native resolution 不等于没有 resize 或 patch 化;
- 动态切图会引入重复区域与 tile 顺序问题;
- 更高像素不必然产生更多有效信息;
- 视频不是“很多独立图片”的简单堆叠;
- 时间池化会省 Token,也会损失短暂事件;
- 统一主干不等于理解与生成共用同一个视觉编码器;
- 统一序列不等于统一损失;
- “原生多模态”没有唯一行业定义;
- K3 原生训练仍然保留 MoonViT-V2 与投影层;
- DeepSeek-VL2 的总参数不能与激活参数混用;
- DeepSeek-OCR 的压缩率和准确率是论文设定下的报告值;
- 多模态 RL 的提升不能自动归因于视觉推理;
- 工具调用提升可能来自 harness,而非裸模型;
- benchmark 总分会掩盖感知、OCR、知识与推理瓶颈;
- 图像中的间接提示注入会把视觉输入变成安全边界。
9. 正式筛选规则
- 核心论文必须改变一种表示、接口、训练目标、系统策略或评测方法;
- 每个数字绑定模型版本、输入设置、训练或评测条件;
- 官方报告数字写成“作者报告”,不写成本站复测;
- 多模态 Agent 结果同时记录视觉观察、工具、harness、步数和 verifier;
- 章节主线控制在约 50–60 个节点,外围候选进入论文图谱;
- DeepSeek 与 Kimi 获得独立聚光灯,但不牺牲从 CLIP、连接器、高分辨率到原生训练的完整历史;
- “原生”必须拆成原生数据混合、原生训练目标、原生主干优化、原生输入输出和原生 Agent 闭环五个可核验维度。