Files
llm-atlas/research/MULTIMODAL_GROK_LEADS.md
T
2026-07-29 07:52:27 +08:00

219 lines
9.3 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 原生多模态专题 · Grok 候选召回
> 生成方式:Grok CLI Headless`--no-subagents --no-memory`
> 日期:2026-07-29
> 角色:只负责扩大候选池、暴露易混边界和提供可视化灵感,不作为事实来源。进入正式课程的技术主张、数字和历史定位,必须回到论文、技术报告或官方代码仓库核验。
## 1. Grok 建议的十六张问题账
| 编号 | 问题账 | 核心问题 |
|---|---|---|
| Q1 | Visual semantic space | 图像怎样获得可与语言比较的语义表示? |
| Q2 | Connector | 视觉特征怎样接进语言模型,谁负责跨模态翻译? |
| Q3 | Resolution & token budget | 高分辨率细节为何会迅速吃光上下文与算力? |
| Q4 | OCR & documents | 场景文字、文档、表格与公式为何比自然图像更难? |
| Q5 | Video | 时间维度怎样进入模型,帧数与视觉 Token 怎样压缩? |
| Q6 | Fusion timing | early fusion、cross-attention、late fusion 分别交换了什么? |
| Q7 | Understanding vs generation | 图像理解与图像生成能否共用表示和主干? |
| Q8 | Multimodal SFT | 指令数据怎样把视觉表征变成可对话能力? |
| Q9 | Multimodal RL | 奖励怎样越过文字输出,回到视觉观察与动作? |
| Q10 | Agent & tools | 模型怎样主动裁剪、放大、写代码、截图并继续观察? |
| Q11 | Hallucination | 模型为何会相信语言先验而忽略像素证据? |
| Q12 | Safety | 图像中的提示注入、隐私与工具副作用怎样进入威胁模型? |
| Q13 | Evaluation | 感知、OCR、知识、推理、视频和 Agent 应怎样分开测? |
| Q14 | Training systems | 图像尺寸、动态 Token 与数据混合怎样改变并行和吞吐? |
| Q15 | Sparse MoE + vision | 视觉 Token 会怎样影响路由负载、专家专化与稳定性? |
| Q16 | DeepSeek vs Kimi | 两条产品线分别把什么问题当成了主矛盾? |
这些问题不会直接变成十六段论文罗列。正式章节会先建立一条统一的数据流,再让每张问题账回答“瓶颈为什么出现、哪篇论文改变了设计空间、代价是什么”。
## 2. Grok 召回的七个历史波次
| 波次 | 时间 | 候选主题 | 进入主线前要核验的边界 |
|---|---|---|---|
| W1 | 20122017 | AlexNet、ResNet、检测与区域特征 | 这是视觉表示前史,不应伪装成 LLM |
| W2 | 20212023 | CLIP、ALIGN、LiT、SigLIP | 对齐表征不等于能开放式对话 |
| W3 | 20212023 | Frozen、Flamingo、BLIP-2、LLaVA | “冻结”了谁、训练了谁必须逐篇说明 |
| W4 | 20232025 | NaViT、动态切图、OCR、文档、视频 | 更高分辨率的真实代价是视觉 Token 与系统方差 |
| W5 | 20232025 | Chameleon、Transfusion、SOLO、统一自回归 | 统一主干、统一序列、统一目标是三个不同命题 |
| W6 | 20242025 | DeepSeek-VL/VL2、Janus、Qwen、InternVL、Kimi-VL | 产品线之间不能只用总参数或榜单横比 |
| W7 | 20252026 | 视觉推理 RL、视觉工具、GUI Agent、K2.5、K3 | 结果必须记录工具、harness、步数与验证器 |
## 3. Grok 召回的候选论文池
### 视觉表示与语言监督
- AlexNet
- ResNet
- Vision Transformer
- CLIP
- ALIGN
- LiT
- SigLIP
- NaViT
### 连接器与冻结式 VLM
- Frozen
- Flamingo
- BLIP
- BLIP-2
- MiniGPT-4
- LLaVA
- LLaVA-1.5
- InstructBLIP
- Kosmos-2
### 高分辨率、OCR、文档与视频
- Qwen-VL / Qwen2-VL / Qwen2.5-VL
- InternVL / InternVL 1.5 / InternVL 2.5
- LLaVA-NeXT / LLaVA-OneVision
- Video-LLaVA
- LLaMA-VID
- DeepSeek-VL
- DeepSeek-VL2
- DeepSeek-OCR
- DeepSeek-OCR2
- Kimi-VL
### 统一理解与生成
- Chameleon
- Transfusion
- SOLO
- Janus
- JanusFlow
- Janus-Pro
### 多模态推理、工具与 Agent
- Visual Sketchpad
- Vision-R1
- VTool-R1
- ToolsRL
- OSWorld
- VisualWebArena
- Kimi K2.5
- Kimi K3
### 评测、幻觉与诊断
- MMBench
- MMMU
- MathVista
- OCRBench
- POPE
- HallusionBench
- Video-MME
## 4. DeepSeek 候选分支:不要画成一条直线
Grok 提醒应把 DeepSeek 多模态工作拆成三条问题导向不同的分支:
1. **理解分支:DeepSeek-VL → DeepSeek-VL2**
- 关注真实世界高分辨率输入、动态切图、视觉—语言竞争和稀疏语言骨干;
- 核验重点:两代视觉编码器、切图策略、像素重排、激活参数量。
2. **统一生成分支:Janus → JanusFlow → Janus-Pro**
- 关注理解和生成是否应该共享视觉编码路径;
- 核验重点:解耦的是编码器还是主干,生成目标是离散自回归还是 rectified flow。
3. **光学压缩分支:DeepSeek-OCR → DeepSeek-OCR2**
- 关注把长文本上下文先压到图像,再以较少视觉 Token 解码;
- 核验重点:DeepEncoder 结构、压缩率定义、官方报告的准确率边界、OCR2 的 token 重排。
正式课程不会用“DeepSeek 一路演进到 OCR”这种线性叙事,因为三条分支优化的是不同目标。
## 5. Kimi 候选分支:MoonViT 的三次训练制度变化
Grok 给出的候选主线:
```text
Kimi-VL
SigLIP 初始化
+ 对比学习 / caption 视觉预训练
+ MoonViT / NaViT 动态分辨率
Kimi K2.5
MoonViT-3D
+ 图像 / 视频共享参数
+ caption NTP,不再使用对比损失
+ text-only SFT 激活视觉工具
Kimi K3
MoonViT-V2 从头训练
+ 与语言主干共同做 NTP
+ 无事后视觉对齐阶段
+ vision-in-the-loop Agent
```
这一主线已被选为正式章节的锚点,但每个框中的初始化、损失和训练阶段仍以 Kimi-VL、K2.5、K3 三份官方报告逐项核验。
## 6. 候选可视化
1. 像素 → patch → 视觉 Token → 压缩 → 上下文占比的水流图;
2. 224²、1024²、3584² 在不同 patch size 下的 Token 爆炸对比;
3. CLIP batch 内成对矩阵与 SigLIP 独立 sigmoid 对比;
4. Frozen / Flamingo / BLIP-2 / LLaVA 连接器横截面;
5. 固定缩放、动态切图、NaViT packing 的分辨率策略对比;
6. image / video 的空间注意力与时间注意力分解;
7. 理解、生成、工具行动三种“输出空间”;
8. Janus 的双视觉编码路径与共享自回归主干;
9. DeepSeek-VL → VL2 的高分辨率路线;
10. DeepSeek-OCR 的“文字 Token → 页面图像 → 视觉 Token”压缩漏斗;
11. DeepSeek-OCR2 的语义 token 重排;
12. Kimi 三代 MoonViT 训练制度时间线;
13. K3 原生多模态的数据—训练—Agent 闭环;
14. 多模态幻觉的“语言先验压过视觉证据”跷跷板;
15. 感知、OCR、推理、视频、Agent 五类评测矩阵。
## 7. 候选交互实验
### Lab A · 视觉 Token 预算
调节分辨率、patch size、帧数、时间池化、2×2 pixel shuffle 与上下文长度,观察原始 patch 数、压缩后 Token 数和上下文占比。
### Lab B · 连接器与训练阶段
切换 Flamingo、BLIP-2、LLaVA、Kimi-VL、K2.5、K3,观察哪些模块冻结、哪些目标生效、训练制度怎样变化。
### Lab C · 光学上下文压缩
把文档文本 Token 数、页面数和视觉 Token 数转成压缩率。DeepSeek-OCR 的曲线只以“论文报告值”显示;插值区域必须明确标成教学近似。
### Lab D · Vision-in-the-loop
比较直接 VQA、文字思维链和工具闭环:裁剪、放大、OCR、Python 图像处理、截图和最终验证分别改变什么观察。
## 8. Grok 暴露的二十个易错点
1. 视觉编码器不等于多模态模型;
2. CLIP 的共享语义空间不等于生成式语言能力;
3. projector 小不代表视觉信息传输没有瓶颈;
4. “冻结 LLM”与“冻结视觉塔”不是同一个训练制度;
5. cross-attention 与把视觉 Token 直接塞进序列不是同一种融合;
6. native resolution 不等于没有 resize 或 patch 化;
7. 动态切图会引入重复区域与 tile 顺序问题;
8. 更高像素不必然产生更多有效信息;
9. 视频不是“很多独立图片”的简单堆叠;
10. 时间池化会省 Token,也会损失短暂事件;
11. 统一主干不等于理解与生成共用同一个视觉编码器;
12. 统一序列不等于统一损失;
13. “原生多模态”没有唯一行业定义;
14. K3 原生训练仍然保留 MoonViT-V2 与投影层;
15. DeepSeek-VL2 的总参数不能与激活参数混用;
16. DeepSeek-OCR 的压缩率和准确率是论文设定下的报告值;
17. 多模态 RL 的提升不能自动归因于视觉推理;
18. 工具调用提升可能来自 harness,而非裸模型;
19. benchmark 总分会掩盖感知、OCR、知识与推理瓶颈;
20. 图像中的间接提示注入会把视觉输入变成安全边界。
## 9. 正式筛选规则
- 核心论文必须改变一种表示、接口、训练目标、系统策略或评测方法;
- 每个数字绑定模型版本、输入设置、训练或评测条件;
- 官方报告数字写成“作者报告”,不写成本站复测;
- 多模态 Agent 结果同时记录视觉观察、工具、harness、步数和 verifier
- 章节主线控制在约 50–60 个节点,外围候选进入论文图谱;
- DeepSeek 与 Kimi 获得独立聚光灯,但不牺牲从 CLIP、连接器、高分辨率到原生训练的完整历史;
- “原生”必须拆成原生数据混合、原生训练目标、原生主干优化、原生输入输出和原生 Agent 闭环五个可核验维度。