feat: publish native multimodal chapter
This commit is contained in:
@@ -0,0 +1,218 @@
|
||||
# 原生多模态专题 · Grok 候选召回
|
||||
|
||||
> 生成方式:Grok CLI Headless(`--no-subagents --no-memory`)
|
||||
> 日期:2026-07-29
|
||||
> 角色:只负责扩大候选池、暴露易混边界和提供可视化灵感,不作为事实来源。进入正式课程的技术主张、数字和历史定位,必须回到论文、技术报告或官方代码仓库核验。
|
||||
|
||||
## 1. Grok 建议的十六张问题账
|
||||
|
||||
| 编号 | 问题账 | 核心问题 |
|
||||
|---|---|---|
|
||||
| Q1 | Visual semantic space | 图像怎样获得可与语言比较的语义表示? |
|
||||
| Q2 | Connector | 视觉特征怎样接进语言模型,谁负责跨模态翻译? |
|
||||
| Q3 | Resolution & token budget | 高分辨率细节为何会迅速吃光上下文与算力? |
|
||||
| Q4 | OCR & documents | 场景文字、文档、表格与公式为何比自然图像更难? |
|
||||
| Q5 | Video | 时间维度怎样进入模型,帧数与视觉 Token 怎样压缩? |
|
||||
| Q6 | Fusion timing | early fusion、cross-attention、late fusion 分别交换了什么? |
|
||||
| Q7 | Understanding vs generation | 图像理解与图像生成能否共用表示和主干? |
|
||||
| Q8 | Multimodal SFT | 指令数据怎样把视觉表征变成可对话能力? |
|
||||
| Q9 | Multimodal RL | 奖励怎样越过文字输出,回到视觉观察与动作? |
|
||||
| Q10 | Agent & tools | 模型怎样主动裁剪、放大、写代码、截图并继续观察? |
|
||||
| Q11 | Hallucination | 模型为何会相信语言先验而忽略像素证据? |
|
||||
| Q12 | Safety | 图像中的提示注入、隐私与工具副作用怎样进入威胁模型? |
|
||||
| Q13 | Evaluation | 感知、OCR、知识、推理、视频和 Agent 应怎样分开测? |
|
||||
| Q14 | Training systems | 图像尺寸、动态 Token 与数据混合怎样改变并行和吞吐? |
|
||||
| Q15 | Sparse MoE + vision | 视觉 Token 会怎样影响路由负载、专家专化与稳定性? |
|
||||
| Q16 | DeepSeek vs Kimi | 两条产品线分别把什么问题当成了主矛盾? |
|
||||
|
||||
这些问题不会直接变成十六段论文罗列。正式章节会先建立一条统一的数据流,再让每张问题账回答“瓶颈为什么出现、哪篇论文改变了设计空间、代价是什么”。
|
||||
|
||||
## 2. Grok 召回的七个历史波次
|
||||
|
||||
| 波次 | 时间 | 候选主题 | 进入主线前要核验的边界 |
|
||||
|---|---|---|---|
|
||||
| W1 | 2012–2017 | AlexNet、ResNet、检测与区域特征 | 这是视觉表示前史,不应伪装成 LLM |
|
||||
| W2 | 2021–2023 | CLIP、ALIGN、LiT、SigLIP | 对齐表征不等于能开放式对话 |
|
||||
| W3 | 2021–2023 | Frozen、Flamingo、BLIP-2、LLaVA | “冻结”了谁、训练了谁必须逐篇说明 |
|
||||
| W4 | 2023–2025 | NaViT、动态切图、OCR、文档、视频 | 更高分辨率的真实代价是视觉 Token 与系统方差 |
|
||||
| W5 | 2023–2025 | Chameleon、Transfusion、SOLO、统一自回归 | 统一主干、统一序列、统一目标是三个不同命题 |
|
||||
| W6 | 2024–2025 | DeepSeek-VL/VL2、Janus、Qwen、InternVL、Kimi-VL | 产品线之间不能只用总参数或榜单横比 |
|
||||
| W7 | 2025–2026 | 视觉推理 RL、视觉工具、GUI Agent、K2.5、K3 | 结果必须记录工具、harness、步数与验证器 |
|
||||
|
||||
## 3. Grok 召回的候选论文池
|
||||
|
||||
### 视觉表示与语言监督
|
||||
|
||||
- AlexNet
|
||||
- ResNet
|
||||
- Vision Transformer
|
||||
- CLIP
|
||||
- ALIGN
|
||||
- LiT
|
||||
- SigLIP
|
||||
- NaViT
|
||||
|
||||
### 连接器与冻结式 VLM
|
||||
|
||||
- Frozen
|
||||
- Flamingo
|
||||
- BLIP
|
||||
- BLIP-2
|
||||
- MiniGPT-4
|
||||
- LLaVA
|
||||
- LLaVA-1.5
|
||||
- InstructBLIP
|
||||
- Kosmos-2
|
||||
|
||||
### 高分辨率、OCR、文档与视频
|
||||
|
||||
- Qwen-VL / Qwen2-VL / Qwen2.5-VL
|
||||
- InternVL / InternVL 1.5 / InternVL 2.5
|
||||
- LLaVA-NeXT / LLaVA-OneVision
|
||||
- Video-LLaVA
|
||||
- LLaMA-VID
|
||||
- DeepSeek-VL
|
||||
- DeepSeek-VL2
|
||||
- DeepSeek-OCR
|
||||
- DeepSeek-OCR2
|
||||
- Kimi-VL
|
||||
|
||||
### 统一理解与生成
|
||||
|
||||
- Chameleon
|
||||
- Transfusion
|
||||
- SOLO
|
||||
- Janus
|
||||
- JanusFlow
|
||||
- Janus-Pro
|
||||
|
||||
### 多模态推理、工具与 Agent
|
||||
|
||||
- Visual Sketchpad
|
||||
- Vision-R1
|
||||
- VTool-R1
|
||||
- ToolsRL
|
||||
- OSWorld
|
||||
- VisualWebArena
|
||||
- Kimi K2.5
|
||||
- Kimi K3
|
||||
|
||||
### 评测、幻觉与诊断
|
||||
|
||||
- MMBench
|
||||
- MMMU
|
||||
- MathVista
|
||||
- OCRBench
|
||||
- POPE
|
||||
- HallusionBench
|
||||
- Video-MME
|
||||
|
||||
## 4. DeepSeek 候选分支:不要画成一条直线
|
||||
|
||||
Grok 提醒应把 DeepSeek 多模态工作拆成三条问题导向不同的分支:
|
||||
|
||||
1. **理解分支:DeepSeek-VL → DeepSeek-VL2**
|
||||
- 关注真实世界高分辨率输入、动态切图、视觉—语言竞争和稀疏语言骨干;
|
||||
- 核验重点:两代视觉编码器、切图策略、像素重排、激活参数量。
|
||||
2. **统一生成分支:Janus → JanusFlow → Janus-Pro**
|
||||
- 关注理解和生成是否应该共享视觉编码路径;
|
||||
- 核验重点:解耦的是编码器还是主干,生成目标是离散自回归还是 rectified flow。
|
||||
3. **光学压缩分支:DeepSeek-OCR → DeepSeek-OCR2**
|
||||
- 关注把长文本上下文先压到图像,再以较少视觉 Token 解码;
|
||||
- 核验重点:DeepEncoder 结构、压缩率定义、官方报告的准确率边界、OCR2 的 token 重排。
|
||||
|
||||
正式课程不会用“DeepSeek 一路演进到 OCR”这种线性叙事,因为三条分支优化的是不同目标。
|
||||
|
||||
## 5. Kimi 候选分支:MoonViT 的三次训练制度变化
|
||||
|
||||
Grok 给出的候选主线:
|
||||
|
||||
```text
|
||||
Kimi-VL
|
||||
SigLIP 初始化
|
||||
+ 对比学习 / caption 视觉预训练
|
||||
+ MoonViT / NaViT 动态分辨率
|
||||
↓
|
||||
Kimi K2.5
|
||||
MoonViT-3D
|
||||
+ 图像 / 视频共享参数
|
||||
+ caption NTP,不再使用对比损失
|
||||
+ text-only SFT 激活视觉工具
|
||||
↓
|
||||
Kimi K3
|
||||
MoonViT-V2 从头训练
|
||||
+ 与语言主干共同做 NTP
|
||||
+ 无事后视觉对齐阶段
|
||||
+ vision-in-the-loop Agent
|
||||
```
|
||||
|
||||
这一主线已被选为正式章节的锚点,但每个框中的初始化、损失和训练阶段仍以 Kimi-VL、K2.5、K3 三份官方报告逐项核验。
|
||||
|
||||
## 6. 候选可视化
|
||||
|
||||
1. 像素 → patch → 视觉 Token → 压缩 → 上下文占比的水流图;
|
||||
2. 224²、1024²、3584² 在不同 patch size 下的 Token 爆炸对比;
|
||||
3. CLIP batch 内成对矩阵与 SigLIP 独立 sigmoid 对比;
|
||||
4. Frozen / Flamingo / BLIP-2 / LLaVA 连接器横截面;
|
||||
5. 固定缩放、动态切图、NaViT packing 的分辨率策略对比;
|
||||
6. image / video 的空间注意力与时间注意力分解;
|
||||
7. 理解、生成、工具行动三种“输出空间”;
|
||||
8. Janus 的双视觉编码路径与共享自回归主干;
|
||||
9. DeepSeek-VL → VL2 的高分辨率路线;
|
||||
10. DeepSeek-OCR 的“文字 Token → 页面图像 → 视觉 Token”压缩漏斗;
|
||||
11. DeepSeek-OCR2 的语义 token 重排;
|
||||
12. Kimi 三代 MoonViT 训练制度时间线;
|
||||
13. K3 原生多模态的数据—训练—Agent 闭环;
|
||||
14. 多模态幻觉的“语言先验压过视觉证据”跷跷板;
|
||||
15. 感知、OCR、推理、视频、Agent 五类评测矩阵。
|
||||
|
||||
## 7. 候选交互实验
|
||||
|
||||
### Lab A · 视觉 Token 预算
|
||||
|
||||
调节分辨率、patch size、帧数、时间池化、2×2 pixel shuffle 与上下文长度,观察原始 patch 数、压缩后 Token 数和上下文占比。
|
||||
|
||||
### Lab B · 连接器与训练阶段
|
||||
|
||||
切换 Flamingo、BLIP-2、LLaVA、Kimi-VL、K2.5、K3,观察哪些模块冻结、哪些目标生效、训练制度怎样变化。
|
||||
|
||||
### Lab C · 光学上下文压缩
|
||||
|
||||
把文档文本 Token 数、页面数和视觉 Token 数转成压缩率。DeepSeek-OCR 的曲线只以“论文报告值”显示;插值区域必须明确标成教学近似。
|
||||
|
||||
### Lab D · Vision-in-the-loop
|
||||
|
||||
比较直接 VQA、文字思维链和工具闭环:裁剪、放大、OCR、Python 图像处理、截图和最终验证分别改变什么观察。
|
||||
|
||||
## 8. Grok 暴露的二十个易错点
|
||||
|
||||
1. 视觉编码器不等于多模态模型;
|
||||
2. CLIP 的共享语义空间不等于生成式语言能力;
|
||||
3. projector 小不代表视觉信息传输没有瓶颈;
|
||||
4. “冻结 LLM”与“冻结视觉塔”不是同一个训练制度;
|
||||
5. cross-attention 与把视觉 Token 直接塞进序列不是同一种融合;
|
||||
6. native resolution 不等于没有 resize 或 patch 化;
|
||||
7. 动态切图会引入重复区域与 tile 顺序问题;
|
||||
8. 更高像素不必然产生更多有效信息;
|
||||
9. 视频不是“很多独立图片”的简单堆叠;
|
||||
10. 时间池化会省 Token,也会损失短暂事件;
|
||||
11. 统一主干不等于理解与生成共用同一个视觉编码器;
|
||||
12. 统一序列不等于统一损失;
|
||||
13. “原生多模态”没有唯一行业定义;
|
||||
14. K3 原生训练仍然保留 MoonViT-V2 与投影层;
|
||||
15. DeepSeek-VL2 的总参数不能与激活参数混用;
|
||||
16. DeepSeek-OCR 的压缩率和准确率是论文设定下的报告值;
|
||||
17. 多模态 RL 的提升不能自动归因于视觉推理;
|
||||
18. 工具调用提升可能来自 harness,而非裸模型;
|
||||
19. benchmark 总分会掩盖感知、OCR、知识与推理瓶颈;
|
||||
20. 图像中的间接提示注入会把视觉输入变成安全边界。
|
||||
|
||||
## 9. 正式筛选规则
|
||||
|
||||
- 核心论文必须改变一种表示、接口、训练目标、系统策略或评测方法;
|
||||
- 每个数字绑定模型版本、输入设置、训练或评测条件;
|
||||
- 官方报告数字写成“作者报告”,不写成本站复测;
|
||||
- 多模态 Agent 结果同时记录视觉观察、工具、harness、步数和 verifier;
|
||||
- 章节主线控制在约 50–60 个节点,外围候选进入论文图谱;
|
||||
- DeepSeek 与 Kimi 获得独立聚光灯,但不牺牲从 CLIP、连接器、高分辨率到原生训练的完整历史;
|
||||
- “原生”必须拆成原生数据混合、原生训练目标、原生主干优化、原生输入输出和原生 Agent 闭环五个可核验维度。
|
||||
File diff suppressed because it is too large
Load Diff
@@ -43,3 +43,14 @@ Agent 首轮缓存位于 `agents/`(不提交 PDF/TXT):
|
||||
复用其他专题缓存。十四张问题账、52 节点论文链、四个交互实验合同与证据边界见
|
||||
`../AGENTS_RESEARCH.md`;Grok Headless 只负责扩展召回,未核验候选永久隔离在
|
||||
`../AGENTS_GROK_LEADS.md`。
|
||||
|
||||
原生多模态首轮缓存位于 `multimodal/`(不提交 PDF/TXT):
|
||||
|
||||
- ResNet、ViT、ALIGN、CLIP、LiT、BLIP、SigLIP 与 NaViT;
|
||||
- DeepSeek-VL2、Janus-Pro、DeepSeek-OCR、DeepSeek-OCR2 与 Kimi-VL;
|
||||
- Kimi K2.5 与 K3 复用 `reasoning/`、`kimi-k3/` 中的官方技术报告缓存。
|
||||
|
||||
本轮本地完整校验 13 份 PDF,并通过官方 arXiv HTML、作者仓库和既有 K2.5/K3 报告核验其余核心节点。
|
||||
DeepSeek-VL/VL2、Janus、OCR 三分支,Kimi 三代 MoonViT、十六张问题账、55 节点正文链与四实验合同见
|
||||
`../MULTIMODAL_RESEARCH.md`;Grok Headless 候选召回只保存在
|
||||
`../MULTIMODAL_GROK_LEADS.md`,不得作为正式事实来源。
|
||||
|
||||
Reference in New Issue
Block a user