Files
llm-atlas/research/MULTIMODAL_GROK_LEADS.md
T
2026-07-29 07:52:27 +08:00

9.3 KiB
Raw Blame History

原生多模态专题 · Grok 候选召回

生成方式:Grok CLI Headless--no-subagents --no-memory 日期:2026-07-29 角色:只负责扩大候选池、暴露易混边界和提供可视化灵感,不作为事实来源。进入正式课程的技术主张、数字和历史定位,必须回到论文、技术报告或官方代码仓库核验。

1. Grok 建议的十六张问题账

编号 问题账 核心问题
Q1 Visual semantic space 图像怎样获得可与语言比较的语义表示?
Q2 Connector 视觉特征怎样接进语言模型,谁负责跨模态翻译?
Q3 Resolution & token budget 高分辨率细节为何会迅速吃光上下文与算力?
Q4 OCR & documents 场景文字、文档、表格与公式为何比自然图像更难?
Q5 Video 时间维度怎样进入模型,帧数与视觉 Token 怎样压缩?
Q6 Fusion timing early fusion、cross-attention、late fusion 分别交换了什么?
Q7 Understanding vs generation 图像理解与图像生成能否共用表示和主干?
Q8 Multimodal SFT 指令数据怎样把视觉表征变成可对话能力?
Q9 Multimodal RL 奖励怎样越过文字输出,回到视觉观察与动作?
Q10 Agent & tools 模型怎样主动裁剪、放大、写代码、截图并继续观察?
Q11 Hallucination 模型为何会相信语言先验而忽略像素证据?
Q12 Safety 图像中的提示注入、隐私与工具副作用怎样进入威胁模型?
Q13 Evaluation 感知、OCR、知识、推理、视频和 Agent 应怎样分开测?
Q14 Training systems 图像尺寸、动态 Token 与数据混合怎样改变并行和吞吐?
Q15 Sparse MoE + vision 视觉 Token 会怎样影响路由负载、专家专化与稳定性?
Q16 DeepSeek vs Kimi 两条产品线分别把什么问题当成了主矛盾?

这些问题不会直接变成十六段论文罗列。正式章节会先建立一条统一的数据流,再让每张问题账回答“瓶颈为什么出现、哪篇论文改变了设计空间、代价是什么”。

2. Grok 召回的七个历史波次

波次 时间 候选主题 进入主线前要核验的边界
W1 20122017 AlexNet、ResNet、检测与区域特征 这是视觉表示前史,不应伪装成 LLM
W2 20212023 CLIP、ALIGN、LiT、SigLIP 对齐表征不等于能开放式对话
W3 20212023 Frozen、Flamingo、BLIP-2、LLaVA “冻结”了谁、训练了谁必须逐篇说明
W4 20232025 NaViT、动态切图、OCR、文档、视频 更高分辨率的真实代价是视觉 Token 与系统方差
W5 20232025 Chameleon、Transfusion、SOLO、统一自回归 统一主干、统一序列、统一目标是三个不同命题
W6 20242025 DeepSeek-VL/VL2、Janus、Qwen、InternVL、Kimi-VL 产品线之间不能只用总参数或榜单横比
W7 20252026 视觉推理 RL、视觉工具、GUI Agent、K2.5、K3 结果必须记录工具、harness、步数与验证器

3. Grok 召回的候选论文池

视觉表示与语言监督

  • AlexNet
  • ResNet
  • Vision Transformer
  • CLIP
  • ALIGN
  • LiT
  • SigLIP
  • NaViT

连接器与冻结式 VLM

  • Frozen
  • Flamingo
  • BLIP
  • BLIP-2
  • MiniGPT-4
  • LLaVA
  • LLaVA-1.5
  • InstructBLIP
  • Kosmos-2

高分辨率、OCR、文档与视频

  • Qwen-VL / Qwen2-VL / Qwen2.5-VL
  • InternVL / InternVL 1.5 / InternVL 2.5
  • LLaVA-NeXT / LLaVA-OneVision
  • Video-LLaVA
  • LLaMA-VID
  • DeepSeek-VL
  • DeepSeek-VL2
  • DeepSeek-OCR
  • DeepSeek-OCR2
  • Kimi-VL

统一理解与生成

  • Chameleon
  • Transfusion
  • SOLO
  • Janus
  • JanusFlow
  • Janus-Pro

多模态推理、工具与 Agent

  • Visual Sketchpad
  • Vision-R1
  • VTool-R1
  • ToolsRL
  • OSWorld
  • VisualWebArena
  • Kimi K2.5
  • Kimi K3

评测、幻觉与诊断

  • MMBench
  • MMMU
  • MathVista
  • OCRBench
  • POPE
  • HallusionBench
  • Video-MME

4. DeepSeek 候选分支:不要画成一条直线

Grok 提醒应把 DeepSeek 多模态工作拆成三条问题导向不同的分支:

  1. 理解分支:DeepSeek-VL → DeepSeek-VL2
    • 关注真实世界高分辨率输入、动态切图、视觉—语言竞争和稀疏语言骨干;
    • 核验重点:两代视觉编码器、切图策略、像素重排、激活参数量。
  2. 统一生成分支:Janus → JanusFlow → Janus-Pro
    • 关注理解和生成是否应该共享视觉编码路径;
    • 核验重点:解耦的是编码器还是主干,生成目标是离散自回归还是 rectified flow。
  3. 光学压缩分支:DeepSeek-OCR → DeepSeek-OCR2
    • 关注把长文本上下文先压到图像,再以较少视觉 Token 解码;
    • 核验重点:DeepEncoder 结构、压缩率定义、官方报告的准确率边界、OCR2 的 token 重排。

正式课程不会用“DeepSeek 一路演进到 OCR”这种线性叙事,因为三条分支优化的是不同目标。

5. Kimi 候选分支:MoonViT 的三次训练制度变化

Grok 给出的候选主线:

Kimi-VL
  SigLIP 初始化
  + 对比学习 / caption 视觉预训练
  + MoonViT / NaViT 动态分辨率
      ↓
Kimi K2.5
  MoonViT-3D
  + 图像 / 视频共享参数
  + caption NTP,不再使用对比损失
  + text-only SFT 激活视觉工具
      ↓
Kimi K3
  MoonViT-V2 从头训练
  + 与语言主干共同做 NTP
  + 无事后视觉对齐阶段
  + vision-in-the-loop Agent

这一主线已被选为正式章节的锚点,但每个框中的初始化、损失和训练阶段仍以 Kimi-VL、K2.5、K3 三份官方报告逐项核验。

6. 候选可视化

  1. 像素 → patch → 视觉 Token → 压缩 → 上下文占比的水流图;
  2. 224²、1024²、3584² 在不同 patch size 下的 Token 爆炸对比;
  3. CLIP batch 内成对矩阵与 SigLIP 独立 sigmoid 对比;
  4. Frozen / Flamingo / BLIP-2 / LLaVA 连接器横截面;
  5. 固定缩放、动态切图、NaViT packing 的分辨率策略对比;
  6. image / video 的空间注意力与时间注意力分解;
  7. 理解、生成、工具行动三种“输出空间”;
  8. Janus 的双视觉编码路径与共享自回归主干;
  9. DeepSeek-VL → VL2 的高分辨率路线;
  10. DeepSeek-OCR 的“文字 Token → 页面图像 → 视觉 Token”压缩漏斗;
  11. DeepSeek-OCR2 的语义 token 重排;
  12. Kimi 三代 MoonViT 训练制度时间线;
  13. K3 原生多模态的数据—训练—Agent 闭环;
  14. 多模态幻觉的“语言先验压过视觉证据”跷跷板;
  15. 感知、OCR、推理、视频、Agent 五类评测矩阵。

7. 候选交互实验

Lab A · 视觉 Token 预算

调节分辨率、patch size、帧数、时间池化、2×2 pixel shuffle 与上下文长度,观察原始 patch 数、压缩后 Token 数和上下文占比。

Lab B · 连接器与训练阶段

切换 Flamingo、BLIP-2、LLaVA、Kimi-VL、K2.5、K3,观察哪些模块冻结、哪些目标生效、训练制度怎样变化。

Lab C · 光学上下文压缩

把文档文本 Token 数、页面数和视觉 Token 数转成压缩率。DeepSeek-OCR 的曲线只以“论文报告值”显示;插值区域必须明确标成教学近似。

Lab D · Vision-in-the-loop

比较直接 VQA、文字思维链和工具闭环:裁剪、放大、OCR、Python 图像处理、截图和最终验证分别改变什么观察。

8. Grok 暴露的二十个易错点

  1. 视觉编码器不等于多模态模型;
  2. CLIP 的共享语义空间不等于生成式语言能力;
  3. projector 小不代表视觉信息传输没有瓶颈;
  4. “冻结 LLM”与“冻结视觉塔”不是同一个训练制度;
  5. cross-attention 与把视觉 Token 直接塞进序列不是同一种融合;
  6. native resolution 不等于没有 resize 或 patch 化;
  7. 动态切图会引入重复区域与 tile 顺序问题;
  8. 更高像素不必然产生更多有效信息;
  9. 视频不是“很多独立图片”的简单堆叠;
  10. 时间池化会省 Token,也会损失短暂事件;
  11. 统一主干不等于理解与生成共用同一个视觉编码器;
  12. 统一序列不等于统一损失;
  13. “原生多模态”没有唯一行业定义;
  14. K3 原生训练仍然保留 MoonViT-V2 与投影层;
  15. DeepSeek-VL2 的总参数不能与激活参数混用;
  16. DeepSeek-OCR 的压缩率和准确率是论文设定下的报告值;
  17. 多模态 RL 的提升不能自动归因于视觉推理;
  18. 工具调用提升可能来自 harness,而非裸模型;
  19. benchmark 总分会掩盖感知、OCR、知识与推理瓶颈;
  20. 图像中的间接提示注入会把视觉输入变成安全边界。

9. 正式筛选规则

  • 核心论文必须改变一种表示、接口、训练目标、系统策略或评测方法;
  • 每个数字绑定模型版本、输入设置、训练或评测条件;
  • 官方报告数字写成“作者报告”,不写成本站复测;
  • 多模态 Agent 结果同时记录视觉观察、工具、harness、步数和 verifier
  • 章节主线控制在约 50–60 个节点,外围候选进入论文图谱;
  • DeepSeek 与 Kimi 获得独立聚光灯,但不牺牲从 CLIP、连接器、高分辨率到原生训练的完整历史;
  • “原生”必须拆成原生数据混合、原生训练目标、原生主干优化、原生输入输出和原生 Agent 闭环五个可核验维度。