# 原生多模态专题 · Grok 候选召回 > 生成方式:Grok CLI Headless(`--no-subagents --no-memory`) > 日期:2026-07-29 > 角色:只负责扩大候选池、暴露易混边界和提供可视化灵感,不作为事实来源。进入正式课程的技术主张、数字和历史定位,必须回到论文、技术报告或官方代码仓库核验。 ## 1. Grok 建议的十六张问题账 | 编号 | 问题账 | 核心问题 | |---|---|---| | Q1 | Visual semantic space | 图像怎样获得可与语言比较的语义表示? | | Q2 | Connector | 视觉特征怎样接进语言模型,谁负责跨模态翻译? | | Q3 | Resolution & token budget | 高分辨率细节为何会迅速吃光上下文与算力? | | Q4 | OCR & documents | 场景文字、文档、表格与公式为何比自然图像更难? | | Q5 | Video | 时间维度怎样进入模型,帧数与视觉 Token 怎样压缩? | | Q6 | Fusion timing | early fusion、cross-attention、late fusion 分别交换了什么? | | Q7 | Understanding vs generation | 图像理解与图像生成能否共用表示和主干? | | Q8 | Multimodal SFT | 指令数据怎样把视觉表征变成可对话能力? | | Q9 | Multimodal RL | 奖励怎样越过文字输出,回到视觉观察与动作? | | Q10 | Agent & tools | 模型怎样主动裁剪、放大、写代码、截图并继续观察? | | Q11 | Hallucination | 模型为何会相信语言先验而忽略像素证据? | | Q12 | Safety | 图像中的提示注入、隐私与工具副作用怎样进入威胁模型? | | Q13 | Evaluation | 感知、OCR、知识、推理、视频和 Agent 应怎样分开测? | | Q14 | Training systems | 图像尺寸、动态 Token 与数据混合怎样改变并行和吞吐? | | Q15 | Sparse MoE + vision | 视觉 Token 会怎样影响路由负载、专家专化与稳定性? | | Q16 | DeepSeek vs Kimi | 两条产品线分别把什么问题当成了主矛盾? | 这些问题不会直接变成十六段论文罗列。正式章节会先建立一条统一的数据流,再让每张问题账回答“瓶颈为什么出现、哪篇论文改变了设计空间、代价是什么”。 ## 2. Grok 召回的七个历史波次 | 波次 | 时间 | 候选主题 | 进入主线前要核验的边界 | |---|---|---|---| | W1 | 2012–2017 | AlexNet、ResNet、检测与区域特征 | 这是视觉表示前史,不应伪装成 LLM | | W2 | 2021–2023 | CLIP、ALIGN、LiT、SigLIP | 对齐表征不等于能开放式对话 | | W3 | 2021–2023 | Frozen、Flamingo、BLIP-2、LLaVA | “冻结”了谁、训练了谁必须逐篇说明 | | W4 | 2023–2025 | NaViT、动态切图、OCR、文档、视频 | 更高分辨率的真实代价是视觉 Token 与系统方差 | | W5 | 2023–2025 | Chameleon、Transfusion、SOLO、统一自回归 | 统一主干、统一序列、统一目标是三个不同命题 | | W6 | 2024–2025 | DeepSeek-VL/VL2、Janus、Qwen、InternVL、Kimi-VL | 产品线之间不能只用总参数或榜单横比 | | W7 | 2025–2026 | 视觉推理 RL、视觉工具、GUI Agent、K2.5、K3 | 结果必须记录工具、harness、步数与验证器 | ## 3. Grok 召回的候选论文池 ### 视觉表示与语言监督 - AlexNet - ResNet - Vision Transformer - CLIP - ALIGN - LiT - SigLIP - NaViT ### 连接器与冻结式 VLM - Frozen - Flamingo - BLIP - BLIP-2 - MiniGPT-4 - LLaVA - LLaVA-1.5 - InstructBLIP - Kosmos-2 ### 高分辨率、OCR、文档与视频 - Qwen-VL / Qwen2-VL / Qwen2.5-VL - InternVL / InternVL 1.5 / InternVL 2.5 - LLaVA-NeXT / LLaVA-OneVision - Video-LLaVA - LLaMA-VID - DeepSeek-VL - DeepSeek-VL2 - DeepSeek-OCR - DeepSeek-OCR2 - Kimi-VL ### 统一理解与生成 - Chameleon - Transfusion - SOLO - Janus - JanusFlow - Janus-Pro ### 多模态推理、工具与 Agent - Visual Sketchpad - Vision-R1 - VTool-R1 - ToolsRL - OSWorld - VisualWebArena - Kimi K2.5 - Kimi K3 ### 评测、幻觉与诊断 - MMBench - MMMU - MathVista - OCRBench - POPE - HallusionBench - Video-MME ## 4. DeepSeek 候选分支:不要画成一条直线 Grok 提醒应把 DeepSeek 多模态工作拆成三条问题导向不同的分支: 1. **理解分支:DeepSeek-VL → DeepSeek-VL2** - 关注真实世界高分辨率输入、动态切图、视觉—语言竞争和稀疏语言骨干; - 核验重点:两代视觉编码器、切图策略、像素重排、激活参数量。 2. **统一生成分支:Janus → JanusFlow → Janus-Pro** - 关注理解和生成是否应该共享视觉编码路径; - 核验重点:解耦的是编码器还是主干,生成目标是离散自回归还是 rectified flow。 3. **光学压缩分支:DeepSeek-OCR → DeepSeek-OCR2** - 关注把长文本上下文先压到图像,再以较少视觉 Token 解码; - 核验重点:DeepEncoder 结构、压缩率定义、官方报告的准确率边界、OCR2 的 token 重排。 正式课程不会用“DeepSeek 一路演进到 OCR”这种线性叙事,因为三条分支优化的是不同目标。 ## 5. Kimi 候选分支:MoonViT 的三次训练制度变化 Grok 给出的候选主线: ```text Kimi-VL SigLIP 初始化 + 对比学习 / caption 视觉预训练 + MoonViT / NaViT 动态分辨率 ↓ Kimi K2.5 MoonViT-3D + 图像 / 视频共享参数 + caption NTP,不再使用对比损失 + text-only SFT 激活视觉工具 ↓ Kimi K3 MoonViT-V2 从头训练 + 与语言主干共同做 NTP + 无事后视觉对齐阶段 + vision-in-the-loop Agent ``` 这一主线已被选为正式章节的锚点,但每个框中的初始化、损失和训练阶段仍以 Kimi-VL、K2.5、K3 三份官方报告逐项核验。 ## 6. 候选可视化 1. 像素 → patch → 视觉 Token → 压缩 → 上下文占比的水流图; 2. 224²、1024²、3584² 在不同 patch size 下的 Token 爆炸对比; 3. CLIP batch 内成对矩阵与 SigLIP 独立 sigmoid 对比; 4. Frozen / Flamingo / BLIP-2 / LLaVA 连接器横截面; 5. 固定缩放、动态切图、NaViT packing 的分辨率策略对比; 6. image / video 的空间注意力与时间注意力分解; 7. 理解、生成、工具行动三种“输出空间”; 8. Janus 的双视觉编码路径与共享自回归主干; 9. DeepSeek-VL → VL2 的高分辨率路线; 10. DeepSeek-OCR 的“文字 Token → 页面图像 → 视觉 Token”压缩漏斗; 11. DeepSeek-OCR2 的语义 token 重排; 12. Kimi 三代 MoonViT 训练制度时间线; 13. K3 原生多模态的数据—训练—Agent 闭环; 14. 多模态幻觉的“语言先验压过视觉证据”跷跷板; 15. 感知、OCR、推理、视频、Agent 五类评测矩阵。 ## 7. 候选交互实验 ### Lab A · 视觉 Token 预算 调节分辨率、patch size、帧数、时间池化、2×2 pixel shuffle 与上下文长度,观察原始 patch 数、压缩后 Token 数和上下文占比。 ### Lab B · 连接器与训练阶段 切换 Flamingo、BLIP-2、LLaVA、Kimi-VL、K2.5、K3,观察哪些模块冻结、哪些目标生效、训练制度怎样变化。 ### Lab C · 光学上下文压缩 把文档文本 Token 数、页面数和视觉 Token 数转成压缩率。DeepSeek-OCR 的曲线只以“论文报告值”显示;插值区域必须明确标成教学近似。 ### Lab D · Vision-in-the-loop 比较直接 VQA、文字思维链和工具闭环:裁剪、放大、OCR、Python 图像处理、截图和最终验证分别改变什么观察。 ## 8. Grok 暴露的二十个易错点 1. 视觉编码器不等于多模态模型; 2. CLIP 的共享语义空间不等于生成式语言能力; 3. projector 小不代表视觉信息传输没有瓶颈; 4. “冻结 LLM”与“冻结视觉塔”不是同一个训练制度; 5. cross-attention 与把视觉 Token 直接塞进序列不是同一种融合; 6. native resolution 不等于没有 resize 或 patch 化; 7. 动态切图会引入重复区域与 tile 顺序问题; 8. 更高像素不必然产生更多有效信息; 9. 视频不是“很多独立图片”的简单堆叠; 10. 时间池化会省 Token,也会损失短暂事件; 11. 统一主干不等于理解与生成共用同一个视觉编码器; 12. 统一序列不等于统一损失; 13. “原生多模态”没有唯一行业定义; 14. K3 原生训练仍然保留 MoonViT-V2 与投影层; 15. DeepSeek-VL2 的总参数不能与激活参数混用; 16. DeepSeek-OCR 的压缩率和准确率是论文设定下的报告值; 17. 多模态 RL 的提升不能自动归因于视觉推理; 18. 工具调用提升可能来自 harness,而非裸模型; 19. benchmark 总分会掩盖感知、OCR、知识与推理瓶颈; 20. 图像中的间接提示注入会把视觉输入变成安全边界。 ## 9. 正式筛选规则 - 核心论文必须改变一种表示、接口、训练目标、系统策略或评测方法; - 每个数字绑定模型版本、输入设置、训练或评测条件; - 官方报告数字写成“作者报告”,不写成本站复测; - 多模态 Agent 结果同时记录视觉观察、工具、harness、步数和 verifier; - 章节主线控制在约 50–60 个节点,外围候选进入论文图谱; - DeepSeek 与 Kimi 获得独立聚光灯,但不牺牲从 CLIP、连接器、高分辨率到原生训练的完整历史; - “原生”必须拆成原生数据混合、原生训练目标、原生主干优化、原生输入输出和原生 Agent 闭环五个可核验维度。