进入视觉预处理的像素
+ +INTERACTIVE / MULTIMODAL LAB
++ Token 数和训练制度是确定性教学模型;DeepSeek-OCR 曲线中的插值会明确标注, + 不冒充论文实测。实验的目标是建立量纲与边界,而不是模拟某个真实模型分数。 +
+这里按正方形图像和规则 patch 计算。真实模型还可能加入缩略图、tile、分隔符、padding 与动态 packing。
+进入视觉预处理的像素
+ +ceil(H/P) × ceil(W/P) × frames
+ +空间与时间压缩后的教学近似
+ +尚未计算文字、工具结果与输出
+ +单图细节与长文字仍有较大共存空间。
+Token 变少不是免费信息压缩:小字、细线和短暂事件更容易丢失。
+点击模型,观察谁冻结、谁训练、是否有单独 alignment,以及“原生”究竟命中了哪几个维度。
+训练信号怎样穿过视觉接口
是否先把视觉特征对到语言空间
简单 projector 加视觉指令数据成为开放 VLM 的强基线。
本站用五个可核验维度拆词,不把厂商命名当成事实定义。
+压缩比可以精确计算;解码准确率只显示论文锚点或明确标记的教学插值。
+tokenizer 后的原始上下文
+二维页面作为压缩介质
+pages × tokens per page
+视觉序列更短,但尚未计算渲染与解码误差。
论文报告:低于 10× 区域约 97%。
不是本站复测,也不外推到所有语言、字体与版式。
同一张小字发票,比较直接回答、文字 CoT 与裁剪—OCR—计算—验证闭环。
+获得一个候选区域,而不是直接猜答案。
+教学案例只说明信息流差异,不代表任何真实模型的准确率。
+NEW / CHAPTER 13 PIXELS · TOKENS · NATIVE MULTIMODALITY
++ 用语义空间、连接器、分辨率、OCR、视频、训练、幻觉、评测与 Agent 十六张账, + 从 ViT、CLIP 和 LLaVA 走到 DeepSeek-VL / Janus / OCR 三分支,以及 Kimi 三代 MoonViT 与 K3 从头共同 NTP。 +
+NEW / CHAPTER 12 AGENTS · TOOL USE · ENVIRONMENTS
diff --git a/src/pages/multimodal/index.astro b/src/pages/multimodal/index.astro new file mode 100644 index 0000000..bbe6199 --- /dev/null +++ b/src/pages/multimodal/index.astro @@ -0,0 +1,1480 @@ +--- +import BaseLayout from "@/layouts/BaseLayout.astro"; +import MultimodalLab from "@/components/MultimodalLab.astro"; + +const toc = [ + ["00", "compass", "先拆成十六张账"], + ["01", "pipeline", "像素到行动的五层"], + ["02", "tokens", "视觉 Token 数学"], + ["03", "vision-prehistory", "视觉骨干前史"], + ["04", "clip", "CLIP 的语义空间"], + ["05", "siglip", "ALIGN / LiT / SigLIP"], + ["06", "connectors", "Frozen / Flamingo"], + ["07", "instruction", "BLIP-2 / LLaVA"], + ["08", "resolution", "分辨率三条路线"], + ["09", "documents", "OCR 与文档"], + ["10", "video", "视频不是图片堆"], + ["11", "native", "“原生”的五维定义"], + ["12", "unified", "统一模型四种含义"], + ["13", "deepseek-map", "DeepSeek 三分支"], + ["14", "deepseek-vl", "VL → VL2"], + ["15", "janus", "Janus 理解与生成"], + ["16", "deepseek-ocr", "光学上下文压缩"], + ["17", "kimi-map", "Kimi 三代 MoonViT"], + ["18", "kimi-vl", "Kimi-VL"], + ["19", "k25", "K2.5"], + ["20", "k3-native", "K3 原生训练"], + ["21", "k3-stability", "从头训练与稳定性"], + ["22", "programmatic", "程序化视觉数据"], + ["23", "lab", "四联交互实验"], + ["24", "hallucination", "多模态幻觉"], + ["25", "evaluation", "评测地图"], + ["26", "visual-agent", "视觉 Agent"], + ["27", "systems", "训练系统与 MoE"], + ["28", "checklist", "审计一款新 VLM"], + ["↳", "papers", "55 个关键节点"], +]; + +const ledgers = [ + ["Q1 / SPACE", "语义空间", "图像怎样靠近语言?", "分类标签、图文对比、caption 与生成目标不是同一层。"], + ["Q2 / BRIDGE", "连接器", "视觉特征怎样进 LLM?", "prefix、resampler、cross-attention、Q-Former、MLP。"], + ["Q3 / BUDGET", "Token 预算", "细节为什么如此昂贵?", "分辨率、patch、tile、shuffle、上下文与预填充成本。"], + ["Q4 / DOC", "OCR / 文档", "模型是在看图还是读结构?", "小字、阅读顺序、公式、表格、版面与多语言。"], + ["Q5 / VIDEO", "时间", "动作顺序怎样进入模型?", "采帧、时空注意力、时间池化、长视频检索。"], + ["Q6 / FUSION", "融合时机", "视觉何时遇见文字?", "early fusion、cross-attention、直接 Token 拼接与晚融合。"], + ["Q7 / OUTPUT", "理解 / 生成", "同一视觉表示能兼顾两端吗?", "语义鲁棒性与像素可逆细节可能冲突。"], + ["Q8 / SFT", "视觉指令", "对齐后为何仍不会协作?", "对话、密集描述、OCR、推理与行动轨迹。"], + ["Q9 / RL", "多模态 RL", "奖励怎样回到像素证据?", "结果奖励、工具使用、视觉校准与跨模态迁移。"], + ["Q10 / AGENT", "工具闭环", "看不清时能否主动再看?", "crop、zoom、OCR、Python、截图、验证器。"], + ["Q11 / HALLU", "幻觉", "语言先验为何压过视觉?", "输入损失、接口损失与生成偏置。"], + ["Q12 / SAFE", "安全", "图片里的文字可信吗?", "视觉提示注入、隐私、权限与工具副作用。"], + ["Q13 / EVAL", "评测", "一个总分混进了什么?", "感知、OCR、知识、推理、视频、Agent 与输入预算。"], + ["Q14 / SYSTEM", "训练系统", "动态图像怎样组 batch?", "packing、straggler、并行、pipeline bubble 与吞吐。"], + ["Q15 / MOE", "稀疏路由", "视觉 Token 会去哪类专家?", "负载、专家专化、路由波动与开放证据缺口。"], + ["Q16 / LINEAGE", "产品谱系", "DeepSeek 与 Kimi 各解哪道题?", "理解、生成、OCR 与原生训练不能压成单线升级。"], +]; + +const waves = [ + { + year: "2012–20", + title: "像素先变成可扩展表征", + nodes: "AlexNet · ResNet · ViT", + gain: "卷积残差让深视觉可训练;ViT 进一步把图像变成 patch 序列。", + debt: "类别监督封闭,固定分辨率会丢失长图和小字。", + }, + { + year: "2021–23", + title: "自然语言成为视觉监督", + nodes: "CLIP · ALIGN · LiT · SigLIP", + gain: "图像获得开放词汇语义空间,预训练视觉塔可以被大量下游模型复用。", + debt: "匹配相似度不是开放式生成,细粒度 OCR 与关系仍弱。", + }, + { + year: "2021–23", + title: "寻找 LLM 的视觉入口", + nodes: "Frozen · Flamingo · BLIP-2 · LLaVA", + gain: "前缀、跨注意力、query bottleneck 与简单 MLP 形成不同连接器范式。", + debt: "冻结带来效率,也把跨模态翻译压在狭窄 bridge 上。", + }, + { + year: "2023–25", + title: "分辨率、文档与视频成为主矛盾", + nodes: "NaViT · dynamic tiling · OCR · temporal pooling", + gain: "模型开始保留长宽比、小字、页面结构与时间关系。", + debt: "视觉 Token、预填充、straggler 与上下文竞争迅速上升。", + }, + { + year: "2024–25", + title: "理解与生成走向统一,但路线分叉", + nodes: "Chameleon · Transfusion · SOLO · Janus", + gain: "统一序列、统一主干、混合目标和解耦视觉路径都成为可选设计。", + debt: "“统一”一词开始同时指四件不同的事。", + }, + { + year: "2024–26", + title: "开放产品线形成自己的答案", + nodes: "DeepSeek-VL/VL2 · Janus · OCR · Kimi-VL/K2.5/K3", + gain: "高分辨率、稀疏骨干、光学压缩、统一视频和原生联合训练进入规模化报告。", + debt: "总参数、激活参数、像素预算和作者报告值更容易被错误横比。", + }, + { + year: "2025–26", + title: "视觉进入 RL 与 Agent 闭环", + nodes: "Vision-R1 · VTool-R1 · ToolsRL · OSWorld · K3", + gain: "模型能主动购买新观察、操作环境并以最终状态验证。", + debt: "模型、工具、harness、步数、权限和 verifier 必须一起审计。", + }, +]; + +const paperChain = [ + ["2012", "AlexNet", "https://proceedings.neurips.cc/paper/4824-imagenet-classification-with-deep-convolutional-neural-networks", "GPU 与大规模卷积视觉表示的转折点。"], + ["2015", "ResNet", "https://arxiv.org/abs/1512.03385", "残差连接让深视觉骨干更易优化。"], + ["2020", "Vision Transformer", "https://arxiv.org/abs/2010.11929", "把图像切成 patch,进入标准 Transformer 序列。"], + ["2021", "ALIGN", "https://arxiv.org/abs/2102.05918", "把噪声 web 图文对扩到超大规模。"], + ["2021", "CLIP", "https://arxiv.org/abs/2103.00020", "自然语言监督的开放视觉语义空间。"], + ["2021", "Frozen", "https://arxiv.org/abs/2106.13884", "视觉前缀接入冻结语言模型。"], + ["2021", "LiT", "https://arxiv.org/abs/2111.07991", "锁定图像塔,只调文本侧对齐。"], + ["2022", "BLIP", "https://arxiv.org/abs/2201.12086", "captioner 与 filter 重建图文数据质量。"], + ["2022", "Flamingo", "https://arxiv.org/abs/2204.14198", "Perceiver Resampler 与 gated cross-attention。"], + ["2023", "BLIP-2", "https://arxiv.org/abs/2301.12597", "Q-Former 连接冻结视觉塔与冻结 LLM。"], + ["2023", "SigLIP", "https://arxiv.org/abs/2303.15343", "用独立 sigmoid pair loss 取代 batch softmax。"], + ["2023", "LLaVA", "https://arxiv.org/abs/2304.08485", "简单 projector 与生成式视觉指令调优。"], + ["2023", "MiniGPT-4", "https://arxiv.org/abs/2304.10592", "少量高质量对话对齐冻结视觉与语言模块。"], + ["2023", "InstructBLIP", "https://arxiv.org/abs/2305.06500", "instruction-aware Q-Former 与任务泛化。"], + ["2023", "PaLI-X", "https://arxiv.org/abs/2305.18565", "多语言视觉—语言模型的组件、任务混合与规模扩展。"], + ["2023", "OCRBench", "https://arxiv.org/abs/2305.07895", "识别、DocVQA、KIE 与公式的综合 OCR 评测。"], + ["2023", "POPE", "https://arxiv.org/abs/2305.10355", "用轮询式问题诊断对象幻觉。"], + ["2023", "Kosmos-2", "https://arxiv.org/abs/2306.14824", "用 location token 把文字指称落到视觉区域。"], + ["2023", "NaViT", "https://arxiv.org/abs/2307.06304", "在 Token 预算内打包任意长宽比图像。"], + ["2023", "MMBench", "https://arxiv.org/abs/2307.06281", "双语多选与 CircularEval 综合评测。"], + ["2023", "Qwen-VL", "https://arxiv.org/abs/2308.12966", "OCR、grounding 与开放视觉对话路线。"], + ["2023", "LLaVA-1.5", "https://arxiv.org/abs/2310.03744", "两层 MLP、数据混合与工程基线。"], + ["2023", "MathVista", "https://arxiv.org/abs/2310.02255", "视觉上下文中的数学推理。"], + ["2023", "HallusionBench", "https://arxiv.org/abs/2310.14566", "语言幻觉、视觉错觉与一致性诊断。"], + ["2023", "Video-LLaVA", "https://arxiv.org/abs/2311.10122", "图像与视频的共同视觉—语言空间。"], + ["2023", "MMMU", "https://arxiv.org/abs/2311.16502", "大学级多学科视觉理解与推理。"], + ["2023", "LLaMA-VID", "https://arxiv.org/abs/2311.17043", "内容 / 上下文 Token 压缩长视频。"], + ["2023", "RLHF-V", "https://arxiv.org/abs/2312.00849", "用细粒度人工纠错与 dense DPO 对齐视觉忠实度。"], + ["2024", "VisualWebArena", "https://arxiv.org/abs/2401.13649", "真实网站中的视觉 grounding Agent。"], + ["2024", "DeepSeek-VL", "https://arxiv.org/abs/2403.05525", "真实场景、高分辨率与语言能力保持。"], + ["2024", "MM1", "https://arxiv.org/abs/2403.09611", "系统研究架构、数据和训练配方的相对作用。"], + ["2024", "InternVL 1.5", "https://arxiv.org/abs/2404.16821", "6B 视觉塔、最多 40 个动态 tile 与双语高质量数据。"], + ["2024", "OSWorld", "https://arxiv.org/abs/2404.07972", "真实桌面截图、动作与执行式验证。"], + ["2024", "Chameleon", "https://arxiv.org/abs/2405.09818", "图文交错离散 Token 的 early-fusion 模型。"], + ["2024", "Video-MME", "https://arxiv.org/abs/2405.21075", "短中长视频、字幕与音频条件评测。"], + ["2024", "Visual Sketchpad", "https://arxiv.org/abs/2406.09403", "用画线、框选和视觉工具产生可回看的视觉思维步骤。"], + ["2024", "JEST", "https://arxiv.org/abs/2406.17711", "按 batch 联合可学习性筛选多模态训练样本。"], + ["2024", "SOLO", "https://arxiv.org/abs/2407.06438", "单一 Transformer 视觉—语言训练配方。"], + ["2024", "LLaVA-OneVision", "https://arxiv.org/abs/2408.03326", "单图、多图、视频统一迁移路线。"], + ["2024", "Transfusion", "https://arxiv.org/abs/2408.11039", "同一主干混合文字 NTP 与图像 diffusion。"], + ["2024", "Qwen2-VL", "https://arxiv.org/abs/2409.12191", "动态视觉 Token、M-RoPE 与统一图像 / 视频处理。"], + ["2024", "Janus", "https://arxiv.org/abs/2410.13848", "解耦理解 / 生成视觉编码路径。"], + ["2024", "JanusFlow", "https://arxiv.org/abs/2411.07975", "自回归语言与 rectified flow 图像生成。"], + ["2024", "InternVL 2.5", "https://arxiv.org/abs/2412.05271", "从模型、数据与测试时三个轴扩展开放多模态模型。"], + ["2024", "DeepSeek-VL2", "https://arxiv.org/abs/2412.10302", "动态 tile、pixel shuffle、MoE 与 MLA。"], + ["2025", "Janus-Pro", "https://arxiv.org/abs/2501.17811", "优化训练阶段、数据和规模。"], + ["2025", "Qwen2.5-VL", "https://arxiv.org/abs/2502.13923", "从头训练动态分辨率 ViT、绝对时间编码与视觉 Agent。"], + ["2025", "Vision-R1", "https://arxiv.org/abs/2503.06749", "大规模 RL 激活多模态推理。"], + ["2025", "Kimi-VL", "https://arxiv.org/abs/2504.07491", "MoonViT 原生分辨率与稀疏 MoE。"], + ["2025", "VTool-R1", "https://arxiv.org/abs/2505.19255", "强化学习训练自主视觉工具调用。"], + ["2025", "DeepSeek-OCR", "https://arxiv.org/abs/2510.18234", "把二维视觉表征用作长上下文压缩介质。"], + ["2026", "DeepSeek-OCR2", "https://arxiv.org/abs/2601.20552", "依据图像语义动态重排视觉 Token。"], + ["2026", "Kimi K2.5", "https://arxiv.org/abs/2602.02276", "MoonViT-3D、zero-vision SFT 与视觉 RL。"], + ["2026", "ToolsRL", "https://arxiv.org/abs/2604.19945", "面向视觉工具使用的强化学习。"], + ["2026", "Kimi K3", "https://arxiv.org/abs/2607.24653", "MoonViT-V2 从头共同 NTP 与视觉闭环 Agent。"], +]; + +const audits = [ + ["输入", "最大像素、tile、帧数、字幕 / 音频和 context 分别是多少?"], + ["视觉塔", "从什么 checkpoint 初始化?固定还是更新?图像与视频是否共享?"], + ["压缩", "patch、pixel shuffle、resampler、时间池化分别丢掉什么?"], + ["连接器", "prefix、cross-attention、Q-Former、MLP,还是单主干?"], + ["训练", "哪些阶段使用对比、caption、NTP、SFT、RL?谁被更新?"], + ["“原生”", "数据、目标、优化、输入输出、Agent 五维究竟满足哪些?"], + ["输出", "只生成文字,还是也生成图像、代码、工具动作和新观察?"], + ["评测", "感知、OCR、知识、推理、视频与 Agent 是否分别记录?"], + ["系统", "视觉 Token 怎样打包、并行和限制长尾?吞吐基线是什么?"], + ["安全", "图像文字被当作数据还是指令?工具副作用怎样授权和验证?"], +]; +--- + +MULTIMODAL / 13 PIXELS · TOKENS · ACTION
++ 从 ViT 把像素切成 Token、CLIP 建立开放语义空间,到 Frozen / Flamingo / BLIP-2 / LLaVA + 寻找视觉入口;再沿 DeepSeek 的理解、生成、光学压缩三分支,与 Kimi 三代 MoonViT, + 走到 K3 从训练起共同优化、并能反复“看—做—再看”的原生多模态。 +
+00 SIXTEEN LEDGERS
++ 多模态不是“给语言模型装一双眼睛”这么简单。像素可能在 resize 时丢失,视觉塔可能看见却没通过 + connector,语言主干可能被常识先验带偏,工具闭环也可能因为权限或验证器失败。十六张账把这些问题逐层拆开。 +
+ + + PREREQUISITE / CHAPTER 02 +先理解 Token、位置、多头注意力和残差,才能看清 ViT 与语言主干共享了什么。
{answer}
+多模态模型是一条受 Token 预算约束的信息管道:视觉编码器决定看见什么,连接器决定传过去什么,主干决定怎样融合,工具闭环决定能否主动获取新证据。
+{wave.gain}
+ 留下的债:{wave.debt} +01 FIVE-LAYER PIPELINE
++ “模型答错了”只能描述终点,不能定位故障。更可用的办法是沿数据流逐层问: + 输入还保留证据吗?视觉塔编码了吗?压缩后传过去了吗?主干引用了吗?最终答案或动作被验证了吗? +
+ +分辨率、长宽比、采帧、裁剪与音频 / 字幕。
失败:细节在进模型前消失CNN、ViT、SigLIP、MoonViT、DeepEncoder。
失败:视觉表征不适合任务tile、resampler、Q-Former、pixel shuffle、MLP。
失败:接口成为信息瓶颈语言先验、跨模态注意力、MoE、长上下文。
失败:看见却没有引用回答、生成图像、代码、工具调用与环境状态。
失败:输出没有独立验证LLM 收到
回答引用
视觉忠实
最终状态正确
把它想成一条证据管道。模型越大,只能改善其中一部分;如果发票小字在 resize 后只剩几个模糊像素,再强的语言推理也无法恢复原始数字。
+02 VISUAL TOKEN MATH
+
+ Vision Transformer 把图像切成 patch。若图像为 H × W,patch 边长为 P,
+ 最粗略的视觉位置数是高、宽两个方向 patch 数的乘积。
+
s × s 表示空间合并因子。视频还要乘帧数,再除时间池化因子。真实模型还会加入 thumbnail、tile、分隔符、padding 与 packing。
+ 2×2 合并后约 64
2×2 合并后约 1,369
2×2 合并后仍有 16,384
小字、细线、对象与空间关系
文字、历史、视频与工具观察共用
ViT、prefill、显存、通信与尾延迟
“最高支持 3584²”不意味着每张图都该用满。最大输入是容量上限;最佳输入取决于信息密度、上下文和系统预算。
+03 VISUAL BACKBONES
++ AlexNet 证明 GPU 与大卷积网络可以在 ImageNet 规模学习视觉特征;ResNet 用残差路径让更深网络更易优化; + ViT 则把图像切成 patch 序列,直接复用 Transformer。真正与 LLM 接轨的关键,不是“图像也有注意力”,而是两种模态开始共享序列接口、位置机制和缩放工具。 +
+ +局部卷积与层级特征;类别空间封闭。
残差高速公路让更深视觉骨干稳定训练。
图像 patch 变成标准 Transformer 序列。
+ ResNet · + Vision Transformer。 + 这是视觉表示前史,不应倒写成“早期 LLM 多模态”。 +
+04 LANGUAGE SUPERVISION
+
+ CLIP 分别编码一批图像与文本,得到一个 N × N 相似度矩阵。正确配对在对角线;
+ 对比目标拉近正确图文、推远错误组合。分类时不必训练新分类头,只要把类别写成自然语言提示。
+
“a photo of a tabby cat”text encodert₁ … tₙ
+ 因此,CLIP 是后续 VLM 的视觉语义地基,不是完整视觉助手。把“图文可比较”变成“根据图像连续生成答案”,仍需要语言主干、连接器、指令数据与生成目标。 + 参见 CLIP 原论文。 +
+05 ALIGN · LIT · SIGLIP
+用超大规模 web 图文对证明“规模可以部分抵消手工清洗不足”,但不会消除偏见、重复和错误配对。
+保留已有强视觉空间,只训练文本侧去匹配;“冻结谁”本身就是训练配方。
+不再把整个 batch 放进同一个 softmax;每对图文独立做二元 sigmoid 分类。
+softmax(similarity matrix)正确 pair 与 batch 内所有候选竞争。
Σ log σ(yᵢⱼ · scoreᵢⱼ)每一对图文独立判断匹配 / 不匹配。
+ SigLIP-SO400M 后来成为 DeepSeek-VL2、Kimi-VL、K2.5 等模型的重要视觉初始化。 + 但一种更好的对齐损失不会自动解决动态分辨率、connector、语言生成或工具使用。 + 一手来源:ALIGN、 + LiT、 + SigLIP。 +
+06 CONNECTOR ERA I
++ 早期路线的核心约束是:已有语言模型很强、训练一次很贵,能否少动它?答案产生了两种不同接口。 +
+ +视觉编码器学习产生连续 embedding,作为冻结 LLM 的前缀。语言模型保留能力,但视觉前缀承担重翻译任务。
+Perceiver Resampler 把可变视觉特征压成固定潜变量,再用 gated cross-attention 插入冻结语言层之间。
+视觉信息是作为普通序列位置进入自注意力,还是保留在独立 memory 里让语言层跨注意力读取?两者的上下文成本和系统实现完全不同。
+07 CONNECTOR ERA II
+Q-Former 用有限 query 从视觉特征取信息。训练参数少,但细粒度场景必须挤过固定瓶颈。
+线性 / 两层 MLP projector 配合生成式视觉指令数据,成为开放 VLM 最易复现的路线之一。
+图里有什么
局部、关系、文字
按用户意图回答
推理、工具与验证
connector 参数少,不代表它不重要。它是视觉塔与 LLM 之间的带宽和坐标变换;信息能否被语言注意力使用,正由这里决定。
+08 RESOLUTION STRATEGIES
+batch 和吞吐最规则;长图被压扁、crop 丢边缘、小字最先消失。
+ 系统简单 / 视觉损失高 +复用固定视觉塔并保留细节;tile 重复、顺序与 Token 成本成为新问题。
+ 局部清晰 / 上下文昂贵 +保留长宽比,在固定 Token 预算内装多张图;需要 mask、位置与变长系统支持。
+ 形状原生 / 系统复杂 ++ NaViT 的关键不是“无限分辨率”,而是取消 batch 中所有图像必须同尺寸的假设。 + DeepSeek-VL2 代表动态切图路线;MoonViT 代表 native-resolution packing 路线。二者都仍受最大 Token、显存与上下文约束。 +
+09 OCR · DOCUMENTS
++ 文档理解要求模型同时回答三件事:字符是什么?阅读顺序是什么?字符在表格、公式、标题和注释中扮演什么结构角色? + OCR 错一位小数,后面的数学推理可以完全正确却得到错误答案。 +
+ +多语言、手写、公式、小字号与非语义字符串。
多栏、脚注、图例与复杂页面并非机械栅格扫描。
表格 cell、键值关系、公式树与跨页引用。
读到事实后,还要计算、比较、验证和引用证据。
+ OCRBench 把文字识别、场景文字 VQA、文档 VQA、关键信息抽取与手写公式放在同一评测框架。 + 它提醒我们:只测自然图 VQA,会遗漏真实办公场景最常见的瓶颈。 +
+10 VIDEO
++ “杯子先掉下还是人先伸手”“红灯出现了多久”“哪个镜头解释了结局”,都不能只靠静态帧集合回答。 + 最直接的逐帧编码又会让视觉 Token 随帧数线性增长。 +
+ +再做 4× 时间池化可把位置约降四倍,但不会免费保留所有短暂事件。
++ Video-MME 的评测包含短中长视频,并区分是否提供字幕和音频。 + 报告视频结果时必须同时记录采帧策略、最大帧数、字幕 / 音频与上下文预算。 +
+11 WHAT DOES “NATIVE” MEAN?
++ 厂商可以用“native”描述输入、数据、架构或训练。若不拆词,我们会把“早期加入图像”“图文共同 NTP”“没有事后 alignment” + 和“能视觉工具闭环”误当成同一个命题。 +
+ +视觉数据是否从预训练早期进入,而非只在末期补课?
视觉塔是否与主干共享生成目标或同一训练制度?
视觉塔与语言主干是否共同更新,而非只学一个事后 bridge?
图、文、视频、代码和渲染能否在同一序列交错?
动作后能否重新看环境,继续推理并验证?
+ K3 明确保留约 0.4B 的 MoonViT-V2 与轻量 MLP projector。它的“原生”重点是从头共同 next-token prediction、 + 无 post-hoc modality alignment,以及视觉在长程工具轨迹中的持续回流。 +
+12 FOUR KINDS OF UNIFICATION
+图像 Token 与文字 Token 可以交错。
不同模态共享大部分计算层。
共同 NTP,或在同一主干混合 NTP 与 diffusion / flow。
理解、生成、工具动作和重新观察进入一条轨迹。
图文交错离散 Token,用 early-fusion 自回归统一建模。图像 tokenizer 质量和长视觉序列成为代价。
+文字做 next-token prediction,连续图像做 diffusion;统一主干不要求统一输出表示。
+理解与生成使用不同视觉编码路径,避免语义鲁棒表征与像素可逆表征互相拉扯。
++ 一手来源:Chameleon · + Transfusion · + SOLO · + Janus。 +
+13 DEEPSEEK SPOTLIGHT
++ 把 DeepSeek-VL、Janus、OCR 画成单向“代际升级”会误导:VL 系列优化高分辨率理解, + Janus 探索理解与生成怎样共用主干,OCR 系列研究二维视觉能否成为长上下文压缩介质。 +
+ +固定混合编码器 → 动态 tile;高分辨率、OCR、MoE 与语言能力保持。
+ 输出中心:文字理解 +解耦视觉编码路径,共享自回归主干;离散生成与 rectified flow 分叉。
+ 输出中心:文字 + 图像 +文字渲染成二维页面,用视觉 Token 压缩;再让语义重排改善阅读顺序。
+ 研究中心:压缩与解码 +同一组织的论文可以共享模型、数据和工程经验,但只要优化目标不同,就不能拿“新年份”替代架构比较。
+14 DEEPSEEK-VL → VL2
++ DeepSeek-VL 面向网页截图、PDF、OCR、图表与真实用例, + 使用混合视觉编码器处理 1024² 输入。它尤其强调:视觉预训练一开始就保留语言数据,主动管理视觉—语言竞争,避免语言能力被覆盖。 +
+ +全局缩略图 + 局部视野
固定视觉编码尺寸
729 → 196 / tile
映射到语言空间
稀疏语言骨干
VL2 论文列出的 1.0B、2.8B、4.5B 是不同版本的激活参数量,不能与总参数混用。动态 tile 也不是任意无限切图:论文候选约束为 m·n ≤ 9。
15 JANUS FAMILY
+更关心概念与关系
更关心可恢复视觉细节
解耦理解与生成视觉编码路径,保留统一自回归主干。
语言自回归 + 图像 rectified flow,并对两种表示做对齐。
延续基本架构,改进训练策略、数据与规模。
+ “统一模型”在这里不等于“一个视觉编码器包办全部”。一手来源: + Janus · + JanusFlow · + Janus-Pro。 +
+16 DEEPSEEK-OCR · OCR2
++ 这不是为了把已有数字文字变得更清晰,而是在问:二维页面能否像人类速览一页纸那样, + 用远少于原始文本序列的位置保留足够信息? +
+ +压缩越强,解码错误通常越多。
论文报告的解码精度区域
论文报告的更强压缩区域
OmniDocBench 特定设置
论文生产管线报告值
压缩率依赖文本 tokenizer、渲染、字体、语言、页面版式、视觉 Token 定义与解码目标。上述数字不是本站复测,也不代表任意文档。
++ DeepSeek-OCR2 用 DeepEncoder V2 根据图像语义动态重排视觉 Token, + 把问题描述为两个串联的一维因果结构:视觉侧决定读取序列,语言侧沿该序列解码。 + 这改善序列组织,但不等于二维结构已被完全解决。 +
+17 KIMI SPOTLIGHT
+对齐一个强视觉塔→用生成目标统一图像 / 视频→从头共同优化视觉塔与超大 MoE 主干
+18 KIMI-VL
+NaViT packing
SigLIP init · abs pos + 2D RoPE
空间位置约降 4×
视觉 → 语言维度
约 2.8B 激活 MoE
Moonlight 中间 checkpoint
MoonViT / projector
图文联合预训练
高质量分布
8K → 128K
+ 这些数字来自 Kimi-VL 官方论文。 + 这一代已经做联合预训练,却仍有独立 ViT 与 0.1T alignment,因此不属于 K3 定义的“无事后对齐”。 +
+19 KIMI K2.5
+每帧内部对象与布局
动作顺序与变化
四帧 patch 轻量聚合
SigLIP contrastive + caption CE视觉语义对齐 + 生成目标
caption CE only图像 / 视频条件 next-token generation
图像 / 视频早已进入基础能力
用 IPython 程序操作激活视觉工具行为
grounding、counting、文档、图表与 STEM
“zero-vision”只修饰 SFT。K2.5 预训练约 15T 图文 Token,之后的 outcome-based RL 也使用视觉任务。作者还报告部分文本基准在视觉 RL 后提升,但这不是普遍规律。
+20 KIMI K3 · NATIVE MULTIMODALITY
++ K3 报告把语言与视觉从训练开始共同优化,以 next-token prediction 作为共同训练制度, + 并取消 post-hoc modality-alignment stage。视觉、代码、渲染物和新观察还能在百万 Token 级 Agent 轨迹里反复交错。 +
+ +语言主干先成型,视觉通过独立阶段找入口。
+视觉塔、projector 与 2.8T MoE 主干在共同目标下从训练早期协同。
+Vision Transformer
MoonViT-V2
无 bias
空间 / 时间分解注意力
2×2 pixel shuffle
报告支持上限
一手来源:Kimi K3 Technical Report。
+21 FROM-SCRATCH VISION
++ K3 报告称,在与 2.8T MoE 主干联合训练的消融中,SigLIP 初始化的 MoonViT-3D 持续出现更高梯度范数和更多尖峰; + 从头训练的 MoonViT-V2 梯度更低、更平稳,并在其视觉评测中达到相当能力。 +
+ +SigLIP 初始化视觉塔梯度更高、尖峰更多。
从头 NTP 可达到相当视觉评测。
架构、规模、数据和优化器改变后结论可能变化。
+ 图中只复现论文主张的趋势,不重绘原始数值。正确表述是“在 K3 的训练消融中”,而不是“SigLIP 初始化普遍不稳定”。 +
+22 PROGRAMMATIC MULTIMODAL DATA
++ K3 扩大程序化多模态数据,把代码与其可渲染产物绑在一起:SVG、3D、Web、游戏、CAD、动效和视频编辑。 + 这些样本天然包含可执行规格、视觉结果与可修改源程序。 +
+ +自然语言需求与约束
<svg> + <path ... /> +</svg>可执行中间表示
HTML / SVG / JS / CAD
模型可以重新观察
形成视觉闭环
传统 caption 只告诉模型“图里有什么”;程序化样本还能告诉它“怎样产生、怎样修改、怎样验证这个视觉结果”。这把理解、生成、代码和 Agent 行为接到同一数据闭环。
+23 INTERACTIVE LAB
++ 前三个实验分别抓住容量、训练和压缩;第四个实验专门证明“文字思考更长”和“主动获得新视觉证据”不是同一种测试时计算。 +
+24 MULTIMODAL HALLUCINATION
+缩放、裁剪、采帧与图像质量。
query、projector、Token 压缩与注意力。
语言先验、共现、奖励与解码。
+ POPE 用对象存在性轮询诊断幻觉; + HallusionBench 进一步用控制组问题拆开语言幻觉、视觉错觉、回答倾向和逻辑一致性。 + 单个 yes/no 分数不能覆盖属性、关系、OCR 与长回答忠实度。 +
+ +动态分辨率、裁剪、负例、密集描述。
region、bbox、OCR span、证据截图。
zoom、OCR、Python、检索与工具。
计算、规则、环境 final state 与拒答。
25 EVALUATION MAP
+6 大学科、30 学科、183 子领域、30 种图像类型。
28 个已有数据集 + 3 个新数据集。
识别、VQA、KIE 与手写公式。
254 小时、2700 问答,短中长视频。
checkpoint + preprocessing + max pixels / frames + prompt + context + tools + evaluator + score
+ 同名模型若 tile、帧数、字幕或工具预算不同,就不是同一个评测条件。
+26 VISUAL AGENTS
+一次图像观察 → 文字答案
验证:参考答案crop / OCR / Python → 新观察
验证:计算或证据连续截图 → 鼠标 / 键盘 / 代码
验证:环境 final state+ VisualWebArena 把视觉网页任务放进可执行网站; + OSWorld 使用真实桌面应用与执行式验证。 + 此时“看懂截图”不等于“坐标落对”,更不等于“跨应用最终状态正确”。 +
+ +决定允许的目标、权限与审批。
可能包含间接提示注入,不能自动升级为指令。
最小权限、可回滚、可审计与独立验证。
27 SYSTEMS · MOE
+长图、长视频和多图样本形成 straggler。
按视觉 Token 分桶、NaViT / sequence packing。
K3 报告把部分 ViT 工作塞进 pipeline bubble。
路由专化、热点与稳定性仍缺公开细证据。
Kimi-VL 与 K3 的吞吐或 bubble 隐藏结论都依赖硬件、精度、batch、分辨率分布、并行拓扑和比较基线,只能写成各自配置下的作者报告。
++ 视觉 Token 进入 MoE 后是否形成稳定“视觉专家”,当前公开证据不足。本章把它列为开放问题,不从少量路由热图猜测语义专化。 +
+28 AUDIT CHECKLIST
+{question}
+ 从像素到视觉 Token,从 CLIP 语义到 connector,从高分辨率、文档和视频到统一理解生成, + 再从 DeepSeek 三分支与 Kimi 三代 MoonViT 走到视觉 RL、Agent、安全与系统。 + 你现在可以不依赖营销命名,逐层解释一款多模态模型到底改变了什么。 +
+↳ PRIMARY PAPER CHAIN
++ 正文只保留改变表示、接口、训练目标、系统策略或评测方法的关键节点。所有链接直达论文或正式会议页面; + 报告数字不做跨模型无条件横比。 +
+{note}
+ + ))} +01 WORKSTREAMS
-
内容首版优先打通全局脉络;随后每轮迭代选择一个专题推进到论文/工程层,并做独立事实复核。
@@ -93,8 +94,8 @@ const workstreams = [
47 页报告目录、151 条参考来源和架构/后训练/系统主线已经提取。 从语言模型基础到评测安全,包含先修依赖和三条贯穿案例。 响应式导航、章节模板、侧栏、进度、论文链和证据提示组件。 K3、语言模型前史、Transformer、DeepSeek、长上下文、MoE、推理、Agent,以及训练系统、Scaling、数据工程、数值和 Alignment 专题。 K3、语言模型前史、Transformer、DeepSeek、Scaling、数据工程、长上下文、MoE、后训练、推理、Agent、训练系统与数值优化专题。 K3、语言模型前史、Transformer、DeepSeek、长上下文、MoE、推理、Agent、多模态,以及训练系统、Scaling、数据工程、数值和 Alignment 专题。 K3、语言模型前史、Transformer、DeepSeek、Scaling、数据工程、长上下文、MoE、后训练、推理、Agent、原生多模态、训练系统与数值优化专题。 八张独立问题账、33 个正式节点、20 段长文与概率—向量—记忆—对齐四联实验。 十张独立问题账、40 个正式节点、21 段正文与 QKV—Mask—多头位置—Block 成本四联实验。 九张账、29 个一手节点、DeepSeek/Kimi 双谱系与曲面—部署—复用—涌现四联实验。 十张账、36 个一手节点、K2/K3 与 DeepSeek-V3/V4 双谱系,以及格式—状态—更新—失稳四联实验。 十二张账、44 个一手节点、DeepSeek/Kimi 后训练双谱系,以及 SFT—RM—PPO/DPO—配方四联实验。 十四张账、52 个一手节点、DeepSeek/Kimi Agent 双谱系,以及循环—工具契约—可靠性—长程 RL 四联实验。 新增 TextWorld、WebArena、ToolSandbox、AgentDojo、RAGEN、Agent Lightning、AgentENV 等 34 个 Agent 节点。 十六张账、55 个一手节点、DeepSeek 三分支、Kimi 三代 MoonViT,以及 Token—连接器—光学压缩—视觉闭环四联实验。 新增 ResNet、ALIGN、NaViT、DeepSeek-VL2、Janus、DeepSeek-OCR、Vision-R1 等 41 个多模态节点。 源码公开到 git.k1412.top,网站由不可变镜像、Compose Manager 与 HTTPS 交付。K3 报告已结构化拆解
16 专题知识图
编辑式网站系统
三十九个原创交互视图
十三篇首版长文
四十三个原创交互视图
十四篇首版长文
语言模型前史深度专题
Transformer 深度专题
Scaling Laws 深度专题
数值、优化器与稳定性深度专题
指令微调与人类偏好深度专题
工具使用与长程 Agent 深度专题
314 篇关键论文索引
原生多模态深度专题
355 篇关键论文索引
公开仓库与自托管发布
真实 pass@k 曲线 → PRM 失败案例 → 逐篇图表精读
案例库 + 真实 traces真实偏好分歧 → RM 长度偏置 → PPO/DPO 小模型复现
数据案例 + 可复现实验真实环境 traces → cross-harness ablation → Agent RL 曲线与提示注入案例
运行证据 + 安全案例库ViT/CLIP → connector VLM → Kimi-VL/MoonViT-V2
视觉 Token 流程图真实视觉 Token traces → 跨分辨率 / connector 消融 → OCR 与视觉 Agent 安全失败案例
运行证据 + 逐图笔记热力图可描述中间权重和提出假设;因果结论必须补消融、patching 或反事实干预。
模型、harness、工具契约、环境、评测器、可靠性与安全不再被压成一个 Agent 分数。
function schema、工具执行、业务状态、策略合规与 pass^k 分层评价;模型自报完成不作为证据。
像素、视觉塔、压缩 / connector、主干与输出 / 工具闭环分开定位;“原生”再拆成数据、目标、优化、输入输出与 Agent 五维。
VL/VL2 的理解、Janus 的统一生成、OCR 的光学压缩不画成错误的单向代际谱系。
DeepSeek-OCR 的 <10× / 20× 锚点标成作者报告;中间只做显式教学插值,超过范围不外推。