DeepSeek V4:视觉Token全程参与

引言
DeepSeek V4 的视觉链路终于被彻底摊开:不只是“看图”,而是把图像真正塞进了语言主干,让视觉 Token 全程参与长上下文 Attention、MoE 路由以及后续的 Agent 推理。随着权重与参考推理代码开放,讨论的重点从“能否识图”转向“视觉如何成为原生一等公民”。这套设计不仅关乎精度,更重塑了多模态在长上下文与工具调用场景中的计算配额与信息流动方式。
视觉是如何进入 V4 的
ViT 前端:保留二维结构与密集细节
V4 的视觉前端是一套 32 层 ViT(隐藏维度 1024、16 个头、patch size=14),并使用二维 RoPE。二维位置编码的意义在 GUI/Web/表格等场景尤为突出:空间关系本身就是语义,按钮区位、表头-数据对齐、图例-曲线对应都依赖二维结构。这里的要点不是“把图像压成向量”,而是先在视觉域把空间骨架搭好,让后续语言主干接上的是可被推理的结构化视觉特征。
Aligner:先看细,再在语言侧压缩

瓶颈出现在视觉到语言的过渡:主干是 4096 维,视觉是 1024 维,且 ViT 的 patch 还很密。Aligner 的策略是“后置压缩、维度映射合一”:
- 将相邻 3×3 的视觉特征聚合,9×1024 合并为 9216。
- 通过 9216→4096→4096 的两层映射,把视觉网格压缩后对齐到语言主干的维度。
这一点很关键:DeepSeek 没有在前端就粗暴降采样,而是允许 ViT 以更高“观察密度”捕捉细节,再在进入计算昂贵的主干前,聪明地把 Token 数降下来。配置中的 vision_max_n_token=384 指的是“进入 V4 序列后的单图预算”,并非 ViT 只看 384 个 patch。这直接影响 Agent 的上下文滚动成本:每次观察环境,究竟往长上下文里追加多少视觉 Token,是被硬预算控制的。
序列构型:为主干的压缩与注意力准备地形
视觉 Token 并不是简单按行拼接。构造序列时会加入 IMAGE_START/IMAGE_END、换行、Padding,以相邻两行交织的方式重排网格,并通过 COMPRESS_PAD_TO=4 将位置与 4-Token 边界对齐。这与主干大量出现的 compress_ratio=4 层粒度相呼应:在进入“压缩友好”的主干前,图像序列已经主动做了对齐和布局优化,利于后续的块级压缩与局部注意力在二维邻域内聚合。其本质是把视觉的空间邻接关系,映射成主干能高效处理的线性邻接性。
视觉 Token 不是“旁听生”,而是主角之一
直接混入主干:Attention、DFlash、MoE 全程参与

与常见“图像编码→跨模态适配器→语言模型”的松耦合路径不同,V4 把视觉 Token 直接插入原有序列。它们参与长上下文 Attention,也进入 DFlash/压缩层的处理,还接受 MoE 的专家路由。代码层面还对视觉 Token 的注意力窗口和路由逻辑做了专门规则,使其既能在周围视觉邻域内高效聚合,又能在跨模态语义上与文本对齐。这种“原生多模态”路径的优势在于:
- 语义一致性:视觉与语言共享同一注意力与路由机制,减少中间桥接的损耗。
- 专家分工:MoE 可为视觉 Token 激活不同专家子网,避免与纯文本模式争抢同一容量。
- 上下文连贯:在长上下文内,视觉信息不被“封箱”,而是与对话历史、工具调用结果共同演化。
为什么这对 Agent 至关重要
对 Agent 来说,“一次观察”不仅是一次推理,更是一次记忆写入。视觉 Token 若只是边缘信息,跨轮对话会迅速丢失细节;而当它们成为序列一等公民,就能在随后的检索、工具规划、反思中持续被引用。vision_max_n_token=384 的设计,使开发者能明确计算预算:观察频率、图像分辨率、回合数之间的平衡被量化,工程层面可控。
与常见多模态方案的差异与取舍
- 路径差异:许多方案采用“图像塔 + 投影 + Cross-Attn”的松耦合范式;V4 走的是深度耦合,视觉直接进入主干,承担同等推理职责。
- 训练与稳定性:深度耦合更容易出现跨模态干扰,需要用窗口规则、Token 布局与 MoE 路由做“秩序管理”。V4 的重排与对齐策略,恰是在工程上为主干的压缩-注意力链路“铺平道路”。
- 计算与质量:后置压缩让前端细节保留更充分,但也要求在 Aligner 处做更聪明的聚合;384 的配额提供硬约束,逼迫模型在“信息密度/上下文长度/响应延迟”之间达成新平衡。
在实际任务上,这种设计对以下场景有显著利好:
- GUI/RPA:需要精确定位控件、理解遮挡与层级关系。
- 图表/表格:二维对应关系清晰保留,文本-数值-图形可在同一注意力平面交互。
- 长会话多图:视觉证据能跨轮保留并被反复引用,决策链更稳。
影响与展望
开放权重意味着两条探索路径同时被点亮:
- 研究侧:可以系统性研究“布局对齐 + 压缩比 + 专家路由”的组合最优;尝试自适应视觉 Token 预算、基于注意力热度的可学习下采样、甚至按任务动态重排视觉序列。
- 工程侧:面向 Agent 的上下文记忆管理、图像批量观察的缓存复用、跨回合的视觉证据检索,都有了可以落地的接口和尺子。
进一步的自然延伸是视频:在已有 3×3 聚合与 4-Token 对齐的思路下,时间维度的块化与对齐策略大概率可复用;而 MoE 的时间路由专家能否像空间专家一样奏效,值得验证。另一方面,384 的硬预算是否可以自适应、是否支持按“注意力收益”动态调配,也是值得尝试的方向。
简言之,DeepSeek V4 把视觉从“外围模块”推到“推理主干”,把多模态真正做成了主流程的组成部分。接下来更重要的问题不再是“会不会看”,而是“如何在有限计算下,把看见的东西更高效地存、取、用”。
标签: DeepSeek V4 多模态 视觉编码 MoE Agent