DeepSeek V4开放视觉,多模态智能体

引言
当多模态被纳入基础能力,智能体的“感知—推理—行动”链条才算完整。DeepSeek 刚刚将这一块拼图补上:V4 系列首次通过官方 API 明确开放视觉输入,实验模型 deepseek-v4-flash-vision-exp(下称 Vision-Exp)上线,支持图文混合的理解与推理。这不仅是“看图”的开始,更像一次围绕工具使用、长周期任务与环境建模的系统升级。
这次更新带来了什么
模型与 API 能力

Vision-Exp 的定位是“实验性多模态”,但在工程层面的集成度已经到位:
- 支持 Chat Completions、Messages、Responses 三种调用格式,利于快速接入现有 Agent 框架。
- 图片输入支持三种路径:base64 内联、外部 URL、Files API 上传,覆盖从在线采集到本地批处理的常见场景。
- 计费方式与文本一致,图片会先转换为 tokens 后计费;单张图片最多 384 tokens,避免了不可控的视觉开销。
这意味着在成本模型上,开发者可以较为准确地预估“每张图的最大成本”,在数据密集型的自动化流程中更容易做规模化预算。
V4 系列的技术底座
回溯 V4 的演进,有助于理解 Vision-Exp 的定位:
- V4-Flash 采用混合专家(MoE)架构,总参数量 2840 亿,但每个 token 激活约 130 亿参数,兼顾推理能力与吞吐效率;默认支持 100 万 token 长上下文。
- 7 月的 V4-Flash-0731 强化了工具调用和长周期 Agent 任务,为“能用工具、能执行、能收尾”的自动化能力打下基础。
- Vision-Exp 在此基础上引入视觉输入,并在多项与工具与代码相关的测试上实现了跨代提升。
简而言之,Vision-Exp 并不是“在文本模型外挂了个视觉编码器”,而更像一次面向多模态 Agent 的联合后训练:让模型在看图、理解环境、规划任务、调用工具之间更顺畅地协同。
基准测试结果与解读
对比 V4-Flash-0731,Vision-Exp 在七项测试中六项发生变化,五项提升、一项小幅下降:
- Terminal Bench 2.1:82.7 → 83.9
- NL2Repo:54.2 → 57.7
- DeepSWE:54.4 → 59.3
- Toolathlon-Verified:70.3 → 75.9
- DSBench-Hard:59.6 → 63.6
- AutomationBench:25.1 → 25.7
- Cybergym:76.7 → 75.3(下降 1.4 分)
两点值得关注:
1) 工具与代码相关能力显著增强
- Toolathlon 提升 5.6 分,DeepSWE 提升 4.9 分。这类评测通常涉及真实代码库修改、跨步骤工具编排和长周期控制,提升幅度意味着模型在“把计划落实到工具动作”上更稳。
- DSBench-Hard 也有明显增长,说明难样本上的规划与稳健性同步改善。
2) 个别领域略有回撤
- Cybergym 的下降可能反映训练分布变化或多模态对某些纯文本策略的干扰,但幅度可控。对安全或对抗类任务,仍建议按场景实测微调配置。
与头部模型的横向对比也有参考意义:
- 相比 Opus 4.8,Vision-Exp 在多数文本 Agent 测试上仍略弱,例如 NL2Repo 低 12 分、DSBench-Hard 低 8.1 分。
- 但在代码密集场景的 DeepSWE 上以 59.3 反超 Opus 的 58.0;Toolathlon 75.9 也仅比 Opus 低 0.3 分。
比较克制的结论是:Vision-Exp 的文本 Agent 能力整体接近 Opus 4.8,在部分代码智能与工具协同测试上实现反超,但尚未全面胜出。对开发者而言,意味着可以围绕代码生产力和流程自动化优先评估其价值。
开发者如何用好 Vision-Exp
接入与集成建议
- 调用方式:优先选择与现有框架契合的接口(Chat Completions/Messages/Responses),减少适配成本。
- 图片输入:
- 单张图片上限 384 tokens,建议对长图与高分辨率图进行裁剪或区域化提问(region-of-interest),提升信噪比与成本效率。
- 对稳定文件流,Files API 更利于批处理与审计;对在线资源,URL 输入便于快速拉取。
- 工具编排:结合 0731 以来增强的工具调用能力,将视觉理解作为“感知模块”前置到工作流中,例如:
- 基于界面截图的 RPA/自动化操作定位。
- 读取日志截屏或监控图表,触发后续脚本或 API 调用。
- 解析架构图/流程图后,自动在代码库中定位实现与改造点。
成本与可靠性
- 成本可预估:图像计费上限固定在 384 tokens,有利于做“每任务图像预算”的配置。对多图场景,分批对话与缓存中间描述可以进一步降本。
- 实验性标记:Vision-Exp 带有 “Exp” 后缀,建议:
- 为关键链路配置回退模型(如 V4-Flash-0731)与重试策略。
- 通过 A/B 测试验证在目标任务上的真实收益曲线,而非仅依赖通用基准分数。
- 对输出做结构化约束(JSON schema 等),提升在工具链中的可控性。
场景示例:从“会看”到“会做”

- 代码与文档共情境处理:将设计图/架构图与代码仓库一并输入,让模型先生成“环境理解摘要”,再进行定位与修改,减少无关检索与错误写入。
- 运营数据与告警闭环:识别仪表盘截图的异常模式,按预案调用脚本拉取数据、定位服务、回滚配置,实现从感知到处置的自动化闭环。
- UI 自动化与可测性:结合页面截图进行元素定位与操作脚本生成,并在回放失败时自动对比差异截图,给出修复建议。
- 合规与治理:对合同扫描件、报表截图进行字段抽取与一致性核验,再联动内部工具完成审批流,减少人工回填。
这些场景的共同点在于:图片不只是“输入噪声”,而是触发与校验工具动作的关键证据。Vision-Exp 的价值,正在于把视觉理解直接嵌入到行动链条中。
影响与展望
多模态能力的开放,对 DeepSeek 生态的意义不止于“多看一个模态”:
- Agent 走向可落地:工具调用、长周期控制与视觉感知的同步增强,让端到端自动化具备更强的鲁棒性与可监控性。
- 成本与工程可控:图像 token 上限与与文本一致的计费体系,为规模化部署降低了不确定性,便于在企业场景做配额与审计。
- 竞争维度变化:在与头部模型的较量中,Vision-Exp 已在部分代码智能评测上取得领先。接下来真正的分水岭,不在单项分数,而在“围绕视觉与工具的真实生产力”。
展望来看,三条路径值得关注:
1) 多模态的纵深:从静态图像扩展到视频/时序视觉,结合长上下文与内存机制,支撑更复杂的人机协同与现场自动化。
2) 工具学习的强化:围绕真实企业工作流的“执行反馈”数据进行后训练,进一步提升计划—执行—反思的闭环能力。
3) 可靠性与治理:在实验性阶段尽快补齐稳定性、可观测性与安全防护机制,包括输出结构约束、异常检测与回滚策略。
Vision-Exp 给“小鲸鱼”装上了眼睛,更重要的是,让它在看清世界后能更好地动手。对于追求端到端自动化的团队,现在是一个值得启动试点与验证价值的时间点。
标签: DeepSeek 多模态 Agent 代码智能 大模型评测