当前位置:首页 > AI资讯 > 正文内容

DeepSeek V4开放视觉,多模态智能体

admin60分钟前AI资讯2

DeepSeek V4开放视觉,多模态智能体

引言

当多模态被纳入基础能力,智能体的“感知—推理—行动”链条才算完整。DeepSeek 刚刚将这一块拼图补上:V4 系列首次通过官方 API 明确开放视觉输入,实验模型 deepseek-v4-flash-vision-exp(下称 Vision-Exp)上线,支持图文混合的理解与推理。这不仅是“看图”的开始,更像一次围绕工具使用、长周期任务与环境建模的系统升级。

这次更新带来了什么

模型与 API 能力

多模态 API 管线的抽象示意图

Vision-Exp 的定位是“实验性多模态”,但在工程层面的集成度已经到位:

  • 支持 Chat Completions、Messages、Responses 三种调用格式,利于快速接入现有 Agent 框架。
  • 图片输入支持三种路径:base64 内联、外部 URL、Files API 上传,覆盖从在线采集到本地批处理的常见场景。
  • 计费方式与文本一致,图片会先转换为 tokens 后计费;单张图片最多 384 tokens,避免了不可控的视觉开销。

这意味着在成本模型上,开发者可以较为准确地预估“每张图的最大成本”,在数据密集型的自动化流程中更容易做规模化预算。

V4 系列的技术底座

回溯 V4 的演进,有助于理解 Vision-Exp 的定位:

  • V4-Flash 采用混合专家(MoE)架构,总参数量 2840 亿,但每个 token 激活约 130 亿参数,兼顾推理能力与吞吐效率;默认支持 100 万 token 长上下文。
  • 7 月的 V4-Flash-0731 强化了工具调用和长周期 Agent 任务,为“能用工具、能执行、能收尾”的自动化能力打下基础。
  • Vision-Exp 在此基础上引入视觉输入,并在多项与工具与代码相关的测试上实现了跨代提升。

简而言之,Vision-Exp 并不是“在文本模型外挂了个视觉编码器”,而更像一次面向多模态 Agent 的联合后训练:让模型在看图、理解环境、规划任务、调用工具之间更顺畅地协同。

基准测试结果与解读

对比 V4-Flash-0731,Vision-Exp 在七项测试中六项发生变化,五项提升、一项小幅下降:

  • Terminal Bench 2.1:82.7 → 83.9
  • NL2Repo:54.2 → 57.7
  • DeepSWE:54.4 → 59.3
  • Toolathlon-Verified:70.3 → 75.9
  • DSBench-Hard:59.6 → 63.6
  • AutomationBench:25.1 → 25.7
  • Cybergym:76.7 → 75.3(下降 1.4 分)

两点值得关注:

1) 工具与代码相关能力显著增强
- Toolathlon 提升 5.6 分,DeepSWE 提升 4.9 分。这类评测通常涉及真实代码库修改、跨步骤工具编排和长周期控制,提升幅度意味着模型在“把计划落实到工具动作”上更稳。
- DSBench-Hard 也有明显增长,说明难样本上的规划与稳健性同步改善。

2) 个别领域略有回撤
- Cybergym 的下降可能反映训练分布变化或多模态对某些纯文本策略的干扰,但幅度可控。对安全或对抗类任务,仍建议按场景实测微调配置。

与头部模型的横向对比也有参考意义:

  • 相比 Opus 4.8,Vision-Exp 在多数文本 Agent 测试上仍略弱,例如 NL2Repo 低 12 分、DSBench-Hard 低 8.1 分。
  • 但在代码密集场景的 DeepSWE 上以 59.3 反超 Opus 的 58.0;Toolathlon 75.9 也仅比 Opus 低 0.3 分。

比较克制的结论是:Vision-Exp 的文本 Agent 能力整体接近 Opus 4.8,在部分代码智能与工具协同测试上实现反超,但尚未全面胜出。对开发者而言,意味着可以围绕代码生产力和流程自动化优先评估其价值。

开发者如何用好 Vision-Exp

接入与集成建议

  • 调用方式:优先选择与现有框架契合的接口(Chat Completions/Messages/Responses),减少适配成本。
  • 图片输入:
  • 单张图片上限 384 tokens,建议对长图与高分辨率图进行裁剪或区域化提问(region-of-interest),提升信噪比与成本效率。
  • 对稳定文件流,Files API 更利于批处理与审计;对在线资源,URL 输入便于快速拉取。
  • 工具编排:结合 0731 以来增强的工具调用能力,将视觉理解作为“感知模块”前置到工作流中,例如:
  • 基于界面截图的 RPA/自动化操作定位。
  • 读取日志截屏或监控图表,触发后续脚本或 API 调用。
  • 解析架构图/流程图后,自动在代码库中定位实现与改造点。

成本与可靠性

  • 成本可预估:图像计费上限固定在 384 tokens,有利于做“每任务图像预算”的配置。对多图场景,分批对话与缓存中间描述可以进一步降本。
  • 实验性标记:Vision-Exp 带有 “Exp” 后缀,建议:
  • 为关键链路配置回退模型(如 V4-Flash-0731)与重试策略。
  • 通过 A/B 测试验证在目标任务上的真实收益曲线,而非仅依赖通用基准分数。
  • 对输出做结构化约束(JSON schema 等),提升在工具链中的可控性。

场景示例:从“会看”到“会做”

智能体从感知到行动的流程示意

  • 代码与文档共情境处理:将设计图/架构图与代码仓库一并输入,让模型先生成“环境理解摘要”,再进行定位与修改,减少无关检索与错误写入。
  • 运营数据与告警闭环:识别仪表盘截图的异常模式,按预案调用脚本拉取数据、定位服务、回滚配置,实现从感知到处置的自动化闭环。
  • UI 自动化与可测性:结合页面截图进行元素定位与操作脚本生成,并在回放失败时自动对比差异截图,给出修复建议。
  • 合规与治理:对合同扫描件、报表截图进行字段抽取与一致性核验,再联动内部工具完成审批流,减少人工回填。

这些场景的共同点在于:图片不只是“输入噪声”,而是触发与校验工具动作的关键证据。Vision-Exp 的价值,正在于把视觉理解直接嵌入到行动链条中。

影响与展望

多模态能力的开放,对 DeepSeek 生态的意义不止于“多看一个模态”:

  • Agent 走向可落地:工具调用、长周期控制与视觉感知的同步增强,让端到端自动化具备更强的鲁棒性与可监控性。
  • 成本与工程可控:图像 token 上限与与文本一致的计费体系,为规模化部署降低了不确定性,便于在企业场景做配额与审计。
  • 竞争维度变化:在与头部模型的较量中,Vision-Exp 已在部分代码智能评测上取得领先。接下来真正的分水岭,不在单项分数,而在“围绕视觉与工具的真实生产力”。

展望来看,三条路径值得关注:

1) 多模态的纵深:从静态图像扩展到视频/时序视觉,结合长上下文与内存机制,支撑更复杂的人机协同与现场自动化。
2) 工具学习的强化:围绕真实企业工作流的“执行反馈”数据进行后训练,进一步提升计划—执行—反思的闭环能力。
3) 可靠性与治理:在实验性阶段尽快补齐稳定性、可观测性与安全防护机制,包括输出结构约束、异常检测与回滚策略。

Vision-Exp 给“小鲸鱼”装上了眼睛,更重要的是,让它在看清世界后能更好地动手。对于追求端到端自动化的团队,现在是一个值得启动试点与验证价值的时间点。

标签: DeepSeek 多模态 Agent 代码智能 大模型评测

返回列表

上一篇:毫秒级全栈闭环:人形机器人乒乓对战

没有最新的文章了...

相关文章

一行代码破解AI巨头算力税黑箱

一行代码,撕开AI巨头的“算力税”黑箱 2025年9月,GitHub上悄然出现的一行命令 npx claude-mem install,像一颗投入深潭的石子,起初无人察觉。然而短短数月后,它竟掀起一场...

曦望S3专芯重塑AI推理算力格局

推理时代的算力革命:曦望如何用“专芯”重构AI基础设施 2026年,AI产业正式迈入“推理落地、智能体普及”的新纪元。当大模型不再只是“会聊天的助手”,而是进化为能思考、会执行的数字员工,一场围绕推理...

AI听懂猫狗语:PettiChat用世界模型破译宠物心声

当AI开始“听懂”猫言狗语:PettiChat如何用世界模型打破人宠沟通壁垒 在通用人工智能(AGI)席卷人类语言世界的今天,一个长期被忽视的沟通场景正悄然迎来技术破局——人类与宠物之间的交流。尽管全...

多模态AI全面开放,算力竞争白热化

多模态AI普及加速,算力与生态竞争进入深水区 4月22日,全球AI领域迎来密集的技术与战略动态。从OpenAI全面开放多模态图像生成能力,到Meta、英伟达、英特尔等巨头在算力、图形AI与端侧智能上的...

服务业扩能提质国家战略新蓝图

服务业扩能提质:国家战略下的新增长极 近日,国务院印发《关于推进服务业扩能提质的意见》,明确提出到2030年服务业总规模突破100万亿元的目标。这一部署不仅为服务业高质量发展擘画蓝图,更释放出国家推动...

AI模型建微信群:协作新革命

当大模型建起了「微信群」:一场 AI 协作的范式革命 4 月的大模型战场,硝烟弥漫。从 ChatGPT 到 DeepSeek,从腾讯混元到阿里通义,各家蓄势待发,准备在两周内轮番亮剑。然而,就在这波技...

发表评论

访客

◎欢迎参与讨论,请在这里发表您的看法和观点。