Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.049 — 2026-08-22
NEWS 19 信源 约 6 分钟

DeepSeek长出眼睛:多模态API开战

DeepSeek把视觉接入V4 API:能看截图、调工具,价格仍按V4-Flash计算。

IMAGE — DeepSeek (via Google News)
DeepSeek长出眼睛:多模态API开战

你把一张网页截图交给AI,让它找出按钮、读懂图表,再根据画面修改页面。过去,DeepSeek的V4 API主要处理文字,人得先把图片“翻译”成文字。现在这一步可以省掉了。

8月21日,DeepSeek把实验性模型DeepSeek-V4-Flash-Vision-Exp上线API平台。它是一款多模态模型——能在同一项任务里处理文字和图片。更重要的是,DeepSeek没有只把它做成“看图问答”,而是把视觉接进Agent工作流。Agent可以理解截图、页面和图文文件,再调用工具继续完成任务。

目前公开信息主要来自DeepSeek公告、文档及其公布的跑分,媒体报道大多是转述,尚不能替代独立实测。

不只是会看图,而是能接着做事

视觉理解,指模型识别图片里的文字、物体、图表和空间关系,并据此回答或行动。对普通聊天来说,这意味着可以直接发图提问。对Agent——能拆解任务、调用工具并执行多步操作的AI——意义更大:它终于能看见软件界面和自己的工作结果。

DeepSeek展示的三个案例都强调这种完整流程:制作商业定制的西藏自驾游PPT,按视觉要求重做DeepSeek Harness官网,以及生成带黏土怪物动态效果的前端Demo。模型需要先理解图片、页面结构和设计意图,再借助工具产出PPT或代码。这不等于模型能原生生成图片;材料能够证明的是视觉理解,以及它与工具执行的结合。

本刊8月4日报道V4-Flash正式版API时,它只提供Chat Completions和Messages两种兼容格式。Vision-Exp在此基础上还支持Responses API——一种把模型回复、工具调用和多步骤交互统一组织起来的接口。现有Agent工具因此更容易接入视觉能力。

开发者把model设为deepseek-v4-flash-vision-exp即可调用。图片可以用base64直接塞进请求、通过外部URL传入,或先上传至Files API,再用file_id引用。接口支持图文混合输入。

图片上传一次,模型可以反复看

同步上线的Files API解决了一个很实际的问题:同一张截图或图表如果要分析多次,不必在每次请求中重新上传。开发者可以先存文件,之后反复引用。这项文件接口本身免费,省下的是带宽和重复传输;模型每次处理图片产生的费用仍然存在,不能理解为“免费识图”。

DeepSeek Harness也在同一天补上配套支持。v0.1.1-rc.1加入Vision-Exp模型选项和原生图片请求;/goal/plan可以接收图文输入,MCP、ACP可以持久保存图片附件,PTC Mode则能转发嵌套图片。换句话说,模型、文件接口和Agent框架是一起到位的,不只是单独增加一个看图入口。

低价策略延伸到视觉

图片会先转换成token——模型计算和计费时使用的信息单位。单张图片最多计为384 tokens,价格与V4-Flash一致。这延续了DeepSeek以低价API争夺开发者的路线,也让批量处理截图、图表和页面的成本更容易控制。

据智东西按官方价格计算,在高峰时段、缓存未命中的特定条件下,单张图片的最高输入理解费用为0.001152元。不过,这个数字不包括输出及请求中的其他成本,也不能代表所有调用情形。

低价在这里不只是“同样能力卖得便宜”。视觉输入会扩大API能处理的任务边界:过去只能接收文字的Agent,现在可以直接读取截图、图表和软件页面。开发者是否愿意把视觉步骤接入日常工作流,价格会直接影响尝试门槛。

“接近Opus 4.8”该怎么理解

据DeepSeek公布,新模型在需要视觉理解的Agent Benchmark——用于比较Agent完成任务能力的一组标准测试——上较V4-Flash明显提升,多模态Agent能力接近Opus 4.8。

其中,ApexBench得分从26.2升至36.5,增加10.3分;Agents' Last Exam从25.2升至27.3。这里最值得看的不是一句“追平”,而是加入视觉后,原本会忽略图片信息的模型终于能参与完整任务。

“纯文本能力与正式版持平”则要谨慎理解。这是官方总体口径,并非每个项目逐项不变。公开榜单里部分指标上升,也有Cybergym下降1.4分。与Opus 4.8相比,更准确的说法也是“整体接近、互有胜负”,而不是全面超过。个别媒体标题中的“追平”放大了结论。

为什么值得关注

这次发布补上的不是一个孤立功能,而是DeepSeek V4开发者体系里的感知入口。模型负责看图,Files API负责复用图片,Harness负责把图片带进目标、计划和工具调用。三者合起来,Agent才有机会形成“看见界面—采取行动—检查结果”的闭环。

同时,Vision-Exp仍延续V4-Flash的计价方式。能力边界扩大而价格体系不变,会把多模态API竞争从“谁能识图”推向“谁能以更低成本,把视觉稳定地嵌进真实任务”。这也是它比一次普通模型更新更重要的原因。

局限与未知

  • Exp代表开放测试的实验版,能力、接口和稳定性以后都可能调整,不能等同于成熟正式版。
  • DeepSeek尚未公布开源权重或完整技术报告,外界无法从现有材料判断视觉能力的具体实现方式。
  • 跑分和演示主要来自官方,真实业务中的准确率、稳定性及长流程表现,仍需独立测试。

供稿材料 SOURCES — 19
05
DeepSeek Unveils Test Model to Rival Anthropic’s Opus 4.8 Bloomberg Technology (via Google News) · NEWS
原文 ↗

← 返回 2026-08-22 · 科技板块