DeepSeek V4 Flash Vision Exp 发布:低成本视觉能力,正在进入多模态 Agent

deepseek-v4-flash-vision-exp

DeepSeek 发布实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp。新模型已经可以通过 API 调用,同时支持文本和图片输入,让 V4 Flash 开始具备截图理解、图表分析、OCR 类任务以及其他视觉工作流能力。

目前最受关注的是它的 Benchmark 表现。DeepSeek 表示,V4 Flash Vision Exp 在多模态 Agent 任务上的整体表现已经接近 Claude Opus 4.8。

不过,相比 Benchmark,另一个设计可能更值得开发者关注:

单张图片最高只消耗 384 个输入 Token,并且按照 V4 Flash 相同的 Token 价格计费。

对于需要频繁读取网页截图、软件界面、文档页面的 AI Agent 来说,这可能显著降低视觉任务的使用成本。

DeepSeek V4 Flash Vision Exp 是什么?

新模型对应的 API 名称为:

deepseek-v4-flash-vision-exp

DeepSeek 将其定位为一款实验性的视觉理解模型,而不是直接替代现有的 V4 Flash。

这次更新最核心的变化其实很简单:

V4 Flash 现在可以直接理解图片。

开发者可以通过 Chat Completions、Messages 和 Responses API 同时提交文本和图片。图片可以通过 Base64、外部 URL,或者 DeepSeek 新推出的 Files API 传入。

这意味着它已经能够支持不少典型的多模态应用场景,例如:

  • 分析网页或软件截图
  • 理解图表和示意图
  • 读取图片中的文本信息
  • 分析 UI 界面
  • 将视觉输入与 Agent 工具调用结合
  • 让 Coding Agent 检查自己生成的页面效果

DeepSeek 表示,在纯文本推理、知识和 Agent 任务上,V4 Flash Vision Exp 与原版 V4 Flash 基本保持相同水平,而在需要视觉理解的任务上则有明显提升。

DeepSeek 称其多模态 Agent 能力已接近 Claude Opus 4.8

这次发布中最引人注意的说法之一,是 DeepSeek 对 Claude Opus 4.8 的直接比较。

从 DeepSeek 公布的部分多模态 Agent Benchmark 来看,两款模型并不是一边倒的关系,而是在不同测试中互有领先。

Benchmark DeepSeek V4 Flash Vision Exp Claude Opus 4.8
Agents' Last Exam 27.3 25.7
ZeroBench 35.0 34.0
ApexBench 36.5 39.4
Chartography 64.3 65.0

V4 Flash Vision Exp 在 Agents' Last Exam 和 ZeroBench 中略占优势,而 Claude Opus 4.8 在 ApexBench 和 Chartography 中仍然领先。

deepseek-comparison
所以从这些测试结果来看,用“接近 Opus 4.8”来描述 DeepSeek 的多模态 Agent 能力并不过分。

不过,这并不意味着 DeepSeek 已经在所有视觉任务上全面追平 Claude。

目前这些成绩主要来自厂商公布的 Benchmark。真正决定实际体验的,仍然包括:

  • OCR 准确率
  • 小字体识别能力
  • 复杂截图理解
  • UI 操作可靠性
  • 视觉幻觉
  • 长流程 Agent 稳定性

这些指标还需要更多第三方测试来验证。

另外还有一个时间点需要注意:Claude Opus 4.8 已经不是 Anthropic 最新的 Opus 模型。

Anthropic 已在 2026 年 7 月 24 日发布 Claude Opus 5,并重点提升 Coding 和 Agent 能力。

所以 DeepSeek 这次对比的是一款仍然很强的 Claude 模型,但并不是 Anthropic 当前最新一代旗舰。

384 Token 的图片上限,可能才是这次更新最值得关注的部分

Benchmark 很容易成为新闻标题,但从实际产品和开发成本来看,DeepSeek 的图片 Token 机制可能更重要。

DeepSeek 会在推理前将图片转换为视觉 Token,并且规定:

每张图片最多只消耗 384 个输入 Token。

较大的图片会先经过自动缩放,因此图片处理成本相对容易预测。

这对于视觉 Agent 非常关键,因为 Agent 很少只处理一张图片。

比如一个浏览器 Agent 完成一次任务,可能需要连续读取 20~30 个页面截图。

Coding Agent 在调整网页 UI 时,也可能不断:

生成页面 → 截图 → 查看问题 → 修改代码 → 再截图。

如果每一次视觉观察都带来较高的 Token 消耗,最终 API 成本会迅速增加。

DeepSeek 通过限制单张图片的 Token 上限,让大量、重复的视觉输入变得更容易控制成本。

当然,这种方案也存在明显的取舍。

图片经过自动缩放以后,特别小的文字、复杂表格、密集型 Dashboard 或高精度图表,都有可能损失部分细节。

因此,低成本视觉并不等于高分辨率视觉一定更强。

这也是开发者正式用于生产环境之前需要重点测试的地方。

和 Gemini 3.7 Flash 相比怎么样?

Google 的 Gemini Flash 同样是这次比较绕不开的模型。

Gemini 3.7 Flash 已于 2026 年 8 月 13 日正式 GA,是目前 Google 最新的 Flash 模型。

它本身就是原生多模态模型,可以处理:

  • 文本
  • 图片
  • 视频
  • 音频
  • PDF

同时还集成了 Function Calling、Code Execution、Google Search Grounding 和 Computer Use 等能力。

因此,Gemini 3.7 Flash 和 DeepSeek V4 Flash Vision Exp 的定位并不完全相同。

Gemini 3.7 Flash 更像是一套覆盖范围更广的原生多模态和工具生态。

DeepSeek V4 Flash Vision Exp 当前更突出的卖点,则是把低成本视觉理解直接加入 Agent 工作流。

换句话说,DeepSeek 这次并不一定是在和 Gemini 做“谁的功能更多”的竞争。

它真正有吸引力的地方,是:

视觉能力 + Agent 能力 + 更激进的图片 Token 成本控制。

对于需要大量处理网页截图和视觉状态的 Agent 产品来说,这种定位其实很有竞争力。

DeepSeek 还上线了 Files API

和视觉模型一起上线的,还有 DeepSeek 新的 Files API

以前如果一个 Agent 需要多次使用同一张图片,应用可能需要反复上传文件。

现在,开发者可以先上传图片,获得一个 file_id,后续请求直接引用这个文件即可。

这看起来只是一个 API 层的小改动,但对于长流程 Agent 来说非常实用。

例如,一个 Agent 在整个任务过程中可能需要多次回看:

  • 某个界面截图
  • 一张架构图
  • 一份扫描文档
  • 一个数据图表

通过 Files API,就不需要每次都重新传输同一个文件。

对多轮、多步骤、多图片的 Agent 工作流来说,这种设计会更加自然。

DeepSeek V4 Flash Vision Exp 适合哪些场景?

如果只是问:

“这张图片里有什么?”

其实并不能完全体现这款模型的价值。

更值得关注的是 视觉理解和 Agent 行动结合之后的应用场景

比如 Coding Agent:

生成网页以后,可以直接查看页面截图,然后发现布局问题,再自动修改代码。

Browser Agent:

可以先观察网页当前状态,再决定下一步点击哪个按钮。

Business Agent:

可以读取 Dashboard 或图表,再根据数据自动触发下一步流程。

Document Agent:

不仅能处理正文,还能结合扫描页、图表、表格和图片中的信息进行理解。

这也是当前多模态 AI 一个越来越明显的发展方向:

从单纯的

“模型可以看图片”

逐渐变成:

“模型可以看、理解,然后采取行动。”

DeepSeek V4 Flash Vision Exp 明显就是沿着这个方向设计的。

现在值得使用吗?

如果是实验和测试,非常值得。

如果直接用于正式生产环境,目前还是建议多做一些验证。

毕竟模型名称里仍然带有 “Exp”,DeepSeek 自己也将其定义为实验性模型。

尤其建议重点测试:

  • 小字体识别
  • 密集型 UI
  • OCR 准确率
  • 图片缩放后的信息损失
  • 视觉幻觉
  • 多轮 Agent 中的稳定性

因此,现在真正值得问的问题,可能并不是:

DeepSeek 是否已经做出了最强的视觉模型?

而是:

V4 Flash Vision Exp 能不能用足够低的成本,提供“足够好”的视觉理解,从而让大规模多模态 Agent 真正变得可用?

如果答案是肯定的,那么这次发布中最重要的数字,或许并不是某个 Benchmark 分数。

而是:

384 Tokens per image。

FAQ

DeepSeek V4 Flash Vision Exp 是什么?

DeepSeek V4 Flash Vision Exp 是 V4 Flash 的实验性多模态版本,可以通过 DeepSeek API 同时处理文本和图片输入。

DeepSeek V4 Flash 支持图片了吗?

普通 V4 Flash 仍然主要面向文本任务。如果需要视觉输入,可以使用:

deepseek-v4-flash-vision-exp

一张图片会消耗多少 Token?

DeepSeek 表示,单张图片最多消耗 384 个输入 Token。较大的图片会在处理前自动缩放。

DeepSeek V4 Flash Vision Exp 比 Claude Opus 4.8 更强吗?

目前还不能这么说。

从 DeepSeek 公布的部分多模态 Agent Benchmark 来看,两款模型互有胜负。真实场景中的 OCR、UI 理解、视觉幻觉和 Agent 稳定性仍然需要更多独立测试。

DeepSeek V4 Flash Vision Exp 和 Gemini 3.7 Flash 哪个更强?

两款模型目前的重点并不完全一样。

Gemini 3.7 Flash 提供更加完整的原生多模态能力和工具生态,可以处理文本、图片、音频、视频和 PDF。

DeepSeek V4 Flash Vision Exp 则更突出 低图片 Token 成本和多模态 Agent 场景

如果是大量截图、UI 分析或者需要持续进行视觉观察的 Agent 工作流,DeepSeek 的成本设计尤其值得关注。