DeepSeek 发布实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp。新模型已经可以通过 API 调用,同时支持文本和图片输入,让 V4 Flash 开始具备截图理解、图表分析、OCR 类任务以及其他视觉工作流能力。
目前最受关注的是它的 Benchmark 表现。DeepSeek 表示,V4 Flash Vision Exp 在多模态 Agent 任务上的整体表现已经接近 Claude Opus 4.8。
不过,相比 Benchmark,另一个设计可能更值得开发者关注:
单张图片最高只消耗 384 个输入 Token,并且按照 V4 Flash 相同的 Token 价格计费。
对于需要频繁读取网页截图、软件界面、文档页面的 AI Agent 来说,这可能显著降低视觉任务的使用成本。
DeepSeek V4 Flash Vision Exp 是什么?
新模型对应的 API 名称为:
deepseek-v4-flash-vision-exp
DeepSeek 将其定位为一款实验性的视觉理解模型,而不是直接替代现有的 V4 Flash。
这次更新最核心的变化其实很简单:
V4 Flash 现在可以直接理解图片。
开发者可以通过 Chat Completions、Messages 和 Responses API 同时提交文本和图片。图片可以通过 Base64、外部 URL,或者 DeepSeek 新推出的 Files API 传入。
这意味着它已经能够支持不少典型的多模态应用场景,例如:
- 分析网页或软件截图
- 理解图表和示意图
- 读取图片中的文本信息
- 分析 UI 界面
- 将视觉输入与 Agent 工具调用结合
- 让 Coding Agent 检查自己生成的页面效果
DeepSeek 表示,在纯文本推理、知识和 Agent 任务上,V4 Flash Vision Exp 与原版 V4 Flash 基本保持相同水平,而在需要视觉理解的任务上则有明显提升。
DeepSeek 称其多模态 Agent 能力已接近 Claude Opus 4.8
这次发布中最引人注意的说法之一,是 DeepSeek 对 Claude Opus 4.8 的直接比较。
从 DeepSeek 公布的部分多模态 Agent Benchmark 来看,两款模型并不是一边倒的关系,而是在不同测试中互有领先。
| Benchmark | DeepSeek V4 Flash Vision Exp | Claude Opus 4.8 |
|---|---|---|
| Agents' Last Exam | 27.3 | 25.7 |
| ZeroBench | 35.0 | 34.0 |
| ApexBench | 36.5 | 39.4 |
| Chartography | 64.3 | 65.0 |
V4 Flash Vision Exp 在 Agents' Last Exam 和 ZeroBench 中略占优势,而 Claude Opus 4.8 在 ApexBench 和 Chartography 中仍然领先。

不过,这并不意味着 DeepSeek 已经在所有视觉任务上全面追平 Claude。
目前这些成绩主要来自厂商公布的 Benchmark。真正决定实际体验的,仍然包括:
- OCR 准确率
- 小字体识别能力
- 复杂截图理解
- UI 操作可靠性
- 视觉幻觉
- 长流程 Agent 稳定性
这些指标还需要更多第三方测试来验证。
另外还有一个时间点需要注意:Claude Opus 4.8 已经不是 Anthropic 最新的 Opus 模型。
Anthropic 已在 2026 年 7 月 24 日发布 Claude Opus 5,并重点提升 Coding 和 Agent 能力。
所以 DeepSeek 这次对比的是一款仍然很强的 Claude 模型,但并不是 Anthropic 当前最新一代旗舰。
384 Token 的图片上限,可能才是这次更新最值得关注的部分
Benchmark 很容易成为新闻标题,但从实际产品和开发成本来看,DeepSeek 的图片 Token 机制可能更重要。
DeepSeek 会在推理前将图片转换为视觉 Token,并且规定:
每张图片最多只消耗 384 个输入 Token。
较大的图片会先经过自动缩放,因此图片处理成本相对容易预测。
这对于视觉 Agent 非常关键,因为 Agent 很少只处理一张图片。
比如一个浏览器 Agent 完成一次任务,可能需要连续读取 20~30 个页面截图。
Coding Agent 在调整网页 UI 时,也可能不断:
生成页面 → 截图 → 查看问题 → 修改代码 → 再截图。
如果每一次视觉观察都带来较高的 Token 消耗,最终 API 成本会迅速增加。
DeepSeek 通过限制单张图片的 Token 上限,让大量、重复的视觉输入变得更容易控制成本。
当然,这种方案也存在明显的取舍。
图片经过自动缩放以后,特别小的文字、复杂表格、密集型 Dashboard 或高精度图表,都有可能损失部分细节。
因此,低成本视觉并不等于高分辨率视觉一定更强。
这也是开发者正式用于生产环境之前需要重点测试的地方。
和 Gemini 3.7 Flash 相比怎么样?
Google 的 Gemini Flash 同样是这次比较绕不开的模型。
Gemini 3.7 Flash 已于 2026 年 8 月 13 日正式 GA,是目前 Google 最新的 Flash 模型。
它本身就是原生多模态模型,可以处理:
- 文本
- 图片
- 视频
- 音频
同时还集成了 Function Calling、Code Execution、Google Search Grounding 和 Computer Use 等能力。
因此,Gemini 3.7 Flash 和 DeepSeek V4 Flash Vision Exp 的定位并不完全相同。
Gemini 3.7 Flash 更像是一套覆盖范围更广的原生多模态和工具生态。
而 DeepSeek V4 Flash Vision Exp 当前更突出的卖点,则是把低成本视觉理解直接加入 Agent 工作流。
换句话说,DeepSeek 这次并不一定是在和 Gemini 做“谁的功能更多”的竞争。
它真正有吸引力的地方,是:
视觉能力 + Agent 能力 + 更激进的图片 Token 成本控制。
对于需要大量处理网页截图和视觉状态的 Agent 产品来说,这种定位其实很有竞争力。
DeepSeek 还上线了 Files API
和视觉模型一起上线的,还有 DeepSeek 新的 Files API。
以前如果一个 Agent 需要多次使用同一张图片,应用可能需要反复上传文件。
现在,开发者可以先上传图片,获得一个 file_id,后续请求直接引用这个文件即可。
这看起来只是一个 API 层的小改动,但对于长流程 Agent 来说非常实用。
例如,一个 Agent 在整个任务过程中可能需要多次回看:
- 某个界面截图
- 一张架构图
- 一份扫描文档
- 一个数据图表
通过 Files API,就不需要每次都重新传输同一个文件。
对多轮、多步骤、多图片的 Agent 工作流来说,这种设计会更加自然。
DeepSeek V4 Flash Vision Exp 适合哪些场景?
如果只是问:
“这张图片里有什么?”
其实并不能完全体现这款模型的价值。
更值得关注的是 视觉理解和 Agent 行动结合之后的应用场景。
比如 Coding Agent:
生成网页以后,可以直接查看页面截图,然后发现布局问题,再自动修改代码。
Browser Agent:
可以先观察网页当前状态,再决定下一步点击哪个按钮。
Business Agent:
可以读取 Dashboard 或图表,再根据数据自动触发下一步流程。
Document Agent:
不仅能处理正文,还能结合扫描页、图表、表格和图片中的信息进行理解。
这也是当前多模态 AI 一个越来越明显的发展方向:
从单纯的
“模型可以看图片”
逐渐变成:
“模型可以看、理解,然后采取行动。”
DeepSeek V4 Flash Vision Exp 明显就是沿着这个方向设计的。
现在值得使用吗?
如果是实验和测试,非常值得。
如果直接用于正式生产环境,目前还是建议多做一些验证。
毕竟模型名称里仍然带有 “Exp”,DeepSeek 自己也将其定义为实验性模型。
尤其建议重点测试:
- 小字体识别
- 密集型 UI
- OCR 准确率
- 图片缩放后的信息损失
- 视觉幻觉
- 多轮 Agent 中的稳定性
因此,现在真正值得问的问题,可能并不是:
DeepSeek 是否已经做出了最强的视觉模型?
而是:
V4 Flash Vision Exp 能不能用足够低的成本,提供“足够好”的视觉理解,从而让大规模多模态 Agent 真正变得可用?
如果答案是肯定的,那么这次发布中最重要的数字,或许并不是某个 Benchmark 分数。
而是:
384 Tokens per image。
FAQ
DeepSeek V4 Flash Vision Exp 是什么?
DeepSeek V4 Flash Vision Exp 是 V4 Flash 的实验性多模态版本,可以通过 DeepSeek API 同时处理文本和图片输入。
DeepSeek V4 Flash 支持图片了吗?
普通 V4 Flash 仍然主要面向文本任务。如果需要视觉输入,可以使用:
deepseek-v4-flash-vision-exp
一张图片会消耗多少 Token?
DeepSeek 表示,单张图片最多消耗 384 个输入 Token。较大的图片会在处理前自动缩放。
DeepSeek V4 Flash Vision Exp 比 Claude Opus 4.8 更强吗?
目前还不能这么说。
从 DeepSeek 公布的部分多模态 Agent Benchmark 来看,两款模型互有胜负。真实场景中的 OCR、UI 理解、视觉幻觉和 Agent 稳定性仍然需要更多独立测试。
DeepSeek V4 Flash Vision Exp 和 Gemini 3.7 Flash 哪个更强?
两款模型目前的重点并不完全一样。
Gemini 3.7 Flash 提供更加完整的原生多模态能力和工具生态,可以处理文本、图片、音频、视频和 PDF。
DeepSeek V4 Flash Vision Exp 则更突出 低图片 Token 成本和多模态 Agent 场景。
如果是大量截图、UI 分析或者需要持续进行视觉观察的 Agent 工作流,DeepSeek 的成本设计尤其值得关注。
