DeepSeek lanzó DeepSeek-V4-Flash-Vision-Exp, un modelo multimodal experimental disponible a través de su API. Acepta tanto texto como imágenes, incorporando la comprensión de capturas de pantalla, el análisis de gráficos, tareas tipo OCR y otros flujos de trabajo visuales a la familia V4 Flash.
Las cifras del benchmark están acaparando la mayor parte de la atención. DeepSeek afirma que el rendimiento de su agente multimodal ahora está cerca del Claude Opus 4.8.
Pero hay otra parte del lanzamiento que podría importar más a los desarrolladores: una sola imagen no usa más de 384 tokens de entrada y se cobra a la misma tarifa por token que V4 Flash.
Para agentes de IA que necesitan mirar repetidamente capturas de pantalla, interfaces o páginas de documentos, eso podría hacer que los flujos de trabajo visuales sean considerablemente más baratos.
¿Qué es DeepSeek V4 Flash Vision Exp?
El nuevo modelo está disponible a través de la API bajo:
deepseek-v4-flash-vision-exp
DeepSeek lo describe como un modelo experimental de comprensión visual, en lugar de ser un reemplazo de V4 Flash estándar.
Su cambio principal es sencillo: V4 Flash ahora puede trabajar directamente con información visual.
Los desarrolladores pueden enviar entradas mixtas de texto e imagen mediante las APIs de Chat Completions, Messages y Responses. Las imágenes se pueden pasar en Base64, mediante URLs externas o a través de la nueva API de Files de DeepSeek.
Esto abre flujos de trabajo como:
-
analizar capturas de pantalla
-
entender gráficos y diagramas
-
extraer información de imágenes de documentos
-
inspeccionar interfaces de usuario
-
combinar entradas visuales con herramientas de agentes
-
permitir que los agentes de código revisen las interfaces que generan
DeepSeek dice que sus capacidades de solo texto se mantienen aproximadamente alineadas con el V4 Flash regular, mientras que el rendimiento mejora significativamente en tareas que requieren comprensión visual.
DeepSeek dice que está cerca de Claude Opus 4.8
Una de las afirmaciones más grandes del anuncio es la comparación con el Anthropic Claude Opus 4.8.
En las evaluaciones publicadas de agentes multimodales de DeepSeek, ambos modelos se reparten las victorias en lugar de que uno supere consistentemente al otro.
| Benchmark | DeepSeek V4 Flash Vision Exp | Claude Opus 4.8 |
|---|---|---|
| Agents' Last Exam | 27.3 | 25.7 |
| ZeroBench | 35.0 | 34.0 |
| ApexBench | 36.5 | 39.4 |
| Chartography | 64.3 | 65.0 |
DeepSeek lidera en Agents' Last Exam y ZeroBench, mientras que Opus 4.8 se mantiene por delante en ApexBench y Chartography.

Sin embargo, no debería leerse como prueba de que DeepSeek haya igualado a Claude en cada tarea de visión. Son evaluaciones publicadas por el proveedor, y aún se necesitarán pruebas independientes para casos reales de OCR, reconocimiento de texto pequeño, alucinaciones visuales, navegación de interfaces y tareas largas de agentes.
También hay un detalle de timing importante: Opus 4.8 ya no es el modelo Opus más nuevo de Anthropic. Anthropic lanzó Claude Opus 5 el 24 de julio de 2026, posicionándolo como una mejora sobre Opus 4.8 en codificación y trabajo agentico.
Así que el nuevo modelo de DeepSeek se compara con un Claude reciente y sólido, pero no con la generación más reciente de Anthropic.
El límite de imagen de 384 tokens es la parte más interesante
Los benchmarks hacen mejores titulares. El diseño de tokens de imagen podría tener un impacto mayor en aplicaciones reales.
DeepSeek convierte imágenes en tokens antes de la inferencia, con cada imagen con un tope de 384 tokens. Las imágenes grandes se redimensionan automáticamente, lo que mantiene su costo de entrada bajo un control predecible.
Esto importa porque los agentes visuales a menudo necesitan más de una imagen.
Imagina un agente de navegador completando una tarea en 30 pantallas distintas. Un agente de código puede capturar capturas de pantalla repetidamente mientras cambia una interfaz. Un flujo de trabajo de documentos podría procesar decenas de páginas escaneadas o gráficos.
En esas situaciones, el costo del procesamiento de imágenes puede acumularse rápidamente.
El enfoque de DeepSeek hace que las observaciones visuales repetidas sean inusualmente ligeras desde la perspectiva de los tokens.
El intercambio es la resolución. Comprimir una captura de pantalla grande en un presupuesto limitado de tokens visuales significa que textos muy pequeños, hojas de cálculo densas o diagramas detallados pueden perder información. La visión económica no significa automáticamente una visión perfecta de alta resolución.
Esa es una de las áreas que los desarrolladores deberían probar antes de depender del modelo en producción.
¿Cómo se compara con Gemini 3.7 Flash?
Google es otra comparación obvia.
Gemini 3.7 Flash estuvo disponible de forma general el 13 de agosto y actualmente es el modelo Flash más reciente de Google. Es nativamente multimodal y admite texto, imágenes, video, audio y PDFs, junto con funciones integradas como llamada a funciones, ejecución de código, Search grounding y uso de computadoras.
Eso hace que las dos propuestas de modelos Flash sean ligeramente diferentes.
Gemini 3.7 Flash ofrece un ecosistema multimodal y de herramientas más amplio.
DeepSeek V4 Flash Vision Exp actualmente parece estar más enfocado en llevar comprensión de imagen económica a flujos de trabajo de agentes.
Por lo tanto, el lanzamiento de DeepSeek no trata necesariamente de superar a Gemini función por función. Su atractivo es la combinación de visión, capacidad de agente y eficiencia agresiva de tokens de imagen.
Para los desarrolladores que procesan grandes volúmenes de capturas de pantalla u observaciones visuales, ese posicionamiento es interesante.
La nueva API de Files también importa
DeepSeek también lanzó una Files API junto con el modelo de visión.
En lugar de enviar la misma imagen repetidamente, los desarrolladores pueden subirla una vez y referenciarla más tarde usando un file_id. DeepSeek afirma que la Files API en sí es gratuita y está diseñada para reducir el ancho de banda cuando la misma imagen se reutiliza en múltiples solicitudes.
Eso suena como una pequeña función de infraestructura, pero tiene sentido para flujos de trabajo de agentes.
Un agente puede necesitar volver a la misma captura de pantalla, diagrama o imagen fuente varias veces mientras completa una tarea más larga. Reutilizar un archivo subido hace que ese flujo de trabajo sea más limpio y evita transferir repetidamente los mismos datos.
Dónde podría ser útil V4 Flash Vision Exp
Las aplicaciones más interesantes van más allá de preguntar: “¿Qué hay en esta imagen?”
Un agente de código podría generar una página web, inspeccionar la captura de pantalla y luego corregir problemas de diseño.
Un agente de navegador podría mirar una interfaz antes de decidir qué acción tomar.
Un agente de negocio podría interpretar un panel o gráfico antes de activar otro flujo de trabajo.
Un sistema de documentos podría combinar extracción de texto con comprensión visual de tablas, diagramas y páginas escaneadas.
Este es el cambio más amplio que ocurre en los modelos de IA: pasar de modelos que simplemente ven imágenes a agentes que pueden ver, razonar y actuar.
DeepSeek V4 Flash Vision Exp encaja directamente en esa tendencia.
¿Deberías usarlo ahora?
Para experimentos, sin duda.
Para cargas de trabajo de producción, se necesita más pruebas.
El modelo aún lleva la etiqueta “Exp”, y el propio DeepSeek lo describe como experimental. Los desarrolladores deberían prestar especial atención al reconocimiento de texto pequeño, interfaces densas, alucinaciones visuales y el rendimiento después del redimensionamiento automático de imágenes.
La pregunta más grande no es si DeepSeek ha construido el mejor modelo de visión del mundo.
La cuestión es si V4 Flash Vision Exp puede entregar una comprensión visual suficientemente buena a un costo que haga prácticos los agentes multimodales de alto volumen.
Si lo logra, el tope de imagen de 384 tokens podría terminar siendo más importante que la comparación de benchmark que acaparó los titulares.
FAQ
¿Qué es DeepSeek V4 Flash Vision Exp?
DeepSeek V4 Flash Vision Exp es una versión multimodal experimental de V4 Flash que admite entradas de texto e imagen a través de la API de DeepSeek.
¿DeepSeek V4 Flash admite imágenes?
El V4 Flash regular sigue siendo un modelo centrado en texto. Los desarrolladores pueden usar deepseek-v4-flash-vision-exp cuando se requiera entrada visual.
¿Cuántos tokens usa una imagen?
DeepSeek dice que una imagen puede consumir hasta 384 tokens de entrada, y que las imágenes más grandes se redimensionan automáticamente antes del procesamiento.
¿DeepSeek V4 Flash Vision Exp es mejor que Claude Opus 4.8?
No de forma universal. En los benchmarks publicados de agentes multimodales de DeepSeek, V4 Flash Vision Exp gana algunas pruebas mientras que Opus 4.8 gana otras. Aún se necesitan comparaciones independientes en casos reales.
¿DeepSeek V4 Flash Vision Exp es mejor que Gemini 3.7 Flash?
Actualmente apuntan a fortalezas algo diferentes. Gemini 3.7 Flash admite un rango más amplio de entradas multimodales y herramientas integradas, mientras que el nuevo modelo de DeepSeek destaca por su límite máximo bajo de tokens de imagen y su enfoque en flujos de trabajo de agentes multimodales.
