DeepSeek이 DeepSeek-V4-Flash-Vision-Exp를 공개했습니다. 이 실험용 멀티모달 모델은 자사 API를 통해 사용할 수 있습니다. 텍스트와 이미지를 모두 입력으로 받을 수 있어 스크린샷 이해, 차트 분석, OCR 스타일 작업 등 다양한 시각적 워크플로를 V4 Flash 제품군에 담아냈습니다.
이제 벤치마크 수치가 가장 큰 주목을 받고 있습니다. DeepSeek은 자사 멀티모달 에이전트 성능이 현재 Claude Opus 4.8에 근접했다고 말합니다.
하지만 출시에서 개발자에게 더 중요할 수 있는 또 다른 부분이 있습니다. 단일 이미지는 최대 384개 입력 토큰을 사용하며, V4 Flash와 동일한 토큰 요율로 과금됩니다.
스크린샷, 인터페이스, 문서 페이지를 반복해서 살펴봐야 하는 AI 에이전트라면, 이러한 방식은 시각적 워크플로 비용을 상당히 낮출 수 있습니다.
DeepSeek V4 Flash Vision Exp란?
새 모델은 API를 통해 다음 경로로 제공됩니다.
deepseek-v4-flash-vision-exp
DeepSeek은 이를 표준 V4 Flash의 대체가 아니라 실험용 시각 이해 모델로 설명합니다.
가장 큰 변화는 간단합니다. 이제 V4 Flash가 시각 정보를 직접 처리할 수 있게 되었습니다.
개발자는 Chat Completions, Messages, Responses API를 통해 텍스트+이미지 혼합 입력을 보낼 수 있습니다. 이미지는 Base64, 외부 URL 또는 DeepSeek의 새 Files API를 통해 전달할 수 있습니다.
이를 통해 다음과 같은 워크플로가 열립니다.
-
스크린샷 분석
-
차트 및 다이어그램 이해
-
문서 이미지에서 정보 추출
-
사용자 인터페이스 점검
-
비주얼 입력을 에이전트 도구와 결합
-
코딩 에이전트가 자신이 생성한 인터페이스를 검토하도록 하기
DeepSeek은 순수 텍스트 기능은 일반 V4 Flash와 대체로 비슷한 수준을 유지하면서, 시각적 이해가 필요한 작업에서는 성능이 크게 향상됐다고 말합니다.
DeepSeek, Claude Opus 4.8과 가깝다고 말하다
이번 발표에서 가장 큰 주장 중 하나는 Anthropic의 Claude Opus 4.8과의 비교입니다.
DeepSeek이 공개한 멀티모달 에이전트 평가에서는 두 모델이 서로를 일관되게 앞서는 구도라기보다, 승리가 번갈아 나옵니다.
| 벤치마크 | DeepSeek V4 Flash Vision Exp | Claude Opus 4.8 |
|---|---|---|
| 에이전트 마지막 시험(Agents' Last Exam) | 27.3 | 25.7 |
| 제로벤치(ZeroBench) | 35.0 | 34.0 |
| 에이펙스벤치(ApexBench) | 36.5 | 39.4 |
| 차토그래피(Chartography) | 64.3 | 65.0 |
DeepSeek은 에이전트 마지막 시험과 ZeroBench에서 앞서고, Opus 4.8은 ApexBench와 Chartography에서 우위를 유지합니다.

다만, 이것이 DeepSeek이 모든 비전 작업에서 Claude와 동일한 수준에 도달했다는 증거로 읽혀서는 안 됩니다. 이는 제공사가 게시한 평가이며, 실제 환경에서의 OCR, 소문자 수준의 작은 글자 인식, 시각적 환각, UI 내비게이션, 장시간 실행되는 에이전트 작업에 대해서는 여전히 독립적인 테스트가 필요합니다.
또 하나 중요한 타이밍 정보가 있습니다. Opus 4.8은 더 이상 Anthropic의 최신 Opus 모델이 아닙니다. Anthropic은 2026년 7월 24일 Claude Opus 5를 출시했고, 이를 Opus 4.8 대비 코딩 및 에이전트 작업에서의 개선으로 포지셔닝했습니다.
즉, 새 DeepSeek 모델은 강력한 최신 Claude 모델과 비교되는 것이지, Anthropic의 최신 세대와 비교되는 것은 아닙니다.
384-토큰 이미지 제한이 더 흥미로운 이유
벤치마크는 헤드라인을 만들기 좋습니다. 이미지-토큰 설계는 실제 애플리케이션에 더 큰 영향을 줄 수 있습니다.
DeepSeek은 추론 전에 이미지를 토큰으로 변환하며, 각 이미지는 최대 384토큰으로 제한됩니다. 큰 이미지는 자동으로 리사이즈되어 입력 비용이 예측 가능하게 유지됩니다.
이는 시각적 에이전트가 종종 한 장의 이미지로 끝나지 않기 때문입니다.
예를 들어 브라우저 에이전트가 30개의 서로 다른 화면을 거치며 작업을 완료한다고 상상해 보세요. 코딩 에이전트는 UI가 바뀔 때마다 반복적으로 스크린샷을 캡처할 수 있습니다. 문서 워크플로는 수십 장의 스캔 페이지나 차트를 처리할 수도 있습니다.
이런 상황에서는 이미지 처리 비용이 빠르게 누적될 수 있습니다.
DeepSeek의 방식은 토큰 관점에서 반복적인 시각 관찰을 유난히 가볍게 만듭니다.
대신 해상도(레졸루션) 트레이드오프가 있습니다. 큰 스크린샷을 제한된 시각 토큰 예산으로 압축하면, 아주 작은 글자, 촘촘한 스프레드시트, 상세한 다이어그램에서는 정보가 손실될 수 있습니다. 저렴한 비전이라고 해서 자동으로 완벽한 고해상도 비전이 보장되는 것은 아닙니다.
그래서 개발자들은 프로덕션에 투입하기 전에 이 부분을 테스트해봐야 합니다.
Gemini 3.7 Flash와 어떻게 비교되나?
구글과의 비교도 자연스럽습니다.
Gemini 3.7 Flash는 8월 13일에 일반 제공되었고, 현재 구글의 최신 Flash 모델입니다. 기본적으로 멀티모달이며 텍스트, 이미지, 비디오, 오디오, PDF를 지원하고, 함수 호출, 코드 실행, Search grounding, 컴퓨터 사용 같은 내장 기능도 제공합니다.
그래서 두 Flash 모델은 제공 방식이 약간 다릅니다.
Gemini 3.7 Flash는 더 폭넓은 멀티모달 및 도구 생태계를 제공합니다.
DeepSeek V4 Flash Vision Exp는 현재 에이전트 워크플로에 저렴한 이미지 이해를 도입하는 데 더 좁게 초점을 맞춘 모습입니다.
따라서 DeepSeek 출시가 반드시 Gemini를 기능 하나하나로 앞서는 것을 목표로 한 것이라고 보긴 어렵습니다. 매력 포인트는 비전, 에이전트 역량, 그리고 공격적인 이미지-토큰 효율의 조합입니다.
스크린샷이나 시각적 관찰을 대량으로 처리하는 개발자에게는 이런 포지셔닝이 흥미로울 수 있습니다.
새로운 Files API도 중요하다
DeepSeek은 비전 모델과 함께 Files API도 출시했습니다.
같은 이미지를 매번 보내는 대신, 개발자는 한 번 업로드해 file_id로 나중에 참조할 수 있습니다. DeepSeek은 Files API 자체는 무료이며, 동일 이미지가 여러 요청에서 재사용될 때 대역폭을 줄이도록 설계했다고 말합니다.
이는 작은 인프라 기능처럼 들릴 수 있지만, 에이전트 워크플로에서는 의미가 큽니다.
에이전트는 더 긴 작업을 수행하는 동안 여러 번 같은 스크린샷, 다이어그램, 원본 이미지를 다시 봐야 할 수 있습니다. 업로드한 파일을 재사용하면 워크플로가 더 깔끔해지고, 같은 데이터를 반복해서 전송하는 부담도 줄일 수 있습니다.
V4 Flash Vision Exp가 유용할 수 있는 곳
가장 흥미로운 활용은 “이 이미지에 뭐가 있지?”를 묻는 수준을 넘어섭니다.
코딩 에이전트는 웹페이지를 생성한 뒤 스크린샷을 확인하고 레이아웃 문제를 바로잡을 수 있습니다.
브라우저 에이전트는 어떤 액션을 취할지 결정하기 전에 인터페이스를 살펴볼 수 있습니다.
비즈니스 에이전트는 다른 워크플로를 실행하기 전에 대시보드나 차트를 해석할 수 있습니다.
문서 시스템은 텍스트 추출과 함께 표, 다이어그램, 스캔 페이지에 대한 시각적 이해를 결합할 수 있습니다.
이건 AI 모델 전반에서 일어나는 더 큰 변화입니다. 단순히 이미지를 보는 모델에서, 이미지를 **보고(reason) 행동(act)**할 수 있는 에이전트로의 전환 말이죠.
DeepSeek V4 Flash Vision Exp는 이 흐름에 직접 들어맞습니다.
지금 사용해도 될까?
실험이라면, 물론입니다.
프로덕션 업무라면 추가 테스트가 더 필요합니다.
모델에는 여전히 “Exp” 라벨이 붙어 있고, DeepSeek 자체도 이를 실험적이라고 설명합니다. 개발자들은 특히 작은 글자 인식, 촘촘한 인터페이스, 시각적 환각, 그리고 자동 이미지 리사이즈 이후의 성능에 주의를 기울여야 합니다.
더 큰 질문은 DeepSeek이 세계 최고의 비전 모델을 만들었는지가 아닙니다.
V4 Flash Vision Exp가 대량의 멀티모달 에이전트를 현실적으로 만들 만큼의 비용으로 ‘충분히 좋은’ 시각적 이해를 제공할 수 있느냐가 핵심입니다.
만약 가능하다면, 헤드라인을 장식한 벤치마크 비교보다 384토큰 이미지 캡이 더 중요해질지도 모릅니다.
FAQ
DeepSeek V4 Flash Vision Exp란?
DeepSeek V4 Flash Vision Exp는 DeepSeek API를 통해 텍스트와 이미지 입력을 지원하는 V4 Flash의 실험용 멀티모달 버전입니다.
DeepSeek V4 Flash는 이미지를 지원하나요?
일반 V4 Flash는 여전히 텍스트 중심 모델입니다. 시각적 입력이 필요할 때 개발자는 deepseek-v4-flash-vision-exp를 사용할 수 있습니다.
한 이미지에는 몇 토큰이 사용되나요?
DeepSeek에 따르면 이미지는 최대 384개의 입력 토큰을 소모할 수 있으며, 더 큰 이미지는 처리 전에 자동으로 리사이즈됩니다.
DeepSeek V4 Flash Vision Exp는 Claude Opus 4.8보다 더 좋나요?
전반적으로 그렇다고 단정하긴 어렵습니다. DeepSeek이 공개한 멀티모달 에이전트 벤치마크에서는 V4 Flash Vision Exp가 일부 테스트에서 이기고 Opus 4.8이 다른 테스트에서 이깁니다. 독립적인 실제 환경 비교는 여전히 필요합니다.
DeepSeek V4 Flash Vision Exp는 Gemini 3.7 Flash보다 더 좋나요?
현재는 다소 다른 강점을 목표로 합니다. Gemini 3.7 Flash는 더 폭넓은 멀티모달 입력과 내장 도구를 지원하는 반면, DeepSeek의 새 모델은 낮은 이미지-토큰 한도와 멀티모달 에이전트 워크플로에 대한 집중으로 돋보입니다.
