Gemini 3.8 Flash 출시: 코딩·AI 에이전트·추론 성능 강화

gemini-3-8-flash

Google이 Gemini 업데이트 속도를 더 빠르게 끌어올리고 있습니다.

9월 2일, Google은 Gemini 3.8 Flash를 공식 출시했습니다. Gemini 3.7 Flash가 나온 지 불과 3주 만입니다.

이번 업데이트는 단순한 소규모 개선에 그치지 않습니다.

Google은 Flash 계열의 강점인 속도와 비용 효율을 유지하면서 장기 코딩, 자율형 AI 에이전트, 복잡한 추론, 엔터프라이즈 워크플로까지 더 잘 처리하도록 모델을 강화하고 있습니다.

그렇다면 Gemini 3.8 Flash에서 실제로 달라진 점은 무엇일까요? 사용할 만한 가치가 있을까요?

Gemini 3.8 Flash란?

Gemini 3.8 Flash는 Google의 최신 범용 Flash 모델입니다.

주요 활용 분야는 다음과 같습니다.

  • 소프트웨어 엔지니어링
  • AI 에이전트
  • 다단계 추론
  • 지식 업무
  • 멀티모달 이해
  • 대규모 AI 애플리케이션

입력으로 텍스트, 이미지, 영상, 오디오, PDF를 지원합니다.

또한 1,048,576 토큰의 입력 컨텍스트 윈도우와 최대 65,536 토큰의 출력을 지원해 대규모 코드베이스, 긴 문서, 많은 정보를 컨텍스트에 유지해야 하는 워크플로에 적합합니다.

Google은 낮음, 중간, 높음의 Thinking Level도 제공해 개발자가 추론 품질, 지연 시간, 비용 사이의 균형을 조절할 수 있도록 했습니다.

Gemini 3.8 Flash의 새로운 점

이번 업데이트를 가장 간단하게 표현하면 다음과 같습니다.

Gemini 3.8 Flash는 어려운 작업에 더 오래, 더 깊게 집중하는 모델이 됐습니다.

복잡한 요청에서는 더 많은 추론 단계를 수행하고, 여러 번 도구를 호출하며, 진행 상황을 확인하고, 결과를 다시 다듬을 수 있습니다. 서둘러 답을 내놓기보다 필요하면 작업을 계속 이어가는 방식입니다.

한 번의 프롬프트만으로 끝나지 않는 작업에서 특히 중요한 변화입니다.

장기 코딩 성능 향상

코딩은 Gemini 3.8 Flash에서 가장 크게 개선된 영역 중 하나입니다.

Google은 DeepSWE v1.1을 주요 지표로 제시합니다. 짧은 코드 생성 문제가 아니라 실제 장기 소프트웨어 엔지니어링 작업을 중심으로 평가하는 벤치마크입니다.

현재 DataCurve 리더보드에서 Gemini 3.8 Flash는 High Effort 기준 약 74%의 작업 성능을 기록했고, 작업당 평균 비용은 약 2.36달러입니다.

gemini-3-8-flash-cost-per-task

Gemini 3.8 Flash는 DeepSWE V1.1에서 높은 성능과 비교적 낮은 작업당 평균 비용을 함께 보여줍니다. 출처: DataCurve AI.

특히 눈에 띄는 부분은 비용 대비 성능입니다.

Claude Opus 5도 현재 리더보드에서 약 74% 수준이지만 작업당 평균 비용은 약 11.84달러입니다. GPT-5.6 Sol은 약 73%에 평균 비용은 약 6.46달러입니다.

물론 모든 코딩 워크플로에서 Gemini가 항상 더 저렴하다는 의미는 아닙니다. 다만 Google이 3.8 Flash를 대규모 에이전트형 코딩에 적합한 모델로 포지셔닝하는 이유를 보여줍니다.

실제 소프트웨어 개발은 함수 하나를 생성하는 것으로 끝나는 경우가 드뭅니다.

AI 코딩 에이전트는 다음과 같은 작업을 수행해야 할 수 있습니다.

  1. 기존 저장소 확인
  2. 의존성 파악
  3. 여러 파일 수정
  4. 테스트 실행
  5. 오류 원인 확인
  6. 코드 수정
  7. 최종 결과 정상 작동 여부 확인

Gemini 3.8 Flash는 바로 이런 장기 워크플로를 더 잘 처리하도록 최적화되고 있습니다.

더 강력해진 AI 에이전트

같은 개선은 AI 에이전트에도 적용됩니다.

실용적인 에이전트라면 질문 하나에 정확히 답하는 것만으로는 부족합니다.

검색, 파일 읽기, API 호출, 코드 실행, 결과 비교를 수행하고 수십 단계가 지나도 처음 목표를 유지할 수 있어야 합니다.

Google은 Gemini 3.8 Flash를 자율형 에이전트와 복잡한 엔터프라이즈 워크플로를 위한 모델로 설명합니다.

지원 도구는 다음과 같습니다.

  • Function Calling
  • 코드 실행
  • 파일 검색
  • Google Search Grounding
  • URL Context
  • Computer Use 프리뷰

즉, Gemini 3.8 Flash는 단순히 텍스트를 생성하는 AI가 아니라 실제로 작업을 완료해야 하는 워크플로에서 더 유용해지고 있습니다.

다단계 추론 강화

추론도 Gemini 3.8 Flash의 주요 개선 영역입니다.

다학제 전문가 수준의 추론을 평가하는 HLE-Verified에서 Gemini 3.8 Flash는 **54.9%**를 기록했습니다.

Google이 공개한 비교 기준에서는 여러 프런티어 모델보다 근소하게 높은 점수입니다.

  • Gemini 3.8 Flash: 54.9%
  • GPT-5.6 Sol: 54.5%
  • Claude Opus 5: 54.4%
  • Gemini 3.7 Flash: 53.6%
  • GPT-5.6 Terra: 51.1%
  • Claude Sonnet 5: 31.0%

gemini-3-8-hle-verified

Gemini 3.8 Flash는 HLE-Verified에서 54.9%를 기록해 Gemini 3.7 Flash와 여러 대형 프런티어 모델을 소폭 앞섰습니다. 출처: Google DeepMind.

53.6%에서 54.9%로 오른 수치만 보면 큰 차이처럼 보이지 않을 수 있습니다.

더 중요한 점은 Google이 낮은 지연 시간과 대규모 배포를 목표로 하는 Flash 모델에서 이런 수준의 추론 성능을 구현했다는 것입니다.

따라서 연구, 분석, 금융, 법률 업무처럼 여러 추론 단계를 연결해 결과를 내야 하는 작업에서도 3.8 Flash의 활용도가 높아지고 있습니다.

Gemini 3.8 Flash vs Gemini 3.7 Flash

간단한 질문에서는 3.7과 3.8의 차이가 크게 느껴지지 않을 수도 있습니다.

하지만 작업이 길고 복잡해질수록 업그레이드 효과가 더 분명해집니다.

기능 Gemini 3.7 Flash Gemini 3.8 Flash
일상 질문 빠름 빠름
장기 코딩 강함 향상됨
AI 에이전트 지원 더 지속적으로 작업
복잡한 추론 강함 향상됨
도구 사용 지원 에이전트 활용 강화
컨텍스트 윈도우 1M 1M
최대 출력 64K 64K
추천 용도 속도 우선 작업 복잡한 에이전트형 워크플로

Google의 Model Card는 중요한 트레이드오프도 설명합니다.

더 높은 Effort 수준에서는 성능을 최대화하기 위해 Gemini 3.8 Flash가 더 많은 토큰을 사용할 수 있습니다.

따라서 모든 간단한 작업에서 3.8이 자동으로 더 좋은 선택은 아닙니다.

단순한 요청에서 토큰 사용량을 최대한 줄이는 것이 목표라면 이전 Flash 모델도 여전히 합리적인 선택일 수 있습니다.

Gemini 3.8 Flash 가격은?

Gemini 3.8 Flash는 Gemini 3.7 Flash와 동일한 초기 API 가격으로 출시됐습니다.

  • 입력: 100만 토큰당 0.75달러
  • 출력: 100만 토큰당 3.75달러

하지만 토큰당 가격만으로 전체 비용을 판단하기는 어렵습니다.

Gemini 3.8 Flash는 어려운 작업에서 추가 추론과 도구 호출을 수행할 수 있기 때문에 복잡한 작업은 낮은 Effort 모델보다 더 많은 토큰을 사용할 수 있습니다.

따라서 더 중요한 질문은 단순히,

어떤 모델의 토큰 가격이 가장 저렴한가?

가 아니라,

전체 작업을 성공적으로 완료하는 데 실제로 얼마가 드는가?

입니다.

DeepSWE 결과가 유용한 이유도 여기에 있습니다. API 단가만 비교하는 대신 실제 작업 성능과 평균 비용을 함께 보여주기 때문입니다.

향후 가격 변경도 확인해야 합니다.

Google은 현재 초기 가격이 2026년 12월 31일에 종료된다고 밝혔습니다. 2027년 1월 1일부터는 다음 가격이 적용될 예정입니다.

  • 입력: 100만 토큰당 1.50달러
  • 출력: 100만 토큰당 7.50달러

대규모 배포를 계획하는 개발자라면 장기 비용 계산에 이 변경을 반영할 필요가 있습니다.

Gemini 3.8 Flash Cyber란?

Google은 Gemini 3.8 Flash와 함께 두 번째 모델인 Gemini 3.8 Flash Cyber도 공개했습니다.

사이버보안에 특화된 모델로 다음과 같은 영역을 대상으로 합니다.

  • 취약점 발견
  • 취약점 연구
  • 코드 보안
  • 자동 패치

일반 Flash 모델과 달리 Gemini 3.8 Flash Cyber는 현재 Google의 Fairwind Program을 통해 승인된 신뢰할 수 있는 방어 측 사용자에게 제공됩니다.

CyberGym 결과는 특히 눈에 띕니다.

C/C++ 코드에서 자율적으로 취약점을 발견하는 능력을 평가하는 CyberGym Pass@1에서 Gemini 3.8 Flash Cyber는 **86.2%**를 기록했습니다.

비교 결과는 다음과 같습니다.

  • Gemini 3.8 Flash Cyber: 86.2%
  • GPT-5.5-Cyber: 85.6%
  • Mythos 5: 83.8%
  • GPT-5.6 Sol: 83.6%
  • Gemini 3.5 Flash Cyber: 77.5%

gemini-3-8-flash-cyber

Gemini 3.8 Flash Cyber는 자율 취약점 발견을 평가하는 CyberGym Pass@1에서 86.2%를 기록했습니다. 출처: Google DeepMind.

Gemini 3.5 Flash Cyber의 77.5%에서 3.8 Flash Cyber의 86.2%로 오른 변화는 상당히 큽니다.

Google은 또한 20개 프로그래밍 언어를 포함하는 복잡한 코드베이스에서 내부 테스트를 진행했고, 취약점 발견 성공률이 70%를 넘었다고 밝혔습니다.

Cyber 버전은 일반 Gemini 3.8 Flash에 보안 설정을 추가한 형태가 아닙니다.

더 폭넓은 사이버보안 기능과 더 엄격한 접근 제어를 갖춘 별도의 전문 모델입니다.

일반 사용자 입장에서 더 중요한 점은 사이버보안 훈련이 Gemini 3.8 세대 전체의 코딩 및 추론 능력 개선에도 기여하고 있다는 것입니다.

Google은 두 모델이 동일한 기반 지능을 공유한다고 설명합니다.

Gemini 3.8 Flash는 어디서 사용할 수 있나?

Gemini 3.8 Flash는 이미 일반 제공되고 있습니다.

개발자는 다음 서비스를 통해 사용할 수 있습니다.

  • Gemini API
  • Google AI Studio
  • Google Antigravity
  • Android Studio

기업 사용자는 Gemini Enterprise를 통해 접근할 수 있으며, Google AI Pro 및 Ultra 구독자는 Gemini 앱과 Google Search의 AI Mode 등에서도 3.8 Flash를 사용할 수 있습니다.

API 사용자의 모델 ID는 다음과 같습니다.

gemini-3.8-flash

직접 사용해 보고 싶다면 **iWeaver에서 Gemini 3.8 Flash를 무료로 체험**해 보세요. 문서, 리서치 자료, 일상적인 AI 작업에서 실제 성능을 확인할 수 있습니다.

Gemini 3.8 Flash는 누구에게 적합할까?

Gemini 3.8 Flash는 다음과 같은 작업을 하는 사용자에게 특히 유용합니다.

  • 대규모 저장소 코딩
  • 자율형 코딩 에이전트
  • 다단계 리서치
  • 긴 문서 처리
  • 복잡한 분석
  • 여러 도구를 사용하는 AI 워크플로
  • 멀티모달 입력
  • 엔터프라이즈 자동화

AI를 짧은 문장 수정, 번역, 간단한 Q&A에 주로 사용한다면 Gemini 3.7 Flash에서 3.8로 바뀐 차이가 크게 느껴지지 않을 수 있습니다.

하지만 긴 작업에서는 3.8 Flash가 훨씬 더 흥미로운 선택이 됩니다.

이번 변화의 핵심은 첫 답변의 품질만 좋아진 것이 아닙니다.

어려운 작업을 끝까지 이어가며 실제로 완료하는 능력이 강화되고 있습니다.

리서치와 지식 업무에서는 어떻게 활용할 수 있을까?

강력한 모델 하나만으로 좋은 AI 워크플로가 완성되는 것은 아닙니다.

업무가 PDF, 연구 논문, 보고서, 웹사이트, 영상, 대량의 참고자료에서 시작된다면 iWeaver 같은 도구를 활용해 깊이 있는 분석 전에 정보를 먼저 정리할 수 있습니다.

같은 자료를 여러 채팅에 반복해서 업로드하는 대신 요약, 구조화된 노트, 마인드맵, 재사용 가능한 지식으로 바꾼 뒤 그 기반에서 작업을 이어갈 수 있습니다.

자유로운 브레인스토밍, 스토리텔링, 롤플레이 또는 불필요한 중단이 적은 창작형 AI 대화를 원한다면 XPT는 보다 유연하고 개방적인 대화에 초점을 둔 다른 선택지를 제공합니다.

모델의 성능이 높아질수록 무엇이든 할 수 있는 하나의 AI를 찾는 것만이 중요한 문제는 아닙니다.

작업에 맞는 모델과 워크플로를 선택하는 것이 점점 더 중요해지고 있습니다.

Gemini 3.8 Flash, 사용할 가치가 있을까?

코딩과 AI 에이전트 용도라면 그렇습니다. Gemini 3.8 Flash는 지금까지 나온 Google Flash 업데이트 중 가장 주목할 만한 버전 중 하나입니다.

세 가지 벤치마크는 비교적 일관된 방향을 보여줍니다.

  • DeepSWE는 경쟁력 있는 작업 비용으로 장기 소프트웨어 엔지니어링 성능이 개선됐음을 보여줍니다.
  • HLE-Verified는 Flash급 모델이 전문가 추론에서 더 큰 프런티어 모델에 가까워지고 있음을 보여줍니다.
  • Gemini 3.8 Flash Cyber는 전문 코딩 및 보안 작업에서 이번 세대가 얼마나 발전했는지 보여줍니다.

물론 벤치마크가 실제 사용 경험과 완전히 같지는 않습니다. Gemini 3.8 Flash 역시 환각, 간헐적인 속도 저하, 높은 추론 설정에서 더 많은 토큰을 사용할 수 있다는 한계가 있습니다.

하지만 방향은 분명합니다.

Flash는 더 이상 Google의 빠르고 가벼운 선택지에만 머물지 않습니다.

Gemini 3.8 Flash는 이제 대규모의 실제 다단계 업무를 처리하는 모델로 점점 확장되고 있습니다.