Qwen3.8 플래시: 더 빠르고 더 저렴하게

qwen3-8-flash-next

Alibaba의 Qwen 팀이 오픈 웨이트를 갖춘 Qwen3.8-Flash-Next를 공개했습니다.

이번 릴리스는 속도나 가격 이상의 의미가 있습니다.

Qwen은 Qwen3.8-Flash-Next가 Qwen4를 위해 계획된 아키텍처의 초기 미리보기이기도 하다고 밝혔습니다. 어텐션, 잔차 연결, 임베딩, 모델 최적화에 변화를 도입했으며, 목표는 하나로 명확합니다: 더 적은 연산으로 더 많은 작업을 해내는 것.

대부분의 사용자에게는 모든 기술적 디테일을 이해할 필요가 없습니다.

하지만 중요한 변화는 더 쉽게 설명할 수 있습니다:

  • 토큰당 약 6B 파라미터가 활성화
  • 컨텍스트를 약 100만 토큰까지 확장 가능
  • 코딩 및 에이전트 벤치마크 성능 강화
  • 멀티모달 및 컴퓨터 사용 능력 개선
  • QSA가 장문맥 처리 비용을 절감
  • API 가격은 대규모 워크로드에 맞게 설계

Qwen3.8 플래시는 단순히 더 빠른 또 다른 모델이 아닙니다.

점점 더 장시간 작업, AI 에이전트, 그리고 많은 정보를 처리해야 하는 워크플로를 위해 설계된 모습입니다.

Qwen3.8 플래시란?

Qwen3.8-Flash-Next는 멀티모달 Mixture-of-Experts (MoE) 모델입니다.

메인 모델의 파라미터는 125B이며, 여기에 N-그램 임베딩을 위한 51B 파라미터가 추가됩니다.

하지만 모든 토큰마다 모델 전체를 전부 활성화하진 않습니다.

토큰당 활성화되는 파라미터는 약 6B 수준입니다.

기본 아이디어는 간단합니다:

모델은 크지만, 각 단계에서 필요한 부분만 사용한다.

이것이 바로 MoE 아키텍처의 주요 장점 중 하나입니다.

Qwen에 따르면 Qwen3.8-Flash-Next는 훈련 비용이 Qwen3.7-Plus의 약 1/9에 불과하면서도, 코딩과 오피스 작업에서 더 강한 결과를 제공한다고 합니다.

사용자 관점에서는 AI 개발에서 더 큰 변화를 시사합니다.

모델이 더 유능해지려면 항상 더 비싸질 필요는 없습니다.

연산을 더 똑똑하게 쓰는 일이, 모델 크기만큼이나 중요할 수 있습니다.

qwen-architecture
## 컨텍스트 100만 토큰까지

Qwen3.8-Flash-Next는 네이티브로 262,144 토큰을 지원하며, YaRN을 통해 약 100만 토큰까지 확장할 수 있습니다.

그래서 다음과 같은 작업에 유용합니다:

  • 긴 PDF와 리포트
  • 대규모 코드베이스
  • 여러 출처에 걸친 연구
  • 장시간 실행되는 AI 에이전트
  • 확장된 대화
  • 문서 간 분석

하지만 긴 컨텍스트는 보통 비용이 따릅니다.

모델이 처리해야 할 정보가 많아질수록, 어텐션의 비용도 더 비싸질 수 있습니다.

Qwen은 이를 **Qwen Sparse Attention (QSA)**로 해결합니다.

컨텍스트 전부에 동일한 양의 어텐션을 주는 대신, QSA는 먼저 가장 관련성이 높은 영역을 식별하고 그곳에 더 많은 연산을 집중합니다.

쉽게 비유하면:

500페이지짜리 책의 모든 페이지를 다시 읽는 대신, 모델이 먼저 정답이 들어 있을 가능성이 높은 챕터를 찾는 것입니다.

qwen-arch
Qwen은 이미 이 시스템에 대한 성능 테스트를 공개했습니다.

1M 토큰 컨텍스트 길이에서 QSA Attention Kernel은 다음을 제공했습니다:

  • 최대 7.6× 더 빠른 Prefill
  • 최대 4.9× 더 빠른 Decode

또한 90% Prefix Cache 히트율을 적용한 서빙 테스트에서, Qwen3.8-Flash-Next는 1M 토큰에서 **Qwen3.7-Plus의 Prefill 처리량을 8.6×**까지 끌어올렸습니다.

따라서 1M 컨텍스트 윈도우는 단지 더 큰 숫자를 지원하는 것에 그치지 않습니다.

Qwen은 장문맥 AI를 훨씬 더 효율적으로 만들려고도 하고 있습니다.

Qwen3.8 플래시는 어떻게 성능을 내나요?

Qwen은 코딩, 에이전트, 추론, 프로페셔널 작업을 아우르는 다양한 벤치마크 결과를 공개했습니다.

가장 주목할 만한 결과 중 일부는 다음과 같습니다:

벤치마크 Qwen3.8-Flash-Next
DeepSWE 1.1 58.7
SWE-bench Pro 62.5
SWE-bench Multilingual 81.0
CoWorkBench 73.9
JobBench 55.7
Toolathlon Verified 73.5
GPQA Diamond 91.7
LiveCodeBench v6 91.9

여기서 중요한 한 가지가 눈에 띕니다:

Qwen3.8 플래시는 코딩에만 집중한 모델이 아닙니다.

오피스 작업, 에이전트 작업, 툴 사용, 프로페셔널 워크플로에서도 강한 성능을 보여줍니다.

예를 들어, 장기 지평의 오피스 및 생산성 작업을 측정하는 CoWorkBench에서 Qwen은 다음과 같이 보고합니다:

모델 CoWorkBench
Qwen3.8-Flash-Next 73.9
Qwen3.8-27B 70.7
Claude Opus 4.6 Max 68.2
Qwen3.7-Plus 65.1
DeepSeek-V4-Flash-0731 45.1

이 결과는 Qwen이 공개한 벤치마크 표에서 가져온 것입니다. 모든 모델이 모든 면에서 더 낫다고 주장하기보다, 특정 테스트에서의 성능을 비교하는 데 유용합니다.

멀티모달 성능도 함께 향상되고 있습니다

Qwen3.8 플래시는 멀티모달 모델이기도 합니다.

공식 결과에는 다음이 포함됩니다:

벤치마크 Qwen3.8-Flash-Next
ClawEval-MM Pass@3 64.4
RecreationBench 49.9
AndroidWorld 84.5
OSWorld 2.0 Partial 52.3
Vision2Web 64.0
ERQA 72.3

특히 AndroidWorld에서 84.5점은 매우 흥미롭습니다.

AndroidWorld는 모델이 안드로이드 환경과 얼마나 잘 상호작용하며 작업을 완료하는지를 측정합니다.

이는 Qwen이 어디로 향하고 있는지 보여줍니다.

AI 모델은 단순히:

질문에 답하는 것

에서:

작업을 이해하고, 도구를 사용하며, 실제 일을 완수하는 것

으로 이동하고 있습니다.

이 흐름은 AI 에이전트 레이스에서 중요한 경쟁 축이 되고 있습니다.

레딧과 X 사용자는 무엇을 주목하나요?

공식 벤치마크는 한쪽 이야기를 보여줍니다.

레딧과 X의 논의는 대체로 일상적인 사용에 더 초점을 맞춥니다.

최근 며칠 사이 반복해서 등장한 주제들이 몇 가지 있습니다:

125B 모델이 실제로 로컬에서 돌아갈 수 있나요?

활성화 6B가 정확히 무슨 의미인가요?

N-그램 임베딩 테이블을 시스템 RAM으로 오프로딩할 수 있나요?

긴 컨텍스트에서 얼마나 빠른가요?

Reddit의 LocalLLaMA 커뮤니티에서는 초기 논의의 상당 부분이 양자화, 메모리 요구사항, 그리고 N-그램 임베딩이 이 아키텍처를 로컬 하드웨어에서 더 쉽게 돌릴 수 있게 만드는지 여부에 집중되어 왔습니다.

X에서도 초기 테스트가 올라오고 있습니다.

110GB의 시스템 RAM을 사용한 RTX 4090 테스트에서는, 대략 250K 토큰의 컨텍스트 윈도우에서 초당 약 21 토큰의 디코드 속도가 보고되었습니다.

결과는 양자화 방식, GPU, RAM, 오프로딩 구성, 그리고 추론 소프트웨어에 따라 자연스럽게 달라질 수 있습니다.

하지만 흥미로운 변화는 이미 분명합니다.

100B+ 모델이 더 이상 자동으로:

데이터 센터 전용

을 의미하지는 않게 됐습니다.

로컬 AI 사용자들은 이미 고급 소비자 하드웨어에서 이런 모델들을 테스트하고 있습니다.

Qwen3.8 플래시는 코딩 모델 그 이상입니다

SWE-bench를 보고 Qwen3.8 플래시를 또 다른 코딩 모델로 보는 건 쉽습니다.

하지만 공식 결과는 더 넓은 무언가를 시사합니다.

Qwen은 다음에도 막대한 투자를 하고 있습니다:

  • 오래 실행되는 오피스 작업
  • 툴 사용
  • 멀티모달 이해
  • 컴퓨터 사용
  • 모바일 에이전트
  • 장문맥 분석

이는 사람들이 AI를 사용하는 방식의 더 큰 변화와 맞닿아 있습니다.

예전의 요청은 종종:

"이 질문에 답해줘."

였지만,

요즘의 요청은 점점:

"이 작업을 끝내줘."

로 바뀌고 있습니다.

두 번째는 훨씬 더 어렵습니다.

AI 에이전트는 파일을 읽고, 웹페이지를 이해하고, 이미지를 확인한 뒤 도구를 사용하고, 그 결과를 바탕으로 계속 진행해야 할 수도 있습니다.

그래서 효율성과 긴 컨텍스트가 이렇게 중요합니다.

문서와 연구를 위한 선택: iWeaver

벤치마크는 유용하지만, 대부분의 사용자는 점수 비교만을 위해 AI 도구를 선택하지 않습니다.

더 중요한 질문은:

이 모델의 역량을 실제 워크플로에 어떻게 맞출 수 있을까요?

정기적으로 다음 작업을 한다면:

  • PDF
  • Word 문서
  • 웹페이지
  • 이미지
  • 오디오
  • 비디오
  • 연구 자료
  • 여러 파일

iWeaver

를 사용해볼 수 있습니다.

iWeaver는 지식 업무와 복잡한 콘텐츠를 위해 만들어졌습니다.

여러 유형의 정보를 하나의 AI 작업 공간으로 모아, 다음과 같은 워크플로를 흐름대로 진행할 수 있습니다:

요약 → 이해 → 분석 → 정리 → 생성

긴 리포트를 업로드하고 핵심 포인트를 추출할 수도 있습니다.

그 다음 여러 웹페이지를 추가해 서로 다른 출처가 무엇을 말하는지 비교해볼 수 있습니다.

또는 회의 오디오, PDF, 이미지 등을 결합해 구조화된 노트로 바꿀 수도 있습니다.

이런 작업들이 바로 긴 컨텍스트와 멀티모달 AI가 특히 유용해지는 이유입니다.

사용자에게 정말 필요한 건 “1 million tokens” 그 자체가 아닙니다.

필요한 것은:

복잡한 정보를 유용한 무언가로 바꿔주는 더 빠른 방법입니다.

열린 주제의 생성: XPT를 사용해보세요

모든 AI 워크플로가 이미 존재하는 문서에서 시작되진 않습니다.

때로는 아이디어에서 시작하죠.

예를 들면:

  • 브레인스토밍
  • 스토리 작성
  • 롤플레이
  • 캐릭터 생성
  • 이미지 생성
  • 월드빌딩
  • 열린 대화

이런 작업에는 XPT for more on open-ended AI creation and ongoing conversations

를 사용해볼 수 있습니다.

워크플로는 더 가까이:

아이디어 → 채팅 → 스토리 → 캐릭터 → 이미지 → 계속 탐색

로 이어집니다.

iWeaver가 주로:

기존 정보를 이해하고 정리하는 것

에 더 가깝다면,

XPT는:

새 아이디어를 더 발전시키는 것

에 더 가깝습니다.

Qwen, Claude, GPT, Gemini, DeepSeek, 그리고 다른 모델 패밀리들이 계속 발전해감에 따라, 기반 모델들 사이의 차이도 계속 변할 것입니다.

일상 사용자에게는 또 하나의 질문이 그만큼 중요해지고 있습니다:

AI 제품이 실제로 제가 작업을 끝내는 데 도움이 될까요?

Qwen3.8 플래시가 중요한 이유

Qwen3.8 플래시에서 가장 흥미로운 부분은 단 하나의 벤치마크 점수가 아닙니다.

전체 릴리스의 방향성이 더 중요합니다.

더 긴 컨텍스트.

더 강력한 에이전트.

더 나은 멀티모달 역량.

더 낮은 연산 비용.

그리고 더 효율적인 아키텍처.

Qwen의 공개 결과는 이미 코딩, 오피스 작업, 툴 사용, 멀티모달 작업, 장문맥 효율성 전반에서 명확한 개선을 보여줍니다.

또한 Qwen3.8-Flash-Next는 Qwen4를 위해 계획된 아키텍처의 초기 미리보기이기도 합니다.

그래서 이것은 일반적인 플래시 시리즈 업데이트 그 이상입니다.

Qwen이 다음으로 어디로 향하는지 명확히 볼 수 있게 해줍니다:

단순히 더 큰 AI가 아니라, 더 효율적으로 연산을 활용하는 더 유능한 AI.