Alibaba의 Qwen 팀이 오픈 웨이트를 갖춘 Qwen3.8-Flash-Next를 공개했습니다.
이번 릴리스는 속도나 가격 이상의 의미가 있습니다.
Qwen은 Qwen3.8-Flash-Next가 Qwen4를 위해 계획된 아키텍처의 초기 미리보기이기도 하다고 밝혔습니다. 어텐션, 잔차 연결, 임베딩, 모델 최적화에 변화를 도입했으며, 목표는 하나로 명확합니다: 더 적은 연산으로 더 많은 작업을 해내는 것.
대부분의 사용자에게는 모든 기술적 디테일을 이해할 필요가 없습니다.
하지만 중요한 변화는 더 쉽게 설명할 수 있습니다:
- 토큰당 약 6B 파라미터가 활성화
- 컨텍스트를 약 100만 토큰까지 확장 가능
- 코딩 및 에이전트 벤치마크 성능 강화
- 멀티모달 및 컴퓨터 사용 능력 개선
- QSA가 장문맥 처리 비용을 절감
- API 가격은 대규모 워크로드에 맞게 설계
Qwen3.8 플래시는 단순히 더 빠른 또 다른 모델이 아닙니다.
점점 더 장시간 작업, AI 에이전트, 그리고 많은 정보를 처리해야 하는 워크플로를 위해 설계된 모습입니다.
Qwen3.8 플래시란?
Qwen3.8-Flash-Next는 멀티모달 Mixture-of-Experts (MoE) 모델입니다.
메인 모델의 파라미터는 125B이며, 여기에 N-그램 임베딩을 위한 51B 파라미터가 추가됩니다.
하지만 모든 토큰마다 모델 전체를 전부 활성화하진 않습니다.
토큰당 활성화되는 파라미터는 약 6B 수준입니다.
기본 아이디어는 간단합니다:
모델은 크지만, 각 단계에서 필요한 부분만 사용한다.
이것이 바로 MoE 아키텍처의 주요 장점 중 하나입니다.
Qwen에 따르면 Qwen3.8-Flash-Next는 훈련 비용이 Qwen3.7-Plus의 약 1/9에 불과하면서도, 코딩과 오피스 작업에서 더 강한 결과를 제공한다고 합니다.
사용자 관점에서는 AI 개발에서 더 큰 변화를 시사합니다.
모델이 더 유능해지려면 항상 더 비싸질 필요는 없습니다.
연산을 더 똑똑하게 쓰는 일이, 모델 크기만큼이나 중요할 수 있습니다.

Qwen3.8-Flash-Next는 네이티브로 262,144 토큰을 지원하며, YaRN을 통해 약 100만 토큰까지 확장할 수 있습니다.
그래서 다음과 같은 작업에 유용합니다:
- 긴 PDF와 리포트
- 대규모 코드베이스
- 여러 출처에 걸친 연구
- 장시간 실행되는 AI 에이전트
- 확장된 대화
- 문서 간 분석
하지만 긴 컨텍스트는 보통 비용이 따릅니다.
모델이 처리해야 할 정보가 많아질수록, 어텐션의 비용도 더 비싸질 수 있습니다.
Qwen은 이를 **Qwen Sparse Attention (QSA)**로 해결합니다.
컨텍스트 전부에 동일한 양의 어텐션을 주는 대신, QSA는 먼저 가장 관련성이 높은 영역을 식별하고 그곳에 더 많은 연산을 집중합니다.
쉽게 비유하면:
500페이지짜리 책의 모든 페이지를 다시 읽는 대신, 모델이 먼저 정답이 들어 있을 가능성이 높은 챕터를 찾는 것입니다.

1M 토큰 컨텍스트 길이에서 QSA Attention Kernel은 다음을 제공했습니다:
- 최대 7.6× 더 빠른 Prefill
- 최대 4.9× 더 빠른 Decode
또한 90% Prefix Cache 히트율을 적용한 서빙 테스트에서, Qwen3.8-Flash-Next는 1M 토큰에서 **Qwen3.7-Plus의 Prefill 처리량을 8.6×**까지 끌어올렸습니다.
따라서 1M 컨텍스트 윈도우는 단지 더 큰 숫자를 지원하는 것에 그치지 않습니다.
Qwen은 장문맥 AI를 훨씬 더 효율적으로 만들려고도 하고 있습니다.
Qwen3.8 플래시는 어떻게 성능을 내나요?
Qwen은 코딩, 에이전트, 추론, 프로페셔널 작업을 아우르는 다양한 벤치마크 결과를 공개했습니다.
가장 주목할 만한 결과 중 일부는 다음과 같습니다:
| 벤치마크 | Qwen3.8-Flash-Next |
|---|---|
| DeepSWE 1.1 | 58.7 |
| SWE-bench Pro | 62.5 |
| SWE-bench Multilingual | 81.0 |
| CoWorkBench | 73.9 |
| JobBench | 55.7 |
| Toolathlon Verified | 73.5 |
| GPQA Diamond | 91.7 |
| LiveCodeBench v6 | 91.9 |
여기서 중요한 한 가지가 눈에 띕니다:
Qwen3.8 플래시는 코딩에만 집중한 모델이 아닙니다.
오피스 작업, 에이전트 작업, 툴 사용, 프로페셔널 워크플로에서도 강한 성능을 보여줍니다.
예를 들어, 장기 지평의 오피스 및 생산성 작업을 측정하는 CoWorkBench에서 Qwen은 다음과 같이 보고합니다:
| 모델 | CoWorkBench |
|---|---|
| Qwen3.8-Flash-Next | 73.9 |
| Qwen3.8-27B | 70.7 |
| Claude Opus 4.6 Max | 68.2 |
| Qwen3.7-Plus | 65.1 |
| DeepSeek-V4-Flash-0731 | 45.1 |
이 결과는 Qwen이 공개한 벤치마크 표에서 가져온 것입니다. 모든 모델이 모든 면에서 더 낫다고 주장하기보다, 특정 테스트에서의 성능을 비교하는 데 유용합니다.
멀티모달 성능도 함께 향상되고 있습니다
Qwen3.8 플래시는 멀티모달 모델이기도 합니다.
공식 결과에는 다음이 포함됩니다:
| 벤치마크 | Qwen3.8-Flash-Next |
|---|---|
| ClawEval-MM Pass@3 | 64.4 |
| RecreationBench | 49.9 |
| AndroidWorld | 84.5 |
| OSWorld 2.0 Partial | 52.3 |
| Vision2Web | 64.0 |
| ERQA | 72.3 |
특히 AndroidWorld에서 84.5점은 매우 흥미롭습니다.
AndroidWorld는 모델이 안드로이드 환경과 얼마나 잘 상호작용하며 작업을 완료하는지를 측정합니다.
이는 Qwen이 어디로 향하고 있는지 보여줍니다.
AI 모델은 단순히:
질문에 답하는 것
에서:
작업을 이해하고, 도구를 사용하며, 실제 일을 완수하는 것
으로 이동하고 있습니다.
이 흐름은 AI 에이전트 레이스에서 중요한 경쟁 축이 되고 있습니다.
레딧과 X 사용자는 무엇을 주목하나요?
공식 벤치마크는 한쪽 이야기를 보여줍니다.
레딧과 X의 논의는 대체로 일상적인 사용에 더 초점을 맞춥니다.
최근 며칠 사이 반복해서 등장한 주제들이 몇 가지 있습니다:
125B 모델이 실제로 로컬에서 돌아갈 수 있나요?
활성화 6B가 정확히 무슨 의미인가요?
N-그램 임베딩 테이블을 시스템 RAM으로 오프로딩할 수 있나요?
긴 컨텍스트에서 얼마나 빠른가요?
Reddit의 LocalLLaMA 커뮤니티에서는 초기 논의의 상당 부분이 양자화, 메모리 요구사항, 그리고 N-그램 임베딩이 이 아키텍처를 로컬 하드웨어에서 더 쉽게 돌릴 수 있게 만드는지 여부에 집중되어 왔습니다.
X에서도 초기 테스트가 올라오고 있습니다.
110GB의 시스템 RAM을 사용한 RTX 4090 테스트에서는, 대략 250K 토큰의 컨텍스트 윈도우에서 초당 약 21 토큰의 디코드 속도가 보고되었습니다.
결과는 양자화 방식, GPU, RAM, 오프로딩 구성, 그리고 추론 소프트웨어에 따라 자연스럽게 달라질 수 있습니다.
하지만 흥미로운 변화는 이미 분명합니다.
100B+ 모델이 더 이상 자동으로:
데이터 센터 전용
을 의미하지는 않게 됐습니다.
로컬 AI 사용자들은 이미 고급 소비자 하드웨어에서 이런 모델들을 테스트하고 있습니다.
Qwen3.8 플래시는 코딩 모델 그 이상입니다
SWE-bench를 보고 Qwen3.8 플래시를 또 다른 코딩 모델로 보는 건 쉽습니다.
하지만 공식 결과는 더 넓은 무언가를 시사합니다.
Qwen은 다음에도 막대한 투자를 하고 있습니다:
- 오래 실행되는 오피스 작업
- 툴 사용
- 멀티모달 이해
- 컴퓨터 사용
- 모바일 에이전트
- 장문맥 분석
이는 사람들이 AI를 사용하는 방식의 더 큰 변화와 맞닿아 있습니다.
예전의 요청은 종종:
"이 질문에 답해줘."
였지만,
요즘의 요청은 점점:
"이 작업을 끝내줘."
로 바뀌고 있습니다.
두 번째는 훨씬 더 어렵습니다.
AI 에이전트는 파일을 읽고, 웹페이지를 이해하고, 이미지를 확인한 뒤 도구를 사용하고, 그 결과를 바탕으로 계속 진행해야 할 수도 있습니다.
그래서 효율성과 긴 컨텍스트가 이렇게 중요합니다.
문서와 연구를 위한 선택: iWeaver
벤치마크는 유용하지만, 대부분의 사용자는 점수 비교만을 위해 AI 도구를 선택하지 않습니다.
더 중요한 질문은:
이 모델의 역량을 실제 워크플로에 어떻게 맞출 수 있을까요?
정기적으로 다음 작업을 한다면:
- Word 문서
- 웹페이지
- 이미지
- 오디오
- 비디오
- 연구 자료
- 여러 파일
를 사용해볼 수 있습니다.
iWeaver는 지식 업무와 복잡한 콘텐츠를 위해 만들어졌습니다.
여러 유형의 정보를 하나의 AI 작업 공간으로 모아, 다음과 같은 워크플로를 흐름대로 진행할 수 있습니다:
요약 → 이해 → 분석 → 정리 → 생성
긴 리포트를 업로드하고 핵심 포인트를 추출할 수도 있습니다.
그 다음 여러 웹페이지를 추가해 서로 다른 출처가 무엇을 말하는지 비교해볼 수 있습니다.
또는 회의 오디오, PDF, 이미지 등을 결합해 구조화된 노트로 바꿀 수도 있습니다.
이런 작업들이 바로 긴 컨텍스트와 멀티모달 AI가 특히 유용해지는 이유입니다.
사용자에게 정말 필요한 건 “1 million tokens” 그 자체가 아닙니다.
필요한 것은:
복잡한 정보를 유용한 무언가로 바꿔주는 더 빠른 방법입니다.
열린 주제의 생성: XPT를 사용해보세요
모든 AI 워크플로가 이미 존재하는 문서에서 시작되진 않습니다.
때로는 아이디어에서 시작하죠.
예를 들면:
- 브레인스토밍
- 스토리 작성
- 롤플레이
- 캐릭터 생성
- 이미지 생성
- 월드빌딩
- 열린 대화
이런 작업에는 XPT for more on open-ended AI creation and ongoing conversations
를 사용해볼 수 있습니다.
워크플로는 더 가까이:
아이디어 → 채팅 → 스토리 → 캐릭터 → 이미지 → 계속 탐색
로 이어집니다.
iWeaver가 주로:
기존 정보를 이해하고 정리하는 것
에 더 가깝다면,
XPT는:
새 아이디어를 더 발전시키는 것
에 더 가깝습니다.
Qwen, Claude, GPT, Gemini, DeepSeek, 그리고 다른 모델 패밀리들이 계속 발전해감에 따라, 기반 모델들 사이의 차이도 계속 변할 것입니다.
일상 사용자에게는 또 하나의 질문이 그만큼 중요해지고 있습니다:
AI 제품이 실제로 제가 작업을 끝내는 데 도움이 될까요?
Qwen3.8 플래시가 중요한 이유
Qwen3.8 플래시에서 가장 흥미로운 부분은 단 하나의 벤치마크 점수가 아닙니다.
전체 릴리스의 방향성이 더 중요합니다.
더 긴 컨텍스트.
더 강력한 에이전트.
더 나은 멀티모달 역량.
더 낮은 연산 비용.
그리고 더 효율적인 아키텍처.
Qwen의 공개 결과는 이미 코딩, 오피스 작업, 툴 사용, 멀티모달 작업, 장문맥 효율성 전반에서 명확한 개선을 보여줍니다.
또한 Qwen3.8-Flash-Next는 Qwen4를 위해 계획된 아키텍처의 초기 미리보기이기도 합니다.
그래서 이것은 일반적인 플래시 시리즈 업데이트 그 이상입니다.
Qwen이 다음으로 어디로 향하는지 명확히 볼 수 있게 해줍니다:
단순히 더 큰 AI가 아니라, 더 효율적으로 연산을 활용하는 더 유능한 AI.
