Qwen3.8-Max는 2026년 가장 뜨거운 화제를 모은 AI 모델 출시 중 하나로 빠르게 자리잡았습니다.
Alibaba의 Qwen 팀은 이를 회사의 “현재까지 가장 뛰어난 모델”로 공식 소개했습니다. 총 2.4조 개 수준의 파라미터를 바탕으로, Qwen3.8-Max는 자율 코딩, 전문 업무, 장기 지평 에이전트, 멀티모달 지능을 위한 플래그십 모델로 포지셔닝되어 있습니다.
공식 발표에는 프리뷰 기간에 누락됐던 여러 세부 정보도 포함되어 있습니다. Qwen은 이제 API 요금, 언어 및 비전 벤치마크 결과, 장시간 실행되는 에이전트 작업 예시, 오픈 모델 가중치를 공개하기 위한 일정까지 공개했습니다.
이 변화는 단순한 또 다른 챗봇 업데이트를 넘어섭니다. Qwen3.8-Max는 고립된 답변을 생성하는 AI 모델에서, 스스로 계획하고 도구를 활용하며 작업을 점검하고 복잡한 프로젝트를 완수하는 AI 에이전트로의 더 넓은 전환을 반영합니다.
Qwen3.8-Max란?
Qwen3.8-Max는 Qwen 계열의 Alibaba 최신 플래그십 모델입니다. 고급 추론, 소프트웨어 개발, 멀티모달 분석, 전문 워크플로, 자율 에이전트 작업을 위해 설계되었습니다.
이 모델은 처음에 다음 식별자로 제공되었습니다:
qwen3.8-max-preview
프리뷰는 개발자에게 조기 액세스를 제공했지만, 특히 표준 API 요금, 오픈 가중치 제공 여부, 종합적인 벤치마크 성능에 대한 여러 질문에는 답을 남기지 않았습니다.
이 세부 내용은 8월 3일에 게시된 공식 Qwen3.8-Max 발표에서 더 명확해졌습니다.
Qwen은 이 모델을 “코딩과 협업”을 위한 새로운 벤치마크로 설명하며, 핵심 4가지 영역을 강조합니다:
- 자율 소프트웨어 개발
- 전문 품질의 결과물
- 장기 지평 계획 및 실행
- 네이티브 멀티모달 에이전트 지능
따라서 Qwen3.8-Max는 단순히 더 큰 대화형 모델로만 포지셔닝된 것이 아닙니다. 코드, 문서, 시각적 인터페이스, 외부 도구, 확장된 작업 이력과 함께 작동하는 AI 시스템의 배후 추론 엔진으로 동작하도록 의도되었습니다.
Qwen3.8-Max의 핵심 기능
약 2.4조 파라미터
Qwen3.8-Max의 대표 스펙은 보고된 2.4조 파라미터 스케일입니다.
이로써 Qwen 팀이 공개적으로 발표한 가장 큰 모델 중 하나가 됩니다. 다만 전체 파라미터 수를, 모든 응답에 실제로 사용되는 파라미터 수와 혼동해서는 안 됩니다.
모델이 혼합 전문가(mixture-of-experts) 아키텍처를 사용한다면, 개별 요청마다 전체 네트워크 중 일부만 활성화될 수 있습니다. 실제 성능은 또한 다음에 좌우됩니다:
- 활성 파라미터의 수
- 학습 데이터 품질
- 강화학습(reinforcement learning) 방법
- 도구 사용 정확도
- 컨텍스트 관리
- 추론 인프라
- 응답 지연 시간
- 반복 작업에서의 신뢰성
파라미터 수는 모델의 규모를 보여주지만, Qwen3.8-Max가 모든 상황에서 경쟁 모델들을 전부 능가할 것임을 증명하진 않습니다.
자율 코딩
Qwen에 따르면 Qwen3.8-Max는 자기 진화형 소프트웨어 개발을 10일 이상 지속할 수 있습니다.
회사는 모델이 빈 폴더에서 제한된 인간 개입만으로도 운영 준비가 된 프로젝트로 이동하는 예시를 제시합니다. 공개 프로젝트 트레이스는 공식 발표에 연결된 GitHub 저장소를 통해 확인할 수 있습니다.
이는 짧은 함수를 생성하거나 단일 버그를 수정하는 작업보다 훨씬 까다롭습니다. 장시간 자율 코딩에는 모델이 다음을 수행해야 할 수 있습니다:
- 제품 목표를 이해한다.
- 적절한 아키텍처를 설계한다.
- 여러 파일을 생성하고 편집한다.
- 의존성을 설치하거나 구성한다.
- 테스트를 실행하고 오류를 해석한다.
- 완성된 애플리케이션을 검토한다.
- 구현 문제를 수정한다.
- 원래 목표를 잃지 않으면서 계속 반복한다.
이 시연은 독립 벤치마크라기보다 공급업체가 제공한 예시입니다. 그럼에도 Qwen3.8-Max가 지원하도록 설계된 확장 개발 워크플로의 유형을 보여줍니다.
장기 지평 에이전트 작업
Qwen은 또한 유난히 긴 두 가지 에이전트 시나리오를 강조합니다:
- 칩 설계 최적화 500회 이상의 턴
- 365일 시뮬레이션 전자상거래 전략
이 예시들은 폐쇄 루프(closed-loop) 적응형 학습을 보여주기 위한 목적입니다. 이런 유형의 워크플로에서 에이전트는 단 한 번의 계획을 만들어내는 데 그치지 않습니다. 결과를 반복해서 관찰하고 전략을 업데이트하며, 다음에 무엇을 할지 결정합니다.
유능한 장기 지평 에이전트는 관련 없는 이력이 누적되지 않으면서도 중요한 컨텍스트를 보존해야 합니다. 또한 신뢰할 수 있는 메모리, 진행 상황 추적, 도구 권한, 검증 규칙, 복구 메커니즘이 필요합니다.
모델은 그 시스템의 한 부분일 뿐입니다. 에이전트 성능은 주변 소프트웨어와 워크플로 설계에도 달려 있습니다.
네이티브 멀티모달 지능
Qwen3.8-Max는 텍스트, 이미지, 비디오 입력을 지원합니다.
Qwen은 비전을 단일 입력 채널이라기보다 연속 피드백 루프로 설명합니다. 시각적 에이전트는 반복적으로:
- 인터페이스를 관찰한다
- 현재 상태를 파악한다
- 다음 행동을 결정한다
- 도구를 실행한다
- 결과를 점검한다
- 오류를 감지한다
- 이전 행동을 수정한다
이 기능은 특히 브라우저 자동화, 소프트웨어 테스트, 문서 처리, 인터페이스 리뷰, 그리고 시각 정보와 서면 지시를 결합하는 워크플로에 특히 중요합니다.
백만 토큰 컨텍스트
공개된 Qwen Code 통합 기록에는 Qwen3.8-Max에 대해 약 100만 토큰 규모의 컨텍스트 윈도우가 명시되어 있습니다.
이 크기의 컨텍스트는 다음을 지원할 수 있습니다:
- 대규모 소프트웨어 리포지토리
- 연구 논문 모음
- 긴 비즈니스 문서
- 확장된 에이전트 이력
- 여러 파일 및 데이터 소스
- 긴 비디오 또는 전사(transcripts)
하지만 더 많은 컨텍스트가 자동으로 더 나은 답을 보장하진 않습니다. 입력이 매우 크면 지연 시간이 늘어나고, 모델이 관련 근거에 집중하기가 더 어려워질 수 있습니다.
더 좋은 결과를 위해서는 여전히 자료를 정리하고, 관련 없는 정보를 제거하며, 완료된 단계의 내용을 요약하고, 중요한 결론을 뒷받침하는 파일이나 구절을 모델이 인용하도록 요청해야 합니다.
Qwen3.8-Max 언어 및 에이전트 벤치마크
Qwen은 Qwen3.8-Max를 Opus 4.8, Fable 5, GPT-5.6 Sol, Qwen3.7-Max와 비교하는 공식 벤치마크 차트를 공개했습니다.

선정된 Qwen3.8-Max 결과는 다음과 같습니다:
| Benchmark | Qwen3.8-Max 점수 |
|---|---|
| Terminal Bench 2.1 | 89.8 |
| FrontierSWE | 73.5 |
| PaperBench | 83.0 |
| AndroidBench | 75.1 |
| QwenSWEBench | 80.7 |
| QwenCoderBench | 58.4 |
| QwenReactBench | 1,724 |
| QwenSVGBench | 1,713 |
| CoWorkBench | 74.8 |
| WorkSpaceBench | 67.7 |
| JobBench | 53.4 |
| SkillsBench | 70.2 |
| GPQA Diamond | 92.6 |
| MMLU-Pro | 92.9 |
| LongBench v2 | 68.3 |
이 차트는 여러 카테고리에서 Qwen3.7-Max 대비 상당한 향상을 보여줍니다.
예를 들어, 보고된 Terminal Bench 2.1 점수는 Qwen3.7-Max의 74.5에서 Qwen3.8-Max의 89.8로 상승합니다. CoWorkBench 결과는 64.8에서 74.8로, WorkSpaceBench는 61.4에서 67.7로 증가했습니다.
또한 모델은 GPQA Diamond에서 92.6, MMLU-Pro에서 92.9 등 강력한 일반 추론 성과도 함께 보고했습니다.
다만 Qwen3.8-Max는 표의 모든 벤치마크에서 1위를 차지하진 않습니다. 다른 모델들이 일부 소프트웨어 엔지니어링 및 전문 에이전트 평가에서 더 높은 점수를 유지하고 있습니다. 따라서 결과는 Qwen3.8-Max를 매우 경쟁력 있는 모델로 설명하는 데는 근거가 되지만, 모든 면에서 보편적으로 우수하다고 단정하긴 어렵습니다.
이 수치들은 Qwen이 공개한 것입니다. 프로덕션 성능에 대한 결론을 내리기 전에는 독립적인 테스트가 여전히 필요합니다.
Qwen3.8-Max 멀티모달 벤치마크
Qwen은 멀티모달 추론, 시각적 에이전트, 문서 지능, 공간 이해, 비주얼 그라운딩, 비디오 작업을 다루는 별도의 벤치마크 차트도 공개했습니다.

선정된 결과는 다음과 같습니다:
| Benchmark | Qwen3.8-Max 점수 |
|---|---|
| MMMU-Pro | 82.3 |
| MathVision | 95.2 / 97.7 |
| LogicVista | 91.9 |
| SLAKE | 90.8 |
| OSWorld-Verified | 86.1 |
| AndroidWorld | 85.3 |
| Parametric CAD Bench | 91.5 |
| OmniDocBench 1.5 | 92.1 |
| RealWorldQA | 88.0 |
| MMStar | 85.9 |
| CountQA | 82.4 |
| Dense200 | 87.0 |
| 자막 포함 VideoMME | 90.4 |
| VideoMMMU | 88.7 |
| MLVU | 90.8 |
이 결과는 Qwen3.8-Max가 단순히 이미지 업로드 기능이 있는 언어 모델에 그치지 않음을 시사합니다. 시각 정보가 계획 수립과 도구 사용에 영향을 주는 작업을 위해 최적화되고 있습니다.
OSWorld-Verified 및 AndroidWorld 같은 벤치마크는 이 에이전트 워크플로의 일부를 시험합니다. 이런 과제는 모델이 인터페이스를 이해하고, 그와 어떻게 상호작용할지 판단해야 함을 요구합니다.
Qwen3.8-Max는 이러한 평가들에서 전반적으로 강한 성능을 보고하고 있지만, 모든 시각적 에이전트 벤치마크에서 1위를 차지하진 않습니다. 문서 이해나 비주얼 질의응답에서의 높은 점수도 신뢰할 수 있는 컴퓨터 제어를 자동으로 보장하진 않습니다.
Qwen3.8-Max의 실제 동작을 확인하세요
Qwen3.8-Max를 더 자세히 살펴보고 다른 주요 오픈 모델과 어떻게 비교되는지 알고 싶으신가요? 아래 영상을 통해 이 모델의 역량, 벤치마크 성능, 잠재적인 실제 적용 사례를 현실적으로 분해해 드립니다.

Qwen3.8-Max API 요금
공식 발표에는 다음 API 요금이 나열되어 있습니다:
| 사용 유형 | 공식 요금 |
|---|---|
| 입력 | 백만 토큰당 $2.00 |
| 출력 | 백만 토큰당 $6.00 |
| 암묵적 캐싱 | 백만 토큰당 $0.25 |
이전 프리뷰 기간과 비교하면 중요한 업데이트입니다. 표준 토큰당 요금이 명확하게 공개되지 않았던 때와 달라졌습니다.
암묵적 캐싱 요금은 동일한 리포지토리, 시스템 지침, 회사 문서, 대화 이력을 반복해서 접근하는 에이전트에 유용할 수 있습니다.
실제 워크플로 비용은 여전히 다음에 따라 달라집니다:
- 입력 컨텍스트 크기
- 추론 길이
- 생성된 출력
- 도구 호출 횟수
- 실패한 시도와 재시도
- 컨텍스트 캐싱 동작
- 사람에 의한 검토 요구 사항
따라서 기업은 광고된 토큰 요율만 비교하기보다는 “완료된 작업 1건당 비용”을 계산해야 합니다.
토큰 단가가 저렴한 모델이라도, 반복적인 수정이 필요하면 비용이 커질 수 있습니다. 반대로, 더 비싼 모델이라도 첫 시도에서 작업을 올바르게 완료한다면 더 나은 가치를 제공할 수 있습니다.
Qwen3.8-Max는 오픈 소스인가요?
8월 3일 발표에서 Qwen은 Qwen3.8-Max의 오픈 가중치가 그다음 주에 공개될 것이라고 밝혔습니다.
팀은 또한 오픈 가중치 Qwen3.8-27B 모델도 함께 발표했습니다.
가중치와 라이선스가 실제로 공개되기 전까지 가장 정확한 설명은 다음과 같습니다:
Qwen은 Qwen3.8-Max와 Qwen3.8-27B의 오픈 가중치가 임박해 공개될 것이라고 공식적으로 발표했습니다. 개발자는 릴리스가 제공되는 시점에 최종 리포지토리, 라이선스, 체크포인트, 배포 요구 사항을 확인해야 합니다.
총 2.4조 파라미터 규모 모델을 로컬에 배포하려면 상당한 인프라가 필요합니다. 상대적으로 작은 27B 모델은 GPU 용량이 제한적인 개인 개발자, 연구 팀, 기업에게 더 실용적일 수 있습니다.
누가 Qwen3.8-Max를 사용해야 할까요?
소프트웨어 개발 팀
Qwen3.8-Max는 다음에 유용할 수 있습니다:
- 익숙하지 않은 리포지토리 탐색
- 아키텍처 변경 계획 수립
- 여러 파일 편집
- 복잡한 실패 디버깅
- 테스트 실행
- 완전한 애플리케이션 구축
- 장기 실행 코딩 에이전트 운영
모델이 프로덕션 코드를 변경하도록 허용하기 전에, 팀은 모델이 리포지토리 지침을 따르는지, 올바른 작업 디렉터리를 사용하는지, 편집 범위를 요청한 범위로 제한하는지, 변경 내용을 검증하는지 테스트해야 합니다.
연구 및 콘텐츠 팀
모델의 긴 컨텍스트와 멀티모달 역량은 다음을 지원할 수 있습니다:
- 연구 종합
- 경쟁 분석
- 문서 검토
- 비디오 분석
- 지식 추출
- 리포트 생성
iWeaver 같은 도구는 사용자가 고급 모델에 소스를 비교하거나 구조화된 분석을 생성해 달라고 요청하기 전에 PDF, 웹 페이지, 비디오 등 자료를 수집하고 정리하는 데 도움을 줄 수 있습니다.
핵심은 추적 가능성을 유지하는 것입니다. 중요한 주장은 반드시 원래 출처와 연결되어 있어야 합니다.
엔터프라이즈 자동화 팀
기업은 Qwen3.8-Max를 다음 용도로 평가할 수 있습니다:
- 내부 지식 어시스턴트
- 고객 지원 워크플로
- 문서 처리
- 오피스 자동화
- 소프트웨어 운영
- 도구를 사용하는 비즈니스 에이전트
프로덕션 평가는 보안, 접근 제어, 데이터 보관, 감사 가능성(auditability), API 안정성, 동시성, 실패 복구, 그리고 총 작업 비용을 포함해야 합니다.
Qwen3.8-Max로 전환해야 할까요?
업무 워크플로에 복잡한 코딩, 긴 문서, 멀티모달 분석, 혹은 여러 라운드의 계획과 실행이 필요한 도구 사용이 포함되어 있다면 Qwen3.8-Max는 테스트해 볼 가치가 있습니다.
다만 벤치마크 차트에서 바로 프로덕션 배포로 이동하는 것은 성급할 수 있습니다.
더 신뢰할 수 있는 방법은 실제 워크플로에서 20~50개의 작업으로 구성된 벤치마크를 만든 뒤, 동일한 프롬프트, 소스 파일, 도구, 평가 기준으로 Qwen3.8-Max를 Qwen3.7-Max 및 최소 한 개 이상의 다른 플래그십 모델과 비교하는 것입니다.
다음도 추적하세요:
- 작업 완료율
- 첫 시도 성공률
- 응답 시간
- 도구 사용 실패
- 사람의 수정 시간
- 입력 및 출력 소모량
- 반복 실행 시 일관성
- 최종 결과물의 품질
가장 좋은 모델이 반드시 파라미터가 가장 많거나 평균 벤치마크 점수가 가장 높은 모델일 필요는 없습니다. 중요한 것은, 허용 가능한 비용으로 여러분의 특정 작업을 안정적으로 완료하는 모델입니다.
결론
Qwen3.8-Max는 보고된 2.4조 파라미터 스케일과 함께 자율 코딩, 장기 지평 계획, 멀티모달 추론, 백만 토큰 컨텍스트 윈도우, 그리고 경쟁력 있는 API 요금을 결합합니다.
공식 벤치마크는 코딩 에이전트, 전문 워크플로, 일반 추론, 문서 이해, 그리고 시각 작업에서 Qwen3.7-Max 대비 의미 있는 진전을 보여줍니다. Qwen은 또한 Qwen3.8-Max와 Qwen3.8-27B 모두에 대해 오픈 가중치 릴리스를 공개했다고 발표했습니다.
남은 질문은 모델이 발표에서 인상적이냐가 아닙니다. 독립 평가와 실제 프로덕션 사용자가, 보고된 성능을 재현할 수 있느냐입니다.
지금 당장 Qwen3.8-Max는 반드시 지켜볼 만한 가장 중요한 모델 중 하나이며, 코딩, 연구, 에이전트 기반 워크플로에서 통제된 테스트를 진행하기에 강력한 후보입니다.
자주 묻는 질문
Qwen3.8-Max는 무엇인가요?
Qwen3.8-Max는 고급 추론, 자율 코딩, 멀티모달 분석, 장기 실행 에이전트 워크플로를 위한 Alibaba의 플래그십 AI 모델입니다. 총 파라미터는 약 2.4조입니다.
Qwen3.8-Max의 API 가격은 얼마인가요?
공식 요금은 입력 백만 토큰당 $2, 출력 백만 토큰당 $6, 암묵적 캐싱은 백만 토큰당 $0.25입니다.
Qwen3.8-Max는 이미지와 비디오를 지원하나요?
네. Qwen3.8-Max는 텍스트, 이미지, 비디오 입력을 지원합니다. Qwen은 비전을 AI 에이전트의 연속적인 계획 및 자기 수정 루프의 일부로 자리매김합니다.
Qwen3.8-Max의 컨텍스트 윈도우 크기는 얼마나 되나요?
공개된 Qwen Code 통합 정보에는 컨텍스트 윈도우가 약 100만 토큰으로 기재되어 있습니다. 실제 한도는 사용 중인 특정 플랫폼이나 API 엔드포인트에서 반드시 확인해야 합니다.
Qwen3.8-Max는 오픈 소스인가요?
Qwen은 Qwen3.8-Max의 오픈 가중치가 8월 3일 발표 이후 공개될 것이라고 밝혔습니다. 로컬 배포를 계획하기 전, 개발자는 최종 리포지토리, 라이선스, 체크포인트 제공 여부를 확인해야 합니다.
Qwen3.8-27B는 무엇인가요?
Qwen3.8-27B는 Qwen3.8-Max와 함께 발표된 더 작은 모델입니다. Qwen은 이것도 오픈 가중치로 함께 출시될 예정이라고 밝혔으며, 로컬 또는 프라이빗 배포에 더 실용적일 수 있습니다.

