Qwen3.8-Max est rapidement devenu l’une des sorties de modèles d’IA les plus commentées de 2026.
L’équipe Qwen de Alibaba l’a officiellement présenté comme le « modèle le plus performant à ce jour » de l’entreprise. Avec environ 2,4 billions de paramètres au total, Qwen3.8-Max est positionné comme un modèle phare pour la programmation autonome, le travail professionnel, les agents à long horizon et l’intelligence multimodale.
L’annonce officielle fournit également plusieurs détails qui manquaient pendant la période d’aperçu. Qwen a désormais publié la tarification de son API, les résultats de benchmarks langage et vision, des exemples de tâches d’agents à exécution prolongée, ainsi qu’une chronologie pour la publication des poids des modèles open source.
Le résultat va au-delà d’une simple mise à jour de chatbot. Qwen3.8-Max reflète un changement plus large : passer de modèles d’IA qui génèrent des réponses isolées à des agents capables de planifier, d’utiliser des outils, d’inspecter leur propre travail et de mener à bien des projets complexes.
Qu’est-ce que Qwen3.8-Max ?
Qwen3.8-Max est le dernier modèle phare de Alibaba dans la famille Qwen. Il est conçu pour le raisonnement avancé, le développement logiciel, l’analyse multimodale, les flux de travail professionnels et les tâches d’agents autonomes.
Le modèle était initialement disponible sous l’identifiant :
qwen3.8-max-preview
L’aperçu donnait aux développeurs un accès anticipé, mais laissait plusieurs questions sans réponse, notamment sur la tarification API standard, la disponibilité des poids open, et la performance complète des benchmarks.
Ces détails sont devenus plus clairs dans la annonce officielle de Qwen3.8-Max publiée le 3 août.
Qwen décrit le modèle comme un nouveau repère pour le « coding and cowork », en mettant en avant quatre axes clés :
- Développement logiciel autonome
- Livrables de qualité professionnelle
- Planification et exécution à long horizon
- Intelligence d’agent multimodale native
Qwen3.8-Max n’est donc pas seulement présenté comme un modèle conversationnel plus grand. L’objectif est de l’utiliser comme moteur de raisonnement derrière des systèmes d’IA qui travaillent avec du code, des documents, des interfaces visuelles, des outils externes et des historiques de tâches étendus.
Principales fonctionnalités de Qwen3.8-Max
Environ 2,4 billions de paramètres
La spécification principale de Qwen3.8-Max est son échelle annoncée de 2,4 billions de paramètres.
Cela en fait l’un des modèles les plus importants annoncés publiquement par l’équipe Qwen. Toutefois, le nombre total de paramètres ne doit pas être confondu avec le nombre de paramètres utilisés pour chaque réponse.
Si le modèle utilise une architecture de type mixture-of-experts, seule une partie du réseau complet peut être activée pour une requête donnée. Les performances réelles dépendent aussi de :
- Le nombre de paramètres actifs
- La qualité des données d’entraînement
- Les méthodes d’apprentissage par renforcement
- La précision dans l’usage des outils
- La gestion du contexte
- L’infrastructure d’inférence
- La latence de réponse
- La fiabilité lors de tâches répétées
Le nombre de paramètres montre l’ampleur du modèle, mais ne prouve pas que Qwen3.8-Max surpassera tous les modèles concurrents dans chaque scénario.
Programmation autonome
Selon Qwen, Qwen3.8-Max peut soutenir plus de dix jours de développement logiciel auto-évolutif.
L’entreprise présente un exemple où le modèle passe d’un dossier vide à un projet prêt pour la production, avec une intervention humaine limitée. Une trace de projet publique est disponible via le dépôt GitHub lié dans l’annonce officielle.
Il s’agit d’une tâche plus exigeante que de générer une fonction courte ou de corriger un bug isolé. La programmation autonome à long cours peut nécessiter qu’un modèle :
- Comprenne l’objectif produit.
- Conçoive une architecture appropriée.
- Crée et modifie plusieurs fichiers.
- Installe ou configure des dépendances.
- Exécute des tests et interprète les erreurs.
- Examine l’application résultante.
- Corrige les problèmes d’implémentation.
- Continue d’itérer sans perdre l’objectif initial.
La démonstration est un exemple fourni par le fournisseur plutôt qu’un benchmark indépendant. Néanmoins, elle illustre le type de flux de développement étendu que Qwen3.8-Max est conçu pour prendre en charge.
Travail d’agents à long horizon
Qwen met aussi en avant deux scénarios d’agent particulièrement longs :
- Plus de 500 tours d’optimisation de conception de puces
- Une stratégie e-commerce simulée sur 365 jours
Ces exemples visent à démontrer un apprentissage adaptatif en boucle fermée. Dans ce type de workflow, un agent ne produit pas simplement un plan unique. Il observe à répétition les résultats, met à jour sa stratégie et décide de la suite.
Un agent compétent à long horizon doit préserver un contexte important tout en évitant l’accumulation d’un historique non pertinent. Il lui faut aussi une mémoire fiable, un suivi de la progression, des autorisations d’outils, des règles de validation et des mécanismes de reprise.
Le modèle n’est qu’une partie de ce système. Les performances d’agent dépendent également du logiciel environnant et de la conception du workflow.
Intelligence multimodale native
Qwen3.8-Max prend en charge des entrées de texte, d’image et de vidéo.
Qwen décrit la vision comme une boucle de rétroaction continue plutôt que comme un simple canal d’entrée. Un agent visuel peut répéter :
- Observer une interface
- Identifier l’état actuel
- Décider de la prochaine action
- Utiliser un outil
- Inspecter le résultat
- Détecter une erreur
- Corriger son action précédente
C’est particulièrement pertinent pour l’automatisation du navigateur, les tests logiciels, le traitement de documents, la revue d’interfaces et les workflows qui combinent des instructions écrites avec des informations visuelles.
Contexte d’un million de tokens
Les informations publiques d’intégration de Qwen Code ont mentionné une fenêtre de contexte d’environ un million de tokens pour Qwen3.8-Max.
Une fenêtre de ce type peut prendre en charge :
- De grands référentiels logiciels
- Des collections d’articles de recherche
- Des documents professionnels longs
- Des historiques d’agents étendus
- Plusieurs fichiers et sources de données
- Des vidéos ou transcriptions longues
Cependant, disposer de plus de contexte ne produit pas automatiquement une meilleure réponse. Des entrées très volumineuses peuvent augmenter la latence et rendre plus difficile pour le modèle de se concentrer sur les éléments probants pertinents.
Pour de meilleurs résultats, les utilisateurs doivent donc encore organiser leurs supports, supprimer les informations sans rapport, résumer les étapes terminées et demander au modèle de citer les fichiers ou passages qui étayent les conclusions importantes.
Benchmarks langage et agents de Qwen3.8-Max
Qwen a publié un graphique de benchmark officiel comparant Qwen3.8-Max à Opus 4.8, Fable 5, GPT-5.6 Sol et Qwen3.7-Max.

Parmi les résultats sélectionnés de Qwen3.8-Max :
| Benchmark | Score de Qwen3.8-Max |
|---|---|
| Terminal Bench 2.1 | 89.8 |
| FrontierSWE | 73.5 |
| PaperBench | 83.0 |
| AndroidBench | 75.1 |
| QwenSWEBench | 80.7 |
| QwenCoderBench | 58.4 |
| QwenReactBench | 1,724 |
| QwenSVGBench | 1,713 |
| CoWorkBench | 74.8 |
| WorkSpaceBench | 67.7 |
| JobBench | 53.4 |
| SkillsBench | 70.2 |
| GPQA Diamond | 92.6 |
| MMLU-Pro | 92.9 |
| LongBench v2 | 68.3 |
Le graphique indique des gains substantiels par rapport à Qwen3.7-Max dans plusieurs catégories.
Par exemple, le score Terminal Bench 2.1 rapporté passe de 74,5 pour Qwen3.7-Max à 89,8 pour Qwen3.8-Max. Le résultat CoWorkBench passe de 64,8 à 74,8, tandis que WorkSpaceBench augmente de 61,4 à 67,7.
Le modèle affiche aussi de solides résultats en raisonnement général, avec notamment 92,6 sur GPQA Diamond et 92,9 sur MMLU-Pro.
Qwen3.8-Max ne mène pas tous les benchmarks du tableau. D’autres modèles conservent des scores plus élevés dans certaines évaluations d’ingénierie logicielle et d’agents professionnels. Les résultats soutiennent donc l’idée de Qwen3.8-Max comme un concurrent très compétitif, sans pour autant le rendre systématiquement supérieur.
Ces chiffres ont été publiés par Qwen. Des tests indépendants restent nécessaires avant de conclure sur les performances en production.
Benchmarks multimodaux de Qwen3.8-Max
Qwen a publié un graphique de benchmark distinct couvrant le raisonnement multimodal, les agents visuels, l’intelligence documentaire, la compréhension spatiale, l’ancrage visuel et les tâches vidéo.

Parmi les résultats sélectionnés :
| Benchmark | Score de Qwen3.8-Max |
|---|---|
| MMMU-Pro | 82.3 |
| MathVision | 95.2 / 97.7 |
| LogicVista | 91.9 |
| SLAKE | 90.8 |
| OSWorld-Verified | 86.1 |
| AndroidWorld | 85.3 |
| Parametric CAD Bench | 91.5 |
| OmniDocBench 1.5 | 92.1 |
| RealWorldQA | 88.0 |
| MMStar | 85.9 |
| CountQA | 82.4 |
| Dense200 | 87.0 |
| VideoMME avec sous-titres | 90.4 |
| VideoMMMU | 88.7 |
| MLVU | 90.8 |
Les résultats suggèrent que Qwen3.8-Max n’est pas simplement un modèle de langage avec une fonctionnalité de téléversement d’images. Il est optimisé pour des tâches où les informations visuelles influencent la planification et l’usage des outils.
Des benchmarks comme OSWorld-Verified et AndroidWorld testent des parties de ce workflow d’agent. Ils exigent que le modèle comprenne une interface et détermine comment interagir avec elle.
Qwen3.8-Max affiche de bonnes performances sur de nombreuses évaluations, même s’il ne mène pas tous les benchmarks d’agents visuels. De hauts scores en compréhension documentaire ou en questions-réponses visuelles ne garantissent pas non plus automatiquement un contrôle fiable de l’ordinateur.
Regardez Qwen3.8-Max en action
Vous voulez voir de plus près Qwen3.8-Max et comment il se compare à d’autres modèles open source de premier plan ? Regardez la vidéo ci-dessous pour un aperçu concret de ses capacités, de ses performances en benchmark et de ses applications potentielles dans le monde réel.

Tarification API de Qwen3.8-Max
L’annonce officielle liste les prix d’API suivants :
| Type d’usage | Prix officiel |
|---|---|
| Entrée | 2,00 $ par million de tokens |
| Sortie | 6,00 $ par million de tokens |
| Mise en cache implicite | 0,25 $ par million de tokens |
Il s’agit d’une mise à jour importante par rapport à la période d’aperçu, lorsque la tarification standard par token n’était pas clairement disponible.
Le prix de la mise en cache implicite peut être utile pour des agents qui accèdent à répétition au même référentiel, aux mêmes instructions système, aux documents de l’entreprise ou à l’historique des conversations.
Les coûts réels de workflow dépendront toutefois de :
- La taille du contexte d’entrée
- La longueur du raisonnement
- La sortie générée
- Le nombre d’appels à des outils
- Les tentatives échouées et les reprises
- Le comportement de mise en cache du contexte
- Les exigences de revue humaine
Les entreprises doivent donc calculer le coût par tâche menée à bien plutôt que de comparer uniquement les modèles selon leurs taux de tokens annoncés.
Un modèle dont les tokens sont peu coûteux peut rester cher s’il nécessite des corrections répétées. Un modèle plus onéreux peut offrir une meilleure valeur s’il termine la tâche correctement dès la première tentative.
Qwen3.8-Max est-il open source ?
Dans son annonce du 3 août, Qwen a indiqué que les poids open de Qwen3.8-Max seraient publiés la semaine suivante.
L’équipe a aussi annoncé un modèle open-weight Qwen3.8-27B.
Tant que les poids et la licence ne sont pas réellement publiés, la description la plus exacte est :
Qwen a officiellement annoncé une publication prochaine des poids open pour Qwen3.8-Max et Qwen3.8-27B. Les développeurs doivent vérifier le dépôt final, la licence, les checkpoints et les exigences de déploiement une fois la sortie disponible.
Le déploiement local d’un modèle avec 2,4 billions de paramètres au total nécessiterait une infrastructure conséquente. Le modèle plus petit (27B) peut être plus pratique pour des développeurs individuels, des équipes de recherche et des entreprises disposant d’une capacité GPU limitée.
Qui devrait utiliser Qwen3.8-Max ?
Équipes de développement logiciel
Qwen3.8-Max peut être utile pour :
- Explorer des référentiels inconnus
- Planifier des changements d’architecture
- Modifier plusieurs fichiers
- Déboguer des défaillances complexes
- Lancer des tests
- Construire des applications complètes
- Faire fonctionner des agents de codage à long cours
Avant d’autoriser le modèle à modifier du code en production, les équipes doivent tester s’il suit les instructions du dépôt, utilise le bon répertoire de travail, limite les modifications à la portée demandée et valide ses changements.
Équipes de recherche et de contenu
Le long contexte du modèle et ses capacités multimodales peuvent servir à :
- Synthèse de recherche
- Analyse concurrentielle
- Revue de documents
- Analyse vidéo
- Extraction de connaissances
- Génération de rapports
Un outil comme iWeaver peut aider les utilisateurs à collecter et organiser des PDF, pages web, vidéos et autres supports avant de demander à un modèle avancé de comparer des sources ou de produire une analyse structurée.
L’essentiel est de préserver la traçabilité. Les affirmations importantes doivent rester reliées à leurs sources d’origine.
Équipes d’automatisation d’entreprise
Les entreprises peuvent évaluer Qwen3.8-Max pour :
- Des assistants internes de connaissances
- Des workflows de support client
- Le traitement de documents
- L’automatisation bureautique
- Les opérations logicielles
- Des agents métier utilisant des outils
L’évaluation en production doit couvrir la sécurité, les contrôles d’accès, la conservation des données, l’auditabilité, la stabilité de l’API, la concurrence, la reprise en cas d’échec et le coût total des tâches.
Devriez-vous passer à Qwen3.8-Max ?
Qwen3.8-Max vaut la peine d’être testé si votre workflow implique un codage complexe, de longs documents, une analyse multimodale, ou des outils qui nécessitent plusieurs cycles de planification et d’exécution.
En revanche, passer directement d’un graphique de benchmark à un déploiement en production serait prématuré.
Une approche plus fiable consiste à créer un benchmark comprenant de 20 à 50 tâches issues de votre workflow réel. Comparez Qwen3.8-Max avec Qwen3.7-Max et au moins un autre modèle phare en utilisant les mêmes prompts, fichiers sources, outils et critères d’évaluation.
Suivez :
- Le taux d’achèvement des tâches
- Le taux de réussite lors de la première tentative
- Le temps de réponse
- Les échecs d’usage des outils
- Le temps de correction humaine
- La consommation d’entrée et de sortie
- La constance sur des exécutions répétées
- La qualité du livrable final
Le meilleur modèle n’est pas nécessairement celui qui possède le plus de paramètres ou le score moyen de benchmark le plus élevé. C’est celui qui exécute de manière fiable vos tâches spécifiques à un coût acceptable.
À retenir
Qwen3.8-Max combine une échelle annoncée de 2,4 billions de paramètres avec de la programmation autonome, une planification à long horizon, un raisonnement multimodal, une fenêtre de contexte d’un million de tokens et une tarification API compétitive.
Les benchmarks officiels suggèrent des progrès significatifs par rapport à Qwen3.7-Max pour les agents de coding, les workflows professionnels, le raisonnement général, la compréhension des documents et les tâches visuelles. Qwen a aussi annoncé des sorties de poids open pour Qwen3.8-Max et Qwen3.8-27B.
La question restante n’est pas de savoir si le modèle impressionne dans une annonce. Il s’agit de savoir si des évaluations indépendantes et des utilisateurs en production peuvent reproduire ses performances rapportées.
Pour l’instant, Qwen3.8-Max fait partie des modèles les plus importants à surveiller—et un excellent candidat pour des tests contrôlés en coding, en recherche et dans les workflows basés sur des agents.
Foire aux questions
Qu’est-ce que Qwen3.8-Max ?
Qwen3.8-Max est le modèle d’IA phare de Alibaba pour le raisonnement avancé, le coding autonome, l’analyse multimodale et les workflows d’agents longue durée. Il compte environ 2,4 billions de paramètres au total.
Quel est le prix de l’API de Qwen3.8-Max ?
La tarification officielle est de 2 $ par million de tokens d’entrée, 6 $ par million de tokens de sortie, et de 0,25 $ par million de tokens pour la mise en cache implicite.
Qwen3.8-Max prend-il en charge les images et les vidéos ?
Oui. Qwen3.8-Max prend en charge des entrées de texte, d’image et de vidéo. Qwen présente la vision comme une partie d’une boucle continue de planification et d’autocorrection pour les agents d’IA.
Quelle est la taille de la fenêtre de contexte de Qwen3.8-Max ?
Les informations publiques d’intégration de Qwen Code ont indiqué une fenêtre de contexte d’environ un million de tokens. Les limites réelles doivent être vérifiées pour la plateforme ou le point de terminaison API spécifique utilisé.
Qwen3.8-Max est-il open source ?
Qwen a annoncé que les poids open de Qwen3.8-Max seraient publiés après l’annonce du 3 août. Les développeurs doivent vérifier la disponibilité du dépôt final, de la licence et des checkpoints avant de planifier un déploiement local.
Qu’est-ce que Qwen3.8-27B ?
Qwen3.8-27B est un modèle plus petit annoncé en même temps que Qwen3.8-Max. Qwen a indiqué qu’il sera également publié avec des poids open, ce qui pourrait le rendre plus pratique pour un déploiement local ou privé.

