L’équipe Qwen d’Alibaba a publié Qwen3.8-Flash-Next avec des poids open source.
Cette sortie vaut le coup d’œil pour plus que la vitesse ou le prix.
Qwen indique que Qwen3.8-Flash-Next est aussi un aperçu précoce de l’architecture prévue pour Qwen4. Elle introduit des changements au niveau de l’attention, des connexions résiduelles, des embeddings et de l’optimisation du modèle, avec un objectif clair : faire davantage avec moins de calcul.
Pour la plupart des utilisateurs, il n’est pas nécessaire de comprendre tous les détails techniques.
Les changements importants sont plus faciles à expliquer :
- Environ 6B paramètres sont activés par token
- Le contexte peut s’étendre à environ 1 million de tokens
- Les benchmarks de codage et d’agents sont plus solides
- Les capacités multimodales et d’utilisation d’ordinateur se sont améliorées
- QSA réduit le coût du traitement en long contexte
- La tarification API est conçue pour les charges à volume élevé
Qwen3.8 Flash n’est pas simplement un autre modèle plus rapide.
Il semble de plus en plus conçu pour les tâches longues, les agents IA et les workflows qui doivent traiter une grande quantité d’informations.
Qu’est-ce que Qwen3.8 Flash ?
Qwen3.8-Flash-Next est un modèle multimodal de type Mixture-of-Experts (MoE).
Le modèle principal a 125B paramètres, auxquels s’ajoutent 51B paramètres pour les embeddings d’n-gram.
Mais il n’active pas l’ensemble du modèle pour chaque token.
Seuls environ 6B paramètres sont activés par token.
L’idée de base est simple :
Le modèle est grand, mais il n’utilise que les parties dont il a besoin à chaque étape.
C’est l’un des principaux avantages d’une architecture MoE.
Qwen indique que Qwen3.8-Flash-Next ne nécessite qu’environ un neuvième du coût d’entraînement de Qwen3.7-Plus, tout en obtenant des résultats plus solides en codage et sur des tâches bureautiques.
Pour les utilisateurs, cela annonce un changement plus large dans le développement de l’IA.
Les modèles n’ont pas toujours besoin de devenir plus coûteux pour devenir plus performants.
Une utilisation plus intelligente du calcul peut compter autant que la taille du modèle.

Qwen3.8-Flash-Next prend en charge 262 144 tokens nativement et peut être étendu à environ 1 million de tokens avec YaRN.
Cela le rend utile pour des tâches telles que :
- des PDF et des rapports longs
- des bases de code volumineuses
- des recherches à travers de nombreuses sources
- des agents IA qui tournent sur la durée
- des conversations prolongées
- l’analyse multi-documents
Cependant, le long contexte s’accompagne normalement d’un coût.
Plus le modèle doit traiter d’informations, plus l’attention peut devenir coûteuse.
Qwen répond à cela avec Qwen Sparse Attention (QSA).
Au lieu de donner la même quantité d’attention à tout dans le contexte, QSA identifie d’abord les régions les plus pertinentes et y consacre davantage de calcul.
Une façon simple de le voir :
Au lieu de relire chaque page d’un livre de 500 pages, le modèle identifie d’abord les chapitres les plus susceptibles de contenir la réponse.

À une longueur de contexte de 1M tokens, le noyau d’attention QSA a livré :
- jusqu’à 7,6× plus rapide en Prefill
- jusqu’à 4,9× plus rapide en Decode
Lors d’un test de déploiement avec un taux de hit du Prefix Cache de 90 %, Qwen3.8-Flash-Next a atteint 8,6× le débit de Prefill de Qwen3.7-Plus à 1M tokens.
Ainsi, la fenêtre de 1M tokens ne sert pas uniquement à supporter un nombre plus élevé.
Qwen cherche aussi à rendre l’IA en long contexte beaucoup plus efficace.
Comment Qwen3.8 Flash se comporte-t-il ?
Qwen a publié un large ensemble de résultats de benchmarks couvrant le codage, les agents, le raisonnement et des tâches professionnelles.
Parmi les résultats les plus notables :
| Benchmark | Qwen3.8-Flash-Next |
|---|---|
| DeepSWE 1.1 | 58,7 |
| SWE-bench Pro | 62,5 |
| SWE-bench Multilingual | 81,0 |
| CoWorkBench | 73,9 |
| JobBench | 55,7 |
| Toolathlon Verified | 73,5 |
| GPQA Diamond | 91,7 |
| LiveCodeBench v6 | 91,9 |
Un point important se démarque :
Qwen3.8 Flash n’est pas uniquement axé sur le codage.
Il performe aussi fortement sur le travail de bureau, les tâches d’agents, l’utilisation d’outils et les workflows professionnels.
Par exemple, sur CoWorkBench, qui mesure des tâches de bureau et de productivité sur le long terme, Qwen indique :
| Modèle | CoWorkBench |
|---|---|
| Qwen3.8-Flash-Next | 73,9 |
| Qwen3.8-27B | 70,7 |
| Claude Opus 4.6 Max | 68,2 |
| Qwen3.7-Plus | 65,1 |
| DeepSeek-V4-Flash-0731 | 45,1 |
Ces résultats proviennent du tableau de benchmarks publié par Qwen. Ils sont utiles pour comparer les performances sur des tests spécifiques, plutôt que d’affirmer largement qu’un modèle est meilleur sur tout.
La performance multimodale progresse aussi
Qwen3.8 Flash est également un modèle multimodal.
Ses résultats officiels incluent :
| Benchmark | Qwen3.8-Flash-Next |
|---|---|
| ClawEval-MM Pass@3 | 64,4 |
| RecreationBench | 49,9 |
| AndroidWorld | 84,5 |
| OSWorld 2.0 Partial | 52,3 |
| Vision2Web | 64,0 |
| ERQA | 72,3 |
Le score de 84,5 sur AndroidWorld est particulièrement intéressant.
AndroidWorld mesure à quel point un modèle peut interagir avec des environnements Android et accomplir des tâches.
Cela montre où Qwen se dirige.
Les modèles IA vont au-delà de :
répondre à une question
vers :
comprendre une tâche, utiliser des outils et accomplir le travail.
Cela devient une part majeure de la course aux agents IA.
Que regardent les utilisateurs de Reddit et X ?
Les benchmarks officiels racontent une partie de l’histoire.
Sur Reddit et X, les discussions se concentrent souvent davantage sur un usage quotidien.
Au cours des derniers jours, plusieurs sujets sont revenus sans cesse :
Un modèle de 125B peut-il vraiment fonctionner en local ?
Que signifie réellement « 6B actif » ?
La table d’embeddings d’n-gram peut-elle être déchargée vers la RAM du système ?
À quelle vitesse ça tourne avec un long contexte ?
Sur la communauté LocalLLaMA de Reddit, une grande partie des discussions précoces a porté sur la quantification, les besoins en mémoire et sur la question de savoir si les embeddings d’n-gram rendent cette architecture plus facile à exécuter sur du matériel local.
Des tests initiaux apparaissent aussi sur X.
Un test avec un RTX 4090 utilisant 110GB de RAM système a rapporté environ 21 tokens par seconde en vitesse de decode, avec une fenêtre de contexte d’environ 250K tokens.
Les résultats varieront naturellement selon la quantification, le GPU, la RAM, la configuration de déchargement et le logiciel d’inférence.
Mais le changement intéressant est déjà clair.
Un modèle de 100B+ ne veut plus automatiquement dire :
datacenter uniquement.
Les utilisateurs d’IA locaux testent déjà ces modèles sur du matériel grand public haut de gamme.
Qwen3.8 Flash est plus qu’un modèle de codage
Il est facile de regarder SWE-bench et de décrire Qwen3.8 Flash comme un autre modèle de codage.
Les résultats officiels suggèrent quelque chose de plus large.
Qwen investit aussi fortement dans :
- des tâches bureautiques sur la durée
- l’utilisation d’outils
- la compréhension multimodale
- l’utilisation d’ordinateur
- des agents mobiles
- l’analyse en long contexte
Cela correspond à un changement plus large dans la manière dont les gens utilisent l’IA.
L’ancienne demande était souvent :
« Réponds à cette question. »
La demande plus récente devient :
« Termine cette tâche. »
La seconde est bien plus difficile.
Un agent IA peut devoir lire des fichiers, comprendre une page web, inspecter une image, utiliser un outil, puis poursuivre en fonction du résultat.
C’est pourquoi l’efficacité et le long contexte comptent autant.
Pour les documents et la recherche : essayez iWeaver
Les benchmarks sont utiles, mais la plupart des utilisateurs ne choisissent pas des outils d’IA uniquement pour comparer des scores.
La question la plus importante est :
Comment ces capacités de modèle peuvent-elles s’intégrer à un workflow réel ?
Si vous travaillez régulièrement avec :
- des PDF
- des documents Word
- des pages web
- des images
- de l’audio
- de la vidéo
- du contenu de recherche
- plusieurs fichiers
vous pouvez essayer iWeaver.
iWeaver est conçu pour le travail de connaissance et les contenus complexes.
Il regroupe différents types d’informations dans un seul espace de travail IA, où vous pouvez parcourir un workflow comme :
Synthétiser → Comprendre → Analyser → Organiser → Créer
Vous pouvez par exemple téléverser un long rapport et en extraire les points clés.
Ensuite, ajoutez plusieurs pages web et comparez ce que disent différentes sources.
Ou combinez l’audio de réunion, les PDF et les images pour les transformer en notes structurées.
Ce sont précisément les types de workflows pour lesquels le long contexte et l’IA multimodale deviennent utiles.
Parce que les utilisateurs n’ont pas vraiment besoin de « 1 million de tokens ».
Ils ont besoin de :
un moyen plus rapide de transformer des informations complexes en quelque chose d’utile.
Pour la création ouverte : essayez XPT
Tous les workflows IA ne commencent pas par un document existant.
Parfois, tout commence par une idée.
Par exemple :
- brainstorming
- écriture d’histoires
- roleplay
- création de personnages
- génération d’images
- worldbuilding
- conversations ouvertes
Pour ce type de tâches, vous pouvez essayer XPT pour en savoir plus sur la création d’IA ouverte et les conversations continues.
Le workflow se rapproche de :
Idée → Chat → Histoire → Personnage → Image → Continuer à explorer
Si iWeaver est surtout centré sur :
comprendre et organiser des informations existantes
XPT est davantage axé sur :
faire évoluer une nouvelle idée
Alors que Qwen, Claude, GPT, Gemini, DeepSeek et d’autres familles de modèles continuent de s’améliorer, les différences entre les modèles sous-jacents continueront d’évoluer.
Pour les utilisateurs du quotidien, une autre question devient aussi importante :
Le produit IA peut-il vraiment m’aider à terminer la tâche ?
Pourquoi Qwen3.8 Flash est important
La partie la plus intéressante de Qwen3.8 Flash n’est pas un score de benchmark.
C’est la direction derrière l’ensemble de la sortie.
Un contexte plus long.
Des agents plus solides.
De meilleures capacités multimodales.
Des coûts de calcul plus faibles.
Et une architecture plus efficace.
Les résultats publiés par Qwen montrent déjà des gains clairs en codage, travail de bureau, utilisation d’outils, tâches multimodales et efficacité en long contexte.
Et Qwen3.8-Flash-Next est aussi un aperçu précoce de l’architecture prévue pour Qwen4.
Cela en fait bien plus qu’une simple mise à jour de la série Flash.
Cela nous donne une vision claire de la direction que Qwen prend ensuite :
pas seulement une IA plus grande, mais une IA plus capable qui utilise le calcul de manière plus efficiente.
