Qwen3.8-Max ist schnell zu einer der meistdiskutierten KI-Modellveröffentlichungen des Jahres 2026 geworden.
Das Qwen-Team von Alibaba hat es offiziell als das „fähigste Modell, das das Unternehmen bisher hervorgebracht hat“ eingeführt. Mit ungefähr 2,4 Billionen Gesamtparametern wird Qwen3.8-Max als Flaggschiff-Modell für autonomes Codieren, professionelles Arbeiten, Agenten mit Langzeithorizont und multimodale Intelligenz positioniert.
Die offizielle Ankündigung liefert außerdem mehrere Details, die in der Vorschauphase noch gefehlt hatten. Qwen hat nun API-Preise veröffentlicht, Ergebnisse zu Sprach- und Vision-Benchmarks, Beispiele für langlaufende Agentenaufgaben sowie einen Zeitplan für die Veröffentlichung von Open-Model-Weights.
Das Ergebnis ist mehr als ein weiteres Chatbot-Update. Qwen3.8-Max spiegelt eine breitere Verschiebung wider: weg von KI-Modellen, die isolierte Antworten erzeugen, hin zu KI-Agenten, die planen, Tools nutzen, ihre eigene Arbeit prüfen und komplexe Projekte abschließen können.
Was ist Qwen3.8-Max?
Qwen3.8-Max ist das neueste Flaggschiff-Modell von Alibaba in der Qwen-Familie. Es ist für fortgeschrittenes Reasoning, Softwareentwicklung, multimodale Analyse, professionelle Workflows und autonome Agentenaufgaben ausgelegt.
Das Modell war zunächst unter dem Identifier verfügbar:
qwen3.8-max-preview
Die Vorschau bot Entwicklern frühen Zugriff, ließ jedoch mehrere Fragen offen – insbesondere rund um standardisierte API-Preise, Verfügbarkeit von Open Weights und umfassende Benchmark-Leistung.
Diese Details wurden klarer in der am 3. August veröffentlichten offiziellen Qwen3.8-Max-Ankündigung.
Qwen beschreibt das Modell als neuen Benchmark für „coding and cowork“ und betont vier Kernbereiche:
- Autonome Softwareentwicklung
- Ablieferungen in professioneller Qualität
- Langfristige Planung und Ausführung
- Native multimodale Agentenintelligenz
Qwen3.8-Max ist daher nicht nur als größeres Konversationsmodell positioniert. Es soll als Reasoning-Engine hinter KI-Systemen funktionieren, die mit Code, Dokumenten, visuellen Oberflächen, externen Tools und erweiterten Aufgabenverläufen arbeiten.
Qwen3.8-Max wichtigste Features
Ungefähr 2,4 Billionen Parameter
Die zentrale Spezifikation für Qwen3.8-Max ist der angegebene 2,4-Billionen-Parameter-Scale.
Damit gehört es zu den größten Modellen, die vom Qwen-Team öffentlich angekündigt wurden. Die Gesamtzahl der Parameter sollte jedoch nicht mit der Anzahl der Parameter verwechselt werden, die für jede einzelne Antwort genutzt werden.
Wenn das Modell eine Mixture-of-Experts-Architektur verwendet, wird möglicherweise nur ein Teil des gesamten Netzwerks für eine konkrete Anfrage aktiviert. Die reale Leistung hängt außerdem ab von:
- der Anzahl der aktiven Parameter
- der Qualität der Trainingsdaten
- Methoden des Reinforcement Learning
- der Genauigkeit beim Tool-Use
- dem Kontextmanagement
- der Inferenz-Infrastruktur
- der Antwortlatenz
- der Zuverlässigkeit bei wiederholten Aufgaben
Die Parameterzahl zeigt die Größenordnung des Modells, beweist aber nicht, dass Qwen3.8-Max in jeder Situation jedes konkurrierende Modell übertreffen wird.
Autonomes Codieren
Laut Qwen kann Qwen3.8-Max mehr als zehn Tage an selbst-evolvierender Softwareentwicklung durchhalten.
Das Unternehmen zeigt ein Beispiel, bei dem das Modell von einem leeren Ordner zu einem produktionsreifen Projekt gelangt – mit nur begrenzten menschlichen Eingriffen. Eine öffentliche Projekt-Trace ist über das GitHub-Repository verfügbar, das in der offiziellen Ankündigung verlinkt ist.
Das ist eine anspruchsvollere Aufgabe als das Erzeugen einer kurzen Funktion oder das Beheben eines einzelnen Bugs. Beim langlaufenden autonomen Codieren muss ein Modell möglicherweise:
- Das Produktziel verstehen.
- Eine passende Architektur entwerfen.
- Mehrere Dateien erstellen und bearbeiten.
- Abhängigkeiten installieren oder konfigurieren.
- Tests ausführen und Fehler interpretieren.
- Die resultierende Anwendung prüfen.
- Implementierungsprobleme korrigieren.
- Iterieren fortsetzen, ohne das ursprüngliche Ziel aus den Augen zu verlieren.
Die Demonstration ist ein vom Anbieter bereitgestelltes Beispiel – kein unabhängiger Benchmark. Dennoch zeigt sie den Typ des erweiterten Entwicklungs-Workflows, den Qwen3.8-Max unterstützen soll.
Agentenarbeit mit Langzeithorizont
Qwen hebt außerdem zwei ungewöhnlich lange Agenten-Szenarien hervor:
- Mehr als 500 Turns zur Optimierung des Chip-Designs
- eine 365-tägige, simulierte E-Commerce-Strategie
Diese Beispiele sollen geschlossenes, adaptives Lernen demonstrieren. In so einem Workflow produziert ein Agent nicht einfach nur einen einmaligen Plan. Er beobachtet wiederholt Ergebnisse, aktualisiert seine Strategie und entscheidet, was als Nächstes zu tun ist.
Ein leistungsfähiger Agent mit Langzeithorizont muss wichtigen Kontext bewahren und gleichzeitig verhindern, dass sich irrelevante Historie ansammelt. Außerdem braucht er verlässliches Gedächtnis, Fortschrittsverfolgung, Tool-Berechtigungen, Validierungsregeln und Mechanismen zur Wiederherstellung.
Das Modell ist nur ein Teil dieses Systems. Die Agentenleistung hängt auch von der umgebenden Software und dem Workflow-Design ab.
Native Multimodale Intelligenz
Qwen3.8-Max unterstützt Text-, Bild- und Video-Inputs.
Qwen beschreibt Vision als kontinuierliche Feedback-Schleife – nicht als einzelnen Input-Kanal. Ein visueller Agent kann wiederholt:
- eine Oberfläche beobachten
- den aktuellen Status identifizieren
- die nächste Aktion entscheiden
- ein Tool bedienen
- das Ergebnis inspizieren
- einen Fehler erkennen
- die vorherige Aktion korrigieren
Das ist besonders relevant für Browser-Automation, Software-Testing, Dokumentenverarbeitung, Interface-Reviews und Workflows, die geschriebene Anweisungen mit visuellen Informationen kombinieren.
Ein-Million-Token-Kontext
Öffentliche Qwen-Code-Integrationseinträge haben für Qwen3.8-Max ein Kontextfenster von ungefähr einer Million Tokens angegeben.
Ein Kontextfenster dieser Größe kann unterstützen:
- große Software-Repositories
- Sammlungen von Forschungspapieren
- umfangreiche Geschäftsdokumente
- erweiterte Agenten-Historien
- mehrere Dateien und Datenquellen
- lange Videos oder Transkripte
Mehr Kontext führt jedoch nicht automatisch zu einer besseren Antwort. Sehr große Inputs können die Latenz erhöhen und es für das Modell schwieriger machen, sich auf relevante Belege zu fokussieren.
Für bessere Ergebnisse sollten Nutzer ihre Materialien daher weiterhin strukturieren, unzusammenhängende Informationen entfernen, abgeschlossene Phasen zusammenfassen und das Modell bitten, die Dateien oder Passagen zu zitieren, die wichtige Schlussfolgerungen stützen.
Qwen3.8-Max Sprach- und Agenten-Benchmarks
Qwen hat ein offizielles Benchmark-Chart veröffentlicht, das Qwen3.8-Max mit Opus 4.8, Fable 5, GPT-5.6 Sol und Qwen3.7-Max vergleicht.

Ausgewählte Ergebnisse von Qwen3.8-Max umfassen:
| Benchmark | Qwen3.8-Max Score |
|---|---|
| Terminal Bench 2.1 | 89.8 |
| FrontierSWE | 73.5 |
| PaperBench | 83.0 |
| AndroidBench | 75.1 |
| QwenSWEBench | 80.7 |
| QwenCoderBench | 58.4 |
| QwenReactBench | 1,724 |
| QwenSVGBench | 1,713 |
| CoWorkBench | 74.8 |
| WorkSpaceBench | 67.7 |
| JobBench | 53.4 |
| SkillsBench | 70.2 |
| GPQA Diamond | 92.6 |
| MMLU-Pro | 92.9 |
| LongBench v2 | 68.3 |
Das Diagramm zeigt in mehreren Kategorien deutliche Zugewinne gegenüber Qwen3.7-Max.
Zum Beispiel steigt der gemeldete Terminal-Bench-2.1-Score von 74,5 für Qwen3.7-Max auf 89,8 für Qwen3.8-Max. Das CoWorkBench-Ergebnis verbessert sich von 64,8 auf 74,8, während WorkSpaceBench von 61,4 auf 67,7 steigt.
Das Modell meldet außerdem starke Ergebnisse im Bereich General Reasoning, darunter 92,6 auf GPQA Diamond und 92,9 auf MMLU-Pro.
Qwen3.8-Max führt jedoch nicht in jedem Benchmark in der Tabelle. Andere Modelle behalten in einigen Software-Engineering- und professionellen Agenten-Evaluierungen höhere Werte. Die Ergebnisse sprechen daher dafür, Qwen3.8-Max als sehr wettbewerbsfähig zu beschreiben – aber nicht als universell überlegen.
Diese Zahlen wurden von Qwen veröffentlicht. Unabhängige Tests sind weiterhin notwendig, bevor Schlussfolgerungen zur Produktionsleistung gezogen werden.
Qwen3.8-Max Multimodale Benchmarks
Qwen hat ein separates Benchmark-Chart veröffentlicht, das multimodales Reasoning, visuelle Agenten, Dokumentenintelligenz, räumliches Verständnis, visuelles Grounding und Video-Aufgaben abdeckt.

Ausgewählte Ergebnisse umfassen:
| Benchmark | Qwen3.8-Max Score |
|---|---|
| MMMU-Pro | 82.3 |
| MathVision | 95.2 / 97.7 |
| LogicVista | 91.9 |
| SLAKE | 90.8 |
| OSWorld-Verified | 86.1 |
| AndroidWorld | 85.3 |
| Parametric CAD Bench | 91.5 |
| OmniDocBench 1.5 | 92.1 |
| RealWorldQA | 88.0 |
| MMStar | 85.9 |
| CountQA | 82.4 |
| Dense200 | 87.0 |
| VideoMME mit Untertiteln | 90.4 |
| VideoMMMU | 88.7 |
| MLVU | 90.8 |
Die Ergebnisse deuten darauf hin, dass Qwen3.8-Max nicht einfach nur ein Sprachmodell mit einer Bild-Upload-Funktion ist. Es wird für Aufgaben optimiert, bei denen visuelle Informationen Planung und Tool-Use beeinflussen.
Benchmarks wie OSWorld-Verified und AndroidWorld testen Teile dieses Agenten-Workflows. Dafür muss das Modell eine Oberfläche verstehen und entscheiden, wie man mit ihr interagiert.
Qwen3.8-Max meldet starke Leistungen in vielen dieser Evaluierungen, führt aber nicht jedes Benchmark für visuelle Agenten an. Hohe Werte in Dokumentenverständnis oder visueller Fragebeantwortung garantieren außerdem nicht automatisch eine zuverlässige Computersteuerung.
Qwen3.8-Max in Aktion ansehen
Möchten Sie einen genaueren Blick auf Qwen3.8-Max werfen und sehen, wie es im Vergleich zu anderen führenden Open-Models abschneidet? Sehen Sie sich das Video unten an – für eine praxisnahe Aufschlüsselung seiner Fähigkeiten, Benchmark-Leistung und möglichen realen Anwendungsfälle.

Qwen3.8-Max API-Preise
Die offizielle Ankündigung listet die folgenden API-Preise:
| Nutzungsart | Offizieller Preis |
|---|---|
| Input | 2,00 $ pro Million Tokens |
| Output | 6,00 $ pro Million Tokens |
| Implizites Caching | 0,25 $ pro Million Tokens |
Das ist ein wichtiges Update gegenüber der Vorschauphase, in der eine standardisierte Preisgestaltung pro Token nicht klar verfügbar war.
Der Preis für implizites Caching kann für Agenten nützlich sein, die wiederholt auf dasselbe Repository, Systemanweisungen, Unternehmensdokumente oder die Konversationshistorie zugreifen.
Die tatsächlichen Kosten im Workflow hängen jedoch weiterhin ab von:
- der Größe des Input-Kontexts
- der Länge des Reasonings
- dem generierten Output
- der Anzahl der Tool-Calls
- fehlgeschlagenen Versuchen und Retries
- dem Verhalten beim Kontext-Caching
- den Anforderungen an die menschliche Prüfung
Unternehmen sollten daher die Kosten pro abgeschlossenem Task berechnen, statt Modelle nur anhand der beworbenen Token-Raten zu vergleichen.
Ein Modell mit günstigen Tokens kann dennoch teuer werden, wenn es wiederholt korrigiert werden muss. Ein teureres Modell kann besseren Gegenwert liefern, wenn es die Aufgabe beim ersten Versuch korrekt erledigt.
Ist Qwen3.8-Max Open Source?
In seiner Ankündigung vom 3. August erklärte Qwen, dass die Open Weights von Qwen3.8-Max in der folgenden Woche veröffentlicht würden.
Das Team hat außerdem ein Open-Weight-Qwen3.8-27B-Modell angekündigt.
Bis die Weights und die Lizenz tatsächlich veröffentlicht sind, ist die genaueste Beschreibung:
Qwen hat offiziell eine bevorstehende Open-Weight-Veröffentlichung für Qwen3.8-Max und Qwen3.8-27B angekündigt. Entwickler sollten das finale Repository, die Lizenz, die Checkpoints und die Anforderungen für das Deployment prüfen, sobald die Veröffentlichung verfügbar ist.
Das lokale Deployment eines Modells mit insgesamt 2,4 Billionen Parametern würde erhebliche Infrastruktur erfordern. Das kleinere 27B-Modell kann für einzelne Entwickler, Forschungsteams und Unternehmen mit begrenzter GPU-Kapazität hingegen praktischer sein.
Für wen eignet sich Qwen3.8-Max?
Software-Entwicklungsteams
Qwen3.8-Max kann für Folgendes nützlich sein:
- das Erkunden unbekannter Repositories
- das Planen von Architekturänderungen
- das Bearbeiten mehrerer Dateien
- das Debuggen komplexer Ausfälle
- das Ausführen von Tests
- das Erstellen kompletter Anwendungen
- das Betreiben langlaufender Coding-Agents
Bevor Teams dem Modell erlauben, Produktionscode zu ändern, sollten sie testen, ob es Repository-Anweisungen befolgt, das richtige Arbeitsverzeichnis nutzt, Änderungen auf den angefragten Umfang begrenzt und seine Änderungen validiert.
Forschungs- und Content-Teams
Der lange Kontext und die multimodalen Fähigkeiten des Modells können unterstützen bei:
- Synthese von Forschungsergebnissen
- Wettbewerbsanalysen
- Dokumentenreviews
- Videoanalysen
- Knowledge Extraction
- Berichtserstellung
Ein Tool wie iWeaver kann Nutzern helfen, PDFs, Webseiten, Videos und andere Materialien zu sammeln und zu organisieren, bevor sie ein fortgeschrittenes Modell bitten, Quellen zu vergleichen oder eine strukturierte Analyse zu erstellen.
Der Schlüssel ist Nachvollziehbarkeit. Wichtige Aussagen sollten mit ihren ursprünglichen Quellen verknüpft bleiben.
Teams für Enterprise-Automation
Unternehmen können Qwen3.8-Max evaluieren für:
- interne Wissensassistenten
- Workflows für den Kundensupport
- Dokumentenverarbeitung
- Office-Automation
- Software-Operations
- Business-Agents, die Tools verwenden
Die Bewertung in Produktion sollte Sicherheit, Zugriffskontrollen, Datenaufbewahrung, Auditierbarkeit, API-Stabilität, Concurrency, Fehlerwiederherstellung und die gesamten Task-Kosten abdecken.
Sollten Sie zu Qwen3.8-Max wechseln?
Qwen3.8-Max lohnt sich zum Testen, wenn Ihr Workflow komplexes Codieren, lange Dokumente, multimodale Analyse oder Tools umfasst, die mehrere Runden aus Planung und Ausführung erfordern.
Ein direkter Wechsel von einem Benchmark-Chart zu einem Production-Deployment wäre jedoch verfrüht.
Ein zuverlässigerer Ansatz ist, einen Benchmark zu erstellen, der 20 bis 50 Tasks aus Ihrem echten Workflow enthält. Vergleichen Sie Qwen3.8-Max mit Qwen3.7-Max und mindestens einem weiteren Flaggschiff-Modell – mit denselben Prompts, Quell-Dateien, Tools und Evaluationskriterien.
Behalten Sie im Blick:
- Task-Abschlussrate
- Erfolgsrate beim ersten Versuch
- Antwortzeit
- Tool-Use-Fehlschläge
- Zeit für menschliche Korrekturen
- Verbrauch von Input und Output
- Konsistenz über wiederholte Läufe hinweg
- Qualität der finalen Ablieferung
Das beste Modell ist nicht zwangsläufig das mit den meisten Parametern oder der höchsten durchschnittlichen Benchmark-Punktzahl. Es ist das Modell, das Ihre spezifischen Tasks zuverlässig zu einem akzeptablen Preis erledigt.
Fazit
Qwen3.8-Max kombiniert eine gemeldete 2,4-Billionen-Parameter-Skala mit autonomem Codieren, Planung über Langzeithorizonte, multimodaler Reasoning, einem Kontextfenster von einer Million Tokens und wettbewerbsfähigen API-Preisen.
Die offiziellen Benchmarks zeigen einen spürbaren Fortschritt gegenüber Qwen3.7-Max bei Coding-Agents, professionellen Workflows, General Reasoning, Dokumentenverständnis und visuellen Aufgaben. Qwen hat außerdem Open-Weight-Releases für sowohl Qwen3.8-Max als auch Qwen3.8-27B angekündigt.
Die entscheidende Frage bleibt nicht, ob das Modell in der Ankündigung beeindruckend wirkt. Es geht darum, ob unabhängige Evaluierungen und reale Produktionsnutzer die gemeldete Leistung reproduzieren können.
Für den Moment ist Qwen3.8-Max eines der wichtigsten Modelle, die man im Blick behalten sollte – und ein starker Kandidat für kontrollierte Tests in Coding-, Forschungs- und Agenten-Workflows.
Häufig gestellte Fragen
Was ist Qwen3.8-Max?
Qwen3.8-Max ist das Flaggschiff-KI-Modell von Alibaba für fortgeschrittenes Reasoning, autonomes Codieren, multimodale Analyse und Workflows für langlaufende Agenten. Es hat ungefähr 2,4 Billionen Gesamtparameter.
Wie hoch ist der Qwen3.8-Max API-Preis?
Offizielle Preise sind 2 $ pro Million Input-Tokens, 6 $ pro Million Output-Tokens und 0,25 $ pro Million Tokens für implizites Caching.
Unterstützt Qwen3.8-Max Bilder und Videos?
Ja. Qwen3.8-Max unterstützt Text-, Bild- und Video-Inputs. Qwen positioniert Vision als Teil einer kontinuierlichen Planungs- und Self-Correction-Schleife für KI-Agenten.
Wie groß ist das Qwen3.8-Max Kontextfenster?
Öffentliche Qwen-Code-Integrationsinformationen haben ein Kontextfenster von ungefähr einer Million Tokens genannt. Die tatsächlichen Limits sollten für die konkrete Plattform oder den API-Endpunkt, der verwendet wird, verifiziert werden.
Ist Qwen3.8-Max Open Source?
Qwen hat angekündigt, dass die Open Weights von Qwen3.8-Max nach der Ankündigung vom 3. August veröffentlicht werden. Entwickler sollten das finale Repository, die Lizenz und die Verfügbarkeit der Checkpoints prüfen, bevor sie ein lokales Deployment planen.
Was ist Qwen3.8-27B?
Qwen3.8-27B ist ein kleineres Modell, das zusammen mit Qwen3.8-Max angekündigt wurde. Qwen hat erklärt, dass es ebenfalls mit Open Weights veröffentlicht wird – möglicherweise macht das es praktischer für ein lokales oder privates Deployment.

