Claude Sonnet 5.5: Benchmarks, Preis, Funktionen & Neuigkeiten

claude-sonnet-5-5

Claude Sonnet 5.5 ist das auf Effizienz ausgerichtete Modell von Anthropic für die tägliche professionelle Arbeit. Es wurde am 28. September 2026 veröffentlicht und ist unter Opus 5.5 für die schwierigsten frei formulierten Probleme eingeordnet – bringt aber spürbare Verbesserungen bei der Codierung, der Erstellung von Dokumenten, beim Bildverständnis und bei lang laufenden Aufgaben. Die praktischsten Änderungen sind dabei recht unkompliziert: Anthropic sagt, es erzeugt Ausgaben mehr als 30% schneller als Sonnet 5, behält die gleichen API-Token-Preise und kann pro erledigter Aufgabe bis zu 30% weniger kosten, weil es oft mit weniger Tokens auskommt.

Es ist für Menschen gedacht, die ein leistungsfähiges Modell für klar umrissene Aufgaben wollen, ohne bei jeder Anfrage für Opus zu zahlen. Die Wahl des Modells hängt selten nur vom höchsten Benchmark-Score ab; Latenz, Retries, Token-Nutzung und die menschliche Prüfung können sich stärker auf die echten Kosten eines Workflows auswirken.

Claude Sonnet 5.5 auf einen Blick

Detail Claude Sonnet 5.5
Veröffentlichungsdatum 28. September 2026
API-Modellname claude-sonnet-5-5
Standard-Eingabepreis 2$ pro 1M Tokens
Standard-Ausgabepreis 10$ pro 1M Tokens
Cache-Lese-Preis 0,20$ pro 1M Tokens
Cache-Schreibe-Preis 2,50$ pro 1M Tokens
Beste Einsatzfälle Gut abgegrenztes Coding und professionelle Aufgaben
Verfügbarkeit Claude-Produkte, Claude Platform, AWS, Google Cloud und Microsoft Azure

Diese Zahlen stammen aus Anthropics Sonnet 5.5-Ankündigung. Die Preisgestaltung und die Zugangsbedingungen der Cloud-Anbieter können abweichen – daher sollten Teams prüfen, welche Plattform sie tatsächlich nutzen, bevor sie Produktionskosten schätzen.

Was sich von Sonnet 5 aus geändert hat?

Das Update ist besonders stark dort, wo ein Modell Arbeit leisten muss – nicht nur eine Frage beantworten. Anthropic hebt Bugfixing, polierte Dokumente, Präsentationen, Tabellenkalkulationen, visuelles Design und längere Aufgaben hervor. Sonnet 5.5 unterstützt außerdem eine anpassbare „Effort“-Einstellung: Niedrigere Werte priorisieren Geschwindigkeit und geringere Token-Nutzung, während höhere Werte mehr Denken und Checks ermöglichen. Anthropic legt Medium als Standard in Claude Code und dessen Apps fest, während die Claude Platform standardmäßig auf High setzt.

Die Schlagzeilen zu Geschwindigkeit und Kosten brauchen eine sorgfältige Formulierung. „30%+ schneller“ bezieht sich auf die Generierung der Ausgabe im Vergleich zu Sonnet 5. „Bis zu 30% weniger“ bezieht sich auf die von Anthropic beobachteten Kosten pro Aufgabe – nicht auf einen Rabatt auf jedes einzelne Token. Der aufgelistete API-Preis bleibt 2$ pro Million Input-Tokens und 10$ pro Million Output-Tokens, sodass sich die tatsächlichen Einsparungen davon abhängen, ob das neue Modell Ihre Arbeit mit kürzeren Antworten, weniger Retries oder weniger Tool-Calls abschließt.

claude-sonnet-5-5-benchmarks-features

Benchmarks für Claude Sonnet 5.5

Anthropic hat mehrere Evaluationen veröffentlicht – von agentischem Coding bis hin zu Knowledge Work. Sie zeigen in manchen Umgebungen eine deutliche Verbesserung gegenüber Sonnet 5 und in anderen nahezu Opus-Ergebnisse.

Benchmark Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0 70,6% 10,3% 66,4% Nicht berichtet
FrontierCode 1.1 Main 46,2% bei Max 42,4% 54,4% 49,3%; 52,1% bei Xhigh
CursorBench 4.0 55,5% 34,1% 57,8% Nicht berichtet
GDPval-AA v2.1 1844 1449 1846 1487
AA-Briefcase v1.1 1811 1359 1822 1483

Die Tabelle ist hilfreich, aber sie ist kein universelles Ranking. Die Effort-Einstellungen, Agent-Harnesses, Tools, Schutzmechanismen und Bewertungsmethoden variieren. Anthropic weist außerdem darauf hin, dass mehr „Reasoning“ nicht immer die Ergebnisse verbessert hat: Bei FrontierCode führte Sonnet 5.5 bei Max manchmal zu Änderungen außerhalb des angeforderten Umfangs. Die beste Konfiguration liefert also ein akzeptables Ergebnis mit kontrollierten Änderungen – nicht unbedingt die, die die meiste Rechenleistung verbraucht.

Coding und Agent Work

Das Ergebnis von Sonnet 5.5 (70,6%) auf Terminal-Bench 4.0 ist die auffälligste Zahl der Veröffentlichung – aber der umgebende Workflow ist wichtiger als die Schlagzeile. Für eine Entwicklerin oder einen Entwickler muss ein nützliches Coding-Modell das Repository verstehen, eine gezielte Änderung vornehmen, passende Checks ausführen und stoppen, bevor es die Aufgabe ausweitet. Geschwindigkeit ist nur dann wirklich wertvoll, wenn die Ausgabe sich leicht prüfen lässt.

Das macht Sonnet 5.5 zu einem sinnvollen Kandidaten für klar begrenzte Aufgaben wie das Diagnostizieren eines Bugs, das Implementieren einer eindeutig spezifizierten Funktion, das Review eines Pull Requests oder das Refactoring einer bekannten Komponente. Große Migrationen und unklare Architekturentscheidungen können weiterhin von Opus 5.5 profitieren – das Anthropic ausdrücklich für anhaltendes Urteilsvermögen positioniert. Eine faire Bewertung sollte daher reale Repository-Aufgaben nutzen und Korrektheit, unnötige Änderungen, verstrichene Zeit, Gesamt-Tokens und die Zeit für menschliche Reviews messen.

Dokumente, Tabellenkalkulationen und Knowledge Work

Die Veröffentlichung ist auch außerhalb der Softwareentwicklung ebenso relevant. Anthropic beschreibt Sonnet 5.5 als stark bei der Erstellung von Dokumenten, Slides und Tabellen – während die GDPval-AA- und AA-Briefcase-Ergebnisse darauf abzielen, professionelles Knowledge Work abzubilden. Diese Scores beweisen nicht, dass jeder Report korrekt sein wird, aber sie unterstützen Tests des Modells bei strukturierten Aufgaben mit klarem Ausgangsmaterial und einem überprüfbaren Ergebnis.

Ein praktischer Workflow könnte mit mehreren Reports, Meeting-Notizen und einer Tabelle beginnen, dann das Modell bitten, Vereinbarungen und Widersprüche zu identifizieren, Kennzahlen mit Quellenbezug herauszuziehen und einen Executive Brief zu entwerfen. Die wichtigste Schutzmaßnahme ist die Verifikation: Numerische Aussagen sollten mit der Quelle abgeglichen werden, und weitreichende Schlussfolgerungen benötigen weiterhin eine qualifizierte menschliche Prüfung. Wenn die erste Herausforderung darin besteht, gemischtes Quellmaterial zu organisieren, kann der AI Summarizer von iWeaver helfen, PDFs, Dokumente, Webseiten, Audio, Bilder und Video in Zusammenfassungen oder strukturierte Notizen umzuwandeln – bevor es in die tiefere Analyse geht.

Preis im Kontext

Sonnet 5.5 und GPT-6 Sol teilen sich die gleiche Standard-Listenpreisstruktur: 2$ pro Million Input-Tokens und 10$ pro Million Output-Tokens. Opus 5.5 kostet entsprechend 4$ und 20$. Diese Zahlen machen Sonnet attraktiv für wiederholte, klar definierte Aufgaben, aber ein Vergleich nur nach Token-Rate ist unvollständig. Auch die Kontextgröße, Caching, Tool-Kosten, der Aufwand fürs Reasoning, fehlgeschlagene Läufe und die Länge der Ausgabe beeinflussen die finale Rechnung.

Wählen Sie für eine Produktionsevaluation daher eine repräsentative Auswahl an Aufgaben und erfassen Sie die gesamten Kosten pro Aufgabe – nicht allein den Preis pro Token. Ein günstigeres Modell, das wiederholt korrigiert werden muss, kann am Ende mehr kosten als erwartet, während ein teureres Modell wirtschaftlich sein kann, wenn es eine hochwertige Aufgabe in einem Durchlauf abschließt. Der gleiche Testsatz sollte zudem nach Modell-Updates erneut ausgeführt werden, weil sich das Verhalten der Anbieter und die Serving-Konfigurationen ändern können.

Lohnt sich die Nutzung von Claude Sonnet 5.5?

Sonnet 5.5 lohnt sich zum Testen, wenn der Großteil Ihrer Arbeit klar abgegrenzt ist und Sie auf Reaktionsfähigkeit, planbare API-Preise sowie eine starke Performance beim Coding oder in Dokumenten setzen. Weniger eindeutig ist es als Standard-Default, wenn das Problem mehrdeutig ist, die Kosten einer subtilen Fehlentscheidung hoch sind oder die Aufgabe über viele Stufen hinweg konsequentes Urteilsvermögen erfordert – diese Fälle liegen näher an der von Opus 5.5 beschriebenen Rolle.

Das stärkste Fazit ist nicht, dass Sonnet 5.5 „jede Alternative schlägt“. Es ist vielmehr, dass Anthropic die Lücke zwischen den alltäglichen und den Premium-Tiers enger gezogen hat – und dabei zugleich einen spürbaren Preisunterschied beibehalten hat. Nutzen Sie die Benchmarks, um zu entscheiden, was einen Test verdient, und wählen Sie dann anhand Ihrer eigenen Quellen, Prompts, Review-Standards und der gesamten Kosten pro Aufgabe. Für eine direkte Tier-Entscheidung sehen Sie Claude Sonnet 5.5 vs Opus 5.5; für Ideen zur Einrichtung geht es weiter mit How to Use Claude Sonnet 5.5.