Claude Sonnet 5.5 : benchmarks, prix, fonctionnalités & nouveautés

claude-sonnet-5-5

Claude Sonnet 5.5 est le modèle d’Anthropic axé sur l’efficacité, conçu pour le travail professionnel du quotidien. Lancé le 28 septembre 2026, il se positionne en dessous de Opus 5.5 pour les problèmes ouverts les plus difficiles, mais il apporte des gains concrets en matière de codage, de création de documents, de compréhension d’images et de tâches longues. Les changements les plus utiles sont assez directs : selon Anthropic, il génère des réponses plus de 30 % plus vite que Sonnet 5, conserve les mêmes prix de jetons pour l’API, et peut coûter jusqu’à 30 % moins par tâche terminée, car il utilise souvent moins de jetons.

Il est conçu pour les personnes qui veulent un modèle performant pour des tâches bien définies, sans payer Opus à chaque requête. Le choix du modèle ne dépend d’ailleurs que rarement du seul score de benchmark le plus élevé : la latence, les tentatives (retries), l’usage des jetons et la validation humaine peuvent avoir un impact plus important sur le coût réel d’un workflow.

Claude Sonnet 5.5 : aperçu rapide

Détail Claude Sonnet 5.5
Date de sortie 28 septembre 2026
Nom du modèle API claude-sonnet-5-5
Prix d’entrée standard 2 $ pour 1 M de jetons
Prix de sortie standard 10 $ pour 1 M de jetons
Prix de lecture du cache 0,20 $ pour 1 M de jetons
Prix d’écriture du cache 2,50 $ pour 1 M de jetons
Meilleure adéquation Codage ciblé et tâches professionnelles
Disponibilité Produits Claude, Claude Platform, AWS, Google Cloud et Microsoft Azure

Ces chiffres proviennent de l’annonce de Sonnet 5.5 par Anthropic. Les tarifs et conditions d’accès des fournisseurs cloud peuvent varier ; les équipes doivent donc vérifier la plateforme qu’elles utilisent réellement avant d’estimer les coûts de production.

Qu’est-ce qui a changé par rapport à Sonnet 5 ?

La mise à jour est la plus marquante dans les situations où un modèle doit effectuer un travail, plutôt que simplement répondre à une question. Anthropic met en avant la correction de bugs, des documents finalisés, des présentations, des tableurs, le design visuel et des tâches plus longues. Sonnet 5.5 prend aussi en charge un effort ajustable : des réglages plus bas privilégient la vitesse et la baisse de la consommation de jetons, tandis que des réglages plus élevés permettent davantage de raisonnement et de vérification. Anthropic définit Medium par défaut dans Claude Code et ses applications, tandis que Claude Platform utilise High par défaut.

Les affirmations principales sur la vitesse et les coûts doivent être formulées avec précision. « 30 % + plus rapide » fait référence à la génération de la sortie par rapport à Sonnet 5. « Jusqu’à 30 % moins cher » fait référence au coût observé par Anthropic pour une tâche, et non à une remise appliquée à chaque jeton. Le prix API indiqué reste à 2 $ pour un million de jetons d’entrée et à 10 $ pour un million de jetons de sortie ; les économies réelles dépendent donc du fait que le nouveau modèle termine votre travail avec des réponses plus courtes, moins de tentatives, ou moins d’appels d’outils.

claude-sonnet-5-5-benchmarks-features

Benchmarks de Claude Sonnet 5.5

Anthropic a publié plusieurs évaluations couvrant le codage « agentique » et le travail de connaissance. Elles montrent une amélioration importante par rapport à Sonnet 5 dans certains environnements et des résultats proches d’Opus dans d’autres.

Benchmark Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0 70,6 % 10,3 % 66,4 % Non communiqué
FrontierCode 1.1 Main 46,2 % à Max 42,4 % 54,4 % 49,3 % ; 52,1 % à Xhigh
CursorBench 4.0 55,5 % 34,1 % 57,8 % Non communiqué
GDPval-AA v2.1 1844 1449 1846 1487
AA-Briefcase v1.1 1811 1359 1822 1483

Ce tableau est utile, mais il ne s’agit pas d’un classement universel. Les réglages d’effort, les environnements « agent », les outils, les garde-fous et les méthodes de scoring varient. Anthropic indique aussi que plus de raisonnement n’a pas toujours amélioré les résultats : sur FrontierCode, Sonnet 5.5 à Max a parfois apporté des modifications en dehors du périmètre demandé. La meilleure configuration produit un résultat acceptable avec des modifications maîtrisées, pas forcément celui qui dépense le plus de calcul.

Codage et travail d’agent

Le résultat de 70,6 % de Sonnet 5.5 sur Terminal-Bench 4.0 est le chiffre le plus marquant du lancement, mais le workflow autour compte davantage que le titre. Pour un développeur, un modèle de codage utile doit comprendre le dépôt, effectuer une modification ciblée, exécuter les vérifications appropriées et s’arrêter avant d’étendre la tâche. La vitesse n’a de valeur que si la sortie reste simple à relire.

C’est pour cela que Sonnet 5.5 est un candidat logique pour des tâches cadrées, comme diagnostiquer un bug, implémenter une fonctionnalité clairement spécifiée, relire une pull request ou refactoriser un composant connu. Les grandes migrations et les décisions architecturales ambiguës peuvent toutefois continuer de tirer avantage d’Opus 5.5, qu’Anthropic positionne explicitement pour le jugement continu. Une évaluation équitable devrait donc utiliser des tâches réelles sur des dépôts et mesurer la justesse, les modifications inutiles, le temps écoulé, le nombre total de jetons et le temps de validation humaine.

Documents, tableurs et travail de connaissance

La sortie est tout aussi pertinente en dehors du développement logiciel. Anthropic décrit Sonnet 5.5 comme performant pour créer des documents, des slides et des tableurs, tandis que les résultats GDPval-AA et AA-Briefcase visent à refléter le travail de connaissance professionnel. Ces scores ne prouvent pas que chaque rapport sera exact, mais ils appuient l’idée de tester le modèle sur des tâches structurées avec des sources claires et une livraison vérifiable.

Un workflow pratique pourrait commencer par plusieurs rapports, des notes de réunion et un tableur, puis demander au modèle d’identifier les accords et les contradictions, d’extraire les chiffres avec des références de sources, et de rédiger un brief exécutif. Le garde-fou essentiel est la vérification : les affirmations numériques doivent être contrôlées par rapport à la source, et les conclusions importantes nécessitent encore une validation humaine qualifiée. Si le premier défi consiste à organiser du contenu provenant de sources hétérogènes, AI Summarizer d’iWeaver peut aider à transformer des PDFs, documents, pages web, audios, images et vidéos en résumés ou en notes structurées avant une analyse plus approfondie.

Les prix, dans leur contexte

Sonnet 5.5 et GPT-6 Sol partagent la même liste de prix standard : 2 $ pour un million de jetons d’entrée et 10 $ pour un million de jetons de sortie. Opus 5.5 coûte respectivement 4 $ et 20 $. Ces chiffres rendent Sonnet intéressant pour des tâches répétées et bien définies, mais la comparaison « coût par jeton » est incomplète. La taille du contexte, le cache, les frais liés aux outils, l’effort de raisonnement, les exécutions échouées et la longueur de la sortie influencent tous la facture finale.

Pour une évaluation en conditions de production, choisissez un ensemble représentatif de tâches et enregistrez le coût total par tâche, plutôt que de vous limiter au prix par jeton. Un modèle moins cher qui nécessite des corrections répétées peut coûter plus que prévu, tandis qu’un modèle plus cher peut être plus économique lorsqu’il termine une tâche à forte valeur en une seule passe. Le même jeu de tests doit aussi être relancé après les mises à jour du modèle, car le comportement des fournisseurs et les configurations de service peuvent changer.

Claude Sonnet 5.5 en vaut-il la peine ?

Sonnet 5.5 vaut la peine d’être testé si la majeure partie de votre travail est clairement cadrée et que vous accordez de l’importance à la réactivité, à une tarification API prévisible et à de solides performances en codage ou sur les documents. C’est moins évident comme choix par défaut lorsque le problème est ambigu, que le coût d’une erreur subtile est élevé, ou que la tâche dépend d’un jugement maintenu sur de nombreuses étapes : dans ces cas, on se rapproche davantage du rôle annoncé d’Opus 5.5.

La conclusion la plus solide n’est pas que Sonnet 5.5 « surpasse » toutes les alternatives. C’est plutôt qu’Anthropic a réduit l’écart entre ses offres du quotidien et ses offres premium tout en conservant une différence de prix significative. Utilisez les benchmarks pour décider ce qui mérite un essai, puis choisissez selon vos sources, vos prompts, vos standards de relecture et le coût total des tâches. Pour une décision directe sur les niveaux, consultez Claude Sonnet 5.5 vs Opus 5.5. Pour des idées de configuration, continuez avec How to Use Claude Sonnet 5.5.