Claude Sonnet 5.5: benchmark, prezzi, funzionalità e novità

claude-sonnet-5-5

Claude Sonnet 5.5 è il modello di Anthropic orientato all’efficienza per il lavoro professionale quotidiano. Pubblicato il 28 settembre 2026, si colloca sotto Opus 5.5 per i problemi aperti più difficili, ma porta guadagni concreti in programmazione, creazione di documenti, comprensione delle immagini e attività di lunga durata. Le modifiche più pratiche sono anche le più semplici: secondo Anthropic genera output con oltre il 30% di velocità in più rispetto a Sonnet 5, mantiene gli stessi prezzi dei token API e può costare fino al 30% in meno per attività completate perché spesso usa meno token.

È pensato per chi vuole un modello capace per un lavoro ben definito, senza pagare Opus a ogni richiesta. La scelta del modello raramente riguarda solo il punteggio di benchmark più alto: latenza, retry, uso dei token e revisione umana possono incidere di più sul costo reale di un flusso di lavoro.

Claude Sonnet 5.5 a colpo d’occhio

Dettaglio Claude Sonnet 5.5
Data di rilascio 28 settembre 2026
Nome modello API claude-sonnet-5-5
Prezzo input standard $2 per 1M token
Prezzo output standard $10 per 1M token
Prezzo lettura cache $0.20 per 1M token
Prezzo scrittura cache $2.50 per 1M token
Adatto per Coding ben definito e attività professionali
Disponibilità Prodotti Claude, Claude Platform, AWS, Google Cloud e Microsoft Azure

Questi dati provengono da l’annuncio di Sonnet 5.5 di Anthropic. I prezzi dei provider cloud e le condizioni di accesso possono variare, quindi i team dovrebbero verificare la piattaforma che usano davvero prima di stimare i costi di produzione.

Cosa è cambiato rispetto a Sonnet 5?

L’aggiornamento è più forte proprio dove un modello deve svolgere un lavoro anziché limitarsi a rispondere a una domanda. Anthropic evidenzia correzioni di bug, documenti rifiniti, presentazioni, fogli di calcolo, design visivo e attività più lunghe. Sonnet 5.5 supporta anche uno sforzo regolabile: impostazioni più basse privilegiano velocità e minore uso di token, mentre impostazioni più alte consentono più ragionamento e controlli. Anthropic imposta Medium come predefinito in Claude Code e nelle sue app, mentre Claude Platform prevede High di default.

Le principali affermazioni su velocità e costi richiedono un’attenzione particolare nella formulazione. “Più del 30% più veloce” si riferisce alla generazione dell’output rispetto a Sonnet 5. “Fino al 30% in meno” si riferisce al costo osservato da Anthropic per attività, non a uno sconto su ogni singolo token. Il prezzo API indicato resta di $2 per un milione di token in input e $10 per un milione di token in output, quindi i risparmi effettivi dipendono da se il nuovo modello completa il tuo lavoro con risposte più brevi, meno retry o meno chiamate a strumenti.

claude-sonnet-5-5-benchmarks-features

Benchmark di Claude Sonnet 5.5

Anthropic ha pubblicato diverse valutazioni che coprono sia coding agentico sia attività di knowledge work. Mostrano un miglioramento significativo rispetto a Sonnet 5 in alcuni contesti e risultati vicini a Opus in altri.

Benchmark Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0 70.6% 10.3% 66.4% Non riportato
FrontierCode 1.1 Main 46.2% a Max 42.4% 54.4% 49.3%; 52.1% a Xhigh
CursorBench 4.0 55.5% 34.1% 57.8% Non riportato
GDPval-AA v2.1 1844 1449 1846 1487
AA-Briefcase v1.1 1811 1359 1822 1483

La tabella è utile, ma non è una classifica universale. Le impostazioni di sforzo, i sistemi di agenti, gli strumenti, le misure di sicurezza e i metodi di scoring variano. Anthropic nota anche che più ragionamento non sempre migliora i risultati: in FrontierCode, Sonnet 5.5 a Max a volte ha apportato modifiche al di fuori dell’ambito richiesto. La configurazione migliore produce un risultato accettabile con modifiche controllate, non necessariamente quello che spende più risorse di calcolo.

Coding e lavoro con agenti

Il risultato di Sonnet 5.5 del 70,6% su Terminal-Bench 4.0 è il numero più accattivante del rilascio, ma il flusso di lavoro che lo circonda conta più del titolo. Per uno sviluppatore, un modello di coding utile deve comprendere il repository, apportare una modifica mirata, eseguire controlli appropriati e fermarsi prima di espandere il compito. La velocità è preziosa solo quando l’output resta facile da rivedere.

Questo rende Sonnet 5.5 un candidato sensato per attività “a confine” come diagnosticare un bug, implementare una funzionalità chiaramente specificata, rivedere una pull request o rifattorizzare un componente noto. Migrazioni importanti e decisioni architetturali ambigue potrebbero comunque trarre vantaggio da Opus 5.5, che Anthropic posiziona esplicitamente per un giudizio sostenuto. Una valutazione equa dovrebbe quindi usare attività reali sul repository e misurare correttezza, modifiche non necessarie, tempo trascorso, token totali e tempo di revisione umana.

Documenti, fogli di calcolo e knowledge work

Il rilascio è altrettanto rilevante anche al di fuori dello sviluppo software. Anthropic descrive Sonnet 5.5 come forte nella creazione di documenti, slide e fogli di calcolo, mentre i risultati GDPval-AA e AA-Briefcase sono pensati per riflettere il lavoro professionale di tipo knowledge. Questi punteggi non dimostrano che ogni report sarà accurato, ma supportano la fase di test del modello su attività strutturate con materiale di partenza chiaro e un output verificabile.

Un flusso di lavoro pratico potrebbe iniziare con diversi report, note di riunione e un foglio di calcolo, poi chiedere al modello di individuare accordi e contraddizioni, estrarre i dati con riferimenti alle fonti e preparare una sintesi esecutiva. La salvaguardia importante è la verifica: le affermazioni numeriche dovrebbero essere controllate rispetto alla fonte e le conclusioni conseguenti richiedono comunque una revisione umana qualificata. Se la prima sfida è organizzare materiale eterogeneo, AI Summarizer di iWeaver può aiutare a trasformare PDF, documenti, pagine web, audio, immagini e video in riassunti o note strutturate prima di un’analisi più profonda.

Prezzi nel contesto

Sonnet 5.5 e GPT-6 Sol condividono lo stesso prezzo di listino standard: $2 per un milione di token in input e $10 per un milione di token in output. Opus 5.5 costa rispettivamente $4 e $20. Queste cifre rendono Sonnet interessante per attività ripetute e ben definite, ma un confronto basato solo sul costo per token è incompleto. La dimensione del contesto, la cache, le commissioni per strumenti, lo sforzo di ragionamento, le esecuzioni fallite e la lunghezza dell’output incidono tutti sulla fattura finale.

Per la valutazione in produzione, scegli un insieme rappresentativo di attività e registra il costo totale per attività, non solo il prezzo per token. Un modello più economico che richiede correzioni ripetute può costare più del previsto, mentre un modello più caro può essere conveniente quando completa un’attività ad alto valore in un’unica passata. Lo stesso set di test dovrebbe anche essere rieseguito dopo gli aggiornamenti del modello, perché il comportamento del provider e le configurazioni di deployment possono cambiare.

Vale la pena usare Claude Sonnet 5.5?

Vale la pena testare Sonnet 5.5 se gran parte del tuo lavoro è chiaramente delimitato e se apprezzi reattività, prezzi API prevedibili e performance solide sia in coding sia nella creazione di documenti. È meno ovvio come scelta predefinita quando il problema è ambiguo, quando il costo di un errore sottile è alto o quando il compito dipende da un giudizio mantenuto per molte fasi; in questi casi, si è più vicini al ruolo dichiarato di Opus 5.5.

La conclusione più forte non è che Sonnet 5.5 “superi” ogni alternativa. È che Anthropic ha ridotto il divario tra i suoi livelli everyday e premium, mantenendo però una differenza di prezzo significativa. Usa i benchmark per decidere cosa merita una prova, poi scegli in base alle tue fonti, prompt, standard di revisione e costo totale delle attività. Per una decisione diretta sul livello, vedi Claude Sonnet 5.5 vs Opus 5.5; per idee di configurazione, continua con Come usare Claude Sonnet 5.5.