Al momento stai visualizzando Claude Sonnet 5.5: più veloce, più economico e con un occhio al design

Claude Sonnet 5.5: più veloce, più economico e con un occhio al design

Anthropic ha presentato Claude Sonnet 5.5, il secondo modello della famiglia Claude 5.5. Si tratta di un aggiornamento rispetto a Claude Sonnet 5 che punta su tre leve concrete: velocità, costo per attività e qualità su compiti quotidiani ben definiti. Secondo quanto riportato nella nota di presentazione, il modello genera output oltre il 30% più rapidamente del predecessore e, in molte attività, costa fino al 30% in meno.

Cosa cambia rispetto a Sonnet 5

Il posizionamento è chiaro: Sonnet 5.5 non sostituisce Opus 5.5, ma lo affianca. Opus resta il modello pensato per lavori complessi e aperti, dove serve giudizio continuo; Sonnet 5.5 è invece ottimizzato per compiti ben delimitati, correzione di bug e produzione di documenti, slide e fogli di calcolo curati. La fonte sottolinea anche una particolare attenzione al design, aspetto non secondario per chi genera materiali destinati a essere presentati o condivisi.

Il modello è indicato come il più veloce della linea Sonnet fino ad oggi. Nelle settimane successive è previsto l’arrivo di Claude Haiku 5.5, pensato per applicazioni ad alto volume e sensibili ai costi.

I numeri dichiarati

Anthropic riporta alcuni risultati di benchmark che aiutano a inquadrare il salto rispetto a Sonnet 5:

  • Terminal-Bench 4.0, valutazione di coding agentico: 70,6% per Sonnet 5.5 contro 10,3% di Sonnet 5.
  • GDPval-AA, test su attività lavorative reali in diverse occupazioni: due punti sotto Opus 5.5.
  • FrontierCode, che misura se le modifiche al codice di un agente verrebbero accettate in merge: a sforzo alto Sonnet 5.5 eguaglia il miglior punteggio di GPT-6 Sol a circa un quinto del costo per attività.
  • CursorBench 4.0, su attività ambigue e multi-file tratte da sessioni reali di Cursor: il miglior punteggio di Sonnet 5.5 è a circa due punti da Opus 5.5.
  • AA-Briefcase, nuovo benchmark su lavoro di conoscenza a lungo orizzonte: a sforzo medio Sonnet 5.5 supera il miglior risultato di Sonnet 5 a circa un nono del costo per attività.

La fonte precisa che su alcune valutazioni Sonnet 5.5 a sforzo massimo arriva a prestazioni comparabili a Opus 5.5, ma avverte che i punteggi dei benchmark colgono solo una parte delle capacità di un modello: nei test interni ed esterni, Opus 5.5 resta più forte su lavoro complesso e aperto che richiede giudizio prolungato.

Prezzi e token

Il listino è identico a quello di Sonnet 5: 2 dollari per milione di token in input, 10 dollari per milione di token in output e 0,20 dollari per milione di token per le letture da cache. Il risparmio non arriva quindi dal prezzo unitario, ma dal fatto che il modello richiede in genere molti meno token per svolgere lo stesso lavoro. Nelle prove di Anthropic, il costo per attività risulta fino al 30% inferiore rispetto al predecessore.

Sicurezza e ambiti di utilizzo

Sul fronte della sicurezza, Sonnet 5.5 è il primo modello della linea Sonnet a debuttare con salvaguardie informatiche e fallback simili a quelli sviluppati per i modelli più capaci, perché le sue capacità in ambito cybersecurity sono comparabili a quelle di Opus 5. Le salvaguardie biologiche restano invece le stesse di Sonnet 5. In entrambi i casi si parla di misure mirate a una ristretta serie di richieste ad alto rischio: lo sviluppo software ordinario e la maggior parte del lavoro nelle scienze della vita non sarebbero interessati.

A chi può servire

Il profilo che emerge è quello di un modello adatto a chi lavora su iterazioni rapide, automazione di attività ripetitive e generazione di documenti o presentazioni pronte da condividere. La velocità e il minor consumo di token lo rendono interessante per team che fanno girare molti task al giorno e devono tenere sotto controllo i costi. Chi invece ha bisogno di ragionamento prolungato su problemi aperti dovrebbe continuare a guardare a Opus 5.5, come riconosce la stessa Anthropic.

Da verificare

I dati citati provengono dalla presentazione ufficiale e da test interni o di early tester, quindi vanno letti come dichiarazioni del fornitore e non come verifiche indipendenti. Restano da confermare sul campo la resa reale su progetti diversi dai benchmark, il comportamento nelle applicazioni in produzione e l’effettivo risparmio di token in base ai casi d’uso. La fonte non indica date precise per l’arrivo di Haiku 5.5, limitandosi a parlare delle prossime settimane.

Lascia un commento