Anthropic ha presentato Claude Opus 5.5, il primo modello della nuova famiglia Claude 5.5. Secondo quanto riportato nella pagina ufficiale dell’azienda, il modello raggiunge prestazioni paragonabili a Claude Fable 5.1 sulla maggior parte delle attività, ma con un costo di esecuzione inferiore del 40% rispetto a Opus 5. È il primo rilascio dopo l’appello dell’azienda a “rallentare la frontiera” e arriva dopo test condotti da valutatori esterni, tra cui Frontier Design e METR.
Cosa cambia rispetto a Opus 5
Le migliorie annunciate riguardano tre aree principali: prestazioni, sicurezza e costi. Sul fronte delle prestazioni, Anthropic descrive Opus 5.5 come un passo avanti significativo rispetto a Opus 5, con early tester che hanno registrato forti incrementi su attività complesse. Un tester avrebbe completato una migrazione di codice da 680.000 righe in meno di un giorno, un lavoro che secondo l’azienda avrebbe richiesto settimane a un team di ingegneri. In un altro caso, incaricato di ridurre i tempi di caricamento di ogni pagina di un’app web, Opus 5.5 avrebbe avuto successo in 39 tentativi su 40, mentre Opus 5 avrebbe prodotto miglioramenti minori alterando il comportamento dell’applicazione.
Sicurezza e allineamento
Sul piano della sicurezza, Anthropic afferma che Opus 5.5 ottiene i migliori risultati di sempre nel proprio audit comportamentale automatizzato, una suite che testa il modello su migliaia di scenari simulati. Il modello sarebbe meno propenso a compiere azioni difficili da invertire o a uscire dai limiti assegnati, e più resistente agli attacchi di prompt injection rispetto a Opus 5. L’azienda ha inoltre ampliato i test di allineamento per coprire attività più lunghe, compiti impossibili e scenari ispirati a incidenti reali, pur riconoscendo che permangono dei limiti. I dettagli completi sono disponibili nella System Card di Opus 5.5.
Poiché Opus 5.5 è comparabile a Claude Mythos 5.1 in biologia e cybersecurity, Anthropic lo distribuisce con salvaguardie simili a quelle di Claude Fable 5.1. Le organizzazioni verificate possono fare domanda al Life Sciences Verification Program per utilizzarlo nella ricerca biologica; nelle prossime settimane sarà ampliato anche l’accesso al Cyber Verification Program per i professionisti verificati della sicurezza informatica.
Costi, velocità e comunicazione
Opus 5.5 richiede meno potenza di calcolo per essere servito rispetto a Opus 5. Secondo i test di Anthropic, con le impostazioni predefinite costa il 40% in meno su carichi di lavoro tipici. I token di input e output sono tariffati a 4 e 20 dollari per milione, il 20% in meno rispetto a Opus 5. Le letture dalla cache, che costituiscono la maggior parte dei costi per attività agentiche e di coding, costano 0,20 dollari per milione di token, il 60% in meno. Il modello genera inoltre output oltre il 30% più velocemente di Opus 5.
In aggiunta alla riduzione dei prezzi, Anthropic aumenta i limiti di utilizzo su cinque ore per i piani Pro, Max, Team ed Enterprise basati su postazione, e offre agli utenti in abbonamento un reset del limite di velocità che può essere salvato e utilizzato quando si preferisce.
Sul piano della comunicazione, Opus 5.5 scriverebbe in modo più naturale rispetto ai modelli precedenti, mettendo le informazioni più importanti in evidenza e rendendo il lavoro più facile da seguire e verificare nelle sessioni lunghe. Un early tester ha commentato che “scrive come scrivo io”.
Disponibilità e prospettive
Claude Sonnet 5.5 e Claude Haiku 5.5 seguiranno nelle prossime settimane, con molte delle stesse migliorie in termini di prestazioni, efficienza e sicurezza. Anthropic sottolinea che, a questi livelli di capacità, i margini nei benchmark sono diventati una guida meno affidabile per le differenze nel mondo reale, e che il divario tra Opus 5.5 e Claude Fable 5.1 è più stretto di quanto i punteggi suggeriscano.
È disponibile anche una modalità veloce per Opus 5.5 in Claude Code e sulla Claude Platform, con velocità fino a 2,5 volte superiore, al costo di 8 dollari per milione di token di input e 40 dollari per milione di token di output.
Per chi sviluppa software, gestisce infrastrutture o lavora con agenti AI, la combinazione di costi inferiori, maggiore velocità e migliori capacità di coding e uso del computer può tradursi in un impatto concreto sui flussi di lavoro. Restano da verificare in modo indipendente le prestazioni reali su casi d’uso specifici e l’efficacia delle salvaguardie annunciate. Maggiori dettagli sono disponibili nella pagina ufficiale di Anthropic.
