Claude Opus 5.5: costi di esercizio più bassi del 40% con prestazioni frontier

Che cosa è

Anthropic ha rilasciato Claude Opus 5.5, primo modello della famiglia Claude 5.5 (annuncio datato 22 settembre 2026). Secondo la pagina ufficiale, lavora ai livelli di Claude Fable 5.1 sulla maggior parte dei compiti, costa il 40% in meno da servire rispetto a Opus 5 ed è presentato come il nuovo modello leader della gamma. È il primo rilascio da quando l'azienda ha chiesto di rallentare la corsa della frontiera, ed è stato testato prima del lancio da valutatori esterni, tra cui Frontier Design e METR.

Cosa cambia

Prezzi, al ribasso su ogni voce:

  • Input: 4 $ per milione di token (Opus 5: 5 $)
  • Output: 20 $ (Opus 5: 25 $)
  • Cache read: 0,20 $ (Opus 5: 0,50 $, cioè -60%)
  • Cache write: 5 $ (Opus 5: 6,25 $)
  • Fast mode: fino a 2,5x di velocità, a 8 $ per input e 40 $ per output

La riga che conta per chi lavora con agenti è quella delle cache read: secondo Anthropic rappresentano la maggior parte dei costi di coding e lavoro agentico. L'output arriva inoltre oltre il 30% più veloce rispetto a Opus 5.

Il risparmio non è solo sul listino. Il 40% dichiarato nasce dall'incrocio tra token più economici e meno token per task. Gli esempi della fonte: audit e correzione di una codebase da 200.000 righe in meno di tre ore, contro oltre 20 ore e 2,5 volte i token di Opus 5; la traduzione di HAProxy da C a Rust conclusa in 9,5 ore contro le 12 di Fable 5.1, con il 51% di costo in meno e quasi tutti i test di regressione del progetto superati.

Benchmark. Nei test riportati Opus 5.5 guida: 66,4% su Terminal-Bench 4.0 (a sforzo xhigh), 54,4% su FrontierCode v1.1, 57,8% su CursorBench 4.0, 81,8% parziale su OSWorld 2.0, 1846 punti su GDPval-AA v2.1. Due avvertenze, entrambe nella fonte:

  1. Anthropic ammette che a questi livelli di capacità i margini sono una guida sempre meno affidabile e che in uso reale il divario con Fable 5.1 è più stretto di quanto dicano i punteggi.
  2. Le valutazioni girano con i safeguard di produzione attivi: quando intervenivano, i task di cybersecurity passavano a Opus 4.8 e quelli di biologia e sviluppo di LLM a Opus 5, con probabile penalizzazione del risultato. Su AutomationBench, eseguito da Zapier senza modelli di fallback, gli interventi dei safeguard contavano come fallimenti.

Non è primo ovunque: su Terminal-Bench-Science 0.1 GPT-6 Astra segna 64,6% contro il 58,7%, e su AutomationBench Astra chiude al 41,4% contro il 40,0%.

Sicurezza. Migliori punteggi di sempre nell'audit comportamentale automatizzato di Anthropic, minore propensione ad azioni difficili da invertire e più resistenza al prompt injection rispetto a Opus 5. Essendo paragonabile a Claude Mythos 5.1 in biologia e cybersecurity, viene erogato con safeguard simili a quelli di Fable 5.1: le organizzazioni approvate possono già candidarsi al Life Sciences Verification Program, l'espansione del Cyber Verification Program è annunciata per le prossime settimane.

Abbonamenti. Limiti di utilizzo a cinque ore in aumento su Pro, Max, Team e piani Enterprise per postazione, più un reset dei rate limit che puoi salvare e usare quando preferisci.

A chi serve davvero

Se mandi in produzione carichi agentici o di coding via API, è qui che si gioca la partita. Cache read a 0,20 $ e meno token per task si sommano sui volumi: su FrontierCode a sforzo predefinito il modello batte GPT-6 Astra a circa il 20% del costo per task, e su Terminal Bench 4.0 lo aggancia a circa il 40%.

Puoi invece rimandare se il tuo carico è ricerca scientifica agentica o automazione di workflow: i numeri della fonte mostrano GPT-6 Astra avanti su quei terreni. E se lavori già con Fable 5.1 senza problemi di budget, la stessa Anthropic suggerisce che la differenza in uso reale è contenuta: il guadagno è soprattutto di efficienza, non di capacità. Sonnet 5.5 e Haiku 5.5 arriveranno nelle prossime settimane con molti degli stessi miglioramenti: se Opus è più di quanto ti serva, sono un'attesa ragionevole.

Sul piano pratico, il fast mode è disponibile in Claude Code e sulla Claude Platform.

Alternative

  • Claude Fable 5.1: capacità comparabile sulla maggior parte dei compiti secondo la stessa fonte, a costi più alti.
  • GPT-6 Astra: avanti su Terminal-Bench-Science e AutomationBench nei dati riportati.
  • GPT-5.6 Sol: sui benchmark elencati resta indietro rispetto a Opus 5.5 e ad Astra.
  • Opus 5: superato dal successore sia in prestazioni sia in prezzo.

Il dibattito della community è raccolto nella discussione su Hacker News.


lillodipiazza

Scritto da

Sviluppo backend e strumenti interni. Scrivo qui le note che vorrei aver trovato io mentre risolvevo il problema.

Lascia un commento

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *