Claude Sonnet 5.5 punta su velocità, efficienza e coding agentico

Che cosa è

Anthropic ha annunciato Claude Sonnet 5.5, secondo modello della famiglia Claude 5.5. È il gradino intermedio della gamma: un complemento più rapido ed economico di Opus 5.5, pensato per compiti quotidiani ben delimitati — fix di bug, documenti, slide e fogli di calcolo — mentre Opus resta orientato al lavoro complesso che richiede giudizio continuo. Haiku 5.5, la fascia per gli alti volumi, è atteso "nelle prossime settimane".

Cosa cambia

Il salto più netto è nel coding agentico. I numeri dell'annuncio:

  • Terminal-Bench 4.0: 70,6%, contro il 10,3% di Sonnet 5 e il 66,4% di Opus 5.5.
  • FrontierCode 1.1 (Main): 46,2% al livello di sforzo Max; a High fa 10 punti più di Sonnet 5 a parità di impostazione, a circa un quindicesimo del costo per task.
  • CursorBench 4.0: 55,5%, a circa due punti dal 57,8% di Opus 5.5.
  • GDPval-AA v2.1 (knowledge work): a due punti da Opus 5.5.
  • OSWorld 2.1 (computer use): 80,1% contro il 57,0% di Sonnet 5.
  • Chartography (lettura di grafici, senza tool): 61,6% contro il 15,6% di Sonnet 5.

Due avvertenze sui confronti. Su Terminal-Bench e CursorBench i grafici usano i punteggi di GPT-5.6 Sol, perché OpenAI non ha pubblicato quelli di GPT-6 Sol. E i benchmark sono valutazioni curate da Anthropic, che essa stessa ricorda catturare una sola sfaccettatura del modello: nei test interni e di tester esterni, Opus 5.5 resta chiaramente più forte sul lavoro complesso e aperto.

Il secondo fronte è l'efficienza. Il prezzo per token non cambia: 2 dollari per milione di token in input, 10 in output, 0,20 per le letture di cache, identici a Sonnet 5. Cambiano i token necessari: nei test di Anthropic il costo per task scende fino al 30%, e la generazione dell'output è oltre il 30% più veloce, il che ne fa il Sonnet più rapido finora rilasciato.

Il dettaglio più utile per chi usa la piattaforma sono i livelli di sforzo (effort). A Low o Medium, Sonnet 5.5 supera il miglior punteggio di Sonnet 5 per circa un decimo del costo per task. Su AA-Briefcase, benchmark di knowledge work a lungo termine, a Medium batte Sonnet 5 per circa un nono del costo. Su FrontierCode a High — il default della piattaforma — eguaglia il miglior risultato di GPT-6 Sol per circa un quinto del costo.

C'è anche una prima assoluta sul fronte sicurezza: è il primo Sonnet a debuttare con safeguard cyber e fallback di fascia Opus, perché le sue capacità in quel dominio sono paragonabili a quelle di Opus 5. Gli safeguard sulla biologia restano quelli di Sonnet 5. In entrambi i casi mirano a un insieme ristretto di richieste ad alto rischio: lo sviluppo software ordinario non è toccato.

Infine, i tester segnalano che batcha le chiamate ai tool più di Sonnet 5: meno passi, meno token, stesso risultato. Curiosità utile a calibrare le aspettative sui compiti a lungo termine: è il primo modello Sonnet a completare Pokémon Red usando solo gli screenshot.

Come si prova

L'annuncio non include comandi né istruzioni di integrazione. Dalla fonte risulta in uso nelle app Claude, dove Medium è il livello di sforzo predefinito, e sulla piattaforma, dove il default è High. Per numeri completi e metodologia il riferimento è il System Card di Sonnet 5.5, collegato dall'annuncio.

A chi serve davvero

Se lavori tutti i giorni con Sonnet 5, il passaggio è quasi scontato: stesso prezzo per token, meno token per task, output più rapidi. CodeRabbit dichiara nelle note dell'annuncio che sposterà subito le review semplici e intermedie sul nuovo modello, per poi estendere la copertura nelle settimane successive.

Se oggi usi Opus 5.5 per progetti complessi, Anthropic ti dice esplicitamente di non cambiare. Il punto di forza di Sonnet 5.5 è il costo sui task ben delimitati, non il giudizio prolungato: conviene a livelli di sforzo bassi o medi, dove il rapporto capacità/dollaro è più favorevole.

Se il tuo carico è ad alto volume e sensibile al costo, aspetta Haiku 5.5: è la fascia pensata per quel caso d'uso, anche se la fonte non indica date precise né numeri.

Alternative

Nella stessa famiglia: Opus 5.5 per il lavoro aperto che richiede giudizio, Haiku 5.5 per il volume quando arriverà. Fuori, i confronti citati dall'annuncio sono con GPT-6 Sol — o GPT-5.6 Sol dove i dati pubblici mancano — ma restano tutti valutazioni di parte. La discussione su Hacker News (470 punti) è il posto dove cercare controverifiche indipendenti.


lillodipiazza

Scritto da

Sviluppo backend e strumenti interni. Scrivo qui le note che vorrei aver trovato io mentre risolvevo il problema.

Lascia un commento

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *