Solo il minimo indispensabile: Opusfived sfida Claude a cambiare un bottone senza toccare altro

Che cosa è

Opusfived è un gioco a pagina singola costruito attorno a un compito minimalista. La homepage lo enuncia senza giri di parole:

Make the "Add to Cart" button blue. Do not let Claude change anything else.

Devi istruire Claude, il modello di Anthropic citato già nel titolo del progetto, perché colori di blu un bottone "Add to Cart". Il vincolo è il vero gioco: tutto il resto deve restare esattamente com'è. Il pulsante "Let's go" avvia la partita.

L'estratto automatico della fonte si ferma alla landing page: non indica autori, versione del modello, stack tecnico né un repository pubblico. C'è un link "About & Terms", ma il suo contenuto non è incluso nell'estrazione.

Cosa cambia

Non c'è una versione: è l'inversione di prospettiva a fare la differenza. Le demo di coding agent mostrano quasi sempre quanto un modello riesce a costruire in pochi minuti. Opusfived misura il contrario: quanto poco riesce a toccare quando glielo vieti espressamente.

Il dolore è quotidiano per chi usa strumenti come Claude Code o Cursor: chiedi una modifica di una riga e il diff torna con refactor, riformattazioni, commenti e funzioni che nessuno ha richiesto. Il titolo del progetto riproduce la richiesta archetipica che, nella pratica, finisce in un pomeriggio di review.

Sotto la battuta c'è un problema tecnico serio: i vincoli negativi sono tra le istruzioni più fragili per un LLM. "Non toccare altro" tende a essere ignorato; formulare il compito in positivo, delimitando con precisione il perimetro della modifica, è l'abilità che il gioco costringe a esercitare. Chi scrive prompt per agenti da un po' lo sa: la parte difficile non è ottenere il cambiamento, è ottenere soltanto quello.

L'attenzione non è di nicchia: la discussione su Hacker News ha superato i 900 punti.

Quello che la fonte non dice, e che determinerebbe il valore reale del gioco:

  • come rilevi le modifiche non richieste: diff del codice, confronto del DOM, verifica visiva;
  • se dietro le quinte lavora il vero Claude via API o un modello simulato;
  • se esistono livelli, punteggi o limiti di tentativi;
  • chi l'abbia sviluppato e con quale stack.

Come si prova

Niente da installare. Apri opusfived.dev e premi "Let's go". La fonte non riporta comandi, requisiti né istruzioni alternative: l'unico accesso è dal browser.

A chi serve davvero

Ti serve se usi assistenti AI per scrivere codice. È un esercizio a costo zero sull'unica competenza che conta davvero con i coding agent: dare vincoli precisi e verificare che vengano rispettati. Dieci minuti qui valgono più di mille teorie sul prompt engineering.

Può funzionare anche in team, come rompighiaccio tecnico o come spunto per definire i criteri con cui accettare o rifiutare le modifiche proposte dal modello in code review.

Puoi ignorarlo se non usi LLM nel tuo flusso di lavoro, o se cerchi una valutazione rigorosa dei modelli: è un gioco, non un benchmark. La fonte non documenta alcuna metodologia di misura, quindi i risultati non dicono nulla di generalizzabile sulla bontà di Claude o di altri modelli.

Alternative

  • Gandalf di Lakera: altro gioco a tema prompting, ma centrato sull'estrazione di un segreto via prompt injection, non sulla modifica minima del codice.
  • La documentazione di prompt engineering di Anthropic: la controparte seria, se il gioco ti lascia la voglia di capire quali formulazioni di vincolo funzionano davvero.
  • Il thread su Hacker News: il posto dove seguire la discussione e leggere le reazioni di chi l'ha affrontato.

lillodipiazza

Scritto da

Sviluppo backend e strumenti interni. Scrivo qui le note che vorrei aver trovato io mentre risolvevo il problema.

Lascia un commento

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *