Che cosa è
Google ha annunciato Gemini 3.8 Flash e 3.8 Flash Cyber, il terzo rilascio Flash in sei settimane: il 3.7 Flash era arrivato tre settimane prima. Il primo è il modello generalista per coding e agenti; il secondo è specializzato in cybersecurity, con mitigazioni più permissive, ed è riservato a un accesso approvato tramite il nuovo Fairwind Program. I due modelli condividono la stessa base: secondo Google, i guadagni di ragionamento e coding derivano anche dall'addestramento intensivo nel dominio della sicurezza.
Cosa cambia
Il punto più concreto per chi usa le API è il prezzo invariato: $0.75 per milione di token in input e $3.75 in output, come il 3.7. Leggi però la nota a piè di pagina: è un prezzo introduttivo che scade il 31 dicembre 2026. Dal 1° gennaio 2027 si passa a $1.50 e $7.50, il doppio.
I miglioramenti dichiarati riguardano software engineering, task agentici e ragionamento multi-step: supera la maggior parte dei modelli frontier più grandi su DeepSWE v1.1, fa registrare 54.9% su HLE-Verified e risultati su benchmark verticali come Vals Finance Agent V2 e Harvey's Legal Agent Benchmark.
Cambia anche la filosofia: "3.8 Flash works harder". Su task complessi il modello esegue più passi di ragionamento e chiama gli strumenti iterativamente, consumando più token ai livelli di effort alti. Se il tuo vincolo è il costo, puoi abbassare l'effort o restare sul 3.7, che Google dichiara pienamente supportato per i workload efficiency-first.
La novità più interessante è 3.8 Flash Cyber. Su CyberGym supererebbe il 3.5 Flash Cyber e modelli frontier più grandi. Su un benchmark interno — motivato dal fatto che CyberGym copre solo codebase C/C++ — Google dichiara un tasso di successo oltre il 70% su vulnerabilità in codebase che coprono 20 linguaggi. Sul patching, CWE-Bench (curato da Collinear) registra un pass@1 del 47.2% contro il 47.8% del miglior modello frontier, a costo significativamente inferiore.
I numeri d'uso interno sono i più concreti: il team Security di Chrome ottiene 2.6 volte più patch corrette rispetto ai migliori modelli commerciali più grandi; Wiz misura +7.5-9.7% di recall su un benchmark interno di penetration testing, con un costo 2.3-5.2 volte minore; il Cloud Vulnerability Research team trova una vulnerabilità critica e fondazionale in meno di 2 ore, dove di solito servono mesi. Sono affermazioni di Google su dati interni: nessuna è verificabile dal post.
Resta che Google non nomina i modelli con cui si confronta: "leading frontier models" e "best commercial models" restano anonimi, così come la metodologia dei benchmark interni.
Sul fronte safety, il 3.8 Flash integra mitigazioni contro usi impropri in ambito CBRN e cyber offense secondo il Frontier Safety Framework, e Google dichiara un salto nella robustezza al prompt injection misurata da Gray Swan.
Come si prova
La fonte non include comandi, ma indica i canali d'accesso. Per sviluppare: Gemini API via Google AI Studio o Android Studio, workflow agentici in Google Antigravity, generazione UI in Stitch. Le aziende passano da Gemini Enterprise. I consumatori con abbonamento Google AI Pro o Ultra lo trovano nell'app Gemini, in AI Mode su Search e in Gemini Sheets. Per la variante Cyber la pagina rimanda a una candidatura al Fairwind Program, riservato ad autorità governative, operatori di infrastrutture critiche e maintainer software. Le demo mostrate nel post — un gioco 3D, una versione DOS di Google Maps, visualizzatori topografici — sono costruite da Google stessa in Antigravity e AI Studio: aneddoti, non verifiche indipendenti.
A chi serve davvero
- Se costruisci agenti o pipeline di coding, il passaggio ha senso da valutare subito: stesso prezzo fino a fine 2026 e guadagni dichiarati proprio sui task lunghi. Ma a effort alti il consumo di token cresce: misura il costo per task completato, non per token.
- Se il tuo workload è sensibile a latenza e costo, resta sul 3.7: è l'opzione che Google stessa indica per i casi efficiency-first.
- Se fai security, la variante Cyber è il pezzo più rilevante del comunicato — ma è chiusa. Serve l'ammissione al Fairwind, e i criteri di selezione restano vaghi. Se non rientri nei profili indicati, oggi non hai una via d'accesso.
Alternative
Google non nomina i concorrenti nei benchmark. Sul versante generalista per coding e agenti le alternative commerciali note restano le serie GPT di OpenAI e Claude di Anthropic, più i modelli open-weight, che il post non tocca. Per la cybersecurity esistono approcci dedicati, ma senza numeri comparativi indipendenti la scelta rimane una scommessa sui benchmark dichiarati dal vendor. Se vuoi il polso della community, la discussione su Hacker News conta 726 punti.
Lascia un commento