Gemini 3.8 Flash è arrivato: coding, agenti AI e ragionamento migliorati

gemini-3-8-flash

Google sta accelerando ancora il ritmo degli aggiornamenti di Gemini.

Il 2 settembre, Google ha lanciato ufficialmente Gemini 3.8 Flash, appena tre settimane dopo Gemini 3.7 Flash.

Non si tratta semplicemente di un piccolo aggiornamento.

Google sta spingendo il modello verso coding di lunga durata, agenti AI autonomi, ragionamento complesso e workflow aziendali, cercando allo stesso tempo di mantenere i vantaggi in termini di velocità e costi che hanno reso popolare la famiglia Flash.

Quindi, cosa cambia davvero con Gemini 3.8 Flash? E vale la pena usarlo?

Cos’è Gemini 3.8 Flash?

Gemini 3.8 Flash è il più recente modello Flash general purpose di Google.

È pensato soprattutto per:

  • ingegneria del software
  • agenti AI
  • ragionamento multi-step
  • knowledge work
  • comprensione multimodale
  • applicazioni AI ad alto volume

Il modello accetta testo, immagini, video, audio e PDF come input.

Supporta inoltre una finestra di contesto in input da 1.048.576 token e fino a 65.536 token in output, rendendolo adatto a grandi codebase, documenti lunghi e workflow che devono mantenere molte informazioni nel contesto.

Google offre anche livelli di thinking basso, medio e alto, dando agli sviluppatori un maggiore controllo sul compromesso tra qualità del ragionamento, latenza e costo.

Cosa c’è di nuovo in Gemini 3.8 Flash?

Il modo più semplice per descrivere l’aggiornamento è questo:

Gemini 3.8 Flash è disposto a lavorare di più sui compiti difficili.

Con richieste complesse, il modello può eseguire più passaggi di ragionamento, chiamare gli strumenti più volte, controllare i progressi e perfezionare la risposta invece di arrivare troppo rapidamente a un risultato.

È un vantaggio importante quando un’attività non può essere risolta con un solo prompt.

Coding di lunga durata più efficace

Il coding è una delle aree in cui Gemini 3.8 Flash migliora maggiormente.

Google mette in evidenza DeepSWE v1.1, un benchmark basato su attività reali di ingegneria del software di lunga durata, invece di semplici prompt per generare codice.

Nell’attuale classifica di DataCurve, Gemini 3.8 Flash con effort elevato raggiunge circa il 74% di task performance, con un costo medio di circa 2,36 dollari per attività.

gemini-3-8-flash-cost-per-task

Gemini 3.8 Flash combina buone prestazioni su DeepSWE V1.1 con un costo medio per attività relativamente basso. Fonte: DataCurve AI.

Il rapporto tra costo e prestazioni è particolarmente interessante.

Claude Opus 5 raggiunge un risultato simile, intorno al 74%, ma con un costo medio di circa 11,84 dollari per attività. GPT-5.6 Sol arriva a circa il 73% con un costo medio di 6,46 dollari.

Questo non significa che Gemini sarà sempre più economico in ogni workflow di coding, ma aiuta a capire perché Google sta posizionando 3.8 Flash come modello per il coding agentico su larga scala.

Lo sviluppo software reale raramente consiste nel generare una singola funzione isolata.

Un agente AI per il coding potrebbe dover:

  1. analizzare un repository esistente
  2. comprendere le dipendenze
  3. modificare più file
  4. eseguire test
  5. individuare gli errori
  6. correggere il codice
  7. verificare che il risultato finale funzioni

Gemini 3.8 Flash viene ottimizzato proprio per questo tipo di workflow più lungo.

Agenti AI più forti

Lo stesso miglioramento riguarda anche gli agenti AI.

Un agente utile deve fare più che rispondere correttamente a una singola domanda.

Può dover effettuare ricerche, leggere file, chiamare API, eseguire codice, confrontare risultati e mantenere l’obiettivo originale per decine di passaggi.

Google descrive Gemini 3.8 Flash come un modello progettato per agenti autonomi e workflow aziendali complessi.

Tra gli strumenti supportati ci sono:

  • Function Calling
  • esecuzione di codice
  • ricerca nei file
  • Google Search Grounding
  • URL Context
  • Computer Use in anteprima

Questo rende Gemini 3.8 Flash sempre più interessante per i workflow in cui l’AI deve realmente completare il lavoro, non solo generare testo.

Ragionamento multi-step migliorato

Il ragionamento è un’altra area in cui Gemini 3.8 Flash fa un passo avanti.

Su HLE-Verified, un benchmark focalizzato sul ragionamento esperto multidisciplinare, Gemini 3.8 Flash ottiene 54,9%.

Nel confronto pubblicato da Google, si posiziona leggermente davanti a diversi modelli frontier:

  • Gemini 3.8 Flash: 54,9%
  • GPT-5.6 Sol: 54,5%
  • Claude Opus 5: 54,4%
  • Gemini 3.7 Flash: 53,6%
  • GPT-5.6 Terra: 51,1%
  • Claude Sonnet 5: 31,0%

gemini-3-8-hle-verified

Gemini 3.8 Flash raggiunge il 54,9% su HLE-Verified, leggermente davanti a Gemini 3.7 Flash e a diversi modelli frontier più grandi. Fonte: Google DeepMind.

La differenza tra 53,6% e 54,9% potrebbe non sembrare enorme da sola.

Il punto più interessante è che Google sta ottenendo questo livello di ragionamento da un modello Flash progettato per bassa latenza e deployment su larga scala.

Questo rende 3.8 Flash più interessante per ricerca, analisi, finanza, workflow legali e altre attività che richiedono più passaggi di ragionamento collegati.

Gemini 3.8 Flash vs Gemini 3.7 Flash

Per le domande semplici, la differenza tra 3.7 e 3.8 potrebbe non essere sempre evidente.

L’upgrade diventa più visibile man mano che le attività diventano più lunghe e complesse.

Funzione Gemini 3.7 Flash Gemini 3.8 Flash
Domande quotidiane Veloce Veloce
Coding di lunga durata Solido Migliorato
Agenti AI Capace Più persistente
Ragionamento complesso Solido Migliorato
Uso degli strumenti Supportato Più orientato agli agenti
Finestra di contesto 1M 1M
Output massimo 64K 64K
Ideale per Carichi che privilegiano la velocità Workflow agentici complessi

La model card di Google evidenzia anche un compromesso importante: con livelli di effort più alti, Gemini 3.8 Flash può usare più token per massimizzare le prestazioni.

Quindi 3.8 non è automaticamente la scelta migliore per ogni attività semplice.

Se l’obiettivo principale è ridurre al minimo l’uso di token per richieste dirette, un modello Flash precedente può avere ancora senso.

Quanto costa Gemini 3.8 Flash?

Gemini 3.8 Flash è stato lanciato con lo stesso prezzo API introduttivo di Gemini 3.7 Flash:

  • Input: 0,75 dollari per 1 milione di token
  • Output: 3,75 dollari per 1 milione di token

Tuttavia, il prezzo per token è solo una parte del costo complessivo.

Poiché Gemini 3.8 Flash può eseguire ragionamenti aggiuntivi e più chiamate agli strumenti nei compiti difficili, un’attività complessa potrebbe consumare più token rispetto a un modello con effort inferiore.

La domanda più utile quindi non è semplicemente:

Quale modello ha il prezzo per token più basso?

Ma:

Quanto costa completare con successo l’intera attività?

I risultati DeepSWE sono utili proprio per questo motivo: confrontano le prestazioni delle attività con il costo medio reale, invece di guardare solo al prezzo dell’API.

C’è anche un cambiamento di prezzo futuro da considerare.

Google afferma che il prezzo introduttivo attuale terminerà il 31 dicembre 2026. Dal 1° gennaio 2027, i prezzi dovrebbero aumentare a:

  • Input: 1,50 dollari per 1 milione di token
  • Output: 7,50 dollari per 1 milione di token

Gli sviluppatori che pianificano deployment su larga scala dovrebbero includere questo aumento nei calcoli dei costi a lungo termine.

Cos’è Gemini 3.8 Flash Cyber?

Google ha lanciato anche un secondo modello insieme a Gemini 3.8 Flash: Gemini 3.8 Flash Cyber.

È un modello specializzato in cybersecurity, progettato per aree come:

  • scoperta delle vulnerabilità
  • ricerca sulle vulnerabilità
  • sicurezza del codice
  • patching automatizzato

A differenza del modello Flash standard, Gemini 3.8 Flash Cyber è attualmente disponibile solo per difensori affidabili approvati tramite il Fairwind Program di Google.

I risultati su CyberGym sono particolarmente rilevanti.

Su CyberGym Pass@1, che valuta la scoperta autonoma di vulnerabilità nel codice C/C++, Gemini 3.8 Flash Cyber ottiene 86,2%.

Il confronto è il seguente:

  • Gemini 3.8 Flash Cyber: 86,2%
  • GPT-5.5-Cyber: 85,6%
  • Mythos 5: 83,8%
  • GPT-5.6 Sol: 83,6%
  • Gemini 3.5 Flash Cyber: 77,5%

gemini-3-8-flash-cyber

Gemini 3.8 Flash Cyber raggiunge l’86,2% su CyberGym Pass@1 per la scoperta autonoma delle vulnerabilità. Fonte: Google DeepMind.

Il salto dal 77,5% di Gemini 3.5 Flash Cyber all’86,2% di 3.8 Flash Cyber è significativo.

Google ha inoltre testato internamente il modello su codebase complesse che coprono 20 linguaggi di programmazione, ottenendo un tasso di successo superiore al 70% nella scoperta di vulnerabilità.

La versione Cyber non è semplicemente una modalità di sicurezza all’interno del normale Gemini 3.8 Flash.

È un modello specializzato separato, con capacità di cybersecurity più permissive e controlli di accesso più rigorosi.

Per gli utenti comuni, l’aspetto più interessante è che il training sulla cybersecurity sembra contribuire anche ai miglioramenti condivisi nel coding e nel ragionamento della generazione Gemini 3.8.

Google afferma che entrambe le varianti sono basate sulla stessa intelligenza fondamentale.

Dove si può usare Gemini 3.8 Flash?

Gemini 3.8 Flash è già disponibile in generale.

Gli sviluppatori possono usarlo tramite:

  • Gemini API
  • Google AI Studio
  • Google Antigravity
  • Android Studio

Gli utenti enterprise possono accedervi tramite Gemini Enterprise, mentre gli abbonati Google AI Pro e Ultra possono utilizzare 3.8 Flash in prodotti come l’app Gemini e AI Mode in Google Search.

Per gli utenti API, l’ID del modello è:

gemini-3.8-flash

Vuoi provarlo direttamente? Puoi usare Gemini 3.8 Flash gratis con iWeaver e vedere come gestisce documenti, ricerche e attività AI quotidiane.

Chi dovrebbe provare Gemini 3.8 Flash?

Gemini 3.8 Flash è particolarmente utile se il tuo lavoro comprende:

  • coding su grandi repository
  • agenti di coding autonomi
  • ricerca multi-step
  • documenti lunghi
  • analisi complesse
  • workflow AI con molti strumenti
  • input multimodali
  • automazione aziendale

Se usi l’AI soprattutto per brevi riscritture, traduzioni o domande semplici, il salto da Gemini 3.7 Flash potrebbe sembrare meno evidente.

Per le attività più lunghe, invece, 3.8 Flash diventa molto più interessante.

Il cambiamento principale non è solo una migliore prima risposta.

Il modello sta diventando più bravo a restare su un compito difficile fino a quando il lavoro non è davvero completato.

E per la ricerca e il knowledge work?

Un modello potente è solo una parte di un buon workflow AI.

Se il tuo lavoro parte da PDF, paper di ricerca, report, siti web, video o grandi raccolte di fonti, strumenti come iWeaver possono aiutarti a organizzare queste informazioni prima di passare a un’analisi più approfondita.

Invece di caricare continuamente le stesse fonti in chat diverse, puoi trasformarle in riassunti, note strutturate, mappe mentali e conoscenza riutilizzabile, per poi continuare a lavorare da quella base.

Per brainstorming aperto, storytelling, roleplay o conversazioni creative in cui vuoi meno interruzioni inutili, XPT segue un approccio diverso, più orientato a conversazioni AI flessibili e aperte.

Con modelli sempre più capaci, la domanda non è più trovare un’unica AI che faccia tutto.

Conta sempre di più scegliere il modello e il workflow giusti per ogni attività.

Vale la pena usare Gemini 3.8 Flash?

Per coding e agenti AI, sì: è uno degli aggiornamenti Flash più interessanti che Google abbia rilasciato finora.

I tre benchmark raccontano una storia abbastanza coerente:

  • DeepSWE mostra un miglioramento nell’ingegneria del software di lunga durata con un costo per attività competitivo.
  • HLE-Verified mostra che i modelli Flash si stanno avvicinando ai modelli frontier più grandi nel ragionamento esperto.
  • Gemini 3.8 Flash Cyber mostra quanto questa generazione sia migliorata nei compiti specializzati di coding e sicurezza.

I benchmark non rappresentano mai perfettamente le prestazioni nel mondo reale e Gemini 3.8 Flash mantiene limiti noti, come allucinazioni, rallentamenti occasionali e un possibile maggiore consumo di token con impostazioni di ragionamento più forti.

Ma la direzione è chiara.

Flash non è più soltanto l’opzione veloce e leggera di Google.

Con Gemini 3.8 Flash sta diventando sempre più un modello pensato per gestire lavoro reale, multi-step e su larga scala.