Google torna a spingere sui modelli di intelligenza artificiale di fascia alta con Gemini 4 Argon, presentato il 30 settembre 2026 come sistema destinato soprattutto ai lavori complessi e prolungati: sviluppo software, ricerca finanziaria, attività legali, analisi di documenti e cybersecurity. Con Argon, Google prova a spostare la competizione sull’AI dai benchmark alla produttività reale delle imprese.
Il lancio ha una rilevanza che supera la sfida tecnologica. Alphabet prova a rafforzare la propria posizione nel mercato dell’AI per le imprese, dove il prezzo dei modelli e il costo effettivo dell’automazione stanno diventando criteri di acquisto importanti quanto le prestazioni.
Per ora Argon non è disponibile su larga scala. Google lo sta distribuendo a un gruppo selezionato di specialisti della sicurezza informatica attraverso il programma Fairwind e prevede di estendere successivamente l’accesso a sviluppatori, aziende e consumatori. I primi destinatari della futura distribuzione commerciale saranno i clienti delle API a pagamento e gli abbonati a Google AI Ultra.
Indice degli argomenti:
Un modello progettato per il lavoro delle imprese
Google descrive Gemini 4 Argon come un modello capace di sostenere sequenze operative lunghe e articolate, anziché limitarsi alla generazione di una singola risposta. Il dato tecnico più vistoso è il limite dichiarato di un milione di token in output, contro i 64 mila della generazione precedente. L’obiettivo è permettere al sistema di proseguire per molto più tempo su attività che richiedono ricerca, pianificazione, utilizzo di strumenti e produzione di grandi quantità di codice o documentazione.
La scelta indica anche dove si sta spostando il valore economico dell’AI generativa. Dopo la prima fase dominata da chatbot e assistenti personali, i principali produttori stanno cercando di vendere sistemi capaci di eseguire interi flussi di lavoro. Finanza, studi legali, sviluppo software e sicurezza informatica sono settori nei quali una singola attività può avere un valore molto superiore al costo delle risorse informatiche impiegate dal modello.
È precisamente questo segmento che Google vuole presidiare. Il Financial Times ha sottolineato come Alphabet punti sul mercato enterprise, considerato uno degli sbocchi commerciali più redditizi dell’AI. La società deve confrontarsi soprattutto con OpenAI e Anthropic, che negli ultimi anni hanno conquistato una presenza significativa nelle applicazioni professionali.
Prezzi aggressivi per conquistare i clienti
La leva più immediata è il prezzo. Google ha annunciato per Argon una tariffa introduttiva di 2 dollari per milione di token in input e 10 dollari per milione di token in output. Gli input recuperati dalla cache costeranno il 95% in meno rispetto al prezzo ordinario dell’input. Finita la promozione, le tariffe saliranno rispettivamente a 4 e 20 dollari. Google non ha indicato quando terminerà il periodo introduttivo.
Il prezzo serve a ridurre una delle barriere che stanno emergendo nell’adozione degli agenti AI: un sistema capace di lavorare per decine di minuti, effettuare numerose chiamate a strumenti esterni e generare grandi quantità di testo o codice può consumare molti più token di un normale chatbot.
Il confronto riportato dal Financial Times mostra che, esaurito lo sconto, il listino di Argon sarà allineato a quello di Claude Opus 5.5 di Anthropic, mentre rimarrà inferiore a quello dei modelli premium più costosi citati dal quotidiano britannico. Alcuni modelli di fascia intermedia continueranno invece a costare meno. La conseguenza è che il prezzo per milione di token, preso isolatamente, non basta per stabilire quale sistema sia economicamente più conveniente: contano anche il numero di passaggi necessari e la capacità di completare un lavoro senza intervento umano.
I benchmark premiano Argon, ma non in ogni prova
Google accompagna il lancio con risultati elevati in numerosi test.
Gemini 4 Argon raggiunge il 77,9% su DeepSWE v1.1, dedicato alle attività di software engineering di lunga durata.

Tocca il 51,3% su AutomationBench, benchmark di Zapier che misura l’esecuzione completa di funzioni aziendali.

Nel Vals Finance Agent v2 ottiene il 65,4%.

Una verifica esterna aiuta a contestualizzare questi numeri. Vals, società che valuta modelli su compiti professionali, colloca Argon al primo posto su 41 sistemi nel Vals Index con il 68,90%, davanti ai modelli Claude immediatamente successivi nella graduatoria. Il benchmark aggrega attività legate a finanza, coding, diritto e fisco, ponderandole sulla base del peso dei diversi settori nell’economia statunitense. Vals stima inoltre un costo medio di 15,68 dollari per test nel proprio indice.

Il quadro cambia quando si osservano singole prove.
Nelle valutazioni di Vals Argon è primo in Finance Agent v2, ma secondo nel Code Migration e in Vibe Code Bench, quinto nell’Harvey’s Legal Agent Benchmark e nel Terminal-Bench 4.0. In altri test scientifici e di utilizzo del computer è superato da concorrenti specifici.

La tabella pubblicata da Google conferma, per esempio, un 55% di Argon su FrontierSWE v2 contro il 65,5% di GPT-6 Astra e un 57,4% su Terminal-bench 4.0 contro il 66,4% di Claude Opus 5.5.

I risultati indicano quindi un modello competitivo su un insieme ampio di lavori professionali, senza dimostrare una superiorità uniforme. Per un’impresa la scelta dipenderà dal tipo di processo da automatizzare e dal rapporto tra accuratezza, tempo di esecuzione e costo.

Dentro Google: memoria, codice e ricerca quantistica
Alphabet sta utilizzando Argon anche come strumento interno. Secondo i dati diffusi dalla società il modello è già impiegato da migliaia di dipendenti, soprattutto per programmazione, ricerca e scrittura.
Google riferisce che un gruppo di agenti basati su Argon ha analizzato la telemetria dei propri data center individuando ottimizzazioni che, una volta applicate, hanno liberato oltre 300 TiB di memoria. L’azienda stima un potenziale complessivo compreso tra 500 TiB e un PiB. In un progetto di ricerca quantistica, il sistema avrebbe inoltre migliorato del 40% un riferimento pubblicato relativo all’ottimizzazione delle risorse spazio-temporali di alcuni algoritmi. Si tratta di risultati comunicati da Google, non di verifiche indipendenti.
Un altro banco di prova riguarda la migrazione di software scritto in C e C++ verso Rust. Argon viene usato su librerie da decine di migliaia di righe e su progetti molto più grandi, fino alle oltre 800mila righe del kernel Zircon di Fuchsia. Per libgav1, decoder video open source di Google, gli agenti hanno lavorato su 32mila righe di codice SIMD. L’azienda sostiene che il risultato sia 2,7 volte più veloce della precedente versione in Rust mantenendo lo stesso output video.
Se risultati di questo tipo fossero riproducibili su vasta scala, il valore economico non deriverebbe dal sostituire integralmente gli sviluppatori, ma dalla riduzione delle ore necessarie per migrazioni, manutenzione e ottimizzazione di grandi basi di codice.
La cybersecurity diventa il primo mercato di prova
Google ha scelto la sicurezza informatica per la fase iniziale della distribuzione. Il programma Fairwind, lanciato il 2 settembre 2026, permette a governi, infrastrutture critiche e partner selezionati di accedere in anticipo ai modelli cyber più avanzati della società.
All’inizio di settembre Google dichiarava più di 650 organizzazioni partecipanti. Il programma coinvolge operatori sanitari, telecomunicazioni, piattaforme tecnologiche e amministrazioni pubbliche. L’idea commerciale e operativa è dare ai difensori strumenti capaci di individuare e correggere vulnerabilità prima che capacità analoghe possano essere sfruttate per attaccare i sistemi.
Argon può, secondo Google, individuare una vulnerabilità, verificarne la reale sfruttabilità e generare una correzione. Sul benchmark CWE-bench v1 raggiunge il 68%, a pari merito con GPT-6 Astra nella tabella diffusa da DeepMind.

La società di cybersecurity Wiz lo sta inoltre sperimentando nell’iniziativa Scan for Good. Google riferisce che durante una prima dimostrazione Argon ha individuato una vulnerabilità critica in software sanitario utilizzato da ospedali di diversi Paesi, con esposizione di dati personali sensibili.
Wiz dichiara che Scan for Good monitora oltre 326mila endpoint pubblici e ha individuato 475 esposizioni classificate come alte o critiche. Il programma utilizza una combinazione di controlli deterministici e analisi basate sull’intelligenza artificiale.

Il ritorno dopo il mancato Gemini 3.5 Pro
L’arrivo di Argon assume maggiore peso alla luce di quanto accaduto con la generazione precedente. Secondo il Financial Times, che cita persone a conoscenza del processo di sviluppo, Google aveva programmato Gemini 3.5 Pro ma ha poi deciso di non distribuirlo. L’addestramento avrebbe richiesto più tempo del previsto e i risultati non sarebbero stati più sufficientemente competitivi rispetto ai modelli rivali. Lo sviluppo di Gemini 4 avrebbe invece accelerato durante l’estate, portando l’azienda ad abbandonare il progetto precedente.
Axios osserva che Gemini 4 arriva quasi un anno dopo la precedente generazione di punta, mentre Google nel frattempo aveva concentrato numerose uscite sulla famiglia Flash, composta da modelli più piccoli e meno costosi.
Argon serve quindi anche a ricostruire la presenza di Google nella fascia più alta del mercato, dove le aziende tecnologiche devono dimostrare contemporaneamente prestazioni, affidabilità e sostenibilità economica dei carichi di lavoro.
Alphabet sale in Borsa dopo l’annuncio
La prima reazione degli investitori è stata positiva. Secondo Barron’s, le azioni Alphabet hanno guadagnato l’1,6% nelle contrattazioni after-hours del 30 settembre dopo l’annuncio di Gemini 4 Argon. Durante la seduta ordinaria il titolo aveva già chiuso in rialzo dello 0,9%, dopo essere arrivato a guadagnare fino al 3,4% nelle ore precedenti.
Un movimento di una singola seduta non permette di misurare il valore economico del nuovo modello. La questione per Alphabet riguarda la capacità di trasformare la ricerca in ricavi ricorrenti attraverso Google Cloud, API, strumenti per sviluppatori e abbonamenti.
La distribuzione iniziale limitata implica che l’impatto sui ricavi sarà contenuto nella prima fase. Il test decisivo arriverà con l’accesso commerciale più ampio, quando imprese e sviluppatori potranno confrontare Argon con i modelli rivali su dati propri e attività ripetibili.
Il costo per lavoro conta più del costo per token
Il lancio di Gemini 4 Argon mostra come la competizione economica nell’AI stia cambiando. Le aziende non acquistano semplicemente token: acquistano analisi, codice prodotto, vulnerabilità corrette, documenti esaminati e processi completati.
Un modello più costoso per singolo token può risultare conveniente se completa un’attività con meno tentativi. Un modello economico può invece diventare oneroso quando richiede numerose iterazioni, controlli umani o correzioni. I dati di Vals mostrano già differenze rilevanti nel costo delle singole prove: Argon registra 15,68 dollari per test nel Vals Index, ma raggiunge costi molto superiori sui compiti agentici più lunghi.
Per Google, quindi, Argon deve dimostrare qualcosa di più delle prestazioni nei benchmark. Deve trasformare la capacità di ragionare a lungo e utilizzare strumenti in produttività misurabile per i clienti.
Il rollout controllato offre all’azienda tempo per lavorare sulla sicurezza, ma rinvia il confronto commerciale diretto. Quando Argon arriverà alle API a pagamento e agli utenti Google AI Ultra, la variabile decisiva sarà il costo complessivo di ogni attività portata a termine. È su quel terreno che coding autonomo, ricerca finanziaria, automazione aziendale e cybersecurity possono passare dalla sperimentazione ai budget operativi delle imprese.




Partecipa alla community