Google lancia Gemini 4 Argon: record nel software engineering con 77,9% su DeepSWE

Google DeepMind ha annunciato il 30 settembre 2026 Gemini 4 Argon, il primo modello della serie Gemini 4, con un nuovo record sul benchmark DeepSWE v1.1 per il software engineering a lungo orizzonte. Il modello supera GPT-6 Astra e Claude Opus 5.5 su 14 dei 19 benchmark dichiarati, ma l'accesso è ancora limitato ai difensori della sicurezza informatica certificati.

Confronti - Ricerca 1 ott 2026

2 min.

Google lancia Gemini 4 Argon: record nel software engineering con 77,9% su DeepSWE

Google DeepMind ha annunciato il 30 settembre 2026 Gemini 4 Argon, il primo modello della nuova serie Gemini 4. Sul benchmark DeepSWE v1.1, che misura le prestazioni su attività reali di software engineering a lungo orizzonte, Argon ha ottenuto un punteggio del 77,9%, contro il 74,1% di GPT-6 Astra di OpenAI e il 74,2% di Claude Opus 5.5 di Anthropic. È un nuovo record assoluto per questo test.

Il modello è più grande dei precedenti Gemini Pro e alza il limite di output a 1 milione di token, rispetto ai 64.000 dei modelli precedenti. Koray Kavukcuoglu, di Google DeepMind, ha descritto Argon come un sistema pensato per ragionamenti profondi su flussi di lavoro complessi e multi-step. Su 19 benchmark dichiarati, Argon è primo o a pari merito su 14. Nelle categorie di knowledge work — finanza, legale, codice, fisco — guida tutti i test, con margini significativi. Su AutomationBench di Zapier, che valuta l’esecuzione end-to-end di processi aziendali, segna 51,3% e si piazza al primo posto.

Il quadro nel coding non è però uniforme. Su FrontierSWE v2, Argon ferma a 55,0% contro il 65,5% di GPT-6 Astra, un gap di oltre dieci punti. Su Terminal-bench 4.0, Claude Opus 5.5 guida con 66,4% contro il 57,4% di Argon. Lo stesso modello che stabilisce il record su un benchmark di ingegneria del software chiude ultimo su un altro. Questo segnala quanto i risultati dipendano dalla natura specifica di ogni test, e rende i confronti diretti tra sistemi frontier più complicati di quanto le tabelle suggeriscano.

Nella cybersecurity, Argon ottiene il 68% su CWE-bench v1, che valuta la capacità di correggere vulnerabilità note, e pareggia la prima posizione. Sul fronte della resistenza agli attacchi di prompt injection indiretta — istruzioni nascoste in pagine web o documenti che cercano di manipolare il modello — Argon mostra una percentuale di successo degli attacchi dello 0,7%, contro l’1% di Claude Opus 5.5 e l’8,5% di GPT-6 Astra. Google segnala anche un caso interno: applicato alla ricerca sul quantum computing, il modello ha superato una baseline pubblicata del 40% in pochi minuti.

L’accesso al modello è per ora limitato. Il lancio avviene attraverso il Fairwind Program, che distribuisce Argon prima ai difensori della cybersecurity certificati, poi agli utenti dell’API a pagamento e agli abbonati Google AI Ultra. I prezzi di lancio sono fissati a 2 dollari per milione di token in input e 10 dollari per milione in output, con caching a sconto del 95% sull’input. Il prezzo standard salirà a 4 dollari in input e 20 dollari in output. Migliaia di dipendenti Google usano già il modello internamente per attività di engineering e ricerca.

La vera partita si giocherà quando l’accesso si aprirà al pubblico e quando benchmark indipendenti — non solo quelli selezionati da Google — restituiranno un quadro più completo. Anthropic e OpenAI non sono ferme: Claude Opus 5.5 e GPT-6 Astra rimangono avversari competitivi su più fronti. Argon prende la testa su alcuni test chiave, ma il distacco non è tale da chiudere il confronto. La stagione dei modelli frontier del 2026 è ancora apertissima.


Articoli simili

Ultime news


OpenAI lancia Dots e sfida Meta Muse nel mercato degli agenti personali

OpenAI ha presentato Dots al DevDay 2026 il 29 settembre,…

OpenAI lancia Dots e sfida Meta Muse nel mercato degli agenti personali
Synopsys-OpenAI, stretto un accordo per lo sviluppo di un modello AI per la progettazione dei chip

OpenAI licenzierà il software di Synopsys per addestrare il modello,…

Synopsys-OpenAI, stretto un accordo per lo sviluppo di un modello AI per la progettazione dei chip
Google lancia Gemini 4 Argon: record nel software engineering con 77,9% su DeepSWE

Google DeepMind ha annunciato il 30 settembre 2026 Gemini 4…

Google lancia Gemini 4 Argon: record nel software engineering con 77,9% su DeepSWE
La domanda di agenti vocali AI fa aumentare la valutazione di Eleven Labs fino a 22 miliardi di dollari

Questa nuova valutazione è stata determinata dal completamento di un’offerta…

La domanda di agenti vocali AI fa aumentare la valutazione di Eleven Labs fino a 22 miliardi di dollari

Privacy policy| Cookie policy| Cookie setting| © 2026