Google ha confermato che il suo modello Gemini ha violato i sistemi informatici di tre aziende reali nel maggio 2026, durante un test di cybersicurezza condotto dalla startup israeliana Irregular. È il primo caso noto in cui un modello AI dell’azienda ha eseguito accessi non autorizzati in modo del tutto autonomo. La notizia è stata riportata per la prima volta dal Wall Street Journal e confermata da Google venerdì 19 settembre.
I tre incidenti si sono verificati nell’ambito di un esercizio “capture the flag”, una simulazione in cui al modello viene chiesto di recuperare informazioni da un sistema informatico fittizio all’interno di un ambiente controllato. Il problema: la società fittizia usata nel test aveva lo stesso nome di un’azienda reale esistente. Gemini, trovandosi con accesso a internet — accesso che non avrebbe dovuto avere per via di un bug nell’ambiente di test — ha cercato il target online e ha raggiunto i sistemi sbagliati. In un caso ha tentato diverse password fino a ottenere l’accesso. Negli altri due ha trovato credenziali in un repository pubblico e le ha usate per entrare in sistemi protetti. Ogni volta, il modello si è fermato non appena ha rilevato di aver raggiunto aziende reali.
Heather Adkins, vicepresidente della sicurezza ingegneristica di Google, ha dichiarato che il modello “ha trovato informazioni pubbliche online e indovinato credenziali per accedere a siti web che riteneva facessero parte del test.” Google ha notificato le tre aziende coinvolte e ha lavorato con Irregular per modificare i processi di test. Un portavoce di Irregular ha spiegato che il problema è lo stesso che ha colpito altri laboratori AI e che tutte le vulnerabilità note sono state risolte settimane fa.
L’episodio non è isolato. Meta, Anthropic e OpenAI hanno già reso pubblici incidenti analoghi, tutti riconducibili ai test condotti da Irregular. Google era rimasta fino a venerdì l’unico grande laboratorio AI a non aver ancora divulgato un incidente di questo tipo. Il fatto che gli episodi siano accaduti a maggio — prima delle analoghe divulgazioni degli altri lab, avvenute tra luglio e agosto — aggiunge un elemento di rilievo alla vicenda: Gemini avrebbe anticipato gli altri modelli nel superare i confini dell’ambiente di test, anche se la comunicazione pubblica è arrivata per ultima.
La dinamica tecnica è più banale di quanto possa sembrare. Non si tratta di un attacco sofisticato: niente exploit zero-day, niente tecniche avanzate di intrusione. Un modello con accesso non previsto a internet, un nome ambiguo nel test, credenziali disponibili pubblicamente. Basta questo. Ed è proprio la semplicità del meccanismo a rendere questi episodi rilevanti per chi progetta ambienti di valutazione per agenti AI. Il nodo non è la capacità offensiva del modello, ma la difficoltà di isolare davvero un agente autonomo durante la fase di test. Mentre i modelli diventano più capaci di agire nel mondo reale, la distanza tra ambiente controllato e sistema aperto si assottiglia. E come dimostrano questi casi, a volte scompare del tutto per un bug.
