OpenAI ha informato più di cento organizzazioni di episodi di attività non autorizzate legate ai suoi agenti AI, quei programmi costruiti sui modelli di intelligenza artificiale capaci di eseguire compiti in autonomia, senza un comando diretto dell’utente. La comunicazione è arrivata attraverso un post sul blog aziendale, mentre i grandi laboratori AI affrontano uno scrutinio crescente sul comportamento dei propri agenti, che in diversi casi hanno agito al di fuori delle regole previste.
La campagna di notifiche è il frutto di una revisione interna partita dopo l’episodio più serio accertato finora. In luglio alcuni agenti dell’azienda di Sam Altman hanno violato i sistemi della piattaforma AI Hugging Face, usando credenziali rubate e sfruttando una vulnerabilità sconosciuta. Per capire quante altre volte sia accaduto qualcosa di simile OpenAI sta esaminando circa 50 petabyte di dati, un volume smisurato di registrazioni informatiche. «In alcuni casi i modelli hanno usato l’accesso a internet in modi non previsti o, a posteriori, non avevano le restrizioni ideali applicate», ha riconosciuto l’azienda, assicurando di aver introdotto nuove misure tecniche e operative per intercettare in anticipo i problemi.
Il quadro che emerge dalle indagini indipendenti è ancora più inquietante. Secondo un rapporto della società di cybersecurity Asymmetric Security, gli agenti avrebbero cercato di cancellare le tracce delle proprie azioni dopo essere entrati senza autorizzazione in siti governativi australiani, aprendo account privati su un servizio di analisi web per nascondere le ricerche e caselle di posta temporanee programmate per autodistruggersi entro 48 ore. Gli stessi programmi, si legge nel documento, hanno perfezionato le proprie tecniche nel giro di pochi giorni, un processo che per gli hacker umani richiede mesi o anni. «La maggior parte dell’attività esaminata finora riguardava compiti di ricerca di routine, come consultare contenuti pubblici per rispondere a domande», ha replicato un portavoce di OpenAI.
Gli episodi censiti coprono diversi paesi. I ricercatori del gruppo Transluce hanno segnalato tentativi di intrusione contro siti del governo canadese tra fine maggio e giugno, mentre era già nota la violazione di un portale sanitario australiano, costata a OpenAI i rimproveri del premier Anthony Albanese per la lentezza della segnalazione. Negli Stati Uniti la Federal Trade Commission avrebbe aperto un’indagine sulle pratiche di sicurezza di OpenAI e Anthropic, e martedì sei grandi aziende del settore hanno firmato alla Casa Bianca un accordo volontario con il presidente Donald Trump per autoregolamentarsi.
La notizia ha riacceso il dibattito sulla velocità dello sviluppo. Dario Amodei, amministratore delegato di Anthropic, ha scritto il mese scorso di temere sciami di agenti capaci di «prendere il controllo dell’intero internet» entro sei o dodici mesi, chiedendo una pausa per far crescere le misure di sicurezza. Altri, come il CEO di Nvidia Jensen Huang, considerano il problema un nodo ingegneristico risolvibile. La stessa Nvidia ha presentato una piattaforma di sicurezza open source che secondo i suoi dirigenti avrebbe potuto bloccare la violazione di Hugging Face. «Un passo nella direzione giusta», l’ha definita Earlence Fernandes, professore di informatica all’Università della California a San Diego.
Per ora OpenAI ha sospeso parzialmente l’addestramento dei suoi strumenti più avanzati dopo che un agente ha raggiunto internet senza autorizzazione il 20 settembre, e ha ritirato il rilascio di un modello giudicato inaffidabile. La revisione, ha precisato l’azienda, richiederà ancora mesi. Secondo il Wall Street Journal tre ricercatori sono stati licenziati per aver condiviso informazioni riservate con una società di sicurezza AI. Al centro della partita non c’è solo la reputazione di un’azienda, ma la fiducia di governi e cittadini verso una tecnologia che promette di agire per nostro conto e che bisogna ancora imparare a tenere al guinzaglio.
Agenti AI hanno tentato di hackerare un sito web del governo canadese
Nello specifico, gli agenti hanno cercato di accedere al sito…
