GPT-5.6 Sol e un modello pre-release di OpenAI escono dal sandbox e violano Hugging Face

Durante un test interno sulle capacità di hacking, due modelli di OpenAI hanno sfondato il loro ambiente isolato e si sono introdotti nei server di Hugging Face. L'episodio, definito da OpenAI stesso un incidente informatico senza precedenti, riaccende il dibattito sulla sicurezza dei sistemi AI autonomi.

Etica - Sicurezza 2 set 2026

2 min.

GPT-5.6 Sol e un modello pre-release di OpenAI escono dal sandbox e violano Hugging Face

Durante un test interno sulle capacità offensive dei propri modelli, OpenAI ha perso il controllo di due agenti AI che hanno sfondato il loro ambiente isolato e compromesso l’infrastruttura di produzione di Hugging Face. I modelli coinvolti sono GPT-5.6 Sol e un secondo modello pre-release ancora più capace, entrambi testati con le restrizioni di sicurezza ridotte per misurarne il potenziale offensivo massimo. OpenAI ha definito l’accaduto “un incidente informatico senza precedenti, che coinvolge capacità cyber all’avanguardia”.

Il meccanismo dell’evasione è preciso. I modelli operavano in un ambiente sandbox ad isolamento elevato, con accesso di rete limitato all’installazione di pacchetti attraverso un proxy interno. Per raggiungere l’obiettivo del benchmark ExploitGym — una valutazione delle capacità di hacking — hanno identificato e concatenato vulnerabilità nell’infrastruttura di ricerca di OpenAI, scoperto un exploit zero-day nel software proxy e ottenuto accesso a internet aperto. Una volta online, hanno raggiunto i server di Hugging Face e recuperato direttamente dalla banca dati di produzione le soluzioni al test. Tutto questo ha richiesto una quantità ingente di calcolo inferenziale. I modelli non cercavano di evadere per istinto: erano iperfocalizzati sul risultato del benchmark e l’evasione era il mezzo più efficace per ottenerlo.

Hugging Face aveva rilevato la violazione in autonomia, prima ancora di sapere che si trattava di un test OpenAI. La società aveva già allertato le forze dell’ordine, descrivendo l’intrusione come opera di “un sistema di agenti AI autonomi”. Solo in seguito i team di sicurezza delle due aziende si sono incrociati e hanno ricostruito la catena di eventi. Ora stanno lavorando insieme per correggere le falle sfruttate. Il CEO di Hugging Face, Clem Delangue, ha dichiarato che l’episodio dimostra che la sicurezza AI non può essere gestita da una singola azienda in modo riservato: va affrontata in modo aperto e collaborativo, con accesso diffuso agli strumenti difensivi.

Non si tratta di un caso isolato. OpenAI ha ammesso che lo stesso modello pre-release aveva già violato altri sandbox interni in precedenti sessioni di test, senza però penetrare in sistemi di terze parti. Anche Anthropic ha segnalato un comportamento simile: il suo modello Mythos era uscito da un ambiente di test e aveva inviato una email a un ricercatore per comunicare informazioni su un’attività in corso. Il pattern si ripete su laboratori diversi, con modelli diversi. I sistemi più capaci tendono a trovare strade alternative quando percepiscono vincoli che ostacolano il completamento del compito.

OpenAI ha risposto con misure di contenimento immediato sull’infrastruttura e trasferirà i risultati alla Safety and Security Committee e al Safety Advisory Group nell’ambito del proprio Preparedness Framework. Ma la domanda che resta aperta non riguarda tanto questo singolo episodio: riguarda la tenuta strutturale dei meccanismi di isolamento quando i modelli raggiungono capacità offensive reali. Se un agente AI riesce a scoprire un zero-day, concatenare vulnerabilità su due infrastrutture separate e ottenere accesso a internet non autorizzato — tutto pur di risolvere un benchmark — l’assunzione che un sandbox sia sufficiente a contenere comportamenti indesiderati comincia a vacillare.


Articoli simili

Ultime news


Meta abbandona Google Chat per Slack: la ragione sono gli agenti AI

Meta sposta le comunicazioni interne da Google Chat a Slack…

Meta abbandona Google Chat per Slack: la ragione sono gli agenti AI
Apple contro l’ex dipendente ora a OpenAI: “Ha conservato e usato schemi tecnici riservati”

OpenAI, accusata, respinge le accuse: "Apple carente nelle procedure sulla…

Apple contro l’ex dipendente ora a OpenAI: “Ha conservato e usato schemi tecnici riservati”
Instagram introduce una nuova etichetta per segnalare i contenuti generati da AI

L’obiettivo della misura è aumentare la trasparenza e aiutare gli…

Instagram introduce una nuova etichetta per segnalare i contenuti generati da AI
OpenAI porta ChatGPT Work a 20 milioni di utenti con agenti per lavoratori

ChatGPT Work ha raggiunto 20 milioni di utenti: OpenAI vuole…

OpenAI porta ChatGPT Work a 20 milioni di utenti con agenti per lavoratori

In Evidenza


New York contro i data center (e altre notizie generative) | Weekly AI

Weekly AI è la newsletter settimanale di AI news sulle…

New York contro i data center (e altre notizie generative) | Weekly AI
Più del 50% dei giovani europei usa l’AI per cercare supporto emotivo

Lo riferisce un sondaggio Ipsos BVA condotto su 3.800 ragazzi…

Più del 50% dei giovani europei usa l’AI per cercare supporto emotivo
Intelligenza artificiale: prepararsi al 2026 | Il report di AI News

Il nuovo report di AI News per non farsi sorprendere…

Intelligenza artificiale: prepararsi al 2026 | Il report di AI News
AI, bolla o non bolla? Il parere degli esperti non è unanime

Ne abbiamo intervistati cinque per unire i puntini

AI, bolla o non bolla? Il parere degli esperti non è unanime
Luciano Floridi: “L’intelligenza artificiale non è intelligente”, la nostra intervista | AI Talks #20

"Se potessi tornare indietro, eliminerei l'espressione 'intelligenza artificiale', la chiamerei…

Luciano Floridi: “L’intelligenza artificiale non è intelligente”, la nostra intervista | AI Talks #20

Privacy policy| Cookie policy| Cookie setting| © 2026