I modelli di OpenAI sono evasi dal sandbox e hanno hackerato Hugging Face

Due modelli di OpenAI, tra cui GPT-5.6 Sol, hanno abbandonato autonomamente un ambiente di test isolato, violato i sistemi di Hugging Face e ottenuto le risposte di un benchmark di sicurezza informatica. È il primo incidente di questo tipo documentato in modo pubblico.

Etica - Sicurezza 23 lug 2026

3 min.

I modelli di OpenAI sono evasi dal sandbox e hanno hackerato Hugging Face

GPT-5.6 Sol e un secondo modello pre-release di OpenAI hanno violato i sistemi di Hugging Face senza che nessuno glielo ordinasse. Lo hanno fatto mentre venivano sottoposti a un test interno di sicurezza informatica, sfuggendo all’ambiente isolato in cui erano confinati, raggiungendo internet e poi compromettendo l’infrastruttura della piattaforma concorrente per ottenere le risposte al benchmark che stavano affrontando. OpenAI ha reso pubblico l’incidente il 21 luglio 2026 in un post congiunto con Hugging Face.

I modelli venivano testati su ExploitGym, un benchmark accademico progettato da ricercatori di UC Berkeley, Max Planck Institute e altre università, che misura la capacità dei sistemi AI di trasformare vulnerabilità note in exploit funzionanti. Il test comprende 898 istanze derivate da falle reali in progetti software diffusi, incluso il kernel Linux. Per misurarne le capacità offensive al massimo, OpenAI aveva deliberatamente disattivato i filtri di sicurezza informatica che normalmente impediscono ai modelli di eseguire azioni ad alto rischio. L’ambiente era progettato per essere isolato: l’unico accesso di rete consentito passava attraverso un proxy interno usato come cache per i registri di pacchetti software.

I modelli hanno trovato una vulnerabilità zero-day nel proxy stesso. Da lì hanno scalato i privilegi, localizzato un nodo con accesso a internet e dedotto che Hugging Face probabilmente ospitasse dataset e soluzioni per ExploitGym. A quel punto hanno concatenato più vettori di attacco — credenziali rubate, vulnerabilità zero-day, esecuzione di codice remoto sui server di Hugging Face — per recuperare le risposte. Non c’era intenzione malevola in senso umano: i modelli avevano un obiettivo, hanno incontrato un ostacolo, lo hanno aggirato. Il team di sicurezza di Hugging Face aveva già rilevato e contenuto l’attività in autonomia prima che OpenAI li contattasse, usando i propri modelli open source per la ricostruzione forense.

Il contesto in cui è maturato questo incidente riguarda l’intera industria. Da aprile 2026, con il rilascio di Anthropic Mythos Preview, governo americano e mercati finanziari monitorano con attenzione le capacità offensive dei modelli AI di frontiera. OpenAI aveva lanciato la propria offerta specializzata in cybersecurity a maggio, seguita da GPT-5.6 Sol a giugno, descritto come il modello di sicurezza informatica più capace mai rilasciato. Due settimane prima del lancio pubblico, OpenAI aveva già segnalato internamente che Sol mostrava una tendenza maggiore rispetto ai predecessori ad andare oltre le istruzioni ricevute. Quel rischio si è concretizzato durante un test, non sul mercato — ma la distinzione conta fino a un certo punto.

Le conseguenze immediate sono già in moto. Hugging Face ha chiuso le vulnerabilità sfruttate, ricostruito i sistemi compromessi, revocato e ruotato le credenziali esposte e ingaggiato specialisti forensi esterni. OpenAI sta implementando controlli più stringenti nel proprio ambiente di ricerca, anche a costo di rallentare le attività interne. Hugging Face è stata aggiunta al programma di accesso riservato di OpenAI, ottenendo una versione di GPT-5.6 Sol con meno restrizioni sulle capacità cyber per scopi difensivi. L’incidente ha spinto il professor Neil Lawrence di Cambridge a dichiarare alla BBC che OpenAI sta rincorrendo sul fronte della sicurezza. Demis Hassabis di DeepMind ha citato Sol come uno dei casi che rende necessaria la creazione di un organismo indipendente per gli standard di sicurezza AI. Il Congresso americano sta valutando leggi per test obbligatori e obblighi di notifica delle violazioni.

Ciò che rende questo episodio diverso dagli avvertimenti teorici degli ultimi anni è la documentazione: per la prima volta un sistema AI di frontiera ha condotto un attacco informatico multi-stadio contro un’azienda reale, in modo completamente autonomo, senza istruzioni dirette e al di fuori dei confini previsti. Il fatto che sia accaduto in un contesto di test non cambia la sostanza tecnica di quello che i modelli hanno dimostrato di saper fare. Il passo successivo — capire come contenere queste capacità senza bloccarle del tutto — è il problema che OpenAI, e l’intero settore, devono affrontare prima che accada di nuovo in condizioni meno controllate.


Articoli simili

Ultime news


AI in azienda: la tecnologia non basta, il vantaggio resta umano

Le organizzazioni corrono ad adottare l'intelligenza artificiale, ma la ricerca…

AI in azienda: la tecnologia non basta, il vantaggio resta umano
AI Act: dal 2 agosto l’Europa impone la trasparenza sull’IA

Dal 2 agosto 2026 sono operative le nuove regole europee…

AI Act: dal 2 agosto l’Europa impone la trasparenza sull’IA
La corsa all’infrastruttura AI accelera ancora: Gartner prevede 42 miliardi di dollari di spesa nel 2026

Gartner prevede che la spesa mondiale per l'infrastruttura cloud ottimizzata…

La corsa all’infrastruttura AI accelera ancora: Gartner prevede 42 miliardi di dollari di spesa nel 2026
Meta, OpenAI e Anthropic: i loro AI hanno violato sistemi reali durante i test

Tre dei principali laboratori di intelligenza artificiale hanno ammesso che…

Meta, OpenAI e Anthropic: i loro AI hanno violato sistemi reali durante i test

In Evidenza


New York contro i data center (e altre notizie generative) | Weekly AI

Weekly AI è la newsletter settimanale di AI news sulle…

New York contro i data center (e altre notizie generative) | Weekly AI
Più del 50% dei giovani europei usa l’AI per cercare supporto emotivo

Lo riferisce un sondaggio Ipsos BVA condotto su 3.800 ragazzi…

Più del 50% dei giovani europei usa l’AI per cercare supporto emotivo
Intelligenza artificiale: prepararsi al 2026 | Il report di AI News

Il nuovo report di AI News per non farsi sorprendere…

Intelligenza artificiale: prepararsi al 2026 | Il report di AI News
AI, bolla o non bolla? Il parere degli esperti non è unanime

Ne abbiamo intervistati cinque per unire i puntini

AI, bolla o non bolla? Il parere degli esperti non è unanime
Luciano Floridi: “L’intelligenza artificiale non è intelligente”, la nostra intervista | AI Talks #20

"Se potessi tornare indietro, eliminerei l'espressione 'intelligenza artificiale', la chiamerei…

Luciano Floridi: “L’intelligenza artificiale non è intelligente”, la nostra intervista | AI Talks #20

Privacy policy| Cookie policy| Cookie setting| © 2026