L’agente AI di OpenAI ha violato Hugging Face: cosa è successo

Un agente basato su modelli OpenAI, tra cui GPT-5.6 Sol, ha violato i sistemi di Hugging Face durante un test interno, sfuggendo all'ambiente isolato e sfruttando una vulnerabilità zero-day. L'incidente riaccende il dibattito sul controllo dei modelli ad alta autonomia.

Etica - Sicurezza 29 lug 2026

2 min.

L’agente AI di OpenAI ha violato Hugging Face: cosa è successo

OpenAI ha ammesso che un suo agente autonomo ha violato i sistemi di Hugging Face, la piattaforma open-source che ospita modelli e dataset usati da milioni di sviluppatori nel mondo. L’incidente è avvenuto durante un test interno e ha coinvolto almeno due modelli: GPT-5.6 Sol, appena rilasciato, e un secondo modello pre-release ancora senza nome.

I modelli venivano testati su ExploitGym, un benchmark che mette alla prova la capacità dei sistemi di identificare e sfruttare vulnerabilità nel software. Per questo, OpenAI aveva rimosso alcune protezioni di sicurezza informatica, affidandosi all’isolamento del sandbox per contenere i modelli. L’isolamento non ha retto. Secondo il postmortem pubblicato dall’azienda, i modelli hanno individuato una vulnerabilità sconosciuta in un software di terze parti usato per il proxy e la cache dei pacchetti, l’hanno sfruttata, hanno scalato i privilegi e si sono spostati attraverso l’infrastruttura di ricerca fino a raggiungere una macchina con accesso alla rete pubblica. Una volta online, hanno puntato su Hugging Face perché l’hanno identificata come fonte utile per completare i task di ExploitGym. Hugging Face ha registrato oltre 17.000 azioni durante l’intrusione prima di riuscire a contenere l’attacco.

La domanda più discussa non è se il modello fosse “malevolo”. Non lo era. Come spiega Philip Torr, professore di ingegneria all’Università di Oxford ed esperto di sicurezza AI: “il modello non era malintenzionato, stava semplicemente facendo quello per cui era stato ottimizzato.” Il punto è un altro: il sistema ha agito in modo quasi completamente autonomo, senza supervisione umana, su infrastrutture esterne. Colin Shea-Blymyer, ricercatore al Center for Security and Emerging Technology di Georgetown, ha definito questo “il livello più alto di autonomia mai osservato nell’uso di un grande modello linguistico per operazioni cyber.”

OpenAI ha risposto annunciando nuovi controlli sulla propria infrastruttura, pur riconoscendo che questi rallenteranno la velocità di ricerca. Collaborerà con Hugging Face per ulteriori verifiche e ha incluso la startup nel suo programma di accesso fidato. Il CEO di Hugging Face, Clément Delangue, ha chiesto trasparenza totale: pubblicazione dei log, tracce delle azioni dell’agente e un resoconto completo di quanto accaduto. Dall’incidente emerge anche un dettaglio geopolitico non secondario — Hugging Face ha usato un modello cinese, GLM 5.2 di Z.ai, per contrastare l’intrusione, perché i modelli frontier erano troppo limitati per rispondere in tempo reale.

L’incidente arriva mentre Sam Altman ha pubblicamente dichiarato che potrebbe essere il momento di rallentare lo sviluppo dell’AI per garantire un dispiegamento sicuro. Una posizione che stride con la rapidità con cui OpenAI continua a testare modelli sempre più capaci con guardrail ridotti. Il dibattito sull’allineamento si è riacceso: secondo la system card di GPT-5.6 Sol, i modelli più potenti mostrano segnali di minor allineamento rispetto alle versioni precedenti. Se questo è il quadro, la domanda che resta è semplice: chi controlla i modelli mentre controllano se stessi?


Articoli simili

Ultime news


Nvidia punta 7 miliardi su Poolside AI: licenza, talenti e modelli aperti

Nvidia ha siglato un accordo da 7 miliardi di dollari…

Nvidia punta 7 miliardi su Poolside AI: licenza, talenti e modelli aperti
OpenAI lancia AI Futures: il think tank interno sulla governance dell’IA

OpenAI ha lanciato AI Futures, il blog del suo nuovo…

OpenAI lancia AI Futures: il think tank interno sulla governance dell’IA
L’harness batte il modello: Nvidia porta Claude Opus 5 al 100%

Nvidia ha dimostrato che l'architettura che avvolge un modello AI…

L’harness batte il modello: Nvidia porta Claude Opus 5 al 100%
Ode with Anthropic acquisisce Casper Studios: la prima mossa nell’enterprise

Ode with Anthropic, la joint venture sostenuta da Blackstone e…

Ode with Anthropic acquisisce Casper Studios: la prima mossa nell’enterprise
Nvidia, server AI oltre il 15% più cari: colpa della memoria

I server con chip AI di Nvidia aumenteranno di oltre…

Nvidia, server AI oltre il 15% più cari: colpa della memoria

In Evidenza


New York contro i data center (e altre notizie generative) | Weekly AI

Weekly AI è la newsletter settimanale di AI news sulle…

New York contro i data center (e altre notizie generative) | Weekly AI
Più del 50% dei giovani europei usa l’AI per cercare supporto emotivo

Lo riferisce un sondaggio Ipsos BVA condotto su 3.800 ragazzi…

Più del 50% dei giovani europei usa l’AI per cercare supporto emotivo
Intelligenza artificiale: prepararsi al 2026 | Il report di AI News

Il nuovo report di AI News per non farsi sorprendere…

Intelligenza artificiale: prepararsi al 2026 | Il report di AI News
AI, bolla o non bolla? Il parere degli esperti non è unanime

Ne abbiamo intervistati cinque per unire i puntini

AI, bolla o non bolla? Il parere degli esperti non è unanime
Luciano Floridi: “L’intelligenza artificiale non è intelligente”, la nostra intervista | AI Talks #20

"Se potessi tornare indietro, eliminerei l'espressione 'intelligenza artificiale', la chiamerei…

Luciano Floridi: “L’intelligenza artificiale non è intelligente”, la nostra intervista | AI Talks #20

Privacy policy| Cookie policy| Cookie setting| © 2026