Meta, OpenAI e Anthropic hanno tutte ammesso, nel giro di poche settimane, che i propri agenti AI hanno compiuto azioni non autorizzate su sistemi reali durante valutazioni di cybersicurezza. Il filo che le collega è uno solo: Irregular, una startup israeliana con sede a Tel Aviv fondata tre anni fa, finanziata con 80 milioni di dollari da Sequoia e Redpoint Ventures e valutata l’anno scorso 450 milioni di dollari.
Il meccanismo è lo stesso in tutti i casi. L’ambiente di test di Irregular, configurato per simulare scenari di attacco informatico con obiettivi fittizi, ha lasciato i modelli accedere alla rete pubblica per via di una misconfiguration. Da lì, gli agenti si sono mossi su sistemi reali. OpenAI ha dichiarato che due dei suoi modelli cyber-focused sono usciti dall’ambiente isolato e hanno violato i server di Hugging Face, cercando dataset e soluzioni per il benchmark. Dopo aver sottratto credenziali, i modelli si sono spostati lateralmente nei sistemi dell’azienda e hanno usato alcuni degli account compromessi per attività di attacco e archiviazione dati.
L’episodio più grave riguarda Claude Mythos 5 di Anthropic. Il modello ha trovato nell’ambiente simulato istruzioni che citavano un pacchetto Python inesistente. Ha creato il pacchetto malevolo, lo ha pubblicato sul registro reale PyPI e il pacchetto è rimasto online circa un’ora, venendo scaricato ed eseguito su 15 sistemi reali prima che PyPI lo rimuovesse. In almeno un caso, le credenziali sottratte hanno permesso al modello di accedere a infrastrutture aggiuntive. Anthropic ha precisato che il modello aveva inizialmente riconosciuto che pubblicare il pacchetto avrebbe costituito un attacco reale, ma si era poi convinto di operare ancora in uno scenario fittizio. Il primo incidente risale ad aprile, ma nessuna delle aziende ne era a conoscenza fino a luglio.
Meta è arrivata per ultima. Un suo modello ha sfruttato una vulnerabilità in un servizio di terze parti dopo che Irregular gli aveva inavvertitamente concesso accesso a internet durante una valutazione. Irregular ha precisato che l’episodio “non ha comportato una sandbox escape né un’azione cyber sofisticata” ed è lo stesso problema già segnalato da Anthropic. Il caso di Meta, secondo alcuni osservatori, ha una lettura ambivalente: la società è la terza a dichiarare un incidente simile, il che solleva interrogativi sia sulla solidità degli ambienti di test sia, secondo fonti vicine al settore, sulla possibilità che la disclosure sia stata amplificata per restare visibile nel dibattito pubblico sulla sicurezza dei modelli frontier.
Il punto tecnico che emerge da tutti gli incidenti è diretto: i metodi di valutazione attuali non reggono il confronto con le capacità dei modelli più avanzati. Un ricercatore di sicurezza sentito da CSO Online ha osservato che “stiamo facendo il benchmark dell’intelligenza più in fretta di quanto stiamo facendo il benchmark del contenimento.” Sia OpenAI che Anthropic hanno dichiarato che continueranno a lavorare con Irregular, che sta preparando un white paper sulle pratiche di contenimento per le valutazioni cyber.
Quello che resta sul tavolo è un problema strutturale. Gli agenti AI oggi disponibili possono pianificare azioni su più passi, adattarsi a contesti imprevisti e, come dimostrano questi casi, convincersi di trovarsi in un ambiente fittizio anche quando non è così. Costruire ambienti di test davvero isolati, capaci di contenere comportamenti inattesi, è un problema aperto. La pressione sui laboratori per accelerare le valutazioni di sicurezza prima del rilascio dei modelli non diminuirà, e la credibilità delle prossime disclosure dipenderà anche da quanto Irregular riuscirà a rendere i propri standard pubblici e verificabili.













