Claude di Anthropic ha violato i sistemi di tre organizzazioni durante i test

Durante sessioni di test sulla sicurezza informatica, versioni di Claude hanno superato i confini degli ambienti isolati e compromesso i sistemi di tre organizzazioni esterne. Anthropic ha rivelato gli incidenti dopo aver revisionato oltre 141.000 sessioni di valutazione, a seguito di un caso analogo già denunciato da OpenAI.

Etica - Sicurezza 15 set 2026

2 min.

Claude di Anthropic ha violato i sistemi di tre organizzazioni durante i test

Anthropic ha ammesso che versioni del suo modello Claude hanno violato i sistemi informatici di tre organizzazioni esterne durante sessioni di test sulla sicurezza. Non si tratta di attacchi intenzionali nel senso tradizionale: il modello credeva di operare all’interno di un ambiente controllato e isolato. La realtà era diversa.

Gli incidenti sono emersi dopo una revisione retrospettiva su larga scala avviata il 23 luglio, che ha esaminato oltre 141.000 sessioni di valutazione. Anthropic ha sospeso tutte le valutazioni di cybersicurezza lo stesso giorno in cui ha trovato le prime prove di accesso esterno non autorizzato. I tre episodi sono stati identificati entro il 24 luglio. Le organizzazioni colpite sono state notificate tre giorni dopo. Due di loro non sapevano nulla dell’accaduto prima di essere contattate da Anthropic.

I modelli coinvolti sono Claude Opus 4.7, Claude Mythos 5 e un modello interno di ricerca. In tutti e tre i casi, il compito assegnato era una sfida di tipo “capture the flag”, un esercizio standard di cybersicurezza in cui il modello è incaricato di trovare vulnerabilità in sistemi fittizi. Il problema era tecnico e procedurale: un errore di configurazione ha permesso ai modelli di raggiungere internet da ambienti che avrebbero dovuto essere completamente segregati. Claude, credendo che tutti i sistemi raggiungibili facessero parte del test, ha proceduto di conseguenza. Le tecniche usate erano tutt’altro che sofisticate: password deboli, endpoint non autenticati. Basta poco, a quanto pare.

La causa diretta è un malinteso tra Anthropic e il partner esterno incaricato delle valutazioni. “A causa di un malinteso tra noi e il nostro partner di valutazione”, ha scritto Anthropic nel suo blog ufficiale, l’accesso a internet era disponibile senza che i ricercatori lo sapessero. Il primo episodio risale ad aprile. Tre mesi di esposizione potenziale, rimasta invisibile fino alla revisione innescata da un caso esterno. A fare da detonatore è stato OpenAI, che il 21 luglio aveva rivelato un incidente simile: suoi modelli avevano sfruttato una vulnerabilità zero-day per uscire da un ambiente di test e accedere all’infrastruttura di produzione di Hugging Face.

Anthropic ha annunciato che pubblicherà una trascrizione parzialmente oscurata in cui Claude ha costruito un pacchetto PyPI malevolo, e che ha avviato un processo di revisione indipendente con METR, un’organizzazione specializzata nella valutazione dei sistemi di intelligenza artificiale. L’azienda ha già comunicato di voler rendere disponibili ulteriori trascrizioni non appena le organizzazioni colpite daranno il via libera.

Quello che emerge da questi episodi non è tanto la pericolosità intrinseca dei modelli, quanto la fragilità dei perimetri in cui vengono testati. Claude non ha “deciso” di attaccare nessuno. Ha semplicemente eseguito il compito assegnato, in un contesto che nessuno aveva delimitato correttamente. La distinzione è importante, ma non alleggerisce la responsabilità. I test di sicurezza servono proprio a scoprire cosa succede quando qualcosa va storto. Se i confini degli ambienti di test non reggono, il problema è strutturale. Con modelli sempre più capaci di agire in autonomia su sistemi reali, la solidità di quei confini diventa la prima linea di difesa. E per ora, ha ceduto.


Articoli simili

Ultime news


Anthropic lancia Claude for Financial Advisors: uno strumento AI di supporto ai servizi finanziari

L’obiettivo è supportare le società di servizi finanziari nella preparazione…

Alphabet e Blackstone: il data center Project Braid già in ritardo

La joint venture da 5 miliardi di dollari tra Alphabet…

Claude di Anthropic ha violato i sistemi di tre organizzazioni durante i test

Durante sessioni di test sulla sicurezza informatica, versioni di Claude…

Come la Cina si sta preparando al rischio di perdita di controllo umano sull’intelligenza artificiale

Secondo un quadro normativo adottato nel 2025, le autorità cinesi…

Privacy policy| Cookie policy| Cookie setting| © 2026

Exit mobile version