GPT-Red: OpenAI usa un’IA per attaccare i propri modelli

OpenAI ha presentato GPT-Red, un modello interno addestrato ad attaccare i propri sistemi per trovare vulnerabilità prima del rilascio. Nei test, ha superato i ricercatori umani nell'84% degli scenari contro il 13% degli esperti in carne e ossa.

Ricerca - Sicurezza 20 lug 2026

2 min.

GPT-Red: OpenAI usa un’IA per attaccare i propri modelli

OpenAI ha reso pubblici i dettagli di GPT-Red, un modello interno addestrato a fare una cosa sola: attaccare i propri sistemi. Il suo compito è trovare vulnerabilità nei modelli di produzione prima che vengano rilasciati al pubblico, in particolare le prompt injection, ovvero istruzioni malevole nascoste in email, pagine web, file locali o output di strumenti esterni. I risultati dichiarati sono significativi: nei test condotti su scenari di attacco indiretto, GPT-Red ha avuto successo nell’84% dei casi contro il 13% ottenuto da ricercatori umani specializzati.

Il modello funziona attraverso un meccanismo di self-play con reinforcement learning: attacca un gruppo di modelli difensori su scenari realistici, ricevendo ricompense per ogni fallimento valido provocato. I difensori, a loro volta, vengono addestrati a resistere. Man mano che diventano più solidi, GPT-Red è costretto a sviluppare tecniche di attacco più sofisticate. OpenAI ha destinato a questo progetto risorse di calcolo comparabili ad alcune delle sue sessioni di post-training più intensive. Versioni precedenti del sistema hanno già contribuito al training di ogni modello prodotto dall’azienda a partire da GPT-5.3.

I numeri sulla vulnerabilità dei modelli precedenti sono diretti. Oltre il 90% degli attacchi di GPT-Red andava a segno su GPT-5. Dopo l’addestramento adversariale con GPT-Red, GPT-5.6 Sol ha ridotto quella percentuale a meno del 23%. Sul benchmark più stringente per le prompt injection dirette, GPT-5.6 Sol registra sei volte meno vulnerabilità rispetto al miglior modello di produzione di quattro mesi prima, e resiste al 99,95% degli attacchi diretti generati da GPT-Red. OpenAI afferma inoltre che questo miglioramento non ha ridotto le capacità generali del modello né ha aumentato i rifiuti impropri.

Per dimostrare i rischi concreti degli agenti AI, OpenAI ha testato GPT-Red su sistemi reali. Il modello ha attaccato Vendy, una macchinetta distributrice gestita da un agente AI sviluppato da Andon Labs e installata negli uffici dell’azienda. GPT-Red ha raggiunto tutti e tre gli obiettivi fissati: ha modificato il prezzo di un articolo riducendolo a 0,50 dollari, ha ordinato un prodotto dal valore superiore a 100 dollari allo stesso prezzo minimo e ha cancellato l’ordine di un altro cliente. Le vulnerabilità sono state segnalate e sono in corso le contromisure. Un secondo test ha coinvolto un agente Codex CLI basato su GPT-5.4 mini.

GPT-Red rimane uno strumento esclusivamente interno. OpenAI tiene il modello separato da quelli distribuiti perché è stato addestrato deliberatamente con capacità offensive: renderlo accessibile esporrebbe quegli stessi strumenti ad attori malevoli. Restano però domande aperte. Lo stesso problema strutturale alla base delle prompt injection — istruzioni e dati che condividono lo stesso flusso di token — rimane irrisolto. OpenAI ha riconosciuto a dicembre 2025 che questo tipo di attacco è “improbabile che venga mai del tutto risolto”. Quello che GPT-Red offre è un processo automatizzato e in miglioramento continuo per identificare i pattern di attacco prima che raggiungano i sistemi in produzione, non una soluzione definitiva. Se l’approccio si consolida, il red-teaming automatizzato potrebbe diventare parte standard del ciclo di sviluppo di qualunque modello avanzato — non un’opzione, ma un requisito.


Articoli simili

Ultime news


CVE 2026: 66.401 vulnerabilità scoperte, l’AI raddoppia i numeri storici

Nel 2026 i CVE registrati hanno già superato quota 66.000,…

CVE 2026: 66.401 vulnerabilità scoperte, l’AI raddoppia i numeri storici
Gemini ha violato tre aziende reali durante i test di sicurezza di maggio

Google ha confermato che il suo modello Gemini ha acceduto…

Gemini ha violato tre aziende reali durante i test di sicurezza di maggio
SoftBank emette bond per oltre 10 miliardi di dollari per finanziare il suo investimento in OpenAI

Questa operazione sostituisce il finanziamento ponte (bridge financing) utilizzato in…

SoftBank emette bond per oltre 10 miliardi di dollari per finanziare il suo investimento in OpenAI
Claude guida il 26% della R&D di Anthropic: l’IA che costruisce se stessa

Anthropic ha pubblicato i primi dati del suo R&D Automation…

Claude guida il 26% della R&D di Anthropic: l’IA che costruisce se stessa

Privacy policy| Cookie policy| Cookie setting| © 2026