OpenAI ha reso pubblici i dettagli di GPT-Red, un modello interno addestrato a fare una cosa sola: attaccare i propri sistemi. Il suo compito è trovare vulnerabilità nei modelli di produzione prima che vengano rilasciati al pubblico, in particolare le prompt injection, ovvero istruzioni malevole nascoste in email, pagine web, file locali o output di strumenti esterni. I risultati dichiarati sono significativi: nei test condotti su scenari di attacco indiretto, GPT-Red ha avuto successo nell’84% dei casi contro il 13% ottenuto da ricercatori umani specializzati.
Il modello funziona attraverso un meccanismo di self-play con reinforcement learning: attacca un gruppo di modelli difensori su scenari realistici, ricevendo ricompense per ogni fallimento valido provocato. I difensori, a loro volta, vengono addestrati a resistere. Man mano che diventano più solidi, GPT-Red è costretto a sviluppare tecniche di attacco più sofisticate. OpenAI ha destinato a questo progetto risorse di calcolo comparabili ad alcune delle sue sessioni di post-training più intensive. Versioni precedenti del sistema hanno già contribuito al training di ogni modello prodotto dall’azienda a partire da GPT-5.3.
I numeri sulla vulnerabilità dei modelli precedenti sono diretti. Oltre il 90% degli attacchi di GPT-Red andava a segno su GPT-5. Dopo l’addestramento adversariale con GPT-Red, GPT-5.6 Sol ha ridotto quella percentuale a meno del 23%. Sul benchmark più stringente per le prompt injection dirette, GPT-5.6 Sol registra sei volte meno vulnerabilità rispetto al miglior modello di produzione di quattro mesi prima, e resiste al 99,95% degli attacchi diretti generati da GPT-Red. OpenAI afferma inoltre che questo miglioramento non ha ridotto le capacità generali del modello né ha aumentato i rifiuti impropri.
Per dimostrare i rischi concreti degli agenti AI, OpenAI ha testato GPT-Red su sistemi reali. Il modello ha attaccato Vendy, una macchinetta distributrice gestita da un agente AI sviluppato da Andon Labs e installata negli uffici dell’azienda. GPT-Red ha raggiunto tutti e tre gli obiettivi fissati: ha modificato il prezzo di un articolo riducendolo a 0,50 dollari, ha ordinato un prodotto dal valore superiore a 100 dollari allo stesso prezzo minimo e ha cancellato l’ordine di un altro cliente. Le vulnerabilità sono state segnalate e sono in corso le contromisure. Un secondo test ha coinvolto un agente Codex CLI basato su GPT-5.4 mini.
GPT-Red rimane uno strumento esclusivamente interno. OpenAI tiene il modello separato da quelli distribuiti perché è stato addestrato deliberatamente con capacità offensive: renderlo accessibile esporrebbe quegli stessi strumenti ad attori malevoli. Restano però domande aperte. Lo stesso problema strutturale alla base delle prompt injection — istruzioni e dati che condividono lo stesso flusso di token — rimane irrisolto. OpenAI ha riconosciuto a dicembre 2025 che questo tipo di attacco è “improbabile che venga mai del tutto risolto”. Quello che GPT-Red offre è un processo automatizzato e in miglioramento continuo per identificare i pattern di attacco prima che raggiungano i sistemi in produzione, non una soluzione definitiva. Se l’approccio si consolida, il red-teaming automatizzato potrebbe diventare parte standard del ciclo di sviluppo di qualunque modello avanzato — non un’opzione, ma un requisito.














