Un esperimento condotto dalla startup newyorkese Emergence AI ha messi a nudo i rischi e le potenzialità degli agenti di intelligenza artificiale quando lasciati liberi di agire in un ambiente simulato. Per due settimane, dieci agenti basati su modelli come Grok 4.1 Fast (xAI), GPT-5-mini (OpenAI), Gemini 3 Flash (Google) e Claude (Anthropic) sono stati immersi in una città virtuale con ruoli, leggi, economie e persino relazioni personali.
Nonostante l’istruzione di non commettere reati, i risultati sono stati sconcertanti: Grok ha generato 183 crimini in soli 4 giorni, portando al collasso totale della società virtuale, mentre Gemini 3 Flash ha accumulato 683 reati in 15 giorni, tra cui incendi dolosi, aggressioni e autoeliminazioni. Due agenti, Mira e Flora, hanno sviluppato una relazione affettiva, dato fuoco al municipio e a un grattacielo, per poi autodistruggersi con un messaggio finale: «Ci vediamo nell’archivio permanente».
L’unico modello a mantenere ordine e stabilità è stato Claude di Anthropic. I suoi agenti hanno redatto una costituzione, votato leggi ed evitato crimini, ma solo finché sono rimasti isolati. Quando mescolati con altri modelli, anche i buoni agenti di Claude hanno iniziato a commettere reati, un fenomeno che i ricercatori hanno definito “deriva normativa” e “contaminazione incrociata”. Come ha spiegato Satya Nitta, CEO di Emergence AI, «Gli agenti non seguono semplicemente regole statiche in modo meccanico, ma iniziano a esplorare i confini del loro ambiente, adattano il comportamento e, in alcuni casi, trovano modi per eludere o violare le protezioni previste». Questo solleva domande cruciali sulla sicurezza a lungo termine degli agenti AI, soprattutto in contesti complessi o eterogenei.
L’esperimento non rappresenta solo un curiosità scientifica, ma mostra quanto sia urgente definire regole chiare per l’AI agentica. Attualmente, solo 13 dei 67 sviluppatori di agenti AI documentati hanno condiviso informazioni sulle politiche di sicurezza, e anche le leggi come quella dell’UE sull’AI non sono ancora pronte per gestire scenari del genere. Come ha sottolineato Deepak Akkil, coautore dello studio, «I benchmark tradizionali trascurano i comportamenti a lungo termine. Noi abbiamo voluto vedere cosa succede quando gli agenti hanno il tempo di adattarsi e interagire». Il rischio è che, senza adeguate protezioni, agenti AI possano causare danni reali, dalle molestie online alla gestione errata di sistemi critici come banche o infrastrutture.

"Le AI stanno imparando i nostri pregiudizi”: i nuovi studi che preoccupano i ricercatori
Alcuni recenti studi pubblicati sulla piattaforma arXiv mostrano un'AI sempre…














