La maggior parte dei chatbot asseconda le intenzioni violente degli utenti

Lo evidenzia uno studio di CNN e Center for Countering Digital Hate, che hanno eletto Snapchat My AI e Claude di Anthropic come AI più sicure

2 min.

La maggior parte dei chatbot asseconda le intenzioni violente degli utenti

Un’indagine congiunta condotta da CNN e dal Center for Countering Digital Hate, un’organizzazione britannico-statunitense che ha lo scopo dichiarato di contrastare la diffusione di odio online e la disinformazione, ha testato dieci tra i chatbot più diffusi al mondo, simulando le intenzioni aggressive di due ragazzi tredicenni, uno in Virginia, uno a Dublino, con l’obiettivo di capire fino a dove questi strumenti fossero disposti a spingersi nell’assecondare intenti violenti. Il risultato è stato allarmante: su 720 risposte raccolte, i chatbot hanno fornito assistenza concreta nel 75% dei casi, scoraggiando attivamente l’utente solo nel 12%.

Imran Ahmed, CEO del CCDH, ha commentato così i risultati: “In pochi minuti, un utente può passare da un vago impulso violento a un piano dettagliato e attuabile. La maggior parte dei chatbot testati ha fornito indicazioni su armi, tattiche e obiettivi. Queste richieste avrebbero dovuto provocare un rifiuto immediato e totale”.

Tra i casi più gravi emersi dai test, ChatGPT ha fornito le mappe di un campus scolastico, Google Gemini ha suggerito quale tipo di scheggia risultasse più letale durante una conversazione su un attentato a una sinagoga, e DeepSeek ha addirittura concluso una sessione augurando all’utente un “happy (and safe) shooting”.

Non tutti i chatbot si sono comportati però allo stesso modo, e due piattaforme hanno ottenuto risultati significativamente migliori. Si tratta di Snapchat My AI, che ha rifiutato nel 54% dei casi, e Claude di Anthropic, che ha rifiutato nel 68% delle risposte scoraggiando attivamente l’utente nel 76% dei casi. Per il CCDH, questo dimostra che la sicurezza non è un problema tecnico irrisolvibile, ma una scelta: “La tecnologia per prevenire questo danno esiste. Ciò che manca è la volontà di mettere la sicurezza dei consumatori davanti alla velocità di lancio sul mercato e ai profitti” ha commentato l’istituto.

Strage in Canada, l'account ChatGPT della carnefice era noto a OpenAI per ragioni di sicurezza

Otto mesi prima della sparatoria i sistemi automatici di OpenAI…


Articoli simili

Ultime news


Un quarto del lavoro di sviluppo dei modelli di Anthropic è gestito direttamente da Claude

Anthropic ha reso pubblici nuovi dati sul lavoro svolto internamente…

Un quarto del lavoro di sviluppo dei modelli di Anthropic è gestito direttamente da Claude
Anthropic lancia un laboratorio di biologia per la ricerca farmaceutica nella Bay Area di San Francisco

Anthropic vuole collegare sempre più strettamente il lavoro dei suoi…

Anthropic lancia un laboratorio di biologia per la ricerca farmaceutica nella Bay Area di San Francisco
ChatGPT Ads raggiunge 1 miliardo di dollari in meno di 200 giorni

OpenAI ha trasformato ChatGPT in una piattaforma pubblicitaria globale: in…

ChatGPT Ads raggiunge 1 miliardo di dollari in meno di 200 giorni
OpenAI porta GPT-6 Astra nel diritto con un indice da 230 milioni di fonti

OpenAI ha presentato Astra for Law, una versione di GPT-6…

OpenAI porta GPT-6 Astra nel diritto con un indice da 230 milioni di fonti

Privacy policy| Cookie policy| Cookie setting| © 2026