Scrivere prompt lunghi e sgrammaticati può aggirare i blocchi dei chatbot AI

Una ricerca di Unit 42 ha individuato una falla non indifferente nel funzionamento di quasi tutti i modelli

2 min.

Scrivere prompt lunghi e sgrammaticati può aggirare i blocchi dei chatbot AI

Una nuova ricerca di Unit 42 ha individuato un nuovo processo per indurre le intelligenze artificiale ad aggirare i loro blocchi negli output. Il metodo è sorprendentemente semplice: scrivere un prompt come un’unica frase lunga e sgrammaticata, senza mai mettere un punto.

Bug indotto

Di fatto è una sorta di bug, che sfrutta le reazioni dei processi delle AI in relazione a forma e punteggiatura.

I blocchi delle AI dipendono molto dalla capacità di comprensione della frase nella sua coerenza dall’inizio alla fine. Ѐ la presenza dei punti alla fine della frase, ad esempio, a dare ai cosiddetti ‘guardrail’ la possibilità di entrare in azione prima che i modelli riescano a fornire una risposta “tossica”.

Le frasi “a cascata”, lunghe, verbose, mal composte e senza interruzioni, aprono a dismisura le possibilità di output e gettano del fumo negli occhi ai blocchi, che non capiscono quando e su cosa entrare in azione. Di fatto il metodo non elude o aggira i limiti imposti, ma li confonde, rendendone l’efficacia meno probabile.

Per un nuovo tipo di guardrail

Il trucco ha rilevato un tasso di successo che, nei test, ha raggiunto addirittura l’80-100% su modelli popolari come Llama (Meta), Gemma (Google) e Qwen.

In conseguenza a questi risultati, gli studiosi hanno proposto un nuovo strumento di analisi, il “refusal-affirmation logit gap”, che misura quanto un modello sia vulnerabile a questo genere di subdoli inganni. “Il training non elimina davvero le risposte dannose, le rende solo meno probabili. Un attaccante può comunque trovarle.

Unit 42 ha diffuso i risultati proponendo un aggiornamento dei processi di blocco. Il team ha elaborato lo scheletro di un nuovo sistema di difese multilivello, che combinino filtraggio degli input, controlli in tempo reale e supervisione post-generazione.


Articoli simili

Ultime news


Cina e Stati Uniti vicine allo scontro militare a causa di un rapporto di intelligence fatto con l’AI

L’AI ha prodotto un falso allarme, indicando erroneamente che una…

Cina e Stati Uniti vicine allo scontro militare a causa di un rapporto di intelligence fatto con l’AI
OpenAI lancia GPT-6 Astra: il modello che Greg Brockman chiama AGI

OpenAI ha rilasciato GPT-6 Astra il 3 settembre 2026, definendolo…

OpenAI lancia GPT-6 Astra: il modello che Greg Brockman chiama AGI
Meta Muse supera ChatGPT e diventa la app più scaricata negli USA

L'agente AI di Meta ha raggiunto il primo posto sull'App…

Meta Muse supera ChatGPT e diventa la app più scaricata negli USA
Un quarto del lavoro di sviluppo dei modelli di Anthropic è gestito direttamente da Claude

Anthropic ha reso pubblici nuovi dati sul lavoro svolto internamente…

Un quarto del lavoro di sviluppo dei modelli di Anthropic è gestito direttamente da Claude
Anthropic lancia un laboratorio di biologia per la ricerca farmaceutica nella Bay Area di San Francisco

Anthropic vuole collegare sempre più strettamente il lavoro dei suoi…

Anthropic lancia un laboratorio di biologia per la ricerca farmaceutica nella Bay Area di San Francisco

Privacy policy| Cookie policy| Cookie setting| © 2026