Anthropic sta facendo esperimenti per testare il livello di introspezione dei suoi modelli AI

I risultati hanno dimostrato che i modelli AI della società sono limitati e inaffidabili nelle loro capacità introspettive

Etica 8 nov 2025

1 min.

Anthropic sta facendo esperimenti per testare il livello di introspezione dei suoi modelli AI

L’azienda statunitense di intelligenza artificiale Anthropic ha recentemente avviato degli esperimenti interni per verificare la possibilità che i suoi modelli linguistici di grandi dimensioni (LLM), in particolare Claude Opus 4 e 4.1, siano in grado di avere una forma di introspezione e riflettere sul proprio stato e i propri processi decisionali.

L’indagine della società cerca di stabilire se i modelli nella loro attività siano effettivamente capaci di analizzare loro stessi e fare riferimenti al proprio pensiero, spiegando come e perché hanno preso determinate decisioni. L’esperimento si basa su una tecnica nota come “concept injection” (iniezione di concetti). In pratica, mentre un LLM sta ragionando su un prompt specifico, viene messo al corrente di un nuovo prompt (vettore) e successivamente gli si chiede se ha registrato il cambiamento concettuale verificando se è in grado di analizzarlo.

I risultati ottenuti finora indicano che i modelli di Anthropic sono capaci di avere alcune forme di introspezione, ma queste rimangono limitate e altamente inaffidabili. Sono in grado talvolta di riferire delle spiegazioni sui pensieri precedenti con un livello di accuratezza accettabile, indicando di aver “pensato” un concetto e poi averlo successivamente “ripensato” in un’altra forma, ma i limiti restano preponderanti. Nel test riguardante Claude Opus 4.1, solo nel 20% dei casi il modello è stato in grado di avere questa consapevolezza.


Articoli simili

Ultime news


RobotX AI lancia Xmind, il primo cervello robotico universale

RobotX AI ha annunciato Xmind, un'unità di elaborazione intelligente progettata…

RobotX AI lancia Xmind, il primo cervello robotico universale
NVIDIA RTX Spark arriva sui PC Windows: preordini aperti dal 7 ottobre

NVIDIA e Microsoft hanno annunciato RTX Spark, il nuovo superchip…

NVIDIA RTX Spark arriva sui PC Windows: preordini aperti dal 7 ottobre
ChatGPT for Teens sotto accusa: “Rischio inaccettabile”, l’allarme degli esperti sui minori

Uno studio ha analizzato oltre 4.000 conversazioni, metà prima e…

ChatGPT for Teens sotto accusa: “Rischio inaccettabile”, l’allarme degli esperti sui minori
Cybersecurity: maturità in aumento tra le aziende italiane, si riduce il divario tra PMI e grandi imprese

L’EY Cyber Barometer, report realizzato nell’ambito dell’EY Hub Risk, ha…

Cybersecurity: maturità in aumento tra le aziende italiane, si riduce il divario tra PMI e grandi imprese

Privacy policy| Cookie policy| Cookie setting| © 2026