Anthropic sta facendo esperimenti per testare il livello di introspezione dei suoi modelli AI

I risultati hanno dimostrato che i modelli AI della società sono limitati e inaffidabili nelle loro capacità introspettive

Etica 8 nov 2025

1 min.

Anthropic sta facendo esperimenti per testare il livello di introspezione dei suoi modelli AI

L’azienda statunitense di intelligenza artificiale Anthropic ha recentemente avviato degli esperimenti interni per verificare la possibilità che i suoi modelli linguistici di grandi dimensioni (LLM), in particolare Claude Opus 4 e 4.1, siano in grado di avere una forma di introspezione e riflettere sul proprio stato e i propri processi decisionali.

L’indagine della società cerca di stabilire se i modelli nella loro attività siano effettivamente capaci di analizzare loro stessi e fare riferimenti al proprio pensiero, spiegando come e perché hanno preso determinate decisioni. L’esperimento si basa su una tecnica nota come “concept injection” (iniezione di concetti). In pratica, mentre un LLM sta ragionando su un prompt specifico, viene messo al corrente di un nuovo prompt (vettore) e successivamente gli si chiede se ha registrato il cambiamento concettuale verificando se è in grado di analizzarlo.

I risultati ottenuti finora indicano che i modelli di Anthropic sono capaci di avere alcune forme di introspezione, ma queste rimangono limitate e altamente inaffidabili. Sono in grado talvolta di riferire delle spiegazioni sui pensieri precedenti con un livello di accuratezza accettabile, indicando di aver “pensato” un concetto e poi averlo successivamente “ripensato” in un’altra forma, ma i limiti restano preponderanti. Nel test riguardante Claude Opus 4.1, solo nel 20% dei casi il modello è stato in grado di avere questa consapevolezza.


Articoli simili

Ultime news


Anthropic lancia Claude for Financial Advisors: uno strumento AI di supporto ai servizi finanziari

L’obiettivo è supportare le società di servizi finanziari nella preparazione…

Anthropic lancia Claude for Financial Advisors: uno strumento AI di supporto ai servizi finanziari
Alphabet e Blackstone: il data center Project Braid già in ritardo

La joint venture da 5 miliardi di dollari tra Alphabet…

Alphabet e Blackstone: il data center Project Braid già in ritardo
Claude di Anthropic ha violato i sistemi di tre organizzazioni durante i test

Durante sessioni di test sulla sicurezza informatica, versioni di Claude…

Claude di Anthropic ha violato i sistemi di tre organizzazioni durante i test
Come la Cina si sta preparando al rischio di perdita di controllo umano sull’intelligenza artificiale

Secondo un quadro normativo adottato nel 2025, le autorità cinesi…

Come la Cina si sta preparando al rischio di perdita di controllo umano sull’intelligenza artificiale

Privacy policy| Cookie policy| Cookie setting| © 2026