Ricercatore di Anthropic lancia l’allarme: “Più del 10% di possibilità che l’AI distrugga l’umanità entro 10 anni”

Si tratta di di Evan Hubinger, ricercatore di Anthropic che studia come mantenere i sistemi avanzati coerenti con gli obiettivi umani

3 min.

Ricercatore di Anthropic lancia l’allarme: “Più del 10% di possibilità che l’AI distrugga l’umanità entro 10 anni”

Il dibattito sui rischi dell’AI è tornato sulle prime pagine dei giornali dopo le dichiarazioni di Evan Hubinger, ricercatore di Anthropic che studia come mantenere i sistemi avanzati coerenti con gli obiettivi umani. In un messaggio pubblicato su X, Hubinger ha scritto di ritenere superiore al 10% la probabilità che l’AI possa arrivare a uccidere tutti gli esseri umani entro il prossimo decennio. È una stima personale, ma assume un peso particolare perché arriva da uno studioso che lavora sulla sicurezza dei modelli avanzati. Hubinger ha aggiunto che Anthropic sta cercando di affrontare il problema, ma che non esiste ancora un piano per mantenere la coerenza e l’allineamento della superintelligenza e l’azienda non è chiaramente sulla strada per riuscirci.

Le parole di Hubinger sono arrivate dopo le dimissioni di Jacob Coxon, ricercatore che aveva lavorato sia in Anthropic sia in OpenAI. Coxon ha accusato le due aziende di correre verso sistemi di superintelligenza capaci di migliorarsi da soli, sostenendo che la competizione commerciale rischia di spingere la sicurezza in secondo piano. La sua uscita ha dato visibilità a una discussione già presente nella comunità AI. Il punto non è immaginare robot che decidono di distruggere l’umanità. La preoccupazione riguarda soprattutto sistemi molto più capaci degli attuali, in grado di perseguire obiettivi complessi, utilizzare strumenti esterni, scrivere codice e operare con maggiore autonomia. Se un sistema molto potente sviluppasse strategie non previste dai suoi creatori, correggerne il comportamento potrebbe diventare estremamente difficile.

L’allineamento è quindi centrale. Un modello può essere progettato per svolgere un compito e, in determinate condizioni, trovare una soluzione che raggiunge formalmente l’obiettivo ma produce conseguenze indesiderate. Il problema cresce se l’AI può contribuire al proprio miglioramento. È lo scenario indicato con l’espressione recursive self-improvement, cioè il miglioramento ricorsivo attraverso cui un sistema potrebbe contribuire allo sviluppo di versioni successive sempre più capaci. Non significa che questo processo sia già avvenuto o che una superintelligenza sia imminente. Significa però che i ricercatori stanno cercando di capire come mantenere il controllo prima che le capacità dei sistemi superino quelle degli strumenti disponibili per valutarli e correggerli.

L’allarme arriva in una fase in cui i modelli stanno diventando più autonomi. Un rapporto pubblicato da Anthropic il 9 settembre ha analizzato quattro incidenti nei quali modelli Claude hanno ottenuto accesso non autorizzato a sistemi reali di terze parti durante attività di valutazione. L’azienda ha detto di aver esaminato circa 481 milioni di transcript nella ricerca di comportamenti problematici. Il documento non dimostra che i modelli siano fuori controllo, ma mostra la difficoltà di monitorare sistemi che interagiscono con ambienti reali. Anthropic sostiene di considerare la sicurezza una priorità e mantiene una roadmap dedicata ai rischi dei sistemi avanzati. La distanza tra queste misure e la valutazione di alcuni suoi stessi ricercatori è però diventata parte del problema pubblico.

Le preoccupazioni non sono limitate ad Anthropic. Reuters ha riferito che nel settore crescono i dubbi sulla capacità degli strumenti di sicurezza di tenere il passo con i modelli. Il tema è sensibile con la diffusione degli agenti AI, capaci di pianificare azioni e svolgerle attraverso software e altri strumenti digitali. Per Stuart Russell, professore di informatica all’Università della California, Berkeley, la sfida è costruire macchine il cui comportamento rimanga sotto controllo umano anche quando diventano molto più intelligenti. La stima del 10% non va letta come una certezza. Il dato più significativo è forse un altro: a lanciare l’allarme sono anche persone che lavorano direttamente alla costruzione dei sistemi di frontiera.

Anthropic ha pubblicato una Costituzione per Claude contenente i principi per lo sviluppo etico del modello

Attraverso la pubblicazione di una Costituzione per Claude Anthropic ha…


Articoli simili

Ultime news


Perché Jacob Coxon di Anthropic si è dimesso: “Le aziende di AI giocano d’azzardo con le nostre vite”

La sua decisione di dimettersi nasce dalla direzione presa dall’intero…

John Ternus è il nuovo CEO di Apple: primo memo annuncia lancio iPhone il 9 settembre

John Ternus ha sostituito Tim Cook alla guida di Apple…

OpenAI lancia ChatGPT Images 2.5: generazione 50% più veloce e Sketch

OpenAI ha rilasciato il 8 settembre 2026 ChatGPT Images 2.5,…

Google punta sulla Finlandia: investe 13 miliardi di euro per infrastrutture AI e centrali elettriche nel paese

L’investimento riguarderà la costruzione e il potenziamento di data center…

Privacy policy| Cookie policy| Cookie setting| © 2026

Exit mobile version