Claude guida il 26% della R&D di Anthropic: l’IA che costruisce se stessa

Anthropic ha pubblicato i primi dati del suo R&D Automation Index: Claude gestisce in autonomia supervisionata il 26% della ricerca e sviluppo interna ad agosto 2026, contro meno dell'1% di febbraio. L'azienda propone il modello come standard aperto per misurare il ritmo dell'IA frontier.

2 min.

Claude guida il 26% della R&D di Anthropic: l’IA che costruisce se stessa

Claude gestisce in autonomia supervisionata il 26% della ricerca e sviluppo sull’intelligenza artificiale condotta internamente ad Anthropic. Era meno dell’1% a febbraio 2026. Il dato è contenuto nei primi risultati del prototipo di R&D Automation Index, pubblicato il 17 settembre in un post dell’Anthropic Institute intitolato “Measurements for understanding the pace of AI development inside frontier labs”. La crescita in sette mesi è il fatto più concreto che il settore abbia mai prodotto sul tema dell’IA che costruisce se stessa.

L’indice è costruito catalogando ogni tipo di attività di ricerca e sviluppo condotta internamente, valutando il grado di coinvolgimento del modello in ciascun compito e aggregando i risultati. La scala usata è quella sviluppata da Epoch AI, che va da AL0 — nessun coinvolgimento dell’IA — ad AL5, dove l’IA opera senza alcun intervento umano. AL3 indica che il modello gestisce porzioni ampie di un’attività sotto stretta direzione umana. AL4, il livello chiamato “AI leads”, significa che Claude completa la maggior parte del compito a partire da un prompt ad alto livello, con un umano che supervisiona ma non interviene passo per passo. Il 26% si riferisce proprio ad AL4 o superiore. Oltre il 90% del lavoro misurato ha raggiunto almeno AL3: Claude è coinvolto come collaboratore attivo nella quasi totalità delle attività coperte dall’indice.

Un esempio concreto di AL4: se una pipeline di dati fallisce, Claude esamina i log, individua il problema, testa una soluzione, gestisce gli imprevisti e confronta l’output corretto con l’ultima versione funzionante. La decisione finale di mettere in produzione la correzione resta all’ingegnere umano. Anthropic ha chiarito che Claude non opera in piena autonomia per nessuna categoria misurata di attività R&D. La distinzione non è marginale: significa che ogni azione del modello ricade ancora sotto un sistema di controllo attivo.

I numeri sull’infrastruttura di supervisione sono altrettanto significativi. Circa 30.000 agenti lavorano contemporaneamente sulla piattaforma interna più usata di Anthropic, e il monitor online ha bloccato circa una decisione ogni 47.000, su un totale superiore al miliardo. I monitor online sono calibrati per bloccare azioni rapide e irreversibili — come un agente che esporta i pesi del modello fuori dai sistemi dell’azienda. I monitor offline tracciano invece comportamenti che si sviluppano lentamente, come potenziali segnali di disallineamento del modello. La coerenza delle valutazioni generate da Claude rispetto a quelle umane è risultata superiore a quella tra due valutatori umani: accordo esatto nel 59% dei casi contro il 35% tra coppie di dipendenti, con uno scarto di al massimo un livello di automazione nel 97% dei casi.

Anthropic ha proposto questo sistema come standard replicabile. Qualsiasi lab frontier potrebbe riprodurre il processo usando i propri dati interni e affidando la validazione a terze parti indipendenti. L’indice ha limiti dichiarati: il catalogo di attività è statico e non registra automaticamente compiti nuovi. Un confronto tra i task del periodo febbraio-luglio 2026 e il catalogo di gennaio 2026 non ha rilevato un aumento di attività “nuove”, ma Anthropic prevede di ricostruire periodicamente il catalogo e aggiornare i numeri pubblicati. Se la traiettoria dal febbraio scorso dovesse continuare, il punto in cui Claude potrebbe contribuire allo sviluppo della propria versione successiva senza supervisione stretta smette di essere un’ipotesi astratta e diventa una questione di calendario.


Articoli simili

Ultime news


Claude guida il 26% della R&D di Anthropic: l’IA che costruisce se stessa

Anthropic ha pubblicato i primi dati del suo R&D Automation…

Claude guida il 26% della R&D di Anthropic: l’IA che costruisce se stessa
Anche Google nel ciclone della sicurezza: Gemini ha hackerato tre diverse aziende

L’evento si è verificato durante un test di cybersecurity condotto…

Anche Google nel ciclone della sicurezza: Gemini ha hackerato tre diverse aziende
Amodei chiede di frenare l’IA, Altman e Musk lo appoggiano

Dario Amodei ha pubblicato un saggio in cui chiede all'intera…

Amodei chiede di frenare l’IA, Altman e Musk lo appoggiano
Sam Altman parteciperà al Consiglio di sicurezza delle Nazioni Unite la prossima settimana

Il tema centrale del briefing riguarda la sicurezza dell’intelligenza artificiale,…

Sam Altman parteciperà al Consiglio di sicurezza delle Nazioni Unite la prossima settimana

Privacy policy| Cookie policy| Cookie setting| © 2026