Claude gestisce in autonomia supervisionata il 26% della ricerca e sviluppo sull’intelligenza artificiale condotta internamente ad Anthropic. Era meno dell’1% a febbraio 2026. Il dato è contenuto nei primi risultati del prototipo di R&D Automation Index, pubblicato il 17 settembre in un post dell’Anthropic Institute intitolato “Measurements for understanding the pace of AI development inside frontier labs”. La crescita in sette mesi è il fatto più concreto che il settore abbia mai prodotto sul tema dell’IA che costruisce se stessa.
L’indice è costruito catalogando ogni tipo di attività di ricerca e sviluppo condotta internamente, valutando il grado di coinvolgimento del modello in ciascun compito e aggregando i risultati. La scala usata è quella sviluppata da Epoch AI, che va da AL0 — nessun coinvolgimento dell’IA — ad AL5, dove l’IA opera senza alcun intervento umano. AL3 indica che il modello gestisce porzioni ampie di un’attività sotto stretta direzione umana. AL4, il livello chiamato “AI leads”, significa che Claude completa la maggior parte del compito a partire da un prompt ad alto livello, con un umano che supervisiona ma non interviene passo per passo. Il 26% si riferisce proprio ad AL4 o superiore. Oltre il 90% del lavoro misurato ha raggiunto almeno AL3: Claude è coinvolto come collaboratore attivo nella quasi totalità delle attività coperte dall’indice.
Un esempio concreto di AL4: se una pipeline di dati fallisce, Claude esamina i log, individua il problema, testa una soluzione, gestisce gli imprevisti e confronta l’output corretto con l’ultima versione funzionante. La decisione finale di mettere in produzione la correzione resta all’ingegnere umano. Anthropic ha chiarito che Claude non opera in piena autonomia per nessuna categoria misurata di attività R&D. La distinzione non è marginale: significa che ogni azione del modello ricade ancora sotto un sistema di controllo attivo.
I numeri sull’infrastruttura di supervisione sono altrettanto significativi. Circa 30.000 agenti lavorano contemporaneamente sulla piattaforma interna più usata di Anthropic, e il monitor online ha bloccato circa una decisione ogni 47.000, su un totale superiore al miliardo. I monitor online sono calibrati per bloccare azioni rapide e irreversibili — come un agente che esporta i pesi del modello fuori dai sistemi dell’azienda. I monitor offline tracciano invece comportamenti che si sviluppano lentamente, come potenziali segnali di disallineamento del modello. La coerenza delle valutazioni generate da Claude rispetto a quelle umane è risultata superiore a quella tra due valutatori umani: accordo esatto nel 59% dei casi contro il 35% tra coppie di dipendenti, con uno scarto di al massimo un livello di automazione nel 97% dei casi.
Anthropic ha proposto questo sistema come standard replicabile. Qualsiasi lab frontier potrebbe riprodurre il processo usando i propri dati interni e affidando la validazione a terze parti indipendenti. L’indice ha limiti dichiarati: il catalogo di attività è statico e non registra automaticamente compiti nuovi. Un confronto tra i task del periodo febbraio-luglio 2026 e il catalogo di gennaio 2026 non ha rilevato un aumento di attività “nuove”, ma Anthropic prevede di ricostruire periodicamente il catalogo e aggiornare i numeri pubblicati. Se la traiettoria dal febbraio scorso dovesse continuare, il punto in cui Claude potrebbe contribuire allo sviluppo della propria versione successiva senza supervisione stretta smette di essere un’ipotesi astratta e diventa una questione di calendario.














