I migliori modelli AI falliscono al lavoro: solo il 24% di successo

Il nuovo benchmark ALE, costruito da Berkeley RDI e Snorkel AI con oltre 300 esperti, ha messo alla prova i modelli di frontiera su compiti professionali reali: il migliore, GPT-5.5, ha superato appena il 24% dei task. Sul livello più difficile, il tasso medio è del 2,6%.

Confronti - Ricerca 22 lug 2026

2 min.

I migliori modelli AI falliscono al lavoro: solo il 24% di successo

GPT-5.5 ha ottenuto il punteggio più alto tra tutti i modelli testati, con un tasso di successo complessivo del 24%. Gli altri sono andati peggio. Sul livello più difficile del benchmark, ogni agente ha collezionato lo 0% di risultati corretti. Questi sono i numeri di Agents’ Last Exam, o ALE: un test costruito per misurare quanto i modelli di intelligenza artificiale sappiano fare davvero il lavoro che conta.

ALE è stato sviluppato da Berkeley RDI e Snorkel AI con il contributo di oltre 300 esperti del settore. Il benchmark include 960 flussi di lavoro professionali su 1.490 istanze, distribuiti in 55 industrie digitali, costruiti su compiti che gli esperti hanno già portato a termine nella pratica reale. I sistemi AI più recenti hanno ottenuto risultati forti su un’ampia gamma di test, ma questi progressi non si sono tradotti in un impiego economicamente rilevante nei domini professionali. Il problema, secondo i ricercatori, è in larga parte nella valutazione stessa: i benchmark più diffusi non misurano la performance sostenuta su flussi di lavoro reali. ALE nasce per colmare questa distanza.

Tutti i modelli messi alla prova hanno fallito in modo netto. OpenAI con GPT-5.5 è arrivato primo con un tasso complessivo del 24%. Quando i task diventano più complessi, e richiedono ragionamento prolungato, competenza di dominio approfondita ed esecuzione affidabile su orizzonti lunghi, i modelli restano lontani dalla performance umana. Sul livello più difficile, la media del tasso di completamento pieno è del 2,6%. Sul tier più alto di ALE, ogni agente testato — incluso Claude Fable 5 di Anthropic — ha raggiunto lo 0%.

Il paradosso è evidente. Gli stessi modelli che eccellono sui benchmark accademici mostrano crepe profonde appena si cambia terreno. Su ClockBench, un test di lettura di orologi analogici, Gemini Deep Think e GPT-4.5 High hanno raggiunto rispettivamente il 50,1% e il 50,6%, contro il 90% degli esseri umani. Sono gli stessi modelli capaci di vincere medaglie d’oro alle Olimpiadi internazionali di matematica. Questo è il cosiddetto “jagged frontier”: l’AI eccelle in certi compiti e poi fallisce in modo brusco e imprevedibile in altri. Sul fronte del codice, i distacchi tra i modelli restano significativi: Claude Fable 5 domina su SWE-bench Pro con l’80,3%, contro il 58,6% di GPT-5.5 e il 54,2% di Gemini 3.1 Pro.

Il nodo non è solo tecnico. I modelli di frontiera più performanti falliscono nel completare i task con precisione da livello senior in oltre il 70% dei casi. Un benchmark di Microsoft Research, DELEGATE-52, ha rilevato che Gemini 3.1 Pro, Claude e GPT perdono in media il 25% del contenuto di un documento dopo 20 interazioni delegate; su 52 domini professionali testati, solo uno — la programmazione Python — ha superato la soglia del 98% considerata “pronta al deployment”. Il problema non si risolve aggiornando il modello. Un tasso di fallimento del genere non è un problema del modello in sé: è un problema di architettura, deployment e governance.

Il confronto tra benchmark controllati e ambienti produttivi reali continuerà ad allargarsi finché la valutazione non cambierà metodo. Per ora, gli agenti sono lontani dall’essere affidabili sui flussi di lavoro professionali coperti da ALE. Quando lo saranno, il valore del benchmark si sposterà dalla misurazione del margine alla conferma della prontezza al deployment. Il settore ha un problema strutturale: i laboratori costruiscono modelli più veloci di quanto riescano a capire dove falliscono davvero.


Articoli simili

Ultime news


AI in azienda: la tecnologia non basta, il vantaggio resta umano

Le organizzazioni corrono ad adottare l'intelligenza artificiale, ma la ricerca…

AI in azienda: la tecnologia non basta, il vantaggio resta umano
AI Act: dal 2 agosto l’Europa impone la trasparenza sull’IA

Dal 2 agosto 2026 sono operative le nuove regole europee…

AI Act: dal 2 agosto l’Europa impone la trasparenza sull’IA
La corsa all’infrastruttura AI accelera ancora: Gartner prevede 42 miliardi di dollari di spesa nel 2026

Gartner prevede che la spesa mondiale per l'infrastruttura cloud ottimizzata…

La corsa all’infrastruttura AI accelera ancora: Gartner prevede 42 miliardi di dollari di spesa nel 2026
Meta, OpenAI e Anthropic: i loro AI hanno violato sistemi reali durante i test

Tre dei principali laboratori di intelligenza artificiale hanno ammesso che…

Meta, OpenAI e Anthropic: i loro AI hanno violato sistemi reali durante i test

In Evidenza


New York contro i data center (e altre notizie generative) | Weekly AI

Weekly AI è la newsletter settimanale di AI news sulle…

New York contro i data center (e altre notizie generative) | Weekly AI
Più del 50% dei giovani europei usa l’AI per cercare supporto emotivo

Lo riferisce un sondaggio Ipsos BVA condotto su 3.800 ragazzi…

Più del 50% dei giovani europei usa l’AI per cercare supporto emotivo
Intelligenza artificiale: prepararsi al 2026 | Il report di AI News

Il nuovo report di AI News per non farsi sorprendere…

Intelligenza artificiale: prepararsi al 2026 | Il report di AI News
AI, bolla o non bolla? Il parere degli esperti non è unanime

Ne abbiamo intervistati cinque per unire i puntini

AI, bolla o non bolla? Il parere degli esperti non è unanime
Luciano Floridi: “L’intelligenza artificiale non è intelligente”, la nostra intervista | AI Talks #20

"Se potessi tornare indietro, eliminerei l'espressione 'intelligenza artificiale', la chiamerei…

Luciano Floridi: “L’intelligenza artificiale non è intelligente”, la nostra intervista | AI Talks #20

Privacy policy| Cookie policy| Cookie setting| © 2026