MLPerf Client v2.0: benchmark AI per PC con agenti e immagini

MLCommons ha rilasciato MLPerf Client v2.0, il benchmark standard per misurare le prestazioni dell'IA sui PC, con nuove categorie per la generazione di immagini e i workflow agentici. Al progetto partecipano AMD, Intel, Microsoft, NVIDIA e Qualcomm.

2 min.

MLPerf Client v2.0: benchmark AI per PC con agenti e immagini

MLCommons ha rilasciato il 18 agosto 2026 MLPerf Client v2.0, l’ultima versione del suo benchmark per misurare le prestazioni dell’intelligenza artificiale sui personal computer. Due nuove categorie entrano nel quadro: generazione di immagini e IA agentiva. Il perimetro di misurazione si allarga, e con esso la capacità del settore di confrontare macchine diverse su compiti che fino a ieri sfuggivano a qualsiasi metrica condivisa.

MLPerf Client nasce per rispondere a una domanda precisa: quanto è capace un PC — laptop, desktop o workstation — di eseguire carichi di lavoro AI in locale? La versione 1.x si concentrava sugli LLM, con test di sintesi, generazione di testo e analisi del codice. La v2.0 mantiene tutto questo e aggiunge due aree nuove. La prima riguarda la generazione visiva: un segmento dedicato con il modello Flux 2 Klein 4B in fase sperimentale, che produce immagini a risoluzione 1024×1024 pixel partendo da quattro prompt distinti, ciascuno con quattro output separati. L’obiettivo è simulare un uso reale, non un test di laboratorio astratto. La seconda area è quella degli agenti: scenari di ingegneria del software e analisi dati, misurati dall’inizio alla fine, con un dettaglio separato tra i tempi di inferenza dell’LLM e i tempi di esecuzione degli strumenti. Due numeri, non uno solo: perché capire dove si perde il tempo cambia le decisioni hardware.

Sul fronte degli LLM, i test obbligatori cambiano formazione. Phi 3.5 Mini Instruct esce, sostituito da Phi 4 Mini Instruct. Llama 3.1 8B resta benchmark base obbligatorio. Qwen 3 8B entra come test sperimentale. Phi 4 Reasoning 14B viene spostato nella categoria estesa, riservata a macchine con maggiori risorse. I prompt base includono ora un task di sintesi intermedia con input da circa 4.000 token, una lunghezza più vicina all’uso quotidiano di chi lavora con documenti lunghi.

Dietro MLPerf Client c’è una coalizione industriale che pochi altri progetti possono vantare: AMD, Intel, Microsoft, NVIDIA, Qualcomm Technologies e i principali produttori di PC hanno contribuito risorse e competenze alla definizione del benchmark. Il valore di questo consorzio non è solo tecnico. È politico, nel senso più neutro del termine: un benchmark condiviso da tutti i grandi produttori di chip e di sistemi operativi diventa difficile da ignorare. I produttori di hardware che vogliono dimostrare le proprie capacità AI non possono più limitarsi a test interni.

Il benchmark gira su Windows, Linux e macOS, con backend differenti a seconda della piattaforma. Il gruppo di lavoro garantisce la comparabilità tra sistemi diversi verificando la qualità visiva degli output durante lo sviluppo: un passaggio necessario quando il risultato non è un numero ma un’immagine, e la metrica non può essere solo la velocità. La trasparenza del processo è parte integrante del progetto, non un’aggiunta.

Con la generazione di immagini e gli agenti ora misurabili in modo standardizzato, il mercato degli AI PC ha finalmente strumenti per confrontare architetture diverse su compiti concreti. Il passo successivo logico è che i produttori inizino a ottimizzare l’hardware proprio su questi benchmark — come è già successo nel mondo dei server con MLPerf Inference. Quando le metriche diventano standard, l’industria si muove di conseguenza.


Articoli simili

Ultime news


Nvidia punta 7 miliardi su Poolside AI: licenza, talenti e modelli aperti

Nvidia ha siglato un accordo da 7 miliardi di dollari…

Nvidia punta 7 miliardi su Poolside AI: licenza, talenti e modelli aperti
OpenAI lancia AI Futures: il think tank interno sulla governance dell’IA

OpenAI ha lanciato AI Futures, il blog del suo nuovo…

OpenAI lancia AI Futures: il think tank interno sulla governance dell’IA
L’harness batte il modello: Nvidia porta Claude Opus 5 al 100%

Nvidia ha dimostrato che l'architettura che avvolge un modello AI…

L’harness batte il modello: Nvidia porta Claude Opus 5 al 100%
Ode with Anthropic acquisisce Casper Studios: la prima mossa nell’enterprise

Ode with Anthropic, la joint venture sostenuta da Blackstone e…

Ode with Anthropic acquisisce Casper Studios: la prima mossa nell’enterprise
Nvidia, server AI oltre il 15% più cari: colpa della memoria

I server con chip AI di Nvidia aumenteranno di oltre…

Nvidia, server AI oltre il 15% più cari: colpa della memoria

In Evidenza


New York contro i data center (e altre notizie generative) | Weekly AI

Weekly AI è la newsletter settimanale di AI news sulle…

New York contro i data center (e altre notizie generative) | Weekly AI
Più del 50% dei giovani europei usa l’AI per cercare supporto emotivo

Lo riferisce un sondaggio Ipsos BVA condotto su 3.800 ragazzi…

Più del 50% dei giovani europei usa l’AI per cercare supporto emotivo
Intelligenza artificiale: prepararsi al 2026 | Il report di AI News

Il nuovo report di AI News per non farsi sorprendere…

Intelligenza artificiale: prepararsi al 2026 | Il report di AI News
AI, bolla o non bolla? Il parere degli esperti non è unanime

Ne abbiamo intervistati cinque per unire i puntini

AI, bolla o non bolla? Il parere degli esperti non è unanime
Luciano Floridi: “L’intelligenza artificiale non è intelligente”, la nostra intervista | AI Talks #20

"Se potessi tornare indietro, eliminerei l'espressione 'intelligenza artificiale', la chiamerei…

Luciano Floridi: “L’intelligenza artificiale non è intelligente”, la nostra intervista | AI Talks #20

Privacy policy| Cookie policy| Cookie setting| © 2026