Nella nostra leaderboard, mappiamo i principali modelli di linguaggio sviluppati e rilasciati dalle aziende di punta operanti nel settore dell’intelligenza artificiale.
La tabella raccoglie i risultati di diverse valutazioni operate attraverso una serie di benchmark in grado di rappresentare in modo comprensivo le funzionalità e i livelli di efficienza dei large language model in esame, dalle abilità matematiche al ‘ragionamento’, fino alla capacità di elaborazione del testo. A ogni modello riportato nella leaderboard è dedicata una pagina di approfondimento.
La mappatura include modelli gratuiti e a pagamento ed è aggiornata nel tempo, in modo da seguire l’evoluzione e i trend del settore.
| Modello |
Average* Punteggio medio delle prestazioni complessive |
MMLU (General) Comprensione multi-task su vari argomenti |
GPQA (Reasoning) Capacità di ragionamento e deduzione |
HumanEval (Coding) Competenze nella programmazione |
Math Risoluzione di problemi matematici |
BFCL (Tool Use) Uso efficace di strumenti esterni |
MGSM (Multilingual) Comprensione e generazione multilingue |
| Claude 4.5 Sonnet |
82.7% |
85% |
83.4% |
72% |
82% |
68.7% |
87% |
| DeepSeek R1 |
80.15% |
90.8% |
71.5% |
71.4% |
97.3% |
57.5% |
88.8% |
| DeepSeek V3 |
81.35% |
88.5% |
64.8% |
74.2% |
94% |
58.6% |
89.2% |
| Gemini 2.5 Pro |
87.7% |
89% |
86.4% |
76.9% |
96.7% |
53.99% |
92.8% |
| GPT 5 |
89.9% |
92.5% |
87.3% |
93.4% |
84.7% |
61.6% |
94% |
| GPT-4o |
80.5% |
88.7% |
53.6% |
90.2% |
76.6% |
83.5% |
90.5% |
| GPT-4o Mini |
81.5% |
82% |
40.2% |
87.2% |
70.2% |
81% |
87% |
| Grok 4 |
84.9% |
87% |
88.4% |
82.7% |
88% |
62.8% |
82.8% |
| Llama-3.3 70b |
77.3% |
86% |
50.5% |
88.4% |
77% |
77.3% |
91.1% |
| Mistral 3 |
- |
85.5% |
71.2% |
- |
90.4% |
- |
- |
OpenAI o1 |
79% |
91.8% |
75.7% |
92.4% |
96.4% |
80.6% |
89.3% |
* Per alcuni modelli non è presente il dato Average in quanto non sono disponibili i valori di alcuni parametri.
Ultimo aggiornamento: Dicembre 2025