xAI ha rilasciato Grok 4.7 il 21 settembre 2026, dopo almeno cinque rinvii accumulati dalla fine di luglio. Il modello è disponibile da subito senza lista d’attesa tramite l’API di xAI, Cursor, Grok Build e i principali gateway di terze parti.
Sul piano tecnico, il salto rispetto a Grok 4.6 è consistente. 2,1 trilioni di parametri, contro 1,5 trilioni del predecessore: un aumento del 40% che si accompagna a un ciclo di reinforcement learning più lungo, a task di addestramento che simulano ore di lavoro continuo e a un sistema di auto-verifica dell’output. La finestra di contesto arriva a 500.000 token. xAI ha anche integrato nel training set dati interni di SpaceX: telemetria dei satelliti Starlink, log di produzione e registrazioni di guasti ingegneristici. L’obiettivo dichiarato è un modello che ragioni meglio su hardware e sistemi fisici rispetto a qualsiasi modello addestrato solo su testo web.
I benchmark mostrano progressi reali su più fronti professionali. Su AA-Briefcase v1.1, il punteggio Elo sale da 1.546 a 1.657, un guadagno di 111 punti. Su GDPval — che misura le prestazioni su lavoro economicamente rilevante come memo legali, fogli di calcolo e presentazioni — Grok 4.7 raggiunge 1.695 Elo in modalità xhigh. Il benchmark legale Harvey Legal Agent passa dal 15,8% al 19,6%, HealthBench Professional dal 48,5% al 56,7%, e EEBench per l’ingegneria elettrica dal 53,0% al 64,0%. Su DeepSWE v1.1 il modello tocca il 71,0%, contro il 65,2% di Grok 4.6. Su CursorBench 4.0, il 46,3% di accuratezza supera GPT-5.6 Sol Max al 41,7%.
Il quadro d’insieme rimane però meno lusinghiero. Sull’Artificial Analysis Intelligence Index v4.3.2, che aggrega dieci benchmark, Grok 4.7 si ferma a 46, mentre Claude Fable 5.1 e GPT-6 Astra guidano entrambi a 53. Il divario si allarga nell’agentic coding: su Terminal-Bench 4.0 il modello registra il 26%, lontano dal 60% di GPT-6 Astra e dal 55% di Claude Fable 5.1. Perfino DeepSeek V4.1 Flash, posizionato nella fascia economica, lo sopravanza di un punto percentuale su questo specifico test. Su GDPval, Fable 5.1 max segna 1.735, quaranta punti sopra Grok 4.7 xhigh.
Il prezzo è uno degli argomenti più forti di xAI: 2 dollari per milione di token in input e 6 dollari per milione in output, identico a Grok 4.6 e sensibilmente inferiore ai listini dei principali modelli occidentali. Esiste anche una variante Grok 4.7 Fast, disponibile su Cursor e Grok Build ma non ancora via API pubblica, che offre circa il doppio della velocità di generazione al doppio del costo base. Per chi vuole l’inferenza in territorio statunitense, è disponibile un endpoint regionale con un sovrapprezzo del 10%.
Sul fronte della sicurezza, xAI ha rifatto da capo lo stack di protezione. Il modello ha superato il biosafety benchmark di LatchBio con un punteggio del 62,4% e su HackerBench v0.3 ha bloccato il 96,7% dei prompt a doppio uso pericoloso senza penalizzare la ricerca legittima in ambito cybersecurity. Un gruppo selezionato di partner nel settore ottiene anche accesso su invito a strumenti di red-teaming per la difesa.
Elon Musk ha indicato che le versioni successive — Grok 4.8, 4.9 e poi Grok 5 — puntano alla leadership di frontiera. Il pattern attuale, però, è ricorrente: xAI porta sul mercato modelli più grandi e più economici, ma i test indipendenti li collocano sistematicamente a ridosso dei migliori senza raggiungerli. Il prezzo competitivo può attrarre sviluppatori e aziende che cercano capacità professionali a costi contenuti, ma per scalare verso la vetta servirà qualcosa di più di un aumento di parametri.














