Moonshot AI ha rilasciato Kimi K3 il 16 luglio 2026: 2,8 trilioni di parametri totali, finestra di contesto da un milione di token, pesi open-weight in arrivo entro il 27 luglio. È il modello open più grande mai costruito, e supera di quasi il doppio il precedente record detenuto da DeepSeek V4 Pro con i suoi 1,6 trilioni.
L’architettura è una Mixture-of-Experts con 896 esperti, di cui solo 16 attivi per ogni token — meno del 2% del totale. In pratica, durante ogni passaggio in avanti vengono utilizzati circa 50 miliardi di parametri, non 2,8 trilioni. Questo è il meccanismo che rende il modello gestibile a livello di inferenza. A quel nucleo sparso, Moonshot ha aggiunto due modifiche strutturali: Kimi Delta Attention, che sostituisce l’attenzione quadratica standard in parte degli strati e consente, secondo la società, una decodifica fino a 6,3 volte più veloce nei contesti lunghi; e Attention Residuals, che cambia il modo in cui ogni strato recupera rappresentazioni da quelli precedenti, dichiarata al 25% di efficienza di addestramento aggiuntiva con meno del 2% di costo extra. Il risultato complessivo è un’efficienza di scaling circa 2,5 volte superiore rispetto a Kimi K2.
Sui benchmark, il quadro è chiaro senza essere uniforme. K3 supera Claude Opus 4.8 e GPT-5.5 in coding e workflow agentici, guida la classifica Frontend Code Arena di Arena.ai con 1.679 punti — saltando dalla posizione 18 alla prima — e su Artificial Analysis ottiene un Elo di 1.547 nella valutazione di knowledge work a lungo orizzonte, un salto di 732 punti rispetto a K2.6. Rimane però sotto a Claude Fable 5 e GPT-5.6 Sol nei punteggi aggregati. Moonshot lo riconosce apertamente. La verifica indipendente completa dovrà aspettare il rilascio dei pesi: fino al 27 luglio ogni numero proviene dall’azienda stessa o da accesso API limitato.
Il contesto che circonda K3 porta con sé tensioni precise. Anthropic aveva accusato Moonshot in febbraio di aver usato 3,4 milioni di conversazioni Claude per addestrare i propri modelli tramite distillazione, e K3 si trova ora a pochi punti dai modelli citati in quell’accusa. Moonshot non ha confermato né smentito. Il blog tecnico di luglio attribuisce i miglioramenti ad architettura e ricette di addestramento. Sul piano geopolitico, tre anni di restrizioni americane all’export di chip non hanno impedito ai laboratori cinesi di avvicinarsi alla frontiera: lo segnalano anche gli analisti di Bank of America, citati da CNBC, secondo cui K3 dimostra che il pre-training su larga scala più lavoro architetturale produce ancora guadagni significativi nonostante i vincoli di calcolo. Moonshot ha risolto il problema spostando il collo di bottiglia: meno compute, più memoria distribuita su almeno 64 acceleratori in un dominio ad alta banda.
Il prezzo è 3 dollari per milione di token in input e 15 per milione in output — circa la metà del costo di Claude Opus 4.8, allo stesso livello di Anthropic Sonnet. L’UK AI Security Institute ha misurato il divario tra modelli aperti e chiusi in 4-7 mesi, sceso dai 6-10 mesi di buona parte del 2025. Quando i pesi di K3 saranno disponibili, la comunità inizierà a quantizzarli e ottimizzarli come già accaduto con Llama, Qwen e DeepSeek. Ogni ciclo è più rapido del precedente. La distanza tra il meglio open e il meglio proprietario si misura ancora in mesi — ma quei mesi continuano a diminuire.














