Alla conferenza Hot Chips del 25 agosto 2026, OpenAI ha mostrato i primi numeri concreti su Jalapeño, il suo chip dedicato all’inferenza realizzato insieme a Broadcom. Sul benchmark pubblico InferenceX di SemiAnalysis, il chip ha registrato da 1,5 a 1,9 volte più lavoro per watt rispetto a un sistema Nvidia Blackwell, con una latenza end-to-end ridotta da 1,7 a 3,6 volte. Fino a quel momento, OpenAI aveva usato solo formule vaghe: efficienza “significativamente migliore dello stato dell’arte”. Adesso ci sono i dati.
Jalapeño è un ASIC progettato da zero per l’inferenza su grandi modelli linguistici. Non è un acceleratore da training riadattato, non è un processore general-purpose. OpenAI lo ha costruito partendo dalle proprie esigenze: la comprensione interna dei modelli, del serving, delle architetture kernel. Broadcom ha curato l’implementazione del silicio e il networking tramite la propria tecnologia Ethernet Tomahawk; Celestica si è occupata dell’integrazione di sistema. Il ciclo di sviluppo, dalla progettazione al tape-out, ha richiesto nove mesi — un tempo ridotto anche grazie all’uso dei modelli AI di OpenAI stessa nella fase di design.
Il chip affronta due colli di bottiglia tipici dell’inferenza: la fase di prefill e quella di comunicazione tra unità di calcolo. Jalapeño minimizza il movimento dei dati e mantiene il KV cache — la struttura che gestisce la memoria durante la generazione di una risposta — il più vicino possibile alle unità di elaborazione. L’architettura bilancia calcolo, memoria e rete per avvicinarsi al picco teorico di utilizzo, invece di lasciare risorse inutilizzate come accade spesso nei sistemi GPU tradizionali. Il thermal design power è stato contenuto tra 700 e 800 watt, restando nei limiti del raffreddamento ad aria: un dettaglio che ha conseguenze pratiche dirette su quali data center esistenti possono ospitarlo senza interventi strutturali.
Il confronto nei benchmark è avvenuto contro i sistemi Nvidia GB200 NVL72 e GB300 NVL72, i rack Blackwell attualmente disponibili. Va detto che quando Jalapeño raggiungerà volumi significativi, nel 2027, il panorama competitivo sarà diverso: Nvidia avrà probabilmente già rilasciato le architetture Rubin, e AMD le sue Instinct MI400. Richard Ho, responsabile hardware di OpenAI, è stato diretto su questo punto: il confronto è con lo stato dell’arte attuale, non con quello futuro. SemiAnalysis ha verificato i benchmark di persona, senza però eseguire l’intera suite in autonomia.
Il déployment è previsto a fine 2026 in volumi ridotti, con un’espansione più consistente nel 2027. OpenAI non ha indicato quante unità intende distribuire il prossimo anno. Il chip non sarà disponibile per clienti esterni: niente mercato di noleggio, niente istanze cloud dedicate, nessuna vendita a terzi. Ho ha spiegato che l’azienda fatica già a coprire il proprio fabbisogno computazionale. Nel frattempo, lo sviluppo non si ferma: una seconda generazione è già in fase avanzata di progettazione, una terza è già in corso, e la seconda dovrebbe completare il tape-out nei prossimi mesi. Jalapeño segna l’inizio di una roadmap hardware autonoma, non un punto d’arrivo.














