OpenAI Jalapeño è il primo chip di inferenza progettato da OpenAI insieme a Broadcom per accelerare i grandi modelli linguistici. Il punto più interessante non è solo l’hardware: secondo OpenAI, il progetto è passato dalla progettazione alla produzione in nove mesi anche grazie all’uso dei suoi modelli AI nel flusso di sviluppo.
La notizia racconta bene dove sta andando l’intelligenza artificiale: non basta avere modelli più potenti, servono anche chip, data center, reti e software costruiti attorno a quei modelli. Jalapeño è proprio questo: un tentativo di portare OpenAI più in profondità nello stack fisico che permette a ChatGPT, Codex, API e prodotti agentici di rispondere più velocemente e con costi più controllabili.

Che cos’è OpenAI Jalapeño
Jalapeño è un ASIC di inferenza per LLM, cioè un chip progettato per eseguire modelli linguistici su larga scala, non una GPU general purpose adattata all’AI. OpenAI lo descrive come il suo primo Intelligence Processor e come il primo tassello di una piattaforma di calcolo multi-generazione costruita con Broadcom e altri partner.
L’obiettivo è ridurre il costo e la latenza dell’inferenza, la fase in cui un modello già addestrato genera risposte per gli utenti. È la parte che impatta direttamente prodotti come ChatGPT, Codex e le API: se l’inferenza diventa più efficiente, un servizio AI può rispondere più rapidamente, sostenere più richieste e consumare meno energia per ogni unità di lavoro.
OpenAI afferma che il chip è stato progettato da zero attorno a kernel, memoria, networking e pattern di serving dei propri modelli, con il contributo di Broadcom per implementazione in silicio e networking ad alte prestazioni. L’azienda cita anche Celestica per schede, rack e sistemi.
Perché i 9 mesi sono il dato che colpisce
Nel settore dei semiconduttori, sviluppare un acceleratore avanzato richiede normalmente cicli molto lunghi. OpenAI sostiene invece che Jalapeño sia arrivato al tape-out in nove mesi. Il tape-out è il passaggio in cui il progetto del chip viene finalizzato per la produzione: non significa prodotto sugli scaffali, ma indica che il design ha superato una fase critica.
Il motivo per cui questo dato pesa è semplice: se l’AI riesce ad abbreviare i cicli di progettazione del silicio, le aziende potrebbero aggiornare l’hardware con una velocità più vicina a quella del software. Non sarebbe una magia automatica, ma un cambiamento industriale importante.
OpenAI collega la rapidità del progetto al co-design tra hardware e software e all’uso dei propri modelli per accelerare alcune fasi di progettazione e ottimizzazione. Il chip quindi non è solo un prodotto per l’AI: è anche un caso pratico di AI usata per costruire l’infrastruttura dell’AI.
L’AI non sostituisce il lavoro degli ingegneri
Il punto da chiarire è fondamentale: Jalapeño non va raccontato come un chip creato da solo da un modello generativo. Le informazioni disponibili indicano un workflow ibrido, con ingegneri al centro delle decisioni e modelli AI usati per accelerare parti del lavoro.
La differenza è importante. Un chip avanzato richiede architettura, microarchitettura, verifica, simulazioni, vincoli fisici, validazione elettrica e controlli di produzione. L’AI può aiutare a generare codice, esplorare alternative, ottimizzare porzioni del progetto e ridurre iterazioni ripetitive, ma il sign-off resta un processo tecnico ad alta responsabilità.
È una dinamica che Tech aveva già raccontato in scala più sperimentale parlando del chip Google progettato con l’AI in 6 ore. Jalapeño però alza il livello, perché non riguarda soltanto un esperimento di floorplanning: è un processore destinato alla strategia infrastrutturale di OpenAI.
Perché OpenAI vuole un chip proprio
La corsa all’AI è sempre più una corsa al calcolo. GPU, acceleratori, reti, memoria e data center sono diventati parte della competizione tra OpenAI, Google, Anthropic, Meta e gli altri grandi attori del settore. Avere un chip progettato attorno ai propri carichi permette di ottimizzare meglio prestazioni, consumi e costi.
OpenAI non sta dicendo che Jalapeño sostituirà tutte le GPU o tutti gli acceleratori sul mercato. Sta dicendo una cosa più mirata: per l’inferenza LLM su larga scala, un ASIC progettato attorno ai carichi reali dei modelli può essere più efficiente di hardware generalista usato per molti scenari diversi.

Questo si collega direttamente alla scala energetica dei data center. Su Tech abbiamo già analizzato quanto può pesare un maxi data center AI di OpenAI da 8 GW: un chip più efficiente non elimina il problema dell’energia, ma può migliorare il rapporto tra calcolo utile e consumo.
Cosa sappiamo sulle prestazioni
OpenAI ha dichiarato che i primi test mostrano prestazioni per watt superiori allo stato dell’arte attuale, ma i numeri vanno letti con cautela. L’azienda ha presentato Jalapeño come un acceleratore ottimizzato per inferenza LLM e ha indicato che campioni ingegneristici stanno già eseguendo carichi di lavoro ML in laboratorio alla frequenza e alla potenza previste per la produzione.
In un successivo aggiornamento sulla propria strategia full stack, OpenAI ha affermato che Jalapeño ha mostrato più throughput di picco per kilowatt e minore latenza dei token su InferenceX rispetto ai sistemi commerciali usati nel confronto. Sono benchmark utili per capire la direzione, ma non equivalgono a una prova indipendente completa in tutti gli scenari possibili.
La domanda da seguire nei prossimi mesi sarà quindi più concreta: quanto Jalapeño riuscirà a incidere sui costi reali dell’inferenza, sulla latenza dei prodotti OpenAI e sulla dipendenza dall’hardware di terze parti?
Perché questa storia conta anche per gli utenti
A prima vista, un ASIC di inferenza sembra una notizia da addetti ai lavori. In realtà riguarda anche gli utenti finali, perché l’hardware determina quante persone possono usare un servizio AI, con quali tempi di risposta e a quale costo.
Se OpenAI riuscirà a rendere l’inferenza più efficiente, gli effetti potrebbero arrivare in modo indiretto: modelli più rapidi, funzioni agentiche meno costose da eseguire, API più sostenibili per gli sviluppatori e maggiore capacità nei momenti di domanda elevata. Non è un effetto immediato né garantito, ma è il motivo industriale dietro questa corsa al silicio proprietario.
La parte più interessante di Jalapeño è quindi il ciclo che descrive: modelli AI che aiutano a progettare chip migliori, chip migliori che eseguono modelli più efficientemente, data center che diventano più grandi e prodotti AI che richiedono ancora più capacità. È un volano tecnologico, ma anche energetico ed economico.
Cosa resta da verificare
Restano aperte alcune domande importanti. Non sappiamo ancora quanto Jalapeño sarà usato fuori dall’infrastruttura OpenAI, quanto velocemente verrà distribuito su scala ampia e quanto inciderà sui costi dei prodotti. Non sappiamo nemmeno se il ciclo di sviluppo accelerato diventerà replicabile sulle generazioni successive o se resterà un risultato eccezionale del primo progetto.
Per ora, però, il segnale è chiaro: OpenAI non vuole dipendere solo dai modelli. Vuole controllare una parte crescente dell’infrastruttura che rende quei modelli utilizzabili. Jalapeño è il simbolo di questa svolta: l’AI non vive più soltanto nel software, ma sta ridisegnando anche il modo in cui si progettano i chip che la fanno funzionare.
Le informazioni tecniche principali sono state verificate sull’annuncio ufficiale OpenAI e Broadcom, sull’aggiornamento OpenAI dedicato alla strategia full stack dell’azienda e sull’intervista tecnica pubblicata da Tom’s Hardware.




Entra nella conversazione
Condividi il tuo punto di vista: non serve creare un account. I contributi restano soggetti alla moderazione editoriale.