En bref
- Jalapeño promet une IA plus rapide et plus économe, avec davantage de performances par kilowatt.
- OpenAI veut concurrencer Nvidia, mais sa puce ne sera disponible qu’en petits volumes fin 2026, avant un déploiement en 2027.
- La stratégie mise sur une optimisation complète, en combinant puce, mémoire, réseau et modèles pour réduire les transferts de données.
Faire tourner plus d’IA, plus vite, avec moins d’électricité, c’est un peu le boss final du moment. Et OpenAI pense avoir un sérieux candidat avec Jalapeño, sa puce dédiée à l’inférence, dont les premiers résultats ont été détaillés à Hot Chips.
Une puce qui vise le nerf de la guerre
Sur le benchmark InferenceX de Semianalysis, Jalapeño a affiché davantage de tokens par utilisateur et un meilleur débit par kilowatt que les processeurs d’inférence considérés aujourd’hui comme le haut du panier. En gros, la promesse est double, plus de travail IA rendu pour chaque unité d’énergie, et des réponses qui arrivent plus vite.
Richard Ho, responsable hardware chez OpenAI, a résumé ça assez franchement en expliquant que les résultats montraient une avancée de performance très importante par rapport à l’état de l’art. Il a ajouté, en substance, que Jalapeño pouvait servir davantage de charge IA par unité d’énergie tout en réduisant la latence. Dit autrement, la puce veut être bonne en volume et bonne en réactivité. Pas mal comme combo.
Des scores forts, avec un bémol sur le timing
Le détail qui compte quand même, c’est l’adversaire choisi pour la comparaison. Les chiffres sont mis face à un système Nvidia Blackwell, donc contre ce qui se fait de mieux actuellement sur le terrain.
Mais le calendrier change la lecture. Richard Ho estime que Jalapeño arrivera fin 2026 en très petits volumes, avant un déploiement bien plus sérieux en 2027. D’ici là, Nvidia et les autres n’auront évidemment pas attendu les bras croisés. Le score est impressionnant aujourd’hui, la bataille réelle se jouera plus tard.
Le pari du full stack chez OpenAI
Annoncée une première fois en octobre dernier, la puce a été développée par OpenAI avec Broadcom. Et ce n’est pas juste un projet isolé. L’idée est d’en faire une plateforme sur plusieurs générations, avec les produits IA, les modèles, la mémoire et les puces pensés ensemble.
Petit détail qui dit beaucoup sur l’ambition du projet, les propres modèles de OpenAI ont aidé pendant le développement. Clairement, la boîte pousse à fond son approche full stack, celle où tout est optimisé de bout en bout au lieu d’empiler des briques séparées.
Là où OpenAI pense gagner du temps
Le cœur de la copie, c’est l’optimisation de phases bien précises de l’inférence. OpenAI explique avoir ciblé surtout le prefill et la communication, deux moments qui deviennent souvent des goulots d’étranglement.
L’entreprise dit avoir conçu Jalapeño pour réduire les mouvements de données et les délais de communication. Le but, c’est de garder local l’état du modèle, y compris le KV cache utilisé pendant la génération d’une réponse, tout en activant la bonne combinaison de calcul, de mémoire et de réseau selon chaque phase. Technique, oui. Mais l’idée est limpide, perdre moins de temps à faire circuler les données. Et dans l’IA moderne, c’est souvent là que se gagne une vraie génération de matos.