OpenAI a détaillé Jalapeño avec ses premiers benchmarks. La puce vise une inférence plus rapide et plus sobre, mais son vrai test viendra fin 2026.
En bref
- OpenAI publie ses premiers benchmarks pour Jalapeño
- La puce surpasse Nvidia Blackwell sur l’inférence testée
- Le vrai déploiement n’arrivera vraiment qu’en 2027
OpenAI sort du simple rôle d’éditeur de modèles
Ce qui se joue ici dépasse une nouvelle puce. Avec Jalapeño, OpenAI avance vers un modèle bien plus intégré, où les modèles, la puce, la mémoire et les produits IA sont pensés ensemble. Pour l’écosystème, c’est le point important.
Annoncé une première fois en octobre, le projet a été mené avec Broadcom, et OpenAI dit avoir utilisé ses propres modèles pour aider au développement. La société veut en faire une plateforme sur plusieurs générations. Autrement dit, pas un coup isolé, mais une brique durable de son infrastructure.
Des benchmarks qui visent directement le terrain de Nvidia
Lors de la conférence Hot Chips, mardi, OpenAI a livré un premier lot de résultats sur le benchmark InferenceX de Semianalysis. Sur ce test, Jalapeño a affiché plus de tokens par utilisateur et un meilleur débit par kilowatt que les processeurs d’inférence considérés aujourd’hui comme les plus avancés.
La comparaison la plus sensible concerne un système Nvidia Blackwell. Et là, forcément, on regarde de près. Richard Ho, responsable hardware chez OpenAI, a résumé la situation ainsi : « Le point essentiel, c’est que les résultats montrent une avancée de performance très, très importante par rapport à l’état de l’art ». Il a aussi insisté sur deux leviers très concrets, plus de travail IA servi par unité d’énergie et des réponses rendues plus vite. Pour un opérateur, ça touche à la fois le coût et la latence.
Pourquoi Jalapeño cible les goulets d’étranglement de l’inférence
Le plus intéressant, à mes yeux, est ailleurs que dans le score brut. OpenAI explique avoir utilisé son approche full-stack pour corriger des phases précises qui freinent souvent l’inférence, surtout le prefill et la communication.
L’idée est de réduire les mouvements de données et les délais d’échange. L’entreprise explique que l’état du modèle, y compris le KV cache utilisé pendant la génération d’une réponse, peut être placé explicitement et conservé en local. Ensuite, le système active la bonne combinaison de calcul, de mémoire et de réseau selon chaque phase d’inférence. En gros, moins d’allers-retours inutiles, plus d’efficacité là où ça coince d’habitude.
Le calendrier tempère un peu l’effet d’annonce
Mais il y a un bémol, quand même. Jalapeño n’arrivera qu’à la fin 2026, et encore en très petits volumes d’après Richard Ho. Le déploiement plus significatif est prévu pour 2027.
Résultat, les benchmarks impressionnent aujourd’hui, mais le marché des accélérateurs IA bouge vite. D’ici là, la concurrence aura eu le temps d’avancer. Ce qui compte donc, ce n’est pas seulement la performance affichée mardi, c’est la capacité d’OpenAI à transformer cette avance technique en déploiement industriel réel.