Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

axios+1axios+1axiosOpenAI a publié mardi des benchmarks montrant que sa puce d'inférence sur mesure Jalapeño surpasse Nvidia et d'autres concurrents en termes de débit et d'efficacité énergétique, marquant ainsi le défi public le plus détaillé à ce jour de la start-up d'IA face à la suprématie matérielle du leader des puces.
Ces benchmarks, partagés avant la présentation d'OpenAI à la conférence sur les semi-conducteurs Hot Chips à Stanford, montrent que Jalapeño fournit 1,5 à 1,9 fois plus de travail d'IA par watt et une latence de bout en bout 1,7 à 3,6 fois plus faible que les systèmes GB200 et GB300 de Nvidia lors de l'exécution de modèles tels que DeepSeek R1, la version à 1 000 milliards de paramètres de Kimi K2.5, et le propre modèle d'OpenAI, GPT-OSS 120B.axios+1
La puce, co-développée avec Broadcom et évoquée pour la première fois en juin, a été conçue de zéro exclusivement pour l'inférence de grands modèles de langage (LLM). Au niveau du système, chaque rack Jalapeño contient 128 accélérateurs offrant 1,7 exaFLOPS de calcul en 4 bits, 27,5 To de mémoire HBM4 et près de 2 pétaoctets par seconde de bande passante mémoire.theregister
Richard Ho, vice-président du matériel chez OpenAI, a déclaré aux journalistes que la puce offrait le « meilleur des deux mondes » avec une latence plus faible et un débit plus élevé, alors que les systèmes d'IA doivent généralement « faire un compromis entre les deux ».theverge
Selon SemiAnalysis, qui a exécuté sa suite de benchmarks InferenceX sur la puce dans les laboratoires d'OpenAI, Jalapeño a atteint plus de 700 jetons par seconde et par utilisateur avec une simultanéité de 1 sur DeepSeek R1 : le tout sans décodage spéculatif ni désagrégation pré-remplissage/décodage, des techniques sur lesquelles s'appuient les concurrents pour gonfler leurs chiffres.newsletter.semianalysis
OpenAI est passée du recrutement de l'équipe initiale à la finalisation de la conception (tape-out) en environ 16 mois, la puce ayant été finalisée en novembre 2025. L'entreprise a indiqué que l'assistance de l'IA avait contribué à une réduction de 8 % de la surface SIMD et de 10 % de la surface du moteur matriciel lors de la conception.newsletter.semianalysis
Néanmoins, Jalapeño ne gère que l'inférence, pas l'entraînement. « Nous allons avoir besoin de beaucoup de puissance de calcul », a déclaré Richard Ho. « Et Jalapeño en fait partie. Cerberus en fait partie. Nvidia en fait partie. AMD Advanced Micro Devices, Inc. en fait partie. »axios
OpenAI prévoit un déploiement limité d'ici fin 2026, avec une montée en puissance de la production de masse tout au long de l'année 2027. L'entreprise développe déjà une puce de deuxième génération, et les plans d'une troisième prennent déjà forme.theverge+1
SemiAnalysis a toutefois souligné d'importantes nuances : les benchmarks ont utilisé une charge de travail relativement simple de 8 000 jetons en entrée et 1 000 en sortie, plutôt que les charges de travail agentiques plus exigeantes qui sollicitent la mise en cache et le routage. De plus, des comparaisons avec la nouvelle architecture Vera Rubin de Nvidia, qui utilise la même mémoire HBM4, seraient plus équitables.newsletter.semianalysis
Cette puce arrive sur un marché déjà encombré. Google Alphabet Inc. dispose de sa gamme de TPU, Amazon Amazon.com, Inc. et Microsoft ont leurs propres conceptions, et Anthropic a confirmé plus tôt ce mois-ci travailler sur son propre projet de puce en interne. OpenAI n'a pas l'intention de vendre Jalapeño à l'externe. « Nos besoins sont si importants que nous ne voyons pas quand nous pourrions le faire », a affirmé Richard Ho.axios