Jalapeño : la bataille de l’IA se déplace vers l’inférence
OpenAI publie les premiers résultats de Jalapeño, sa puce maison dédiée à l’inférence. Derrière les benchmarks face à Nvidia, le vrai enjeu est ailleurs : coût du calcul, vitesse des agents et contrôle de toute la pile IA.
En bref
- Jalapeño est la première puce d’inférencePhase d’utilisation d’un modèle déjà entraîné : produire une sortie à partir d’une entrée (par opposition à l’entraînement). conçue par OpenAILaboratoire d’IA américain à l’origine des modèles GPT et de ChatGPT, accessibles par API et non téléchargeables., avec Broadcom.
- Sur les premiers tests publics, elle affiche 1,5 à 1,9× plus de travail IA par watt et 1,7 à 3,6× moins de latenceDélai avant (ou pendant) la réponse d’un modèle. Le TTFT mesure le temps jusqu’au premier token. que les systèmes comparés.
- Son objectif n’est pas d’entraîner les modèles, mais de les faire tourner plus vite et à moindre coût une fois entraînés.
- L’enjeu est particulièrement important pour les agents, où les temps d’attente s’additionnent à chaque étape.
- Les résultats sont prometteurs mais à lire avec leurs caveats : validation SemiAnalysis partielle, workloads encore limités et comparaison très dépendante des scénarios.
Sommaire · 7 sections
OpenAI vient de publier les premiers résultats détaillés de Jalapeño, sa première puce conçue spécifiquement pour faire tourner des modèles d’IA. Derrière le nom un peu léger se cache un sujet beaucoup plus structurant : OpenAI veut désormais optimiser non seulement ses modèles et ses logiciels, mais aussi le matériel sur lequel ils s’exécutent.
Et les premiers chiffres sont suffisamment spectaculaires pour attirer l’attention. Sur plusieurs modèles publics, OpenAI annonce entre 1,5 et 1,9 fois plus de travail IA par watt et une latence de bout en bout réduite de 1,7 à 3,6 fois face aux systèmes de comparaison. Mais pour comprendre ce que cela peut réellement changer, il faut d’abord distinguer deux étapes souvent mélangées : l’entraînement et l’inférence.
Jalapeño, c’est quoi exactement ?
Jalapeño est un ASIC, une puce spécialisée conçue avec Broadcom pour un usage précis : l’inférence des grands modèles de langage.
L’entraînement correspond à la phase où un modèle apprend à partir d’immenses volumes de données. C’est extrêmement coûteux, mais relativement ponctuel. L’inférence, elle, commence une fois le modèle entraîné : c’est tout le calcul nécessaire chaque fois qu’un utilisateur pose une question à ChatGPT, qu’un développeur appelle une APIApplication Programming Interface : contrat machine pour consommer un service (HTTP, SDK, webhooks). ou qu’un agent exécute une tâche.
Autrement dit, plus les usages de l’IA augmentent, plus l’inférence devient une dépense permanente.
C’est précisément cette partie qu’OpenAI cherche à optimiser avec Jalapeño.
La puce n’a donc pas vocation à remplacer tous les GPUProcesseur graphique massivement parallèle, standard de fait pour entraîner et servir des modèles de deep learning.. OpenAI indique d’ailleurs qu’il continuera à utiliser massivement des accélérateurs Nvidia et ceux d’autres partenaires. Jalapeño ajoute plutôt une nouvelle brique spécialisée dans une infrastructure devenue gigantesque.
Pourquoi l’inférence devient le vrai nerf de la guerre
Pendant les premières années de l’IA générative, la compétition s’est largement racontée à travers la taille des modèles, le nombre de GPU nécessaires à leur entraînement ou les milliards investis dans les data centers.
Mais une fois qu’un modèle est disponible pour des centaines de millions d’utilisateurs, une autre équation apparaît : combien coûte chaque réponse ?
Une amélioration du nombre de tokensUnité de texte traitée par un modèle (souvent un morceau de mot). Les coûts et fenêtres de contexte se comptent en tokens. produits par watt peut paraître très technique. À l’échelle d’un service mondial, elle devient rapidement économique.
Une infrastructure plus efficace permet théoriquement de servir davantage de requêtes avec la même quantité d’électricité et de matériel. Elle peut aussi réduire le coût d’une requête, améliorer la disponibilité lors des pics de demande et rendre économiquement viables des usages jusque-là trop gourmands.
C’est ce qu’OpenAI appelle son avantage « full stack » : concevoir ensemble les modèles, les logiciels de serving, le réseau, la mémoire et désormais les puces.
Google poursuit depuis longtemps une logique comparable avec ses TPU. Meta, Microsoft et d’autres hyperscalers développent également leurs propres accélérateurs. Dans un secteur où Nvidia reste central, fabriquer une partie de son silicium est à la fois un levier d’optimisation et un moyen de réduire une dépendance stratégique.
Pourquoi Jalapeño est surtout intéressant pour les agents
C’est probablement le point le plus important pour la suite.
Une conversation classique avec un chatbot implique quelques étapes : envoyer une requête, générer une réponse, éventuellement recommencer.
Un agent peut au contraire effectuer des dizaines ou des centaines d’actions successives : lire des fichiers, lancer une recherche, appeler un outil, analyser le résultat, modifier du code, tester, recommencer.
Dans ce type de fonctionnement, la latence s’accumule. Une étape qui gagne une seconde peut sembler marginale ; répétée cinquante fois dans une même tâche, elle change complètement l’expérience.
OpenAI insiste donc autant sur la vitesse que sur le débit. Jalapeño a été conçu pour éviter le compromis traditionnel entre un système optimisé pour servir énormément d’utilisateurs simultanément et un système optimisé pour répondre extrêmement vite à chacun d’eux.
Sur les benchmarksJeu de référence public ou interne pour comparer des modèles (MMLU, HumanEval, etc.) — à lire avec prudence hors domaine. publiés, OpenAI affirme obtenir les deux.
C’est particulièrement intéressant si l’on imagine des agents qui travaillent plusieurs minutes, voire plusieurs heures, en multipliant les appels au modèle. Dans ce monde-là, le coût et la latence de l’inférence deviennent presque aussi importants que l’intelligence du modèle lui-même.
Ce que montrent les premiers benchmarks
OpenAI a testé Jalapeño avec InferenceX, un benchmark public développé par SemiAnalysis, sur trois modèles : GPT-OSSLogiciel dont le code source est disponible sous une licence qui autorise étude, modification, redistribution. 120B, DeepSeek R1 670B et Kimi K2.5 1T.
Selon les résultats publiés, Jalapeño atteint selon les cas :
- 1,5 à 1,9× plus de performance par watt au débit maximal ;
- 1,7 à 3,6× moins de latence de bout en bout ;
- 2,1 à 4,1× plus de performance sur certains scénarios très interactifs.
Ces comparaisons perf/W reposent sur le TDP publié par accélérateur : 700 W pour Jalapeño, 1 200 W pour le GB200 et 1 400 W pour le GB300. OpenAI précise toutefois que la consommation soutenue mesurée de Jalapeño est restée à 550 W ou moins sur les charges testées. C’est un point important pour lire correctement les courbes : la normalisation est cohérente entre plateformes, mais elle ne reflète pas nécessairement la consommation réelle en charge.
Autre nuance en faveur d’OpenAI : Jalapeño obtient ces résultats sans Multi Token Prediction ni décodage spéculatif, alors que les autres puces des graphiques sont évaluées dans leurs meilleures configurations avec MTP.
SemiAnalysis précise cependant que tous les chiffres lui ont été fournis par OpenAI. Ses analystes ont observé sur place et vérifié des runs InferenceX, mais sans exécuter eux-mêmes l’intégralité de la suite de tests. Leur validation est donc utile, sans être équivalente à un benchmark indépendant de bout en bout.
Leur analyse formule aussi plusieurs réserves.
Premièrement, les charges testées restent relativement simples par rapport aux scénarios longs, multi-tours et riches en cache que produisent de vrais agents. SemiAnalysis préfère pour cela son benchmark AgentX, sur lequel Jalapeño n’a pas encore publié de résultats.
Deuxièmement, les modèles choisis ne représentent pas la frontière la plus récente de l’open-weightModèle dont les poids sont publiés (ex. Llama, Mistral), par opposition à une API fermée uniquement. : Nvidia et AMD ont déjà publié des résultats sur des modèles plus gros, comme DeepSeek V4 Pro et Kimi K3.
Enfin, la comparaison avec Nvidia Rubin existe déjà. SemiAnalysis relève que, sur les résultats publics disponibles en juillet, Jalapeño dépasse Vera Rubin en débit de tokens par MW dans le scénario STP, tandis que les deux plateformes sont au coude-à-coude sur le ratio performance/TCO. La comparaison n’est toutefois pas totalement symétrique : les résultats Vera Rubin utilisent le décodage spéculatif, contrairement à ceux de Jalapeño, ce qui rend ce coude-à-coude plutôt flatteur pour OpenAI. Cela ne permet toujours pas de conclure qu’OpenAI a « battu Nvidia » de manière générale : les architectures, les charges, les logiciels et les générations évoluent trop vite pour réduire la comparaison à un seul graphique.
Une puce conçue avec de l’IA — et pour être programmée par de l’IA
L’autre partie intéressante de l’annonce concerne la manière dont Jalapeño a été développé.
OpenAI explique avoir utilisé ses propres modèles pendant la conception et l’optimisation de la puce. L’entreprise affirme être passée du design initial au tape-out en neuf mois. C’est le calendrier communiqué par OpenAI : SemiAnalysis situe plus largement le début des travaux de conception à la mi-2024, avec environ seize mois entre les premiers recrutements et le tape-out de novembre 2025. Les deux formulations ne mesurent donc manifestement pas exactement la même phase du projet.
Mais le raisonnement va plus loin : l’architecture a également été pensée pour être programmable par des agents IASystème qui planifie et enchaîne des actions (outils, APIs, code) pour atteindre un objectif, au-delà d’une seule réponse texte..
Adapter un nouveau modèle à un accélérateur nécessite généralement d’écrire et d’optimiser des kernels, ces petits programmes extrêmement spécialisés qui exploitent le matériel au maximum. OpenAI indique avoir utilisé Codex et GPT-Astra pour porter en environ deux mois trois modèles open-weight qui n’étaient pas prévus initialement sur Jalapeño.
Sur certains blocs précis de GPT-OSS, les implémentations produites avec l’IA auraient même été 1,5 à 1,8 fois plus rapides que les versions écrites auparavant par des experts humains.
Il ne s’agit pas des performances du modèle entier, mais le signal est intéressant : l’IA commence à participer directement à l’optimisation du matériel qui la fera tourner.
On voit apparaître une boucle assez nouvelle : les modèles aident à concevoir les puces, puis les puces accélèrent les modèles qui pourront aider à concevoir la génération suivante.
Ce que cela pourrait changer pour les utilisateurs
À court terme, probablement pas grand-chose de visible.
Jalapeño doit commencer à être déployé dans l’infrastructure d’OpenAI d’ici la fin 2026. À ce stade, il s’agit encore d’échantillons d’ingénierie. La production doit ensuite monter progressivement en 2027, avec l’essentiel du volume prévu au quatrième trimestre.
Il ne faut donc pas s’attendre à un bouton « Jalapeño » dans ChatGPT.
Les effets, s’ils se confirment, seront plutôt indirects :
- des réponses plus rapides ;
- des agents capables d’enchaîner davantage d’étapes sans devenir interminables ;
- une meilleure disponibilité aux heures de pointe ;
- davantage de calcul disponible à coût énergétique comparable ;
- potentiellement des API ou des modes d’inférence très rapides plus accessibles économiquement.
Autrement dit, Jalapeño est une technologie d’infrastructure. Son succès se mesurera justement au fait que l’utilisateur n’aura pas besoin de savoir qu’elle existe.
Et maintenant ?
OpenAI présente déjà Jalapeño comme la première génération d’une feuille de route plus longue : une Gen 2 est en développement avancé et une Gen 3 commence à prendre forme.
C’est sans doute plus important que les benchmarks publiés cette semaine.
Une première puce peut être impressionnante sans transformer le marché. Une plateforme renouvelée tous les ans ou tous les deux ans, profondément intégrée aux modèles et aux produits d’OpenAI, peut en revanche modifier durablement l’économie de l’entreprise.
La compétition autour de l’IA ne se limite donc plus à savoir qui possède le meilleur modèle. Elle porte aussi sur qui maîtrise le mieux l’ensemble de la chaîne nécessaire pour le faire tourner : data centers, énergie, réseau, mémoire, logiciels et silicium.
Jalapeño est encore au début de son histoire. Mais il montre déjà dans quelle direction OpenAI veut aller : transformer l’IA en une pile industrielle intégrée, optimisée de la puce jusqu’au produit final.
Lecture 404 Mates
Jalapeño montre que la prochaine bataille de l’IA ne se jouera pas uniquement sur la qualité des modèles. Elle se jouera aussi sur la capacité à exécuter ces modèles à très grande échelle, avec une latence et un coût compatibles avec des usages agentiques permanents. Pour les développeurs, cela pourrait progressivement déplacer la contrainte principale : moins « quel modèle puis-je me permettre d’appeler ? », davantage « combien d’étapes puis-je confier à un agent sans que le temps et le coût explosent ? ».


