OpenAI publie les premiers résultats de Jalapeño, sa puce conçue pour l’inférence des modèles d’IA. Sur trois modèles ouverts, l’entreprise annonce de 1,5 à 1,9 fois plus de travail par watt au débit maximal et une latence de bout en bout réduite de 1,7 à 3,6 fois par rapport aux systèmes de comparaison.
La société prévoit de commencer à déployer Jalapeño dans sa propre infrastructure d’ici la fin de 2026, d’abord en faibles volumes selon TechCrunch. La deuxième génération est déjà en développement et une troisième est en préparation.
OpenAI présente les premiers résultats de Jalapeño, sa première puce d’inférence personnalisée.
— OpenAI (@OpenAI) 25 août 2026
Des mesures sur trois modèles ouverts
OpenAI a évalué la puce avec InferenceX, un benchmark public de SemiAnalysis qui mesure le service complet d’une requête. Les tests portent sur GPT‑OSS 120B, DeepSeek R1 670B et Kimi K2.5 1T. L’entreprise compare le débit par kilowatt, la latence de bout en bout et le nombre de jetons servis à chaque utilisateur.
Sur Kimi K2.5, le plus grand modèle du test, Jalapeño afficherait environ 1,5 fois plus de performance maximale par watt et une latence 3,4 fois plus faible que le système de comparaison. Sur DeepSeek R1, OpenAI revendique 1,7 fois plus de débit par watt et une latence réduite par 3,6.
Ces résultats restent publiés par le concepteur de la puce. Ils utilisent néanmoins des modèles et un protocole publics, ce qui facilite la reproduction et la comparaison. La concurrence évoluera aussi d’ici le déploiement à grande échelle de Jalapeño.
Une architecture pensée pour les agents
Jalapeño cible les deux phases principales de l’inférence. Le « prefill » traite le contexte initial et sollicite fortement le calcul, tandis que le décodage génère les jetons successifs et dépend davantage de la bande passante mémoire. OpenAI affirme avoir conçu ensemble la puce, la mémoire, le réseau et le logiciel pour réduire les déplacements de données entre ces phases.
Cette latence compte particulièrement pour les agents, qui enchaînent de nombreuses actions. Un délai modeste à chaque étape peut devenir important à l’échelle d’une tâche complète. OpenAI relie donc directement Jalapeño à des réponses ChatGPT plus rapides et à des sessions Codex plus réactives.
Une puce de 700 watts, encore en qualification
La puissance nominale annoncée est de 700 watts, avec une consommation soutenue mesurée par OpenAI à 550 watts ou moins sur les charges testées. L’entreprise poursuit la qualification de production, l’industrialisation du logiciel et la validation sur davantage de modèles avant le déploiement.
OpenAI précise qu’elle continuera parallèlement à utiliser des accélérateurs NVIDIA et ceux d’autres partenaires. Jalapeño ne remplace donc pas immédiatement ces infrastructures : il ouvre une filière interne optimisée pour les charges d’inférence de l’entreprise et pour les modèles agentiques à faible latence.
Sources : résultats publiés par OpenAI, analyse de TechCrunch et publication officielle d’OpenAI, consultés le 25 août 2026.
