El nuevo chip de inferencia de OpenAI, denominado Jalapeño, ha demostrado un rendimiento superior en las pruebas de referencia realizadas en la conferencia Hot Chips. Este chip supera a los modelos de Nvidia, Blackwell y Rubin, en términos de rendimiento por vatio y latencia de tokens, según los resultados proporcionados por OpenAI y verificados por SemiAnalysis.
Jalapeño está diseñado específicamente para manejar inferencia de modelos de IA, pero no para entrenarlos, y no está optimizado para los modelos propios de OpenAI. En las pruebas realizadas con los modelos GPT-OSS 120B, Deepseek R1 670B y Kimi K2.5 1T, el chip logró alcanzar hasta 1,400 tokens por segundo por usuario en GPT-OSS y más de 700 tokens por segundo en Deepseek R1. Su rendimiento también se destacó al conseguir entre 1.5x y 1.9x más trabajo de IA por vatio en comparación con los sistemas comerciales más avanzados.
A pesar de su éxito, Jalapeño no ha sido probado con modelos más grandes que ya han sido utilizados por Nvidia y AMD. Actualmente, mientras que los sistemas Rubin están disponibles para los consumidores, Jalapeño aún no ha sido lanzado al mercado.