Nvidia ha comenzado la producción completa de su nuevo acelerador de inferencia, el Groq 3 LPX, diseñado para generar tokens rápidamente para agentes de IA. En pruebas, este sistema alcanzó una impresionante velocidad de 3,400 tokens por segundo, lo que según Nvidia lo convierte en cuatro veces más rápido que su competidor, Cerebras, que logra 882 tokens por segundo. Sin embargo, los expertos señalan que la comparación es favorable para Nvidia, ya que su arquitectura requiere al menos 64 chips para alcanzar esos resultados, mientras que Cerebras puede funcionar con uno o dos aceleradores.
El Groq 3 LPX está diseñado para aplicaciones de IA que requieren alta velocidad, permitiendo que los agentes realicen múltiples pasos de razonamiento en menos tiempo. Esto es crucial, ya que durante las tareas de codificación, un sistema rápido puede reducir el tiempo de ejecución de horas a minutos. Nvidia indica que el acelerador se activará a finales de este año.
En la conferencia Hot Chips 2026, Nvidia presentó su chip como un "acelerador de inferencia de IA interactivo", construido sobre la plataforma Vera Rubin. La arquitectura del Groq utiliza un flujo de datos que depende de SRAM, pero cada unidad de procesamiento (LPU) tiene solo 500 MB de memoria, significativamente menos que otros modelos de Nvidia.