El modelo DiffusionGemma, desarrollado por Google DeepMind y publicado a mediados de junio, ha demostrado ser altamente eficiente al combinar velocidad y calidad en la generación de texto. En lugar de crear un nuevo modelo desde cero, el equipo adaptó el modelo existente Gemma-4-26B-A4B en un modelo de difusión, utilizando menos del diez por ciento del presupuesto original de tokens de entrenamiento. Este enfoque permite alcanzar una velocidad de aproximadamente 1,500 tokens por segundo en un acelerador Nvidia H100.
DiffusionGemma opera en dos etapas de entrenamiento que equilibran la calidad y la velocidad. En la primera fase, el modelo se entrena para reconstruir bloques de texto ruidoso a partir de datos de ejemplo. Posteriormente, se aplica un proceso combinado de aprendizaje por refuerzo y destilación de muestreador, denominado SD·RL, que optimiza la calidad de las respuestas y reduce los pasos computacionales necesarios.
Este método ha aumentado en promedio diez puntos la calidad en pruebas de razonamiento y ha cuadruplicado la cantidad de tokens procesados por cada paso computacional. Además, las respuestas de DiffusionGemma son aproximadamente un 50 por ciento más cortas, lo que contribuye a mejorar aún más la velocidad de respuesta. A diferencia de los modelos de lenguaje estándar, DiffusionGemma puede corregir errores antes de finalizar la salida, desarrollando respuestas y razonamientos de manera paralela.