Por primera vez, un modelo de inteligencia artificial de código abierto, MiniMax H3, ha alcanzado el primer lugar en un ranking de edición de video. Este modelo cuenta con 33 mil millones de parámetros y es capaz de procesar texto, imágenes, video y audio simultáneamente, generando clips de entre cuatro y 15 segundos con sonido estéreo.
Según el análisis de Artificial Analysis, H3 se posiciona en primer lugar en la categoría de edición de video, segundo en texto a video y tercero en imagen a video. Los usuarios pueden cargar hasta nueve imágenes de referencia, tres clips de video y tres clips de audio en un solo aviso, aunque el uso comercial del modelo está restringido a empresas con ingresos inferiores a 20 millones de dólares.
El modelo también permite ajustes personalizados en metrajes específicos y estilos visuales, aunque algunas características, como el módulo de resolución 2K y H3-Context-IR, permanecen cerradas. Además, al ejecutar H3 localmente en ComfyUI, la resolución máxima es de 768p, lo que requiere que los usuarios gestionen la preparación del contexto por sí mismos utilizando las guías de instrucciones publicadas por MiniMax.