El modelo Qwen3.8 Max de Alibaba ha logrado un avance significativo, alcanzando una puntuación de 56 en el Índice de Análisis de Inteligencia Artificial, lo que representa un aumento de 10 puntos respecto a su predecesor, Qwen3.7 Max, que obtuvo 46. Sin embargo, este rendimiento es aún inferior al de Kimi K3, que se posiciona en 57 y es 25% más económico. En comparación, Claude Opus 5 lidera con una puntuación de 1,852 en el índice GDPval-AA.
A pesar de su mejora en el rendimiento, Qwen3.8 Max presenta una eficiencia reducida, requiriendo 64 pasos por tarea en lugar de los 14 anteriores, y el número de tokens de entrada ha aumentado 15 veces. Esto se traduce en un costo de $1.14 por tarea en el Índice de Inteligencia, más del doble que Qwen3.7 Max, que costaba $0.53. En contraste, Kimi K3 ofrece un costo de $0.86 por tarea.
El nuevo modelo también ha experimentado caídas en algunas métricas, como el AA-LCR, que bajó 2 puntos, y el AA-Omniscience, que descendió 10 puntos. Aunque la tasa de precisión se mantiene en torno al 31%, la tasa de alucinaciones ha aumentado del 23% al 40%, indicando un cambio en la forma en que el modelo maneja la incertidumbre.