La nueva versión 4.2 del Intelligence Index de Artificial Analysis ha sido lanzada, revelando que GPT-6 Astra ha mejorado su puntuación en cuatro puntos en comparación con su predecesor, Sol. Este cambio llega tras críticas sobre la capacidad de los benchmarks anteriores para reflejar el verdadero progreso de Astra. En evaluaciones previas, varios modelos, incluido el de OpenAI, colocaron a Astra en una posición destacada frente a 267 modelos, donde alcanzó 169 puntos en más de 50 benchmarks, liderando en la clasificación de Epoch AI.
A pesar de estos logros, Claude Fable 5.1 de Anthropic sigue en la primera posición, con Astra ocupando el segundo lugar y Meta en tercero. Además, se ha informado que Astra utiliza menos tokens por tarea que otros modelos de vanguardia. La actualización también introdujo dos nuevos benchmarks: AA-Briefcase y GDP.pdf, mientras que se eliminó el GPQA-Diamond debido a que los modelos lo han resuelto.
Artificial Analysis ha corregido errores de puntuación en varios benchmarks y ajustado sus sistemas de calificación para obtener resultados más consistentes. Se ha indicado que la próxima versión 5 ha estado en desarrollo durante ocho meses y se implementará en etapas.