Los modelos de lenguaje de gran tamaño (LLMs) han sido elogiados por matemáticos como Timothy Gowers y Peter Sarnak por sus habilidades en matemáticas, aunque también se reconocen sus limitaciones en cuanto a la creatividad. Gowers destaca que, aunque estos modelos pueden combinar métodos conocidos y explorar múltiples caminos de búsqueda, carecen de la intuición necesaria para seleccionar las rutas más productivas en espacios de búsqueda extensos.
Sarnak añade que la inteligencia artificial puede derivar resultados de teorías existentes, pero no logra desarrollar las abstracciones fundamentales que sustentan importantes demostraciones cuando se comienza desde preguntas elementales. Un investigador de DeepMind, Tom Zahavy, llegó a conclusiones similares en su trabajo titulado "LLMs Can't Jump", donde identifica el obstáculo como la "abducción manipulativa", que es la capacidad de inventar nuevas suposiciones fundamentales sin precedentes lingüísticos.
Estas evaluaciones contribuyen a un debate más amplio sobre la versatilidad de los LLMs, cuestionando si realmente están evolucionando o simplemente mejorando en tareas y problemas familiares.