Un nuevo estudio revela que los asistentes de codificación basados en inteligencia artificial, como Claude Code de Anthropic y Codex de OpenAI, tienen una notable incapacidad para juzgar el tiempo necesario para completar tareas. Durante las pruebas, estos modelos sobreestimaron consistentemente el tiempo requerido, adivinando aproximadamente 90 minutos en la mayoría de los casos, independientemente de la complejidad de las tareas. En particular, Claude erróneamente calculó el tiempo en tres veces más de lo necesario, mientras que Codex lo hizo entre seis y diez veces más.
Los investigadores, parte del programa de investigación MATS, examinaron 200 tareas del conjunto ProgramBench y otros 18 benchmarks propios. Se observó que la falta de precisión era más pronunciada en tareas cortas, donde las estimaciones eran significativamente mayores que los tiempos reales de ejecución. Por ejemplo, para el juego Fable 5, la estimación promedio fue tres veces superior al tiempo real.
Además, los resultados variaron según la configuración de software utilizada por los modelos. Claude Code trabajó durante un promedio de 90 minutos hasta completar la tarea, mientras que Codex se detuvo tras aproximadamente media hora. En cuanto a la calidad de su propio trabajo, ambos modelos tendieron a sobrestimar sus resultados en 20 puntos de media, proporcionando calificaciones excesivamente altas incluso en tareas fallidas.