La falta de temporalidad en los agentes de IA desafía la percepción humana del tiempo

Un estudio revela que los asistentes de programación como Claude Code y Codex sobreestiman el tiempo de tareas en hasta diez veces. Esto afecta la eficacia en proyectos prolongados.

La falta de temporalidad en los agentes de IA desafía la percepción humana del tiempo
NeboAI Te resumo la noticia con datos, cifras y contexto
EN 30 SEGUNDOS

EN 1 ORACIÓN

SENTIMIENTO
Neutro

𒀭
NeboAI está trabajando, aguarda un instante...
Preparando análisis detallado
Resumen rápido completado
Extrayendo datos, cifras y citas...
Identificando protagonistas y contexto
ANÁLISIS DETALLADO
COMPARTIR

NeboAI produce ediciones automáticas de textos periodísticos en forma de resúmenes y análisis. Sus resultados experimentales están basados en inteligencia artificial. Por tratarse de una edición de IA, los textos eventualmente pueden contener errores, omisiones, establecer relaciones equivocadas entre datos y otras inexactitudes imprevistas. Recomendamos chequear la edición.

Un nuevo estudio revela que los asistentes de codificación basados en inteligencia artificial, como Claude Code de Anthropic y Codex de OpenAI, tienen una notable incapacidad para juzgar el tiempo necesario para completar tareas. Durante las pruebas, estos modelos sobreestimaron consistentemente el tiempo requerido, adivinando aproximadamente 90 minutos en la mayoría de los casos, independientemente de la complejidad de las tareas. En particular, Claude erróneamente calculó el tiempo en tres veces más de lo necesario, mientras que Codex lo hizo entre seis y diez veces más.

Los investigadores, parte del programa de investigación MATS, examinaron 200 tareas del conjunto ProgramBench y otros 18 benchmarks propios. Se observó que la falta de precisión era más pronunciada en tareas cortas, donde las estimaciones eran significativamente mayores que los tiempos reales de ejecución. Por ejemplo, para el juego Fable 5, la estimación promedio fue tres veces superior al tiempo real.

Además, los resultados variaron según la configuración de software utilizada por los modelos. Claude Code trabajó durante un promedio de 90 minutos hasta completar la tarea, mientras que Codex se detuvo tras aproximadamente media hora. En cuanto a la calidad de su propio trabajo, ambos modelos tendieron a sobrestimar sus resultados en 20 puntos de media, proporcionando calificaciones excesivamente altas incluso en tareas fallidas.

¿Quieres leer la nota completa? Accede al artículo original con todos los detalles.
Leer Artículo Original
TL;DR

Este artículo es un resumen original con fines informativos. Créditos de imagen y cobertura completa en la fuente original. · Ver Política de contenidos

Redacción
Redacción Equipo EsportsAMA

El equipo de redacción de EsportsAMA está formado por apasionados del gaming competitivo y los esports. Cubrimos a diario las principales noticias del sector, desde fichajes y torneos hasta novedades de tus juegos favoritos, con foco en la escena española y latinoamericana.

Presiona Enter para buscar o ESC para cerrar