Un estudio realizado por investigadores de la Wharton School de la Universidad de Pennsylvania reveló que los agentes de compras basados en inteligencia artificial no están listos para tomar decisiones de compra de manera confiable. Durante la investigación, se evaluaron seis modelos de IA para determinar cómo variaban sus recomendaciones de productos al cambiar el contexto de búsqueda.
Los agentes fueron sometidos a pruebas utilizando el simulador ACES para seleccionar un reloj de fitness a partir de una cuadrícula de productos. Los resultados mostraron que una única fuente externa podía alterar drásticamente las recomendaciones. Por ejemplo, la probabilidad de que el modelo Claude Opus 4.8 eligiera el Fitbit Inspire 3 aumentó en 90 puntos porcentuales tras ver una reseña de Wirecutter, mientras que para Gemini 3.5 Flash, el incremento fue de 99 puntos porcentuales.
En experimentos adicionales, se combinó la presencia de dos o tres fuentes, pero los resultados mostraron que tener múltiples fuentes no equilibraba las recomendaciones. Wirecutter continuó siendo la referencia predominante en la mayoría de los casos. Además, el orden en que se presentaron las fuentes también afectó las decisiones, indicando que incluso pequeñas variaciones en el contexto pueden influir significativamente en las elecciones de los modelos de IA.