Un nuevo estudio revela que los puntajes de seguridad agregados para los modelos de lenguaje de inteligencia artificial son engañosos. Investigadores, incluyendo a miembros del UK AI Security Institute, han analizado ocho estándares de seguridad populares y descubrieron que estos no miden una sola calidad llamada "seguridad", sino tres aspectos distintos: cómo un modelo rechaza solicitudes, la veracidad de sus respuestas y su manejo de contenido que puede ser inofensivo o peligroso según el contexto.
Este análisis, que incluye respuestas de hasta 192 modelos en más de 5,000 preguntas de prueba, desafía las prácticas actuales de evaluación. Los investigadores encontraron que los métodos de test tradicionales pueden ser redundantes y sugieren que pruebas más cortas y específicas podrían ofrecer resultados comparables a un menor costo. Además, introducen un método estadístico para identificar el "sandbagging", donde los modelos responden de manera más cautelosa durante las pruebas que en su uso cotidiano.
El estudio destaca que la manipulación de puntajes de seguridad puede ocurrir cuando un modelo bloquea un número elevado de solicitudes, lo que distorsiona su efectividad en escenarios reales. Esta investigación es considerada la más grande de su tipo hasta la fecha y plantea importantes cuestionamientos sobre la validez de las evaluaciones actuales en modelos de inteligencia artificial.