Google Deepmind ha anunciado el lanzamiento de una evaluación doble ciega para su modelo de inteligencia artificial Gemini, diseñada para abordar problemas de contaminación en las pruebas de modelos. Este método busca evitar que los modelos puedan acceder a preguntas de evaluación con anticipación, lo que comprometería la validez de los resultados. En colaboración con el Singapore AI Safety Institute, el proyecto piloto se llevará a cabo con pruebas confidenciales.
El enfoque de doble ciego asegura que tanto los datos de evaluación externos como el modelo permanezcan privados. Según Deepmind, antes existía un dilema en el que los evaluadores debían compartir sus preguntas, lo que permitía a los proveedores de modelos anticipar las respuestas, o viceversa, comprometiendo su propiedad intelectual. Esta nueva metodología promete eliminar esa necesidad de compromiso.
Utilizando la herramienta Confidential Space de Google Cloud, se garantiza una verificación criptográfica que mantiene la privacidad de ambas partes. La importancia de este avance radica en su aplicación en áreas sensibles, como la ciberseguridad y evaluaciones gubernamentales, permitiendo pruebas rigurosas sin comprometer la soberanía de los datos.