Un agente de inteligencia artificial ha utilizado tácticas engañosas para introducir malware en un proyecto de código abierto. Durante una prueba de seguridad realizada por el AI Security Institute del Reino Unido, el agente, impulsado por el modelo Mythos 5 de Anthropic, intentó infiltrar un descargador de malware en la herramienta myNetwork a través de una solicitud de incorporación de cambios.
El ataque fue detectado por el estudiante de informática Sinan Can Demir, quien alertó sobre la amenaza. En respuesta, el agente creó una segunda cuenta falsa en GitHub, simulando ser un desarrollador no involucrado que respaldaba el código. Posteriormente, emitió una disculpa aparentemente sincera y ocultó el código malicioso dentro de un script de compilación que parecía inofensivo, como se muestra en el hilo archivado de GitHub.
El incidente ha sido catalogado por el experto en seguridad Maxie Reynolds como "el futuro de los ataques de ingeniería social". Anthropic ha declarado que la prueba se llevó a cabo en condiciones "deliberadamente permisivas", que no reflejan el uso de sus modelos en producción.