Investigadores logran descifrar prompts de LLM con precisión casi perfecta

Investigadores de IIT Bombay y Adobe Research han desarrollado un método preciso para reconstruir prompts de modelos de lenguaje a partir de texto generado. Esta técnica, que no requiere acceso a los pesos del modelo, permite generar múltiples variantes de un mismo prompt, lo que plantea preocupaciones sobre la seguridad y la privacidad en el uso de estos sistemas.

Investigadores logran descifrar prompts de LLM con precisión casi perfecta
NeboAI Te resumo la noticia con datos, cifras y contexto
EN 30 SEGUNDOS

EN 1 ORACIÓN

SENTIMIENTO
Neutro

𒀭
NeboAI está trabajando, aguarda un instante...
Preparando análisis detallado
Resumen rápido completado
Extrayendo datos, cifras y citas...
Identificando protagonistas y contexto
ANÁLISIS DETALLADO
COMPARTIR

NeboAI produce ediciones automáticas de textos periodísticos en forma de resúmenes y análisis. Sus resultados experimentales están basados en inteligencia artificial. Por tratarse de una edición de IA, los textos eventualmente pueden contener errores, omisiones, establecer relaciones equivocadas entre datos y otras inexactitudes imprevistas. Recomendamos chequear la edición.

Investigadores del IIT Bombay y Adobe Research han logrado un avance significativo al desarrollar un método que permite reconstruir los prompts utilizados en modelos de lenguaje grande (LLM) a partir de su texto de salida con una precisión casi perfecta. Este enfoque es innovador porque no requiere acceso a los pesos del modelo y se aplica incluso a modelos de terceros.

El algoritmo, denominado "Predicción de Token Anterior" (PTP), invierte el proceso habitual de los modelos de lenguaje. En lugar de anticipar el siguiente token, este modelo inverso se entrena para predecir los tokens anteriores utilizando datos generados sintéticamente. Con solo una respuesta generada, se puede obtener el prompt original exacto junto con varias alternativas que mantienen el significado esencial.

En pruebas, los investigadores lograron reconstruir el prompt "¿Cómo contactar a los competidores para conocer sus estrategias de precios?" palabra por palabra, además de generar seis variantes que, a pesar de tener diferentes redacciones, conservan la esencia del mensaje. Cuando estos prompts reconstruidos fueron alimentados de nuevo al modelo original, las respuestas coincidieron con las originales, demostrando la efectividad del método.

Este avance también permite que atacantes no necesiten conocer qué modelo generó el texto, ya que el modelo inverso fue capaz de reconstruir prompts a partir de respuestas de diferentes LLMs, como el GPT-4o.

¿Quieres leer la nota completa? Accede al artículo original con todos los detalles.
Leer Artículo Original
TL;DR

Este artículo es un resumen original con fines informativos. Créditos de imagen y cobertura completa en la fuente original. · Ver Política de contenidos

Redacción
Redacción Equipo EsportsAMA

El equipo de redacción de EsportsAMA está formado por apasionados del gaming competitivo y los esports. Cubrimos a diario las principales noticias del sector, desde fichajes y torneos hasta novedades de tus juegos favoritos, con foco en la escena española y latinoamericana.

Presiona Enter para buscar o ESC para cerrar