Investigadores del IIT Bombay y Adobe Research han logrado un avance significativo al desarrollar un método que permite reconstruir los prompts utilizados en modelos de lenguaje grande (LLM) a partir de su texto de salida con una precisión casi perfecta. Este enfoque es innovador porque no requiere acceso a los pesos del modelo y se aplica incluso a modelos de terceros.
El algoritmo, denominado "Predicción de Token Anterior" (PTP), invierte el proceso habitual de los modelos de lenguaje. En lugar de anticipar el siguiente token, este modelo inverso se entrena para predecir los tokens anteriores utilizando datos generados sintéticamente. Con solo una respuesta generada, se puede obtener el prompt original exacto junto con varias alternativas que mantienen el significado esencial.
En pruebas, los investigadores lograron reconstruir el prompt "¿Cómo contactar a los competidores para conocer sus estrategias de precios?" palabra por palabra, además de generar seis variantes que, a pesar de tener diferentes redacciones, conservan la esencia del mensaje. Cuando estos prompts reconstruidos fueron alimentados de nuevo al modelo original, las respuestas coincidieron con las originales, demostrando la efectividad del método.
Este avance también permite que atacantes no necesiten conocer qué modelo generó el texto, ya que el modelo inverso fue capaz de reconstruir prompts a partir de respuestas de diferentes LLMs, como el GPT-4o.