La investigación revela una vulnerabilidad significativa en los modelos de lenguaje grandes (LLM), donde el uso repetitivo de indicaciones puede provocar que el sistema "se desvíe" y filtre fragmentos de sus datos de entrenamiento. Al instruir al modelo para que repita continuamente palabras específicas, los investigadores observaron que, con el tiempo, deja de cumplir la instrucción y comienza a generar fragmentos de texto copiados directamente de su extenso corpus de entrenamiento. Este fenómeno, denominado ataque de divergencia, rompe efectivamente la identidad del modelo, transformándolo de un agente conversacional en un mecanismo para la extracción de datos. Las implicaciones para la privacidad de los datos son profundas, ya que este método puede exponer información sensible, incluidos datos de identificación personal, direcciones de correo electrónico privadas y código propietario. Aunque solo una pequeña fracción de la salida generada puede corresponder a contenido memorizado, la facilidad con la que los atacantes pueden recuperar estos fragmentos sugiere que grandes volúmenes de datos privados o propietarios podrían ser recolectados de manera sistemática. Esto destaca un riesgo crítico en el despliegue de modelos, donde la ingestión de vastos conjuntos de datos de internet incrusta inadvertidamente información confidencial que puede ser revelada, ya sea de forma accidental o maliciosa. Este hallazgo es particularmente relevante para la comunidad de datos abiertos, ya que subraya la necesidad de una rigurosa sanitización de datos y de técnicas de preservación de la privacidad en los conjuntos de datos de entrenamiento. Demuestra que simplemente eliminar identificadores personales evidentes no es suficiente si los modelos conservan la capacidad de reconstruir y generar texto literal de sus fuentes de entrenamiento. En consecuencia, los desarrolladores deben priorizar salvaguardas robustas para prevenir la filtración de datos, asegurando que tanto las iniciativas de datos abiertos como los modelos de inteligencia artificial comerciales no comprometan inadvertidamente la privacidad y los derechos de las personas cuyos datos se utilizaron para el entrenamiento.

Source:
Published on 2023-12-02