Extracting Training Data from ChatGPT

La investigación demuestra que los modelos de lenguaje comerciales, incluso aquellos alineados explícitamente para prevenir la filtración de datos, siguen siendo vulnerables a ataques de extracción de datos de entrenamiento. Mediante el uso de indicaciones simples pero efectivas, los investigadores pueden eludir las medidas de seguridad para recuperar contenido textual exacto del conjunto de datos de entrenamiento del modelo. Este hallazgo cuestiona la suposición de que las técnicas de alineación protegen adecuadamente la privacidad, revelando que la alineación a menudo enmascara problemas subyacentes de memorización en lugar de eliminarlos. Las implicaciones para los datos abiertos son profundas, ya que los modelos se entrenan con grandes cantidades de información pública de internet. Cuando estos modelos reproducen texto exacto, exponen efectivamente los datos de origen, lo que podría violar las normas de derechos de autor y privacidad asociadas con conjuntos de datos públicamente disponibles. Esta capacidad sugiere que la frontera entre la salida del modelo y el material original es permeable, planteando serias preocupaciones sobre cómo se utilizan y protegen los datos abiertos cuando se absorben en sistemas propietarios. Para abordar estos riesgos, los autores enfatizan la necesidad de realizar pruebas rigurosas de los modelos base y de los sistemas en producción. Las empresas que lanzan grandes modelos de lenguaje deberían implementar pruebas de penetración internas y de terceros exhaustivas para identificar estas vulnerabilidades antes de su lanzamiento público. Además, la comunidad de datos abiertos debe abogar por mejores prácticas de auditoría para garantizar que el uso de información pública no comprometa la integridad y la privacidad de las fuentes de las que originalmente se extrajeron esos datos.

Source: not-just-memorization.github.io
Published on 2023-11-30