ChatGPT can leak training data, violate privacy, says Google's DeepMind

Investigadores de Google DeepMind demostraron que los protocolos de alineación de seguridad diseñados para mantener seguros los modelos de inteligencia artificial generativa pueden eludirse mediante un ataque basado en la repetición. Al solicitar al modelo que repitiera sin cesar palabras individuales específicas, lograron que se desviara de su rol de asistente útil y volviera a un modo básico de memorización. Esta técnica eliminó eficazmente las capas de seguridad, provocando que la IA reprodujera literalmente fragmentos de sus datos de entrenamiento originales, incluidos poemas completos y extractos literarios. Más allá de la simple duplicación de texto, el estudio reveló graves implicaciones para la privacidad, ya que el modelo filtró información personalmente identificable. El ataque logró extraer detalles sensibles, como nombres, números de teléfono y direcciones, demostrando que el sistema retiene y puede divulgar datos privados a pesar de los esfuerzos de alineación. Esta "memorización extraíble" pone de manifiesto una vulnerabilidad crítica: el mecanismo subyacente de la IA, que comprime y descomprime texto, sigue siendo accesible si las barreras de seguridad se desestabilizan suficientemente mediante patrones de entrada específicos. Este hallazgo es fundamental para la comunidad de datos abiertos, ya que expone los riesgos inherentes a entrenar modelos con conjuntos de datos públicos a gran escala. Cuestiona la suposición de que la alineación por sí sola es suficiente para proteger la privacidad, sugiriendo que incluso los datos abiertos o públicos utilizados para el entrenamiento pueden permanecer incrustados en el modelo y ser susceptibles de extracción. En consecuencia, los desarrolladores y los responsables de la gestión de datos deben considerar no solo cómo se utilizan los datos, sino también cómo pueden prevenirse de manera segura su memorización y posterior revelación mediante consultas adversarias.

Source: zdnet.com
Published on 2023-12-05