Stanford Report Reveals 1,000+ CSAM in AI Training Dataset
El informe del Observatorio de Internet de Stanford revela que conjuntos de datos abiertos ampliamente utilizados, como LAION, contienen miles de materiales de abuso sexual infantil (CSAM, por sus siglas en inglés). Este hallazgo es crucial para la comunidad de datos abiertos, ya que pone de manifiesto los riesgos inherentes a la curación de grandes volúmenes de datos públicos procedentes de la web no moderada. Demuestra que la apertura no garantiza la seguridad y que los conjuntos de entrenamiento populares suelen albergar contenido dañino que puede ser ingerido inadvertidamente por potentes modelos de inteligencia artificial generativa, planteando importantes preocupaciones éticas y legales para los desarrolladores que dependen de estos recursos. Más allá de la mera presencia de este contenido, el informe identifica que las instancias repetidas de CSAM pueden reforzar imágenes específicas de las víctimas, complicando los esfuerzos para limpiar los modelos. Para abordar este problema, los autores proponen una estrategia de mitigación en varias etapas que incluye la eliminación del contenido ilegal de las URL de origen, los metadatos y los conjuntos de datos internos. También recomiendan cotejar los nuevos datos contra bases de datos de hash establecidas por agencias de protección infantil y modificar los procesos de entrenamiento para separar estrictamente el contenido para adultos y el contenido infantil, reduciendo así el riesgo de una fusión nociva de conceptos dentro de los sistemas entrenados. Sin embargo, la viabilidad de estas soluciones se ve limitada por la naturaleza descentralizada de los datos abiertos. Sin una autoridad central que pueda imponer la eliminación del contenido en todas las copias conservadas por investigadores independientes y plataformas, la erradicación del CSAM sigue siendo extremadamente difícil. Esto subraya una implicación vital para los datos abiertos: las prácticas actuales son insuficientes para gestionar contenido ilegal o dañino. La industria debe desarrollar marcos más robustos y colaborativos para la curación de conjuntos de datos y la gobernanza de modelos, a fin de garantizar que la transparencia en el entrenamiento de la IA no implique permitir la distribución de material ilegal.
Source: medianama.comPublished on 2024-01-06