The org behind the dataset used to train Stable Diffusion claims it has removed CSAM | TechCrunch
LAION ha publicado Re-LAION-5B, una versión exhaustivamente depurada de su ampliamente utilizado conjunto de datos de imágenes y texto, para abordar graves preocupaciones éticas relacionadas con contenido ilegal. Tras una investigación de la Universidad de Stanford que identificó miles de enlaces a material sospechoso de abuso sexual infantil y otro contenido dañino dentro del conjunto de datos original, LAION colaboró con importantes organizaciones sin ánimo de lucro para eliminar estos índices. Esta actualización demuestra la capacidad de la comunidad de código abierto para autorregularse y corregir problemas de integridad de los datos, asegurando que los recursos fundamentales para la IA generativa permanezcan alineados con los estándares de seguridad y los requisitos legales. La iniciativa destaca la importancia crítica de la transparencia y la rendición de cuentas en los ecosistemas de datos abiertos. Al ofrecer una alternativa verificada y segura, LAION subraya la necesidad de procesos rigurosos de curación para los conjuntos de datos públicos, especialmente aquellos con amplia accesibilidad e implicaciones comerciales. Este esfuerzo sirve como modelo de cómo las organizaciones de investigación pueden responder a la escrutinio externo, ofreciendo una ruta clara para que los investigadores migren a recursos más seguros mientras mantienen el espíritu colaborativo inherente a la ciencia abierta. Este lanzamiento es particularmente relevante para los datos abiertos, ya que ilustra la tensión entre la innovación rápida y la responsabilidad ética. Enfatiza que incluso los conjuntos de datos no comerciales, orientados a la investigación, pueden tener impactos significativos en el desarrollo de la IA y en la confianza pública. La disponibilidad de Re-LAION-5B anima a la comunidad en general a priorizar la higiene de los datos, demostrando que el acceso abierto no excluye el estricto cumplimiento de los límites legales y morales en la gestión de datos.
Source: techcrunch.comPublished on 2024-08-31
Related news
- Child abuse images removed from AI image-generator training source, researchers say
- Child abuse images removed from AI image-generator training source, researchers say - Local News 8
- Study: Transparency is often lacking in datasets used to train large language models
- Unusual Ontario Place redevelopment bidding process leads to fresh questions | Globalnews.ca