Clearing Rights For A ‘Non-Infringing’ Collection Of AI Training Media Is Hard
Clearing Rights For A ‘Non-Infringing’ Collection Of AI Training Media Is Hard
La aparición de conjuntos de datos curados y “no infractores” para el entrenamiento de la inteligencia artificial pone de manifiesto los importantes desafíos prácticos que implica verificar el estado de los derechos de autor a gran escala. Aunque la agregación de millones de imágenes de dominio público y bajo licencia Creative Commons Zero (CC0) parece una solución sencilla para abordar las preocupaciones sobre responsabilidad legal, la implementación en el mundo real revela complejidades profundas. Bases de datos como Source.Plus demuestran que, incluso cuando los metadatos sugieren que una imagen es de libre uso, verificar la licencia subyacente requiere navegar entre fuentes contradictorias, adaptarse a cambios en las políticas de las plataformas e identificar contribuyentes desactualizados. La fragilidad de estas afirmaciones se hace evidente al rastrear imágenes específicas a través de múltiples plataformas. Una imagen puede aparecer como CC0 en un repositorio debido a reglas históricas de carga que ya no están vigentes, mientras que los términos de licencia actuales restringen su uso comercial. Esta discrepancia ilustra que la agregación automatizada a menudo no logra capturar la naturaleza dinámica de las licencias, dejando a los desarrolladores con una falsa sensación de seguridad. El riesgo no es solo técnico, sino legal, ya que confiar en metadatos potencialmente inexactos puede generar vacíos de responsabilidad difíciles de resolver. Este artículo es crucial para la comunidad de datos abiertos porque subraya la necesidad de una procedencia rigurosa de los datos y de información transparente sobre las licencias. A medida que los desarrolladores de IA buscan depender de datos con licencias abiertas, deben reconocer que “abierto” no significa automáticamente “seguro” o “claramente licenciado”. El caso enfatiza que las prácticas sostenibles de datos abiertos requieren más que una simple agregación; exigen mecanismos robustos de verificación y una comunicación clara sobre la evolución de las licencias para garantizar el cumplimiento ético y legal en el entrenamiento de IA a gran escala.
Fuente: techdirt.comPublicado el 2024-06-01
Noticias relacionadas
- Hugging Face says it detected 'unauthorized access' to its AI model hosting platform | TechCrunch
- Freedom of Information Act
- Elecciones 2024: ¿Por qué recomienda Inai no publicar foto del pulgar entintado tras votar? | El Universal
- GPT-4o’s Chinese token-training data is polluted by spam and porn websites