El artículo destaca un cambio crucial en la relación entre los propietarios de la propiedad intelectual y la industria de la inteligencia artificial. Los creadores de contenido, liderados por The New York Times, están desafiando con éxito el uso no autorizado de materiales protegidos por derechos de autor para entrenar modelos de lenguaje de gran escala. Al conseguir acuerdos para la eliminación de datos y bloquear futuras extracciones, estos creadores están estableciendo precedentes legales que validan los derechos de propiedad sobre el contenido digital utilizado en los procesos de aprendizaje automático. Este conflicto subraya la dependencia crítica del desarrollo de la IA en conjuntos de datos propietarios de alta calidad. Si bien plataformas como Common Crawl proporcionan la columna vertebral esencial para el entrenamiento de los principales modelos de lenguaje, sus técnicas indiscriminadas de extracción de datos ahora enfrentan una resistencia organizada. El resultado de estos conflictos probablemente redefinirá la forma en que se obtienen los datos, obligando a los desarrolladores de IA a negociar permisos y compensaciones en lugar de depender del rastreo no regulado de la web, lo que afectará la escalabilidad y la ética del entrenamiento de modelos. Esta narrativa es altamente relevante para los datos abiertos, ya que desafía la suposición de que la información públicamente disponible en Internet es de libre uso. Ilustra la tensión entre el ethos de los datos abiertos, que promueve la accesibilidad universal, y las realidades legales de la protección de los derechos de autor. A medida que las iniciativas de datos abiertos se intersectan con la IA, las partes interesadas deben navegar por preguntas complejas en relación con la atribución, el consentimiento y la explotación comercial, asegurando que las prácticas abiertas no infrinjan los derechos de los productores de contenido.
Source: businessinsider.comPublished on 2023-11-09